第9章 统计 章末题型归纳总结(4知识点+4题型+好题必刷)高二数学同步苏教版选择性必修第二册
2025-04-13
|
2份
|
72页
|
1379人阅读
|
41人下载
内容正文:
第9章 统计 章末题型归纳总结
变量间的相关关系
1、变量之间的相关关系
当自变量取值一定时,因变量的取值带有一定的随机性,则这两个变量之间的关系叫相关关系.由于相关关系的不确定性,在寻找变量之间相关关系的过程中,统计发挥着非常重要的作用.我们可以通过收集大量的数据,在对数据进行统计分析的基础上,发现其中的规律,对它们的关系作出判断.
注意:相关关系与函数关系是不同的,相关关系是一种非确定的关系,函数关系是一种确定的关系,而且函数关系是一种因果关系,但相关关系不一定是因果关系,也可能是伴随关系.
2、散点图
将样本中的个数据点描在平面直角坐标系中,所得图形叫做散点图.根据散点图中点的分布可以直观地判断两个变量之间的关系.
(1)如果散点图中的点散布在从左下角到右上角的区域内,对于两个变量的这种相关关系,我们将它称为正相关,如图(1)所示;
(2)如果散点图中的点散布在从左上角到右下角的区域内,对于两个变量的这种相关关系,我们将它称为负相关,如图(2)所示.
3、相关系数
若相应于变量的取值,变量的观测值为,则变量与的相关系数,通常用来衡量与之间的线性关系的强弱,的范围为.
(1)当时,表示两个变量正相关;当时,表示两个变量负相关.
(2)越接近,表示两个变量的线性相关性越强;越接近,表示两个变量间几乎不存在线性相关关系.当时,所有数据点都在一条直线上.
(3)通常当时,认为两个变量具有很强的线性相关关系.
(2025·宁夏银川·一模)有一散点图如图所示,在5个数据中去掉后,下列说法错误的是( )
A.残差平方和变小 B.相关系数r变大
C.决定系数变大 D.解释变量x与响应变量y的相关性变弱
【答案】D
【解析】从散点图可分析出,若去掉D点,
则解释变量x与响应变量y的线性相关性变强,且是正相关,
所以相关系数r变大,决定系数变大,残差平方和变小,
故选:D.
线性回归
1、线性回归
线性回归是研究不具备确定的函数关系的两个变量之间的关系(相关关系)的方法.
对于一组具有线性相关关系的数据(x1,y1),(x2,y2),…,(xn,yn),其回归方程的求法为
其中,,,(,)称为样本点的中心.
2、残差分析
对于预报变量,通过观测得到的数据称为观测值,通过回归方程得到的称为预测值,观测值减去预测值等于残差,称为相应于点的残差,即有.残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果以及判断原始数据中是否存在可疑数据等,这方面工作称为残差分析.
(1)残差图
通过残差分析,残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,其中这样的带状区域的宽度越窄,说明模型拟合精确度越高;反之,不合适.
(2)通过残差平方和分析,如果残差平方和越小,则说明选用的模型的拟合效果越好;反之,不合适.
(3)相关指数
用相关指数来刻画回归的效果,其计算公式是:.
越接近于,说明残差的平方和越小,也表示回归的效果越好.
(2025·广东·模拟预测)已知变量与的取值如下表:
1
2
3
4
5
5
8
11
且对呈现线性相关关系,则与的经验回归方程必经过的定点为( )
A. B. C. D.
【答案】C
【解析】由于,
则线性回归方程必过定点.
故选:C.
非线性回归
解答非线性拟合问题,要先根据散点图选择合适的函数类型,设出回归方程,通过换元将陌生的非线性回归方程化归转化为我们熟悉的线性回归方程.
求出样本数据换元后的值,然后根据线性回归方程的计算方法计算变换后的线性回归方程系数,还原后即可求出非线性回归方程,再利用回归方程进行预报预测,注意计算要细心,避免计算错误.
1、建立非线性回归模型的基本步骤:
(1)确定研究对象,明确哪个是解释变量,哪个是预报变量;
(2)画出确定好的解释变量和预报变量的散点图,观察它们之间的关系(是否存在非线性关系);
(3)由经验确定非线性回归方程的类型(如我们观察到数据呈非线性关系,一般选用反比例函数、二次函数、指数函数、对数函数、幂函数模型等);
(4)通过换元,将非线性回归方程模型转化为线性回归方程模型;
(5)按照公式计算线性回归方程中的参数(如最小二乘法),得到线性回归方程;
(6)消去新元,得到非线性回归方程;
(7)得出结果后分析残差图是否有异常.若存在异常,则检查数据是否有误,或模型是否合适等.
(2025·四川·模拟预测)下表是某工厂记录的一个反应器投料后,连续8天每天某种气体的生成量(L):
日期代码x
1
2
3
4
5
6
7
8
生成的气体y(L)
4
8
16
31
51
71
97
122
为了分析该气体生成量变化趋势、工厂分别用两种模型:①,②对变量x和y的关系进行拟合,得到相应的回归方程并进行残差分析,残差图如下:
注:残差:经计算得,,,,其中,
(1)根据残差图、比较模型①,模型②的拟合效果,应该选择哪个模型?并简要说明理由;
(2)根据(1)问选定的模型求出相应的回归方程(系数均保留两位小数);
(3)若在第8天要根据(2)问求出的回归方程来对该气体生成量做出预测,那么估计第9天该气体生成量是多少?(精确到个位)
附:回归直线的斜率和截距的最小二乘估计公式分别为:,.
【解析】(1)选择模型①,理由如下:
根据残差图可以看出:模型①的残差点分布在x轴附近,模型②的残差点距离x轴较远,
所以,模型②的残差明显比模型①大,所以模型①的拟合效果相对较好;
(2)由(1)可知y关于x的回归方程为,
令,则,
由所给的数据可得,
,
,
则,
所以y关于x的回归方程为.
(3)将代入回归方程,可得,
所以预测该气体第9天的生成量约为157L.
独立性检验
1、分类变量和列联表
(1)分类变量:
变量的不同“值”表示个体所属的不同类别,像这样的变量称为分类变量.
(2)列联表:
①定义:列出的两个分类变量的频数表称为列联表.
②2×2列联表.
一般地,假设有两个分类变量X和Y,它们的取值分别为{,}和{,},其样本频数列联表(称为2×2列联表)为
总计
总计
从列表中,依据与的值可直观得出结论:两个变量是否有关系.
2、等高条形图
(1)等高条形图和表格相比,更能直观地反映出两个分类变量间是否相互影响,常用等高条形图表示列联表数据的频率特征.
(2)观察等高条形图发现与相差很大,就判断两个分类变量之间有关系.
3、独立性检验
计算随机变量利用的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验.
0.10
0.05
0.010
0.005
0.001
2.706
3.841
6.635
7.879
10.828
(2025·辽宁·二模)某实验中学为调查本校高三学生的学习成绩是否与坚持体育锻炼有关,随机选取了高三300名学生的某次联考成绩进行统计,得到如下表格:
分数
锻炼
合计
坚持锻炼
不坚持锻炼
分数
100
80
180
分数<600
50
70
120
合计
150
150
300
依据小概率值的独立性检验,可以认为高三学生的学习成绩与坚持进行体育锻炼有关,则m的值可能是( )
附:,.
α
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
A.0.001 B.0.005 C.0.01 D.0.05
【答案】D
【解析】由题意,,
结合表格数据及选项,可以认为高三学生的学习成绩与坚持进行体育锻炼有关,
则m的值可能是0.05.
故选:D.
线性回归方程
【例1】(2025·江西九江·二模)植物的根是吸收水分和矿物养分的主要器官.已知在一定范围内,小麦对氮元素的吸收量与它的根长度具有线性相关关系.某盆栽小麦实验中,在确保土壤肥力及灌溉条件相对稳定的情况下,统计了根长度(单位:)与氮元素吸收量(单位:天)的相关数据,如下表所示:
9.9
12.1
14.8
18.2
19.9
21.8
25.1
27.7
30.4
32.1
0.30
0.34
0.42
0.50
0.55
0.60
0.71
0.74
0.78
0.86
根据表中数据可得及线性回归方程为,则( )
A.
B.变量与的相关系数
C.在一定范围内,小麦的根长度每增加,它一天的氮元素吸收量平均增加
D.若对小麦的根长度与钾元素吸收量的相关数据进行统计,则对应回归方程不变
【答案】C
【解析】由线性回归方程过样本中心点知,,故A错误;
小麦对氮元素的吸收量与它的根长度具有正相关关系,故相关系数,故B错误;
由线性回归方程可得,在一定范围内,小麦的根长度每增加,它一天的氮元素吸收量平均增加,故C正确;
若研究小麦的根长度与钾元素吸收量的相关关系,回归方程可能发生改变,故D错误.
故选:C.
【变式1-1】(2025·河北秦皇岛·一模)近几年我国新能源汽车产业快速发展,据行业数据显示,新能源汽车的数量在不断增加.下表为某城市统计的近5年新能源汽车的新增数量,其中为年份代号,(单位:万辆)代表新增新能源汽车的数量.
年份
2020
2021
2022
2023
2024
年份代号
1
2
3
4
5
新增新能源汽车万辆
1.2
1.8
2.5
3.2
3.8
(1)计算样本相关系数,判断是否可以用线性回归模型拟合与的关系,当时,可以认为两个变量有很强的线性相关性;否则,没有很强的线性相关性.
(2)求关于的经验回归方程,并据此估计该城市2026年的新增新能源汽车的数量;
参考数据:.参考公式:.
【解析】(1)由题意可得:,
则
,
因为,故可以用线性回归模型拟合与的关系.
(2)由题意可得:,,
则,当时,,
所以估计该市2026年新增燃油车5.14万辆.
【变式1-2】(2025·高二·陕西宝鸡·期末)如图是某采矿厂的污水排放量单位:吨与矿产品年产量单位:吨的折线图:
(1)依据折线图计算相关系数精确到,并据此判断是否可用线性回归模型拟合y与x的关系?若,则线性相关程度很高,可用线性回归模型拟合
(2)若可用线性回归模型拟合与的关系,请建立关于的线性回归方程,并预测年产量为10吨时的污水排放量.
相关公式:,参考数据:.
回归方程中,
【解析】(1)由折线图得如下数据计算得:
,,,
所以相关系数,
因为,所以可用线性回归模型拟合y与x的关系
(2)
,
所以回归方程为,
当时,,
所以预测年产量为10吨时的污水排放量为吨
【变式1-3】(2025·高二·江西吉安·期末)防疫抗疫,人人有责,随着奥密克戎的全球肆虐,防疫形势越来越严峻,防疫物资需求量急增.下表是某口罩厂今年的月份与订单(单位:万元)的几组对应数据:
月份
1
2
3
4
5
订单
20
24
43
52
(1)求关于的线性回归方程,并估计6月份该厂的订单数;
(2)求相关系数(精确到0.01),说明与之间具有怎样的相关关系.
参考数据:,,.,.参考公式:相关系数;回归直线的方程是,其中.
【解析】(1)由题可得:,
,
,
关于的线性回归方程为,
2022年6月对应的变量为6,将代入,
得,
估计6月份该厂的订单数为59.9万元.
(2)相关系数.
与之间具有很强的正相关关系.
【变式1-4】(2025·宁夏石嘴山·一模)某人工智能公司从2018至2024年的利润情况如下表所示:
年份
2018
2019
2020
2021
2022
2023
2024
年份代码x
1
2
3
4
5
6
7
利润y(单位:亿元)
2.9
3.3
3.6
4.4
4.8
5.2
5.9
(1)根据表中的数据,推断变量y与x之间是否线性相关.计算y与x之间的相关系数(精确到0.01),并推断它们的相关程度;
(2)求出y关于x的经验回归方程,并预测该人工智能公司2025年的利润;
(3)把利润不超过4(亿元)的年份叫做“试销年”,从2018年到2024年这七年中任取2年,X表示取到“试销年”的个数,求X的分布列和数学期望.
参考数据:,,,
参考公式:对于一组数据,
①相关系数为:;
②经验回归直线的斜率和截距的最小二乘估计公式分别,.
【解析】(1)由题设,易知y与x线性相关,且,
,
由于,可以推断变量y与x成正线性相关且相关程度很强.
(2)由题设,,,
所以,因此关于x的回归方程为,
当时,,即预测该人工智能公司2025的利润为6.3亿元;
(3)由题意,2018年到2024年这七年的“试销年”为三个,
因此从2018年到2024年这七年中任取2个,取到“试销年”的个数能取的值为,
则,,,
因此的分布列如下:
所以其数学期望为.
【解题方法总结】
对于一组具有线性相关关系的数据(,),(,),…,(,),其回归方程的求法为,其中,,,(,)称为样本点的中心.
非线性回归方程
【例2】(2025·高二·宁夏石嘴山·期中)红铃虫是棉花的主要害虫之一,其产卵数与温度有关.现收集到一只红铃虫的产卵数(个)和温度的8组观测数据,制成图l所示的散点图,现用两种模型①,②分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图.
根据收集到的数据,计算得到如下值:表中;;;
25
2.9
646
168
422688
50.4
70308
(1)根据残差图,比较模型①、②的拟合效果,哪种模型比较合适?
(2)求出关于的回归方程.附:对于一组数据,,…,其回归直线的斜率和截距的最小二乘估计分别为,,
【解析】(1)模型①更合适.
模型①残差点比较均匀地落在水平的带状区域中,且带状区域的宽度比模型②带状宽度窄,
所以模型①的拟合精度更高,回归方程的预报精度相应就会越高,故选模型①比较合适.
(2)令与温度x可以用线性回归方程来拟合,则.
于是, ,
因此关于的线性回归方程为,即,
所以产卵数y关于温度x的回归方程为.
【变式2-1】(2025·陕西宝鸡·模拟预测)统计显示,我国在线直播生活购物用户规模近几年保持高速增长态势,下表为年—年我国在线直播生活购物用户规模(单位:亿人),其中年—年对应的代码依次为—.
年份代码
市场规模
,,,其中
参考公式:对于一组数据、、、,其经验回归直线的斜率和截距的最小二乘估计公式分别为,.
(1)由上表数据可知,若用函数模型拟合与的关系,请估计年我国在线直播生活购物用户的规模(结果精确到);
(2)已知我国在线直播生活购物用户选择在品牌官方直播间购物的概率,现从我国在线直播购物用户中随机抽取人,记这人中选择在品牌官方直播间购物的人数为,若,求的数学期望和方差.
【解析】(1)设,则,
因为,,,
所以,,
所以,与的拟合函数关系式为
当时,,
则估计年我国在线直播生活购物用户的规模为亿人.
(2)由题意知,所以,,
,
由,可得,
因为,解得,
所以,,.
【变式2-2】(2025·广东茂名·一模)一只药用昆虫的产卵数与一定范围内的温度有关,现收集了该种药用昆虫的6组观测数据如下表:
温度
21
23
24
27
29
32
产卵数个
6
11
20
27
57
77
经计算得:线性回归模型的残差平方和,其中分别为观测数据中的温差和产卵数,.
(1)若用线性回归方程,求关于的回归方程(精确到0.1);
(2)若用非线性回归模型求得关于回归方程为,且相关指数0.9522.
(i)试与(1)中的回归模型相比,用说明哪种模型的拟合效果更好.
(ii)用拟合效果好的模型预测温度为时该种药用昆虫的产卵数(结果取整数).
附:一组数据,其回归直线的斜率和截距的最小二乘估计为;相关指数.
【解析】(1)由题意,则,,
,,
y关于x的线性回归方程为.
(2)(i)对于线性回归模型,,,
相关指数为,
因为,所以用非线性回归模型拟合效果更好.
(ii)当,时(个)
所以温度为时,该种药用昆虫的产卵数估计为190个.
【变式2-3】(2025·湖北荆州·一模)已知鸡的产蛋量与鸡舍的温度有关,为了确定下一个时段鸡舍的控制温度,某企业需要了解鸡舍的温度(单位),对某种鸡的时段产蛋量(单位: )和时段投入成本(单位:万元)的影响,为此,该企业收集了7个鸡舍的时段控制温度和产蛋量的数据,对数据初步处理后得到了如图所示的散点图和表中的统计量的值.
17.40
82.30
3.6
140
9.7
2935.1
35.0
其中, .
(1)根据散点图判断, 与哪一个更适宜作为该种鸡的时段产蛋量关于鸡舍时段控制温度的回归方程类型?(给判断即可,不必说明理由)
(2)若用作为回归方程模型,根据表中数据,建立关于的回归方程;
(3)已知时段投入成本与的关系为,当时段控制温度为时,鸡的时段产蛋量及时段投入成本的预报值分别是多少?
附:①对于一组具有线性相关关系的数据,其回归直线的斜率和截距的最小二乘估计分别为,
②
0.08
0.47
2.72
20.09
1096.63
【解析】(1)适宜;
(2)由得,
令, , ,
由图表中的数据可知, ,
所以,
则关于的回归方程为;
(3)时,由回归方程,,
即鸡舍的温度为时,即的时段产量的预报值为,投入的陈本预报值为.
【解题方法总结】
解答非线性拟合问题,要先根据散点图选择合适的函数类型,设出回归方程,通过换元将陌生的非线性回归方程化归转化为我们熟悉的线性回归方程.
独立性检验
【例3】(2025·甘肃·一模)为了解高一学生整理数学错题与提高数学成绩的相关性,某小组通过随机抽样,获得了每天整理错题和未每天整理错题的各20名学生3次数学考试成绩的平均分,绘制了如图1,2的频率分布直方图,并且已知高一学生3次数学考试成绩的总体均分为115分.
(1)依据频率分布直方图,完成以下列联表:
成绩不低于总体均分
成绩低于总体均分
合计
每天整理错题
未每天整理错题
合计
(2)依据小概率值的独立性检验,分析数学成绩不低于总体均分是否与每天整理数学错题有关.
附
0.10
0.01
0.001
2.706
6.635
10.828
【解析】(1)根据频率分布直方图,可得
成绩不低于总体均分
成绩低于总体均分
合计
每天整理错题
14
6
20
未每天整理错题
5
15
20
合计
19
21
40
(2)假设:数学成绩不低于总体均分与每天整理数学错题无关.
计算可得
根据小概率值的独立性检验,可推断不成立,
即认为数学成绩不低于总体均分与每天整理错题有关.
【变式3-1】(2025·浙江杭州·二模)某车企为考察选购新能源汽车的款式与性别的关联性,调查100人购买情况,得到如下列联表:
新能源汽车款
新能源汽车款
总计
男性
50
10
女性
25
15
40
总计
25
100
(1)求;
(2)根据小概率值的独立性检验,能否认为选购该新能源汽车的款式与性别有关联?
(3)假设用样本估计总体,用频率估计概率,所有人选购汽车的款式情况相互独立.若从购买者中随机抽取3人,设被抽取的3人中购买了B款车的人数为,求的数学期望.
附:,.
0.10
0.05
0.010
0.005
2.706
3.841
6.635
7.879
【解析】(1)由题意得,.
(2)零假设为:选购新能源汽车的款式与性别无关联.
根据列联表中的数据,可得,
根据小概率值的独立性检验,推断不成立,
可以认为选购车的款式与性别有关,此推断犯错误的概率不大于0.05;
(3)随机抽取1人购买B款车的概率为,
的可能取值有,由题意得,
由二项分布的期望公式得.
【变式3-2】(2025·河北秦皇岛·二模)年哈尔滨亚洲冬季运动会,是继年北京冬奥会后中国举办的又一重大国际综合性冰雪盛会,将于年月日至月日在黑龙江省哈尔滨市举行,人们将在观看比赛的同时,开始投入健身的行列.某兴趣小组为了解哈尔滨市不同年龄段的市民每周锻炼的时长情况,随机抽取人进行调查,得到如下列联表:
年龄
周平均锻炼时长
合计
少于小时
不少于小时
岁以下
岁以上(含)
合计
(1)试根据的独立性检验,判断周平均锻炼时长是否与年龄有关;
(2)现从岁以下的样本中按周平均锻炼时长是否少于小时,用分层随机抽样的方法抽取人做进一步访谈,再从这人中随机抽取人填写调查问卷.记抽取人中周平均锻炼时长少于小时的人数为,求的分布列和数学期望.
附:,其中.
【解析】(1)零假设:周平均锻炼时长是否与年龄无关,
由列联表中的数据,可得,
又,根据的独立性检验,我们推断假设不成立,
即周平均锻炼时长与年龄有关.
(2)抽取的人中,周平均锻炼时长少于小时的有人,
不少于小时的有人,
所以所有可能的取值为,
,,,
所以随机变量的分布列为:
随机变量的数学期望.
【变式3-3】(2025·河南·二模)某校开设校本课程“剪纸”,为了解学生参加该课程与性别是否有关,用简单随机抽样的方法分别从男生和女生中各抽取了50名学生进行调查,得到如下列联表:
性别
课程
合计
参加“剪纸”课程
不参加“剪纸”课程
男生
10
女生
30
50
合计
(1)补全列联表,并依据小概率值的独立性检验,分析参加“剪纸”课程是否与性别有关联;
(2)以样本估计总体,且以频率估计概率,若从该校女生中随机抽取3人,记其中参加“剪纸”课程的人数为,求的期望.
附:,其中.
0.050
0.025
0.010
3.841
5.024
6.635
【解析】(1)列联表如下:
性别
课程
合计
参加“剪纸”课程
不参加“剪纸”课程
男生
10
40
50
女生
20
30
50
合计
30
70
100
零假设为:参加“剪纸”课程与性别无关联,
则,
依据小概率值的独立性检验,我们推断不成立,即认为参加“剪纸”课程与性别有关联,此推断犯错误的概率不大于0.050.
(2)由表格中的数据知,从女生中抽取1人,其参加“剪纸”课程的概率为,
的可能取值为0,1,2,3,且,
所以.
【解题方法总结】
计算随机变量利用的取值推断分类变量X和Y是否独立的方法称为独立性检验.
统计的综合应用
【例4】(2025·福建泉州·模拟预测)定义两组数据,的“斯皮尔曼系数”为变量在该组数据中的排名和变量在该组数据中的排名的样本相关系数,记为,其中.
某校15名学生的数学成绩的排名与知识竞赛成绩的排名如下表:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
1
5
3
4
9
8
7
6
10
2
12
14
13
11
15
(1)试求这15名学生的数学成绩与知识竞赛成绩的“斯皮尔曼系数”;
(2)已知在这15名学生中有10人数学成绩优秀,现从这15人中随机抽取3人,抽到数学成绩优秀的学生有人,试求的分布列和数学期望.
【解析】(1)依题意,,
所以这15名学生的数学成绩与知识竞赛成绩的“斯皮尔曼系数”是0.8.
(2)依题意,的值可能为0,1,2,3,
,
,
则的分布列为:
0
1
2
3
所以的数学期望为.
【变式4-1】(2025·高二·北京海淀·期末)某公司有甲乙两条生产线生产同一种产品,为了解产品的质量情况,对两条生产线生产的产品进行简单随机抽样,经检测得到了A、B的两项质量指标值,记为,定义产品的指标偏差,数据如下表:
甲生产线抽样产品编号
指标
1
2
3
4
5
6
7
8
9
10
0.98
0.96
1.07
1.02
0.99
0.93
0.92
0.96
1.11
1.02
2.01
1.97
1.96
2.03
2.04
1.98
1.95
1.99
2.07
2.02
0.03
0.07
0.11
0.05
0.05
0.09
0.13
0.05
0.18
0.04
乙生产线抽样产品编号
指标
1
2
3
4
5
6
7
8
1.02
0.97
0.95
0.94
1.13
0.98
0.97
1.01
2.01
2.03
2.15
1.93
2.01
2.02
2.19
2.04
0.03
0.06
0.20
0.13
0.14
0.04
0.22
0.05
假设用频率估计概率,且每件产品的质量相互独立.
(1)从甲生产线上随机抽取一件产品,估计该产品满足且的概率;
(2)从甲乙两条生产线上各随机抽取一件产品,设表示这两件产品中满足的产品数,求的分布列和数学期望;
(3)已知的值越小则该产品质量越好.如果甲乙两条生产线各生产一件产品,根据现有数据判断哪条生产线上的产品质量更好?并说明理由.
【解析】(1)记表示“从甲生产线上随机抽取一件产品,该产品满足且”.
用频率估计概率,则.
所以该产品满足且的概率为.
(2)由表格数据,用频率估计概率,
可得“从甲生产线上随机抽取一件产品,该产品满足”的概率为;
“从乙生产线上随机抽取一件产品,该产品满足”的概率为.
由题意,的所有可能取值为.
,
.
所以的分布列为
0
1
2
所以的数学期望为.
(3)甲生产线上的产品质量更好,
因为甲生产线上值的平均值,
乙生产线上值的平均值,
所以甲生产线上值的平均值明显比乙小,
所以甲生产线上的产品质量更好.
其它理由:从甲乙两生产线的样本中各随机取一件,则
甲生产品的值小于乙的概率为,
所以甲生产线上的产品质量更好.
【变式4-2】(2025·高三·全国·专题练习)北京冬奥会助推户外冰雪运动发展持续升温,近年来越来越多的青年学生喜爱这一运动,为了研究性别与青年学生是否喜爱冰雪运动之间的关系,从某高校的男、女生中各随机抽取200名进行问卷调查,得到如下列联表.
喜爱
不喜爱
合计
男生
200
女生
200
合计
280
120
400
(1)当时,从样本中喜爱冰雪运动的学生中,按性别采用按比例分配的分层随机抽样方法抽取7人,再从这7人中随机抽取4人调研喜爱的原因,记这4人中男生的人数为,求的分布列与数学期望.
(2)定义,其中为列联表中第行第列的实际数据,为列联表中第行与第列的总频率之积再乘列联表的总额数得到的理论频数,如,.基于小概率值的检验规则:首先提出零假设(变量相互独立),然后计算的值,当时,我们推断不成立,即认为和不独立,该推断犯错误的概率不超过;否则,我们没有充分证据推断不成立,可以认为和独立.根据的计算公式,求解下面问题:
①当时,依据小概率值的独立性检验,分析性别与青年学生是否喜爱冰雪运动有关?
②当时,依据小概率值的独立性检验,若认为性别与青年学生是否喜爱冰雪运动有关,则至少有多少名男生喜爱冰雪运动?
附:
0.1
0.025
0.005
2.706
5.024
7.879
【解析】(1)当时,样本中喜爱冰雪运动的学生中男生有160人,女生有120人,
则采用按比例分配的分层随机抽样方法抽取的7人中,男生有4人,女生有3人.
由题意可知,的所有可能取值为1,2,3,4,
,,
,,
的分布列为
1
2
3
4
故.
(2)零假设为:性别与青年学生是否喜爱冰雪运动独立,
即性别与青年学生是否喜爱冰雪运动无关联.
当时,列联表如下:
喜爱
不喜爱
合计
男生
150
50
200
女生
130
70
200
合计
280
120
400
,,,,,,,,
.
,根据小概率值的独立性检验,我们推断成立,
即认为性别与青年学生是否喜爱冰雪运动无关联.
,
由题意可知,,整理得.又,,
,的最大值为9.
又,至少有151名男生喜爱冰雪运动.
【变式4-3】(2025·全国·模拟预测)某医科大学科研部门为研究退休人员是否患痴呆症与上网的关系,随机调查了市100位退休人员,统计数据如下表所示:
患痴呆症
不患痴呆症
合计
上网
16
32
48
不上网
34
18
52
合计
50
50
100
(1)依据的独立性检验,能否认为该市退休人员是否患痴呆症与上网之间有关联?
(2)从该市退休人员中任取一位,记事件A为“此人患痴呆症”,为“此人上网”,则为“此人不患痴呆症”,定义事件A的强度,在事件发生的条件下A的强度.
(i)证明:;
(ⅱ)利用抽样的样本数据,估计的值.
附:,其中.
0.050
0.010
0.001
3.841
6.635
10.828
【解析】(1)根据列联表中的数据,得
,
根据小概率值的独立性检验,我们推断不成立,
即认为该市退休人员是否患痴呆症与上网之间有关联,
此推断犯错误的概率不大于0.01.
(2),
所以,
故
.
(ⅱ)由样本数据可得,
所以,所以估计的值为2.
【变式4-4】(2025·湖南永州·三模)为了精准地找到目标人群,更好地销售新能源汽车,某4S店对近期购车的男性与女性各100位进行问卷调查,并作为样本进行统计分析,得到如下列联表:
购买新能源汽车(人数)
购买传统燃油车(人数)
男性
女性
(1)当时,将样本中购买传统燃油车的购车者按性别采用分层抽样的方法抽取6人,再从这6人中随机抽取3人调查购买传统燃油车的原因,记这3人中女性的人数为X,求X的分布列与数学期望;
(2)定义,其中为列联表中第i行第j列的实际数据,为列联表中第i行与第j列的总频率之积再乘以列联表的总频数得到的理论频数.基于小概率值的检验规则:首先提出零假设(变量X,Y相互独立〉,然后计算的值,当时,我们推断不成立,即认为X和Y不独立,该推断犯错误的概率不超过;否则,我们没有充分证据推断不成立,可以认为X和Y独立.根据的计算公式,求解下面问题:
(i)当时,依据小概率值的独立性检验,请分析性别与是否喜爱购买新能源汽车有关;
(ⅱ)当时,依据小概率值的独立性检验,若认为性别与是否喜爱购买新能源汽车有关,则至少有多少名男性喜爱购买新能源汽车?
附:
0.1
0.025
0.005
2.706
5.024
7.879
【解析】(1)当m=0时,
用分层抽样的方法抽取购买传统燃油车的6人中,男性有2人,女性有4人.
由题意可知,X的可能取值为1,2,3.
X的分布列如下表
X
1
2
3
.
(2)(i)零假设为:
性别与是否购买新能源汽车独立,即性别与是否购买新能源汽车无关联.
当m=0时,
,
,
∴根据小概率值的独立性检验,我们推断不成立,即认为性别与是否购
买新能源汽车有关联,此推断犯错误的概率不超过0.005.
(ⅱ)
由题意可知,
整理得,
,
所以的最大值为4,
又,
至少有76名男性购买新能源汽车.
【解题方法总结】
灵活运用统计工具,结合实际问题分析,注重解题过程的严谨性。
1.(2025·辽宁·二模)某实验中学为调查本校高三学生的学习成绩是否与坚持体育锻炼有关,随机选取了高三300名学生的某次联考成绩进行统计,得到如下表格:
分数
锻炼
合计
坚持锻炼
不坚持锻炼
分数
100
80
180
分数<600
50
70
120
合计
150
150
300
依据小概率值的独立性检验,可以认为高三学生的学习成绩与坚持进行体育锻炼有关,则m的值可能是( )
附:,.
α
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
A.0.001 B.0.005 C.0.01 D.0.05
【答案】D
【解析】由题意,,
结合表格数据及选项,可以认为高三学生的学习成绩与坚持进行体育锻炼有关,
则m的值可能是0.05.
故选:D.
2.(2025·江西九江·二模)植物的根是吸收水分和矿物养分的主要器官.已知在一定范围内,小麦对氮元素的吸收量与它的根长度具有线性相关关系.某盆栽小麦实验中,在确保土壤肥力及灌溉条件相对稳定的情况下,统计了根长度(单位:)与氮元素吸收量(单位:天)的相关数据,如下表所示:
9.9
12.1
14.8
18.2
19.9
21.8
25.1
27.7
30.4
32.1
0.30
0.34
0.42
0.50
0.55
0.60
0.71
0.74
0.78
0.86
根据表中数据可得及线性回归方程为,则( )
A.
B.变量与的相关系数
C.在一定范围内,小麦的根长度每增加,它一天的氮元素吸收量平均增加
D.若对小麦的根长度与钾元素吸收量的相关数据进行统计,则对应回归方程不变
【答案】C
【解析】由线性回归方程过样本中心点知,,故A错误;
小麦对氮元素的吸收量与它的根长度具有正相关关系,故相关系数,故B错误;
由线性回归方程可得,在一定范围内,小麦的根长度每增加,它一天的氮元素吸收量平均增加,故C正确;
若研究小麦的根长度与钾元素吸收量的相关关系,回归方程可能发生改变,故D错误.
故选:C.
3.(2025·湖北·模拟预测)根据变量和的成对样本数据,由一元线性回归模型①,得到经验回归模型,对应的残差如图(1)所示.根据变量和的成对样本数据,由一元线性回归模型②,得到经验回归模型,对应的残差如图(2)所示,则( )
A.模型①的误差满足一元线性回归模型的的假设,不满足的假设
B.模型①的误差不满足一元线性回归模型的的假设,满足的假设
C.模型②的误差满足一元线性回归模型的的假设,不满足的假设
D.模型②的误差不满足一元线性回归模型的的假设,满足的假设
【答案】A
【解析】对于残差图(1)对应的散点,随机误差满足的假设,但是方差随着的变化而变化,不满足的假设;
对图(2)对应的散点,均匀分布在水平带状区域内,随机误差满足的假设,方差不随的变化而变化,满足的假设.
故选:A.
4.(2025·河北沧州·一模)若变量y与x之间存在线性相关关系,且根据最小二乘法得到的经验回归方程为,样本点中心为,则样本点的残差为( )
A. B.1.5 C.0.5 D.
【答案】B
【解析】依题意,,所以,即经验回归方程为,
又当时,,所以样本点的残差为,
故选:B.
5.(2025·陕西汉中·二模)2024年全民健身运动的主题“全民健身与奥运同行”,为了满足群众健身需求,某健身房近几年陆续购买了几台型跑步机,该型号跑步机已投入使用的时间(单位:年)与当年所需要支出的维修费用(单位:千元)有如下统计资料:
2
3
4
5
6
2.2
3.8
5.5
6.5
7
根据表中的数据可得到线性回归方程为,则( )
A.与的样本相关系数
B.
C.表中维修费用的第60百分位数为6.5
D.该型跑步机已投入使用的时间为10年时,当年所需要支出的维修费用一定是12.38万元
【答案】B
【解析】对于A,由,得与成正相关,样本相关系数,A错误;
对于B,,,则,B正确;
对于C,,因此第60百分位数为,C错误;
对于D,由选项B知,,当时,,
则当年所需要支出的维修费用约为12.38万元,D错误.
故选:B
6.(2025·重庆·模拟预测)已知变量和的统计数据如下表.
80
90
100
110
120
y
120
140
165
180
若,线性相关,经验回归方程为,则( )
A.155 B.158 C.160 D.162
【答案】A
【解析】由表中数据可得,
代入经验回归方程可得,
则.
故选:A
7.(2025·福建莆田·二模)为了解女儿身高与其母亲身高的关系,随机抽取5对母女的身高数据如下:
母亲身高
164
166
166
166
168
女儿身高
165
165
166
167
167
根据最小二乘法(即取最小),关于的回归直线方程为( )
A. B. C. D.
【答案】C
【解析】观察数据,可得与有关,故排除D.
又,.
所以回归直线方程必过点,所以排除AB.
故选:C
8.(多选题)(2025·河北秦皇岛·二模)某科技公司统计了一款App最近5个月的下载量,如下表所示,若与线性相关,且经验回归方程为,则( )
月份编号
1
2
3
4
5
下载量万次
5
4.5
4
3.5
2.5
A.与负相关 B.
C.第7个月的下载量估计为1.8万次 D.残差绝对值的最大值为0.2
【答案】ABD
【解析】对于A,由,则回归直线斜向下,故A正确;
对于B,由,,即样本中心为,
则,解得,故B正确;
对于C,将代入回归方程,解得,故C错误;
对于D,由题意可得下表:
则最大值为,故D正确.
故选:ABD.
9.(多选题)(2025·山东济南·一模)为了验证牛的毛色(黑色、红色)和角(有角、无角)这两对相对性状是否相关,某学院进行了一次数据统计,并根据形成的2×2列联表,计算得到,根据小概率值为的独立性检验,则( )
附:
0.100
0.050
0.010
2.706
3.841
6.635
A.若,则认为“毛色”和“角”无关
B.若,则认为“毛色”和“角”有关,此推断犯错误的概率不超过10%
C.若,则认为“毛色”和“角”无关
D.若,则认为“毛色”和“角”有关,此推断犯错误的概率不超过1%
【答案】BC
【解析】对AB,若,因为 ,则认为“毛色”和“角”有关,此推断犯错误的概率不超过10%,故A 错,B 对;
对CD,若,因为,则认为“毛色”和“角”无关,故C正确,D错误.
故选:BC.
10.(多选题)(2025·湖南·模拟预测)小王经过调查获得如下数据:
2
4
7
17
30
1
2
3
4
5
参考公式:相关系数,,.
下列说法正确的有( )
A.该数据组的线性回归方程(系数精确到0.01)为
B.该数据组的相关系数,很接近1说明该数据组拟合效果很好
C.所有数据点中残差最小的是
D.去掉数据点后,回归直线会向下移动
【答案】ACD
【解析】对于A,,,
,
,
所以,,
所以该数据组的线性回归方程为,故A正确;
对于B,由,
则,很接近1说明两个变量相关性越强,与拟合效果无关,故B错误;
对于C,由残差绝对值,结合A项的回归方程可得,
,,,
,,所有数据点中残差最小的是,故C正确;
对于D,,故点在回归直线上方,故去掉该点后,回归直线下移,故D正确.
故选:ACD.
11.(2025·黑龙江哈尔滨·一模)由样本数据,求得回归直线方程为,且,若去除偏离点后,得到新的回归直线方程为,则去除偏离点后,相应于样本点的残差值为 .
【答案】
【解析】由于回归直线过样本中心点,当时,,
去除偏离点后,剩余数据的中心点为,
则,,
将点的坐标代入回归直线方程,可得,解得,
所以,新的回归直线方程为,
当时,,
所以,去除偏离点后,相应于样本点的残差值为.
故答案为:.
12.(2025·全国·模拟预测)害虫防控对于提高农作物产量具有重要意义.已知某种害虫产卵数(单位:个)与温度(单位:)有关,测得一组数据,可用模型进行拟合,利用变换得到的线性回归方程为.若,则的值为 .
【答案】
【解析】对两边同时取对数可得;
即,可得
由可得,
代入可得,即,所以.
故答案为:
13.(2025·高三·全国·课后作业)某校团委对“学生性别和喜欢网络游戏是否有关”作了一次调查,其中被调查的男女生人数相同,男生喜欢网络游戏的人数占男生人数的,女生喜欢网络游戏的人数占女生人数的.若根据独立性检验认为喜欢网络游戏和性别有关,且此推断犯错误的概率超过0.01但不超过0.05,则被调查的学生中男生可能有 人.(请将所有可能的结果都填在横线上)
附表:,其中.
0.050
0.010
3.841
6.635
【答案】45,50,55,60,65
【解析】设男生有x人,由题意可得列联表如下,
喜欢
不喜欢
合计
男生
x
女生
x
合计
若认为喜欢网络游戏和性别有关,且该推断犯错误的概率超过0.01但不超过0.05,
则.
∵,
∴,解得,
又x为5的整数倍,∴被调查的学生中男生可能人数为45,50,55,60,65.
故答案为:45,50,55,60,65.
14.(2025·内蒙古赤峰·一模)为了研究某市高三年级学生的性别和身高的关联性,随机抽取了200名高三年级学生,整理数据得到如下列联表,并画出身高的频率分布直方图:
性别
身高
合计
低于
不低于
女
20
男
50
合计
200
(1)根据身高的频率分布直方图,求列联表中的,的值;
(2)依据小概率值的独立性检验,能否认为“高三年级学生的性别”与“身高是否低于”有关联?
(3)将样本频率视为概率,在全市不低于的学生中随机抽取6人,其中不低于的人数记为,求的期望.
附:,
0.050
0.010
0.001
3.841
6.635
10.828
【解析】(1)由图,低于的学生有人,则不低于170cm的学生有人.
从而,;
(2)零假设为:性别与身高没有关联,
计算可得
根据的独立性检验,推断不成立,因此该市高三年级学生的性别与身高是否低于170cm有关联;
(3)样本中抽中不低于175cm的频数为人
样本中抽中不低于175cm的频率为
将样本频率视为概率,在全市不低于170cm的学生中随机抽取6人,
其中不低于175cm的人数记为,则
.
15.(2025·高三·山东青岛·期末)现将近几日某地区门锁销售的数量进行统计,得到如下表格:
第x天
1
2
3
4
5
6
7
数量y
200
260
280
350
420
440
500
(1)若y与x线性相关,求出y关于x的经验回归方程,并预测第10天该地区门锁的销售数量;(参考公式和数据:)
(2)某人手里有三把钥匙,其中只有一把可以打开门锁,他现在无法分清哪一把能够打.记X为他有放回的进行开锁时的开锁次数,Y为他无放回的进行开锁时的开锁次数.求的概率.
【解析】(1)依题意可得;
又,
所以,
可知,
所以经验回归方程为,
将代入该方程可得预测第10天该地区门锁的销售数量为;
(2)有放回时,随机变量对应的概率为;
无放回时,随机变量对应的概率为;
若,则有以下情况:
当时,,此时概率为;
当时,或,此时概率为;
因此可得的概率为.
16.(2025·辽宁·模拟预测)某商场为了解月投放消费券(单位:千元)和月利润(单位:万元)的关系,进行了数据收集整理,得到下面的表格:
月投放消费券千元
25
64
100
144
196
289
月利润万元
591
595
600
604
607
615
(1)根据表中数据,通过作散点图分析,可把作为关于的经验回归方程,试求该经验回归方程;
(2)该商场为进一步提高利润,推出了“购物达千元,玩游戏,送消费券”的活动.在商场游戏活动点放置甲、乙两个袋子,甲袋中放有3个相同的小盒,其中有两个小盒中放有“奖”字条,另一个是空盒,乙袋中也放有3个与甲袋中相同的小盒,都是空盒.游戏活动参加者先从甲、乙两袋中各任取一个小盒交换后再放回袋子中,重复次这样的操作后,记甲袋中恰有2个小盒放有“奖”字条的概率为,恰有1个小盒放有“奖”字条的概率为.若甲袋中恰有2个小盒放有“奖”字条,参加者可得200元消费券;恰有1个小盒放有“奖”字条,参加者可得100元消费券;没有小盒放有“奖”字条,参加者可得50元消费券.
(i)求;
(ii)记一个游戏活动参加者参加一次活动获得消费券总数为,分别求和的数学期望和,并判断对于和,游戏活动参加者应如何选择?
附:对于一组数据,其回归直线的斜率和截距的最小二乘估计分别为.
【解析】(1)设,则,
,
所以,
,
所以,
,
所以,
,
所以关于的经验回归方程为.
(2)(i)由题意得,
由全概率公式得,
.
(ii)由题意可知,
,
和的可能取值为,和的分布列分别为
50
100
200
50
100
200
,
,
因为,
所以,
故游戏活动参加者应选择.
2 / 14
学科网(北京)股份有限公司
$$
第9章 统计 章末题型归纳总结
变量间的相关关系
1、变量之间的相关关系
当自变量取值一定时,因变量的取值带有一定的随机性,则这两个变量之间的关系叫相关关系.由于相关关系的不确定性,在寻找变量之间相关关系的过程中,统计发挥着非常重要的作用.我们可以通过收集大量的数据,在对数据进行统计分析的基础上,发现其中的规律,对它们的关系作出判断.
注意:相关关系与函数关系是不同的,相关关系是一种非确定的关系,函数关系是一种确定的关系,而且函数关系是一种因果关系,但相关关系不一定是因果关系,也可能是伴随关系.
2、散点图
将样本中的个数据点描在平面直角坐标系中,所得图形叫做散点图.根据散点图中点的分布可以直观地判断两个变量之间的关系.
(1)如果散点图中的点散布在从左下角到右上角的区域内,对于两个变量的这种相关关系,我们将它称为正相关,如图(1)所示;
(2)如果散点图中的点散布在从左上角到右下角的区域内,对于两个变量的这种相关关系,我们将它称为负相关,如图(2)所示.
3、相关系数
若相应于变量的取值,变量的观测值为,则变量与的相关系数,通常用来衡量与之间的线性关系的强弱,的范围为.
(1)当时,表示两个变量正相关;当时,表示两个变量负相关.
(2)越接近,表示两个变量的线性相关性越强;越接近,表示两个变量间几乎不存在线性相关关系.当时,所有数据点都在一条直线上.
(3)通常当时,认为两个变量具有很强的线性相关关系.
(2025·宁夏银川·一模)有一散点图如图所示,在5个数据中去掉后,下列说法错误的是( )
A.残差平方和变小 B.相关系数r变大
C.决定系数变大 D.解释变量x与响应变量y的相关性变弱
线性回归
1、线性回归
线性回归是研究不具备确定的函数关系的两个变量之间的关系(相关关系)的方法.
对于一组具有线性相关关系的数据(x1,y1),(x2,y2),…,(xn,yn),其回归方程的求法为
其中,,,(,)称为样本点的中心.
2、残差分析
对于预报变量,通过观测得到的数据称为观测值,通过回归方程得到的称为预测值,观测值减去预测值等于残差,称为相应于点的残差,即有.残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果以及判断原始数据中是否存在可疑数据等,这方面工作称为残差分析.
(1)残差图
通过残差分析,残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,其中这样的带状区域的宽度越窄,说明模型拟合精确度越高;反之,不合适.
(2)通过残差平方和分析,如果残差平方和越小,则说明选用的模型的拟合效果越好;反之,不合适.
(3)相关指数
用相关指数来刻画回归的效果,其计算公式是:.
越接近于,说明残差的平方和越小,也表示回归的效果越好.
(2025·广东·模拟预测)已知变量与的取值如下表:
1
2
3
4
5
5
8
11
且对呈现线性相关关系,则与的经验回归方程必经过的定点为( )
A. B. C. D.
非线性回归
解答非线性拟合问题,要先根据散点图选择合适的函数类型,设出回归方程,通过换元将陌生的非线性回归方程化归转化为我们熟悉的线性回归方程.
求出样本数据换元后的值,然后根据线性回归方程的计算方法计算变换后的线性回归方程系数,还原后即可求出非线性回归方程,再利用回归方程进行预报预测,注意计算要细心,避免计算错误.
1、建立非线性回归模型的基本步骤:
(1)确定研究对象,明确哪个是解释变量,哪个是预报变量;
(2)画出确定好的解释变量和预报变量的散点图,观察它们之间的关系(是否存在非线性关系);
(3)由经验确定非线性回归方程的类型(如我们观察到数据呈非线性关系,一般选用反比例函数、二次函数、指数函数、对数函数、幂函数模型等);
(4)通过换元,将非线性回归方程模型转化为线性回归方程模型;
(5)按照公式计算线性回归方程中的参数(如最小二乘法),得到线性回归方程;
(6)消去新元,得到非线性回归方程;
(7)得出结果后分析残差图是否有异常.若存在异常,则检查数据是否有误,或模型是否合适等.
(2025·四川·模拟预测)下表是某工厂记录的一个反应器投料后,连续8天每天某种气体的生成量(L):
日期代码x
1
2
3
4
5
6
7
8
生成的气体y(L)
4
8
16
31
51
71
97
122
为了分析该气体生成量变化趋势、工厂分别用两种模型:①,②对变量x和y的关系进行拟合,得到相应的回归方程并进行残差分析,残差图如下:
注:残差:经计算得,,,,其中,
(1)根据残差图、比较模型①,模型②的拟合效果,应该选择哪个模型?并简要说明理由;
(2)根据(1)问选定的模型求出相应的回归方程(系数均保留两位小数);
(3)若在第8天要根据(2)问求出的回归方程来对该气体生成量做出预测,那么估计第9天该气体生成量是多少?(精确到个位)
附:回归直线的斜率和截距的最小二乘估计公式分别为:,.
独立性检验
1、分类变量和列联表
(1)分类变量:
变量的不同“值”表示个体所属的不同类别,像这样的变量称为分类变量.
(2)列联表:
①定义:列出的两个分类变量的频数表称为列联表.
②2×2列联表.
一般地,假设有两个分类变量X和Y,它们的取值分别为{,}和{,},其样本频数列联表(称为2×2列联表)为
总计
总计
从列表中,依据与的值可直观得出结论:两个变量是否有关系.
2、等高条形图
(1)等高条形图和表格相比,更能直观地反映出两个分类变量间是否相互影响,常用等高条形图表示列联表数据的频率特征.
(2)观察等高条形图发现与相差很大,就判断两个分类变量之间有关系.
3、独立性检验
计算随机变量利用的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验.
0.10
0.05
0.010
0.005
0.001
2.706
3.841
6.635
7.879
10.828
(2025·辽宁·二模)某实验中学为调查本校高三学生的学习成绩是否与坚持体育锻炼有关,随机选取了高三300名学生的某次联考成绩进行统计,得到如下表格:
分数
锻炼
合计
坚持锻炼
不坚持锻炼
分数
100
80
180
分数<600
50
70
120
合计
150
150
300
依据小概率值的独立性检验,可以认为高三学生的学习成绩与坚持进行体育锻炼有关,则m的值可能是( )
附:,.
α
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
A.0.001 B.0.005 C.0.01 D.0.05
线性回归方程
【例1】(2025·江西九江·二模)植物的根是吸收水分和矿物养分的主要器官.已知在一定范围内,小麦对氮元素的吸收量与它的根长度具有线性相关关系.某盆栽小麦实验中,在确保土壤肥力及灌溉条件相对稳定的情况下,统计了根长度(单位:)与氮元素吸收量(单位:天)的相关数据,如下表所示:
9.9
12.1
14.8
18.2
19.9
21.8
25.1
27.7
30.4
32.1
0.30
0.34
0.42
0.50
0.55
0.60
0.71
0.74
0.78
0.86
根据表中数据可得及线性回归方程为,则( )
A.
B.变量与的相关系数
C.在一定范围内,小麦的根长度每增加,它一天的氮元素吸收量平均增加
D.若对小麦的根长度与钾元素吸收量的相关数据进行统计,则对应回归方程不变
【变式1-1】(2025·河北秦皇岛·一模)近几年我国新能源汽车产业快速发展,据行业数据显示,新能源汽车的数量在不断增加.下表为某城市统计的近5年新能源汽车的新增数量,其中为年份代号,(单位:万辆)代表新增新能源汽车的数量.
年份
2020
2021
2022
2023
2024
年份代号
1
2
3
4
5
新增新能源汽车万辆
1.2
1.8
2.5
3.2
3.8
(1)计算样本相关系数,判断是否可以用线性回归模型拟合与的关系,当时,可以认为两个变量有很强的线性相关性;否则,没有很强的线性相关性.
(2)求关于的经验回归方程,并据此估计该城市2026年的新增新能源汽车的数量;
参考数据:.参考公式:.
【变式1-2】(2025·高二·陕西宝鸡·期末)如图是某采矿厂的污水排放量单位:吨与矿产品年产量单位:吨的折线图:
(1)依据折线图计算相关系数精确到,并据此判断是否可用线性回归模型拟合y与x的关系?若,则线性相关程度很高,可用线性回归模型拟合
(2)若可用线性回归模型拟合与的关系,请建立关于的线性回归方程,并预测年产量为10吨时的污水排放量.
相关公式:,参考数据:.
回归方程中,
【变式1-3】(2025·高二·江西吉安·期末)防疫抗疫,人人有责,随着奥密克戎的全球肆虐,防疫形势越来越严峻,防疫物资需求量急增.下表是某口罩厂今年的月份与订单(单位:万元)的几组对应数据:
月份
1
2
3
4
5
订单
20
24
43
52
(1)求关于的线性回归方程,并估计6月份该厂的订单数;
(2)求相关系数(精确到0.01),说明与之间具有怎样的相关关系.
参考数据:,,.,.参考公式:相关系数;回归直线的方程是,其中.
【变式1-4】(2025·宁夏石嘴山·一模)某人工智能公司从2018至2024年的利润情况如下表所示:
年份
2018
2019
2020
2021
2022
2023
2024
年份代码x
1
2
3
4
5
6
7
利润y(单位:亿元)
2.9
3.3
3.6
4.4
4.8
5.2
5.9
(1)根据表中的数据,推断变量y与x之间是否线性相关.计算y与x之间的相关系数(精确到0.01),并推断它们的相关程度;
(2)求出y关于x的经验回归方程,并预测该人工智能公司2025年的利润;
(3)把利润不超过4(亿元)的年份叫做“试销年”,从2018年到2024年这七年中任取2年,X表示取到“试销年”的个数,求X的分布列和数学期望.
参考数据:,,,
参考公式:对于一组数据,
①相关系数为:;
②经验回归直线的斜率和截距的最小二乘估计公式分别,.
【解题方法总结】
对于一组具有线性相关关系的数据(,),(,),…,(,),其回归方程的求法为,其中,,,(,)称为样本点的中心.
非线性回归方程
【例2】(2025·高二·宁夏石嘴山·期中)红铃虫是棉花的主要害虫之一,其产卵数与温度有关.现收集到一只红铃虫的产卵数(个)和温度的8组观测数据,制成图l所示的散点图,现用两种模型①,②分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图.
根据收集到的数据,计算得到如下值:表中;;;
25
2.9
646
168
422688
50.4
70308
(1)根据残差图,比较模型①、②的拟合效果,哪种模型比较合适?
(2)求出关于的回归方程.附:对于一组数据,,…,其回归直线的斜率和截距的最小二乘估计分别为,,
【变式2-1】(2025·陕西宝鸡·模拟预测)统计显示,我国在线直播生活购物用户规模近几年保持高速增长态势,下表为年—年我国在线直播生活购物用户规模(单位:亿人),其中年—年对应的代码依次为—.
年份代码
市场规模
,,,其中
参考公式:对于一组数据、、、,其经验回归直线的斜率和截距的最小二乘估计公式分别为,.
(1)由上表数据可知,若用函数模型拟合与的关系,请估计年我国在线直播生活购物用户的规模(结果精确到);
(2)已知我国在线直播生活购物用户选择在品牌官方直播间购物的概率,现从我国在线直播购物用户中随机抽取人,记这人中选择在品牌官方直播间购物的人数为,若,求的数学期望和方差.
【变式2-2】(2025·广东茂名·一模)一只药用昆虫的产卵数与一定范围内的温度有关,现收集了该种药用昆虫的6组观测数据如下表:
温度
21
23
24
27
29
32
产卵数个
6
11
20
27
57
77
经计算得:线性回归模型的残差平方和,其中分别为观测数据中的温差和产卵数,.
(1)若用线性回归方程,求关于的回归方程(精确到0.1);
(2)若用非线性回归模型求得关于回归方程为,且相关指数0.9522.
(i)试与(1)中的回归模型相比,用说明哪种模型的拟合效果更好.
(ii)用拟合效果好的模型预测温度为时该种药用昆虫的产卵数(结果取整数).
附:一组数据,其回归直线的斜率和截距的最小二乘估计为;相关指数.
【变式2-3】(2025·湖北荆州·一模)已知鸡的产蛋量与鸡舍的温度有关,为了确定下一个时段鸡舍的控制温度,某企业需要了解鸡舍的温度(单位),对某种鸡的时段产蛋量(单位: )和时段投入成本(单位:万元)的影响,为此,该企业收集了7个鸡舍的时段控制温度和产蛋量的数据,对数据初步处理后得到了如图所示的散点图和表中的统计量的值.
17.40
82.30
3.6
140
9.7
2935.1
35.0
其中, .
(1)根据散点图判断, 与哪一个更适宜作为该种鸡的时段产蛋量关于鸡舍时段控制温度的回归方程类型?(给判断即可,不必说明理由)
(2)若用作为回归方程模型,根据表中数据,建立关于的回归方程;
(3)已知时段投入成本与的关系为,当时段控制温度为时,鸡的时段产蛋量及时段投入成本的预报值分别是多少?
附:①对于一组具有线性相关关系的数据,其回归直线的斜率和截距的最小二乘估计分别为,
②
0.08
0.47
2.72
20.09
1096.63
【解题方法总结】
解答非线性拟合问题,要先根据散点图选择合适的函数类型,设出回归方程,通过换元将陌生的非线性回归方程化归转化为我们熟悉的线性回归方程.
独立性检验
【例3】(2025·甘肃·一模)为了解高一学生整理数学错题与提高数学成绩的相关性,某小组通过随机抽样,获得了每天整理错题和未每天整理错题的各20名学生3次数学考试成绩的平均分,绘制了如图1,2的频率分布直方图,并且已知高一学生3次数学考试成绩的总体均分为115分.
(1)依据频率分布直方图,完成以下列联表:
成绩不低于总体均分
成绩低于总体均分
合计
每天整理错题
未每天整理错题
合计
(2)依据小概率值的独立性检验,分析数学成绩不低于总体均分是否与每天整理数学错题有关.
附
0.10
0.01
0.001
2.706
6.635
10.828
【变式3-1】(2025·浙江杭州·二模)某车企为考察选购新能源汽车的款式与性别的关联性,调查100人购买情况,得到如下列联表:
新能源汽车款
新能源汽车款
总计
男性
50
10
女性
25
15
40
总计
25
100
(1)求;
(2)根据小概率值的独立性检验,能否认为选购该新能源汽车的款式与性别有关联?
(3)假设用样本估计总体,用频率估计概率,所有人选购汽车的款式情况相互独立.若从购买者中随机抽取3人,设被抽取的3人中购买了B款车的人数为,求的数学期望.
附:,.
0.10
0.05
0.010
0.005
2.706
3.841
6.635
7.879
【变式3-2】(2025·河北秦皇岛·二模)年哈尔滨亚洲冬季运动会,是继年北京冬奥会后中国举办的又一重大国际综合性冰雪盛会,将于年月日至月日在黑龙江省哈尔滨市举行,人们将在观看比赛的同时,开始投入健身的行列.某兴趣小组为了解哈尔滨市不同年龄段的市民每周锻炼的时长情况,随机抽取人进行调查,得到如下列联表:
年龄
周平均锻炼时长
合计
少于小时
不少于小时
岁以下
岁以上(含)
合计
(1)试根据的独立性检验,判断周平均锻炼时长是否与年龄有关;
(2)现从岁以下的样本中按周平均锻炼时长是否少于小时,用分层随机抽样的方法抽取人做进一步访谈,再从这人中随机抽取人填写调查问卷.记抽取人中周平均锻炼时长少于小时的人数为,求的分布列和数学期望.
附:,其中.
【变式3-3】(2025·河南·二模)某校开设校本课程“剪纸”,为了解学生参加该课程与性别是否有关,用简单随机抽样的方法分别从男生和女生中各抽取了50名学生进行调查,得到如下列联表:
性别
课程
合计
参加“剪纸”课程
不参加“剪纸”课程
男生
10
女生
30
50
合计
(1)补全列联表,并依据小概率值的独立性检验,分析参加“剪纸”课程是否与性别有关联;
(2)以样本估计总体,且以频率估计概率,若从该校女生中随机抽取3人,记其中参加“剪纸”课程的人数为,求的期望.
附:,其中.
0.050
0.025
0.010
3.841
5.024
6.635
【解题方法总结】
计算随机变量利用的取值推断分类变量X和Y是否独立的方法称为独立性检验.
统计的综合应用
【例4】(2025·福建泉州·模拟预测)定义两组数据,的“斯皮尔曼系数”为变量在该组数据中的排名和变量在该组数据中的排名的样本相关系数,记为,其中.
某校15名学生的数学成绩的排名与知识竞赛成绩的排名如下表:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
1
5
3
4
9
8
7
6
10
2
12
14
13
11
15
(1)试求这15名学生的数学成绩与知识竞赛成绩的“斯皮尔曼系数”;
(2)已知在这15名学生中有10人数学成绩优秀,现从这15人中随机抽取3人,抽到数学成绩优秀的学生有人,试求的分布列和数学期望.
【变式4-1】(2025·高二·北京海淀·期末)某公司有甲乙两条生产线生产同一种产品,为了解产品的质量情况,对两条生产线生产的产品进行简单随机抽样,经检测得到了A、B的两项质量指标值,记为,定义产品的指标偏差,数据如下表:
甲生产线抽样产品编号
指标
1
2
3
4
5
6
7
8
9
10
0.98
0.96
1.07
1.02
0.99
0.93
0.92
0.96
1.11
1.02
2.01
1.97
1.96
2.03
2.04
1.98
1.95
1.99
2.07
2.02
0.03
0.07
0.11
0.05
0.05
0.09
0.13
0.05
0.18
0.04
乙生产线抽样产品编号
指标
1
2
3
4
5
6
7
8
1.02
0.97
0.95
0.94
1.13
0.98
0.97
1.01
2.01
2.03
2.15
1.93
2.01
2.02
2.19
2.04
0.03
0.06
0.20
0.13
0.14
0.04
0.22
0.05
假设用频率估计概率,且每件产品的质量相互独立.
(1)从甲生产线上随机抽取一件产品,估计该产品满足且的概率;
(2)从甲乙两条生产线上各随机抽取一件产品,设表示这两件产品中满足的产品数,求的分布列和数学期望;
(3)已知的值越小则该产品质量越好.如果甲乙两条生产线各生产一件产品,根据现有数据判断哪条生产线上的产品质量更好?并说明理由.
【变式4-2】(2025·高三·全国·专题练习)北京冬奥会助推户外冰雪运动发展持续升温,近年来越来越多的青年学生喜爱这一运动,为了研究性别与青年学生是否喜爱冰雪运动之间的关系,从某高校的男、女生中各随机抽取200名进行问卷调查,得到如下列联表.
喜爱
不喜爱
合计
男生
200
女生
200
合计
280
120
400
(1)当时,从样本中喜爱冰雪运动的学生中,按性别采用按比例分配的分层随机抽样方法抽取7人,再从这7人中随机抽取4人调研喜爱的原因,记这4人中男生的人数为,求的分布列与数学期望.
(2)定义,其中为列联表中第行第列的实际数据,为列联表中第行与第列的总频率之积再乘列联表的总额数得到的理论频数,如,.基于小概率值的检验规则:首先提出零假设(变量相互独立),然后计算的值,当时,我们推断不成立,即认为和不独立,该推断犯错误的概率不超过;否则,我们没有充分证据推断不成立,可以认为和独立.根据的计算公式,求解下面问题:
①当时,依据小概率值的独立性检验,分析性别与青年学生是否喜爱冰雪运动有关?
②当时,依据小概率值的独立性检验,若认为性别与青年学生是否喜爱冰雪运动有关,则至少有多少名男生喜爱冰雪运动?
附:
0.1
0.025
0.005
2.706
5.024
7.879
【变式4-3】(2025·全国·模拟预测)某医科大学科研部门为研究退休人员是否患痴呆症与上网的关系,随机调查了市100位退休人员,统计数据如下表所示:
患痴呆症
不患痴呆症
合计
上网
16
32
48
不上网
34
18
52
合计
50
50
100
(1)依据的独立性检验,能否认为该市退休人员是否患痴呆症与上网之间有关联?
(2)从该市退休人员中任取一位,记事件A为“此人患痴呆症”,为“此人上网”,则为“此人不患痴呆症”,定义事件A的强度,在事件发生的条件下A的强度.
(i)证明:;
(ⅱ)利用抽样的样本数据,估计的值.
附:,其中.
0.050
0.010
0.001
3.841
6.635
10.828
【变式4-4】(2025·湖南永州·三模)为了精准地找到目标人群,更好地销售新能源汽车,某4S店对近期购车的男性与女性各100位进行问卷调查,并作为样本进行统计分析,得到如下列联表:
购买新能源汽车(人数)
购买传统燃油车(人数)
男性
女性
(1)当时,将样本中购买传统燃油车的购车者按性别采用分层抽样的方法抽取6人,再从这6人中随机抽取3人调查购买传统燃油车的原因,记这3人中女性的人数为X,求X的分布列与数学期望;
(2)定义,其中为列联表中第i行第j列的实际数据,为列联表中第i行与第j列的总频率之积再乘以列联表的总频数得到的理论频数.基于小概率值的检验规则:首先提出零假设(变量X,Y相互独立〉,然后计算的值,当时,我们推断不成立,即认为X和Y不独立,该推断犯错误的概率不超过;否则,我们没有充分证据推断不成立,可以认为X和Y独立.根据的计算公式,求解下面问题:
(i)当时,依据小概率值的独立性检验,请分析性别与是否喜爱购买新能源汽车有关;
(ⅱ)当时,依据小概率值的独立性检验,若认为性别与是否喜爱购买新能源汽车有关,则至少有多少名男性喜爱购买新能源汽车?
附:
0.1
0.025
0.005
2.706
5.024
7.879
【解题方法总结】
灵活运用统计工具,结合实际问题分析,注重解题过程的严谨性。
1.(2025·辽宁·二模)某实验中学为调查本校高三学生的学习成绩是否与坚持体育锻炼有关,随机选取了高三300名学生的某次联考成绩进行统计,得到如下表格:
分数
锻炼
合计
坚持锻炼
不坚持锻炼
分数
100
80
180
分数<600
50
70
120
合计
150
150
300
依据小概率值的独立性检验,可以认为高三学生的学习成绩与坚持进行体育锻炼有关,则m的值可能是( )
附:,.
α
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
A.0.001 B.0.005 C.0.01 D.0.05
2.(2025·江西九江·二模)植物的根是吸收水分和矿物养分的主要器官.已知在一定范围内,小麦对氮元素的吸收量与它的根长度具有线性相关关系.某盆栽小麦实验中,在确保土壤肥力及灌溉条件相对稳定的情况下,统计了根长度(单位:)与氮元素吸收量(单位:天)的相关数据,如下表所示:
9.9
12.1
14.8
18.2
19.9
21.8
25.1
27.7
30.4
32.1
0.30
0.34
0.42
0.50
0.55
0.60
0.71
0.74
0.78
0.86
根据表中数据可得及线性回归方程为,则( )
A.
B.变量与的相关系数
C.在一定范围内,小麦的根长度每增加,它一天的氮元素吸收量平均增加
D.若对小麦的根长度与钾元素吸收量的相关数据进行统计,则对应回归方程不变
3.(2025·湖北·模拟预测)根据变量和的成对样本数据,由一元线性回归模型①,得到经验回归模型,对应的残差如图(1)所示.根据变量和的成对样本数据,由一元线性回归模型②,得到经验回归模型,对应的残差如图(2)所示,则( )
A.模型①的误差满足一元线性回归模型的的假设,不满足的假设
B.模型①的误差不满足一元线性回归模型的的假设,满足的假设
C.模型②的误差满足一元线性回归模型的的假设,不满足的假设
D.模型②的误差不满足一元线性回归模型的的假设,满足的假设
4.(2025·河北沧州·一模)若变量y与x之间存在线性相关关系,且根据最小二乘法得到的经验回归方程为,样本点中心为,则样本点的残差为( )
A. B.1.5 C.0.5 D.
5.(2025·陕西汉中·二模)2024年全民健身运动的主题“全民健身与奥运同行”,为了满足群众健身需求,某健身房近几年陆续购买了几台型跑步机,该型号跑步机已投入使用的时间(单位:年)与当年所需要支出的维修费用(单位:千元)有如下统计资料:
2
3
4
5
6
2.2
3.8
5.5
6.5
7
根据表中的数据可得到线性回归方程为,则( )
A.与的样本相关系数
B.
C.表中维修费用的第60百分位数为6.5
D.该型跑步机已投入使用的时间为10年时,当年所需要支出的维修费用一定是12.38万元
6.(2025·重庆·模拟预测)已知变量和的统计数据如下表.
80
90
100
110
120
y
120
140
165
180
若,线性相关,经验回归方程为,则( )
A.155 B.158 C.160 D.162
7.(2025·福建莆田·二模)为了解女儿身高与其母亲身高的关系,随机抽取5对母女的身高数据如下:
母亲身高
164
166
166
166
168
女儿身高
165
165
166
167
167
根据最小二乘法(即取最小),关于的回归直线方程为( )
A. B. C. D.
8.(多选题)(2025·河北秦皇岛·二模)某科技公司统计了一款App最近5个月的下载量,如下表所示,若与线性相关,且经验回归方程为,则( )
月份编号
1
2
3
4
5
下载量万次
5
4.5
4
3.5
2.5
A.与负相关 B.
C.第7个月的下载量估计为1.8万次 D.残差绝对值的最大值为0.2
9.(多选题)(2025·山东济南·一模)为了验证牛的毛色(黑色、红色)和角(有角、无角)这两对相对性状是否相关,某学院进行了一次数据统计,并根据形成的2×2列联表,计算得到,根据小概率值为的独立性检验,则( )
附:
0.100
0.050
0.010
2.706
3.841
6.635
A.若,则认为“毛色”和“角”无关
B.若,则认为“毛色”和“角”有关,此推断犯错误的概率不超过10%
C.若,则认为“毛色”和“角”无关
D.若,则认为“毛色”和“角”有关,此推断犯错误的概率不超过1%
10.(多选题)(2025·湖南·模拟预测)小王经过调查获得如下数据:
2
4
7
17
30
1
2
3
4
5
参考公式:相关系数,,.
下列说法正确的有( )
A.该数据组的线性回归方程(系数精确到0.01)为
B.该数据组的相关系数,很接近1说明该数据组拟合效果很好
C.所有数据点中残差最小的是
D.去掉数据点后,回归直线会向下移动
11.(2025·黑龙江哈尔滨·一模)由样本数据,求得回归直线方程为,且,若去除偏离点后,得到新的回归直线方程为,则去除偏离点后,相应于样本点的残差值为 .
12.(2025·全国·模拟预测)害虫防控对于提高农作物产量具有重要意义.已知某种害虫产卵数(单位:个)与温度(单位:)有关,测得一组数据,可用模型进行拟合,利用变换得到的线性回归方程为.若,则的值为 .
13.(2025·高三·全国·课后作业)某校团委对“学生性别和喜欢网络游戏是否有关”作了一次调查,其中被调查的男女生人数相同,男生喜欢网络游戏的人数占男生人数的,女生喜欢网络游戏的人数占女生人数的.若根据独立性检验认为喜欢网络游戏和性别有关,且此推断犯错误的概率超过0.01但不超过0.05,则被调查的学生中男生可能有 人.(请将所有可能的结果都填在横线上)
附表:,其中.
0.050
0.010
3.841
6.635
14.(2025·内蒙古赤峰·一模)为了研究某市高三年级学生的性别和身高的关联性,随机抽取了200名高三年级学生,整理数据得到如下列联表,并画出身高的频率分布直方图:
性别
身高
合计
低于
不低于
女
20
男
50
合计
200
(1)根据身高的频率分布直方图,求列联表中的,的值;
(2)依据小概率值的独立性检验,能否认为“高三年级学生的性别”与“身高是否低于”有关联?
(3)将样本频率视为概率,在全市不低于的学生中随机抽取6人,其中不低于的人数记为,求的期望.
附:,
0.050
0.010
0.001
3.841
6.635
10.828
15.(2025·高三·山东青岛·期末)现将近几日某地区门锁销售的数量进行统计,得到如下表格:
第x天
1
2
3
4
5
6
7
数量y
200
260
280
350
420
440
500
(1)若y与x线性相关,求出y关于x的经验回归方程,并预测第10天该地区门锁的销售数量;(参考公式和数据:)
(2)某人手里有三把钥匙,其中只有一把可以打开门锁,他现在无法分清哪一把能够打.记X为他有放回的进行开锁时的开锁次数,Y为他无放回的进行开锁时的开锁次数.求的概率.
16.(2025·辽宁·模拟预测)某商场为了解月投放消费券(单位:千元)和月利润(单位:万元)的关系,进行了数据收集整理,得到下面的表格:
月投放消费券千元
25
64
100
144
196
289
月利润万元
591
595
600
604
607
615
(1)根据表中数据,通过作散点图分析,可把作为关于的经验回归方程,试求该经验回归方程;
(2)该商场为进一步提高利润,推出了“购物达千元,玩游戏,送消费券”的活动.在商场游戏活动点放置甲、乙两个袋子,甲袋中放有3个相同的小盒,其中有两个小盒中放有“奖”字条,另一个是空盒,乙袋中也放有3个与甲袋中相同的小盒,都是空盒.游戏活动参加者先从甲、乙两袋中各任取一个小盒交换后再放回袋子中,重复次这样的操作后,记甲袋中恰有2个小盒放有“奖”字条的概率为,恰有1个小盒放有“奖”字条的概率为.若甲袋中恰有2个小盒放有“奖”字条,参加者可得200元消费券;恰有1个小盒放有“奖”字条,参加者可得100元消费券;没有小盒放有“奖”字条,参加者可得50元消费券.
(i)求;
(ii)记一个游戏活动参加者参加一次活动获得消费券总数为,分别求和的数学期望和,并判断对于和,游戏活动参加者应如何选择?
附:对于一组数据,其回归直线的斜率和截距的最小二乘估计分别为.
2 / 14
学科网(北京)股份有限公司
$$
相关资源
示范课
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。