内容正文:
“功夫”2025届第一轮精练
第54讲 成对数据的统计分析
第54讲 成对数据的统计分析
“功夫”2025届第一轮精练
最新考题尽在“功夫”!- 6 -
最新考题尽在“功夫”!- 7 -
学科网(北京)股份有限公司
学习目标
1. 了解样本相关系数的统计含义.
2. 了解一元线性回归模型和2×2列联表,会运用这些方法解决简单的实际问题.
3. 会利用统计软件进行数据分析.
成对数据的相关性
知识:
【例1】1.(2024·天津)下列图中,线性相关性系数最大的是( )
A.B.C. D.
【解析】观察4幅图可知,A图散点分布比较集中,且大体接近某一条直线,线性回归模型拟合效果比较好,呈现明显的正相关,值相比于其他3图更接近1.
故选:A
2.(2023·天津·)鸢是鹰科的一种鸟,《诗经·大雅·旱麓》曰:“鸢飞戾天,鱼跃余渊”. 鸢尾花因花瓣形如鸢尾而得名,寓意鹏程万里、前途无量.通过随机抽样,收集了若干朵某品种鸢尾花的花萼长度和花瓣长度(单位:cm),绘制散点图如图所示,计算得样本相关系数为,利用最小二乘法求得相应的经验回归方程为,根据以上信息,如下判断正确的为( )
A.花瓣长度和花萼长度不存在相关关系
B.花瓣长度和花萼长度负相关
C.花萼长度为7cm的该品种鸢尾花的花瓣长度的平均值为
D.若从样本中抽取一部分,则这部分的相关系数一定是
【解析】根据散点的集中程度可知,花瓣长度和花萼长度有相关性,A选项错误
散点的分布是从左下到右上,从而花瓣长度和花萼长度呈现正相关性,B选项错误,
把代入可得,C选项正确;
由于是全部数据的相关系数,取出来一部分数据,相关性可能变强,可能变弱,即取出的数据的相关系数不一定是,D选项错误
故选:C
感悟提升 判定两个变量相关性的方法
(1)画散点图:点的分布从左下角到右上角,两个变量正相关;点的分布从左上角到右下角,两个变量负相关.
(2)样本相关系数:当r>0时,正相关;当r<0时,负相关;|r|越接近于1,相关性越强.
(3)决定系数法:利用决定系数判定,R2越接近1,模型的拟合效果越好,相关性越强.
【拓展练习】1.(2024上海夏)已知气候温度和海水表层温度相关,且相关系数为正数,对此描述正确的是( )
A.气候温度高,海水表层温度就高 B.气候温度高,海水表层温度就低
C.随着气候温度由低到高,海水表层温度呈上升趋势
D.随着气候温度由低到高,海水表层温度呈下降趋势
【解析】对于AB,当气候温度高,海水表层温度变高变低不确定,故AB错误.
对于CD,因为相关系数为正,故随着气候温度由低到高时,海水表层温度呈上升趋势,
故C正确,D错误.故选:C.
2.(2022全国乙理)某地经过多年的环境治理,已将荒山改造成了绿水青山.为估计一林区某种树木的总材积量,随机选取了10棵这种树木,测量每棵树的根部横截面积(单位:)和材积量(单位:),得到如下数据:
样本号i
1
2
3
4
5
6
7
8
9
10
总和
根部横截面积
0.04
0.06
0.04
0.08
0.08
0.05
0.05
0.07
0.07
0.06
0.6
材积量
0.25
0.40
0.22
0.54
0.51
0.34
0.36
0.46
0.42
0.40
3.9
并计算得.
(1)估计该林区这种树木平均一棵的根部横截面积与平均一棵的材积量;
(2)求该林区这种树木的根部横截面积与材积量的样本相关系数(精确到0.01);
(3)现测量了该林区所有这种树木的根部横截面积,并得到所有这种树木的根部横截面积总和为.已知树木的材积量与其根部横截面积近似成正比.利用以上数据给出该林区这种树木的总材积量的估计值.
附:相关系数.
【解析】(1)样本中10棵这种树木的根部横截面积的平均值
样本中10棵这种树木的材积量的平均值
据此可估计该林区这种树木平均一棵的根部横截面积为,
平均一棵的材积量为
(2)
则
(3)设该林区这种树木的总材积量的估计值为,
又已知树木的材积量与其根部横截面积近似成正比,
可得,解之得.
则该林区这种树木的总材积量估计为
线性经验回归方程
知识:
【例2】 1. 某研究机构为调查人的最大可视距离y(单位:米)和年龄x(单位:岁)之间的关系,对不同年龄的志愿者进行了研究,收集数据得到下表:
x
20
25
30
35
40
y
167
160
150
143
130
(1)根据上表提供的数据,求出y关于x的经验回归方程;
(2)根据(1)中求出的经验回归方程,估计年龄为50岁的人的最大可视距离.
参考公式:经验回归方程=x+中斜率和截距的最小二乘估计公式分别为==,=-.
【解析】(1)由题意可得==30,
==150,
xiyi=20×167+25×160+30×150+35×143+40×130=22 045,
=202+252+302+352+402=4 750,
所以===-1.82,
则=-=150+1.82×30=204.6,
故所求经验回归方程为=-1.82x+204.6.
(2)当x=50时,=-1.82×50+204.6=113.6,
即年龄为50岁的人的最大可视距离约为113.6米.
思维升华 求经验回归方程的步骤
2.(2023·福州统考)已知变量x和y的统计数据如表:
x
6
7
8
9
10
y
3.5
4
5
6
6.5
若由表中数据得到经验回归方程为=0.8x+,则当x=10时的残差为________(注:观测值减去预测值称为残差).
【解析】 ==8,
==5,
则=5-0.8×8=-1.4,
所以=0.8x-1.4,当x=10时,=6.6,
所以当x=10时的残差为6.5-6.6=-0.1.
【拓展练习】3.某地为响应“扶贫必扶智,扶智就是扶知识、扶技术、扶方法”的号召,建立了农业科技图书馆,供农民免费借阅,收集的自2016年至2020年共5年的借阅数据如下表:
年份
2016
2017
2018
2019
2020
年份代码x
1
2
3
4
5
年借阅量y(万册)
4.9
5.1
5.5
5.7
5.8
根据上表,可得y关于x的经验回归方程为=0.24x+,下列结论正确的有( )
A.=4.68 B.4.9,5.1,5.5,5.7,5.8的75%分位数为5.7
C.y与x的样本相关系数 D.2023年的借阅量一定为6.6万册
【解析】对于A,因为=×(1+2+3+4+5)=3,=×(4.9+5.1+5.5+5.7+5.8)=5.4,所以5.4=0.24×3+,得=4.68,A正确;
对于B,因为5×75%=3.75,所以4.9,5.1,5.5,5.7,5.8的75%分位数为5.7,B正确;对于C,由0.24>0,可知C正确;
对于D,由A可知=0.24×8+4.68=6.6,所以2023年的借阅量约为6.6万册,D错误.故选ABC.
非线性回归模型
【例3】1.某汽车销售公司某年经济收入在短期内逐月攀升,该公司在1月份至6月份的销售收入y(单位:百万元)关于月份x的数据如下表:
时间x/月
1
2
3
4
5
6
收入y/百万元
6.6
8.6
16.1
21.6
33.0
41.0
根据以上数据绘制散点图如图所示.
(1)根据散点图判断:与y=cedx(a,b,c,d均为常数)哪一个适宜作为该公司销售收入y关于月份x的回归方程类型?(给出判断即可,不必说明理由)
(2)根据(1)的结果及表中数据,求出y关于x的经验回归方程,并预测该公司8月份的销售收入.(结果近似到小数点后第二位)
参考数据:
3.50
21.15
2.85
17.5
125.35
6.73
其中设u=ln y,ui=ln yi(i=1,2,3,4,5,6).
附:公式见本讲知识聚焦,e4.56≈95.58,e4.58≈97.51.
【解析】(1) 因为散点图中点的分布不是一条直线,相邻两点在y轴上差距是增大的趋势,所以用y=cedx表示更合适.
(2) 由y=cedx,得ln y=ln (cedx)=ln c+dx,
设u=ln y,所以u=ln c+dx.
因为=3.50,=17.50,=6.73,=2.85,
所以==≈0.38,ln c=-0.38=2.85-0.38×3.50=1.52,
所以ln y=1.52+0.38x,即=e1.52+0.38x,则经验回归方程为y=e1.52+0.38x.
当x=8时,y=e1.52+0.38×8=e4.56≈95.58,
故预测该公司8月份的销售收入为95.58百万元.
思维升华
(1)类型一:y=cebx,对方程两边取对数,则方程变为ln y=ln (cebx)=ln c+bx,将ln y,ln c进行换元,ln y=z,ln c=a,则非线性经验回归方程变成线性经验回归方程z=a+bx;
(2)类型二:y=kcx+d,常见的变化形式为y-d=kcx⇒ln (y-d)=ln k+x ln c,令ln (y-d)=z,lnk=a,ln c=b,则非线性经验回归方程变成线性经
2.中国茶文化博大精深,已知茶水的口感与茶叶类型以及水温有关.经验表明,某种绿茶用85 ℃的水泡制,再等到茶水温度降至60 ℃时饮用,可以产生最佳口感.某学习研究小组通过测量,得到了下面表格中的数据(室温是20 ℃).
泡制时间x/min
0
1
2
3
4
水温y/℃
85
79
74
71
65
(1)小组成员根据上面表格中的数据绘制散点图,并根据散点图分布情况,考虑到茶水温度降到室温(即20 ℃)就不能再降的事实,决定选择函数模型y=kcx+20(x≥0)来刻画.
①令z=ln(y-20),求出z关于x的经验回归方程;
②利用①的结论,求出y=kcx+20(x≥0,c>0)中的k与c.
(2)你认为该品种绿茶用85 ℃的水大约泡制多久后饮用,可以产生最佳口感?
参考数据:ln 65≈4.2,ln 59≈4.1,ln 54≈4.0,ln 51≈3.9,ln 45≈3.8,log0.90.6≈4.8,e-0.1≈0.9,e4.2≈66.7,≈0.6.
参考公式:=x+,=,=-.
【解析】(1)①由已知得出x与z的关系,如下表:
泡制时间x/min
0
1
2
3
4
z
4.2
4.1
4.0
3.9
3.8
设经验回归方程为=x+,
由题意,得==2,
==4,
∴(xi-)(zi-)=(-2)×0.2+(-1)×0.1+1×(-0.1)+2×(-0.2)=-1,
(xi-)2=(-2)2+(-1)2+12+22=10,
则===-0.1,
=-=4+0.1×2=4.2,
则z关于x的经验回归方程为=-0.1x+4.2.
②由y=kcx+20(x≥0),得y-20=kcx(x≥0),
两边取对数得,ln(y-20)=ln k+xln c,
利用①的结论得:ln c=-0.1,ln k=4.2,
∴c=e-0.1≈0.9,k=e4.2≈66.7.
(2)由(1)得,y=66.7×0.9x+20(x≥0),
令y=60,得x≈log0.90.6≈4.8.
∴该品种绿茶用85 ℃的水大约泡制4.8 min后饮用口感最佳.
【拓展练习】4.(2020·全国)某校一个课外学习小组为研究某作物种子的发芽率y和温度x(单位:°C)的关系,在20个不同的温度条件下进行种子发芽实验,由实验数据得到下面的散点图:
由此散点图,在10°C至40°C之间,下面四个回归方程类型中最适宜作为发芽率y和温度x的回归方程类型的是( )
A. B. C. D.
【解析】由散点图分布可知,散点图分布在一个对数函数的图象附近,
因此,最适合作为发芽率和温度的回归方程类型的是.
故选:D.
5. (2024·西安调研)某商业银行对存款利率与日存款总量的关系进行调研,发现存款利率每上升一定的百分点,日均存款总额就会发生一定的变化,经过统计得到下表:
利率上升百分点x
0.1
0.2
0.3
0.4
0.5
日均存款总额y(亿元)
0.2
0.35
0.5
0.65
0.8
(1)在给出的坐标系中画出上表数据的散点图;
(2)根据上表提供的数据,用最小二乘法求出y关于x的经验回归方程;
(3)已知现行利率下的日均存款总额为0.625亿元,试根据(2)中的经验回归方程,预测日均存款总额为现行利率下的2倍时,利率需上升多少个百分点?
参考公式及数据:①=,=-,②,=0.55.
【解析】 (1)如图所示.
(2)由表格数据可得
=×(0.1+0.2+0.3+0.4+0.5)=0.3,
=×(0.2+0.35+0.5+0.65+0.8)=0.5,
所以===1.5,
=-=0.5-1.5×0.3=0.05,
故=1.5x+0.05.
(3)设利率需上升x个百分点,
由(2)得,0.625×2=1.5x+0.05,解得x=0.8,
所以预测利率需上升0.8个百分点.
列联表与独立性检验
【例4】1.(2024年上海夏季)为了解某地初中学生体育锻炼时长与学业成绩的关系,从该地区29000名学生中抽取580人,得到日均体育锻炼时长与学业成绩的数据如下表所示:
时间范围
学业成绩
优秀
5
44
42
3
1
不优秀
134
147
137
40
27
(1)该地区29000名学生中体育锻炼时长不少于1小时人数约为多少?
(2)估计该地区初中学生日均体育锻炼的时长(精确到0.1)
(3)是否有的把握认为学业成绩优秀与日均体育锻炼时长不小于1小时且小于2小时有关?
(附:其中,.)
【解析】(1)由表可知锻炼时长不少于1小时的人数为占比,
则估计该地区29000名学生中体育锻炼时长不少于1小时的人数为.
(2)估计该地区初中生的日均体育锻炼时长约为
.
则估计该地区初中学生日均体育锻炼的时长为0.9小时.
其他
合计
优秀
45
50
95
不优秀
177
308
485
合计
222
358
580
(3)由题列联表如下:
提出零假设:该地区成绩优秀与日均锻炼时长不少于1小时但少于2小时无关.
其中.
.
则零假设不成立,
即有的把握认为学业成绩优秀与日均锻炼时长不小于1小时且小于2小时有关.
思维升华 独立性检验的一般步骤
(1)根据样本数据制成2×2列联表.
(2)根据公式计算.
(3)比较χ2与临界值的大小关系,作统计推断.
2.(2024全国甲理)某工厂进行生产线智能化升级改造,升级改造后,从该工厂甲、乙两个车间的产品中随机抽取150件进行检验,数据如下:
优级品
合格品
不合格品
总计
甲车间
26
24
0
50
乙车间
70
28
2
100
总计
96
52
2
150
(1)填写如下列联表:
优级品
非优级品
甲车间
乙车间
能否有的把握认为甲、乙两车间产品的优级品率存在差异?能否有的把握认为甲,乙两车间产品的优级品率存在差异?
(2)已知升级改造前该工厂产品的优级品率,设为升级改造后抽取的n件产品的优级品率.如果,则认为该工厂产品的优级品率提高了,根据抽取的150件产品的数据,能否认为生产线智能化升级改造后,该工厂产品的优级品率提高了?()
附:
0.050
0.010
0.001
k
3.841
6.635
10.828
优级品
非优级品
甲车间
26
24
乙车间
70
30
【解析】(1)根据题意可得列联表:
可得,
因为,
所以有的把握认为甲、乙两车间产品的优级品率存在差异,没有的把握认为甲,乙两车间产品的优级品率存在差异.
(2)由题意可知:生产线智能化升级改造后,该工厂产品的优级品的频率为,
用频率估计概率可得,
又因为升级改造前该工厂产品的优级品率,
则,
可知,
所以可以认为生产线智能化升级改造后,该工厂产品的优级品率提高了.
【拓展练习】
6.(2022全国甲文)甲、乙两城之间的长途客车均由A和B两家公司运营,为了解这两家公司长途客车的运行情况,随机调查了甲、乙两城之间的500个班次,得到下面列联表:
准点班次数
未准点班次数
A
240
20
B
210
30
(1)根据上表,分别估计这两家公司甲、乙两城之间的长途客车准点的概率;
(2)能否有90%的把握认为甲、乙两城之间的长途客车是否准点与客车所属公司有关?
附:,
0.100
0.050
0.010
2.706
3.841
6.635
【解析】(1)根据表中数据,A共有班次260次,准点班次有240次,
设A家公司长途客车准点事件为M,
则;
B共有班次240次,准点班次有210次,
设B家公司长途客车准点事件为N,
则.
A家公司长途客车准点的概率为;
B家公司长途客车准点的概率为.
(2)列联表
准点班次数
未准点班次数
合计
A
240
20
260
B
210
30
240
合计
450
50
500
=,
根据临界值表可知,有的把握认为甲、乙两城之间的长途客车是否准点与客车所属公司有关.
7.(2023·全国甲卷·)一项试验旨在研究臭氧效应.实验方案如下:选40只小白鼠,随机地将其中20只分配到实验组,另外20只分配到对照组,实验组的小白鼠饲养在高浓度臭氧环境,对照组的小白鼠饲养在正常环境,一段时间后统计每只小白鼠体重的增加量(单位:g).
(1)设表示指定的两只小白鼠中分配到对照组的只数,求的分布列和数学期望;
(2)实验结果如下:
对照组
实验组
对照组的小白鼠体重的增加量从小到大排序为:
15.2 18.8 20.2 21.3 22.5 23.2 25.8 26.5 27.5 30.1
32.6 34.3 34.8 35.6 35.6 35.8 36.2 37.3 40.5 43.2
实验组的小白鼠体重的增加量从小到大排序为:
7.8 9.2 11.4 12.4 13.2 15.5 16.5 18.0 18.8 19.2
19.8 20.2 21.6 22.8 23.6 23.9 25.1 28.2 32.3 36.5
(i)求40只小鼠体重的增加量的中位数m,再分别统计两样本中小于m与不小于的数据的个数,完成如下列联表:
(ii)根据(i)中的列联表,能否有95%的把握认为小白鼠在高浓度臭氧环境中与正常环境中体重的增加量有差异.
附:
0.100
0.050
0.010
2.706
3.841
6.635
【解析】(1)依题意,的可能取值为,
则,,,
所以的分布列为:
故.
(2)(i)依题意,可知这40只小白鼠体重增量的中位数是将两组数据合在一起,从小到大排后第20位与第21位数据的平均数,观察数据可得第20位为,第21位数据为,
所以,
故列联表为:
合计
对照组
6
14
20
实验组
14
6
20
合计
20
20
40
(ii)由(i)可得,,
所以能有的把握认为小白鼠在高浓度臭氧环境中与正常环境中体重的增加量有差异.
8.(2024·黑龙江·二模)根据分类变量x与y的成对样本数据,计算得,依据的独立性检验,结论为( )参考值:
0.1
0.05
0.01
2.706
3.841
6.635
A.x与y不独立 B.x与y不独立,这个结论犯错误的概率不超过0.05
C. x与y独立 D.x与y独立,这个结论犯错误的概率不超过0.05
【解析】零假设为:x与y独立,
由,依据的独立性检验,可得成立,
故可以认为x与y独立. 故选:C.
$$ “功夫”2025届第一轮精练
第54讲 成对数据的统计分析
第54讲 成对数据的统计分析
“功夫”2025届第一轮精练
最新考题尽在“功夫”!- 6 -
最新考题尽在“功夫”!- 7 -
学科网(北京)股份有限公司
学习目标
1. 了解样本相关系数的统计含义.
2. 了解一元线性回归模型和2×2列联表,会运用这些方法解决简单的实际问题.
3. 会利用统计软件进行数据分析.
成对数据的相关性
知识:
【例1】1.(2024·天津)下列图中,线性相关性系数最大的是( )
A.B.C. D.
【解析】观察4幅图可知,A图散点分布比较集中,且大体接近某一条直线,线性回归模型拟合效果比较好,呈现明显的正相关,值相比于其他3图更接近1.
故选:A
2.(2023·天津·)鸢是鹰科的一种鸟,《诗经·大雅·旱麓》曰:“鸢飞戾天,鱼跃余渊”. 鸢尾花因花瓣形如鸢尾而得名,寓意鹏程万里、前途无量.通过随机抽样,收集了若干朵某品种鸢尾花的花萼长度和花瓣长度(单位:cm),绘制散点图如图所示,计算得样本相关系数为,利用最小二乘法求得相应的经验回归方程为,根据以上信息,如下判断正确的为( )
A.花瓣长度和花萼长度不存在相关关系
B.花瓣长度和花萼长度负相关
C.花萼长度为7cm的该品种鸢尾花的花瓣长度的平均值为
D.若从样本中抽取一部分,则这部分的相关系数一定是
【解析】根据散点的集中程度可知,花瓣长度和花萼长度有相关性,A选项错误
散点的分布是从左下到右上,从而花瓣长度和花萼长度呈现正相关性,B选项错误,
把代入可得,C选项正确;
由于是全部数据的相关系数,取出来一部分数据,相关性可能变强,可能变弱,即取出的数据的相关系数不一定是,D选项错误
故选:C
感悟提升 判定两个变量相关性的方法
(1)画散点图:点的分布从左下角到右上角,两个变量正相关;点的分布从左上角到右下角,两个变量负相关.
(2)样本相关系数:当r>0时,正相关;当r<0时,负相关;|r|越接近于1,相关性越强.
(3)决定系数法:利用决定系数判定,R2越接近1,模型的拟合效果越好,相关性越强.
【拓展练习】1.(2024上海夏)已知气候温度和海水表层温度相关,且相关系数为正数,对此描述正确的是( )
A.气候温度高,海水表层温度就高 B.气候温度高,海水表层温度就低
C.随着气候温度由低到高,海水表层温度呈上升趋势
D.随着气候温度由低到高,海水表层温度呈下降趋势
【解析】对于AB,当气候温度高,海水表层温度变高变低不确定,故AB错误.
对于CD,因为相关系数为正,故随着气候温度由低到高时,海水表层温度呈上升趋势,
故C正确,D错误.故选:C.
2.(2022全国乙理)某地经过多年的环境治理,已将荒山改造成了绿水青山.为估计一林区某种树木的总材积量,随机选取了10棵这种树木,测量每棵树的根部横截面积(单位:)和材积量(单位:),得到如下数据:
样本号i
1
2
3
4
5
6
7
8
9
10
总和
根部横截面积
0.04
0.06
0.04
0.08
0.08
0.05
0.05
0.07
0.07
0.06
0.6
材积量
0.25
0.40
0.22
0.54
0.51
0.34
0.36
0.46
0.42
0.40
3.9
并计算得.
(1)估计该林区这种树木平均一棵的根部横截面积与平均一棵的材积量;
(2)求该林区这种树木的根部横截面积与材积量的样本相关系数(精确到0.01);
(3)现测量了该林区所有这种树木的根部横截面积,并得到所有这种树木的根部横截面积总和为.已知树木的材积量与其根部横截面积近似成正比.利用以上数据给出该林区这种树木的总材积量的估计值.
附:相关系数.
【解析】(1)样本中10棵这种树木的根部横截面积的平均值
样本中10棵这种树木的材积量的平均值
据此可估计该林区这种树木平均一棵的根部横截面积为,
平均一棵的材积量为
(2)
则
(3)设该林区这种树木的总材积量的估计值为,
又已知树木的材积量与其根部横截面积近似成正比,
可得,解之得.
则该林区这种树木的总材积量估计为
线性经验回归方程
知识:
【例2】 1. 某研究机构为调查人的最大可视距离y(单位:米)和年龄x(单位:岁)之间的关系,对不同年龄的志愿者进行了研究,收集数据得到下表:
x
20
25
30
35
40
y
167
160
150
143
130
(1)根据上表提供的数据,求出y关于x的经验回归方程;
(2)根据(1)中求出的经验回归方程,估计年龄为50岁的人的最大可视距离.
参考公式:经验回归方程=x+中斜率和截距的最小二乘估计公式分别为==,=-.
【解析】(1)由题意可得==30,
==150,
xiyi=20×167+25×160+30×150+35×143+40×130=22 045,
=202+252+302+352+402=4 750,
所以===-1.82,
则=-=150+1.82×30=204.6,
故所求经验回归方程为=-1.82x+204.6.
(2)当x=50时,=-1.82×50+204.6=113.6,
即年龄为50岁的人的最大可视距离约为113.6米.
思维升华 求经验回归方程的步骤
2.(2023·福州统考)已知变量x和y的统计数据如表:
x
6
7
8
9
10
y
3.5
4
5
6
6.5
若由表中数据得到经验回归方程为=0.8x+,则当x=10时的残差为________(注:观测值减去预测值称为残差).
【解析】 ==8,
==5,
则=5-0.8×8=-1.4,
所以=0.8x-1.4,当x=10时,=6.6,
所以当x=10时的残差为6.5-6.6=-0.1.
【拓展练习】3.某地为响应“扶贫必扶智,扶智就是扶知识、扶技术、扶方法”的号召,建立了农业科技图书馆,供农民免费借阅,收集的自2016年至2020年共5年的借阅数据如下表:
年份
2016
2017
2018
2019
2020
年份代码x
1
2
3
4
5
年借阅量y(万册)
4.9
5.1
5.5
5.7
5.8
根据上表,可得y关于x的经验回归方程为=0.24x+,下列结论正确的有( )
A.=4.68 B.4.9,5.1,5.5,5.7,5.8的75%分位数为5.7
C.y与x的样本相关系数 D.2023年的借阅量一定为6.6万册
【解析】对于A,因为=×(1+2+3+4+5)=3,=×(4.9+5.1+5.5+5.7+5.8)=5.4,所以5.4=0.24×3+,得=4.68,A正确;
对于B,因为5×75%=3.75,所以4.9,5.1,5.5,5.7,5.8的75%分位数为5.7,B正确;对于C,由0.24>0,可知C正确;
对于D,由A可知=0.24×8+4.68=6.6,所以2023年的借阅量约为6.6万册,D错误.故选ABC.
非线性回归模型
【例3】1.某汽车销售公司某年经济收入在短期内逐月攀升,该公司在1月份至6月份的销售收入y(单位:百万元)关于月份x的数据如下表:
时间x/月
1
2
3
4
5
6
收入y/百万元
6.6
8.6
16.1
21.6
33.0
41.0
根据以上数据绘制散点图如图所示.
(1)根据散点图判断:与y=cedx(a,b,c,d均为常数)哪一个适宜作为该公司销售收入y关于月份x的回归方程类型?(给出判断即可,不必说明理由)
(2)根据(1)的结果及表中数据,求出y关于x的经验回归方程,并预测该公司8月份的销售收入.(结果近似到小数点后第二位)
参考数据:
3.50
21.15
2.85
17.5
125.35
6.73
其中设u=ln y,ui=ln yi(i=1,2,3,4,5,6).
附:公式见本讲知识聚焦,e4.56≈95.58,e4.58≈97.51.
【解析】(1) 因为散点图中点的分布不是一条直线,相邻两点在y轴上差距是增大的趋势,所以用y=cedx表示更合适.
(2) 由y=cedx,得ln y=ln (cedx)=ln c+dx,
设u=ln y,所以u=ln c+dx.
因为=3.50,=17.50,=6.73,=2.85,
所以==≈0.38,ln c=-0.38=2.85-0.38×3.50=1.52,
所以ln y=1.52+0.38x,即=e1.52+0.38x,则经验回归方程为y=e1.52+0.38x.
当x=8时,y=e1.52+0.38×8=e4.56≈95.58,
故预测该公司8月份的销售收入为95.58百万元.
思维升华
(1)类型一:y=cebx,对方程两边取对数,则方程变为ln y=ln (cebx)=ln c+bx,将ln y,ln c进行换元,ln y=z,ln c=a,则非线性经验回归方程变成线性经验回归方程z=a+bx;
(2)类型二:y=kcx+d,常见的变化形式为y-d=kcx⇒ln (y-d)=ln k+x ln c,令ln (y-d)=z,lnk=a,ln c=b,则非线性经验回归方程变成线性经
2.中国茶文化博大精深,已知茶水的口感与茶叶类型以及水温有关.经验表明,某种绿茶用85 ℃的水泡制,再等到茶水温度降至60 ℃时饮用,可以产生最佳口感.某学习研究小组通过测量,得到了下面表格中的数据(室温是20 ℃).
泡制时间x/min
0
1
2
3
4
水温y/℃
85
79
74
71
65
(1)小组成员根据上面表格中的数据绘制散点图,并根据散点图分布情况,考虑到茶水温度降到室温(即20 ℃)就不能再降的事实,决定选择函数模型y=kcx+20(x≥0)来刻画.
①令z=ln(y-20),求出z关于x的经验回归方程;
②利用①的结论,求出y=kcx+20(x≥0,c>0)中的k与c.
(2)你认为该品种绿茶用85 ℃的水大约泡制多久后饮用,可以产生最佳口感?
参考数据:ln 65≈4.2,ln 59≈4.1,ln 54≈4.0,ln 51≈3.9,ln 45≈3.8,log0.90.6≈4.8,e-0.1≈0.9,e4.2≈66.7,≈0.6.
参考公式:=x+,=,=-.
【解析】(1)①由已知得出x与z的关系,如下表:
泡制时间x/min
0
1
2
3
4
z
4.2
4.1
4.0
3.9
3.8
设经验回归方程为=x+,
由题意,得==2,
==4,
∴(xi-)(zi-)=(-2)×0.2+(-1)×0.1+1×(-0.1)+2×(-0.2)=-1,
(xi-)2=(-2)2+(-1)2+12+22=10,
则===-0.1,
=-=4+0.1×2=4.2,
则z关于x的经验回归方程为=-0.1x+4.2.
②由y=kcx+20(x≥0),得y-20=kcx(x≥0),
两边取对数得,ln(y-20)=ln k+xln c,
利用①的结论得:ln c=-0.1,ln k=4.2,
∴c=e-0.1≈0.9,k=e4.2≈66.7.
(2)由(1)得,y=66.7×0.9x+20(x≥0),
令y=60,得x≈log0.90.6≈4.8.
∴该品种绿茶用85 ℃的水大约泡制4.8 min后饮用口感最佳.
【拓展练习】4.(2020·全国)某校一个课外学习小组为研究某作物种子的发芽率y和温度x(单位:°C)的关系,在20个不同的温度条件下进行种子发芽实验,由实验数据得到下面的散点图:
由此散点图,在10°C至40°C之间,下面四个回归方程类型中最适宜作为发芽率y和温度x的回归方程类型的是( )
A. B. C. D.
【解析】由散点图分布可知,散点图分布在一个对数函数的图象附近,
因此,最适合作为发芽率和温度的回归方程类型的是.
故选:D.
5. (2024·西安调研)某商业银行对存款利率与日存款总量的关系进行调研,发现存款利率每上升一定的百分点,日均存款总额就会发生一定的变化,经过统计得到下表:
利率上升百分点x
0.1
0.2
0.3
0.4
0.5
日均存款总额y(亿元)
0.2
0.35
0.5
0.65
0.8
(1)在给出的坐标系中画出上表数据的散点图;
(2)根据上表提供的数据,用最小二乘法求出y关于x的经验回归方程;
(3)已知现行利率下的日均存款总额为0.625亿元,试根据(2)中的经验回归方程,预测日均存款总额为现行利率下的2倍时,利率需上升多少个百分点?
参考公式及数据:①=,=-,②,=0.55.
【解析】 (1)如图所示.
(2)由表格数据可得
=×(0.1+0.2+0.3+0.4+0.5)=0.3,
=×(0.2+0.35+0.5+0.65+0.8)=0.5,
所以===1.5,
=-=0.5-1.5×0.3=0.05,
故=1.5x+0.05.
(3)设利率需上升x个百分点,
由(2)得,0.625×2=1.5x+0.05,解得x=0.8,
所以预测利率需上升0.8个百分点.
列联表与独立性检验
【例4】1.(2024年上海夏季)为了解某地初中学生体育锻炼时长与学业成绩的关系,从该地区29000名学生中抽取580人,得到日均体育锻炼时长与学业成绩的数据如下表所示:
时间范围
学业成绩
优秀
5
44
42
3
1
不优秀
134
147
137
40
27
(1)该地区29000名学生中体育锻炼时长不少于1小时人数约为多少?
(2)估计该地区初中学生日均体育锻炼的时长(精确到0.1)
(3)是否有的把握认为学业成绩优秀与日均体育锻炼时长不小于1小时且小于2小时有关?
(附:其中,.)
【解析】(1)由表可知锻炼时长不少于1小时的人数为占比,
则估计该地区29000名学生中体育锻炼时长不少于1小时的人数为.
(2)估计该地区初中生的日均体育锻炼时长约为
.
则估计该地区初中学生日均体育锻炼的时长为0.9小时.
其他
合计
优秀
45
50
95
不优秀
177
308
485
合计
222
358
580
(3)由题列联表如下:
提出零假设:该地区成绩优秀与日均锻炼时长不少于1小时但少于2小时无关.
其中.
.
则零假设不成立,
即有的把握认为学业成绩优秀与日均锻炼时长不小于1小时且小于2小时有关.
思维升华 独立性检验的一般步骤
(1)根据样本数据制成2×2列联表.
(2)根据公式计算.
(3)比较χ2与临界值的大小关系,作统计推断.
2.(2024全国甲理)某工厂进行生产线智能化升级改造,升级改造后,从该工厂甲、乙两个车间的产品中随机抽取150件进行检验,数据如下:
优级品
合格品
不合格品
总计
甲车间
26
24
0
50
乙车间
70
28
2
100
总计
96
52
2
150
(1)填写如下列联表:
优级品
非优级品
甲车间
乙车间
能否有的把握认为甲、乙两车间产品的优级品率存在差异?能否有的把握认为甲,乙两车间产品的优级品率存在差异?
(2)已知升级改造前该工厂产品的优级品率,设为升级改造后抽取的n件产品的优级品率.如果,则认为该工厂产品的优级品率提高了,根据抽取的150件产品的数据,能否认为生产线智能化升级改造后,该工厂产品的优级品率提高了?()
附:
0.050
0.010
0.001
k
3.841
6.635
10.828
优级品
非优级品
甲车间
26
24
乙车间
70
30
【解析】(1)根据题意可得列联表:
可得,
因为,
所以有的把握认为甲、乙两车间产品的优级品率存在差异,没有的把握认为甲,乙两车间产品的优级品率存在差异.
(2)由题意可知:生产线智能化升级改造后,该工厂产品的优级品的频率为,
用频率估计概率可得,
又因为升级改造前该工厂产品的优级品率,
则,
可知,
所以可以认为生产线智能化升级改造后,该工厂产品的优级品率提高了.
【拓展练习】
6.(2022全国甲文)甲、乙两城之间的长途客车均由A和B两家公司运营,为了解这两家公司长途客车的运行情况,随机调查了甲、乙两城之间的500个班次,得到下面列联表:
准点班次数
未准点班次数
A
240
20
B
210
30
(1)根据上表,分别估计这两家公司甲、乙两城之间的长途客车准点的概率;
(2)能否有90%的把握认为甲、乙两城之间的长途客车是否准点与客车所属公司有关?
附:,
0.100
0.050
0.010
2.706
3.841
6.635
【解析】(1)根据表中数据,A共有班次260次,准点班次有240次,
设A家公司长途客车准点事件为M,
则;
B共有班次240次,准点班次有210次,
设B家公司长途客车准点事件为N,
则.
A家公司长途客车准点的概率为;
B家公司长途客车准点的概率为.
(2)列联表
准点班次数
未准点班次数
合计
A
240
20
260
B
210
30
240
合计
450
50
500
=,
根据临界值表可知,有的把握认为甲、乙两城之间的长途客车是否准点与客车所属公司有关.
7.(2023·全国甲卷·)一项试验旨在研究臭氧效应.实验方案如下:选40只小白鼠,随机地将其中20只分配到实验组,另外20只分配到对照组,实验组的小白鼠饲养在高浓度臭氧环境,对照组的小白鼠饲养在正常环境,一段时间后统计每只小白鼠体重的增加量(单位:g).
(1)设表示指定的两只小白鼠中分配到对照组的只数,求的分布列和数学期望;
(2)实验结果如下:
对照组
实验组
对照组的小白鼠体重的增加量从小到大排序为:
15.2 18.8 20.2 21.3 22.5 23.2 25.8 26.5 27.5 30.1
32.6 34.3 34.8 35.6 35.6 35.8 36.2 37.3 40.5 43.2
实验组的小白鼠体重的增加量从小到大排序为:
7.8 9.2 11.4 12.4 13.2 15.5 16.5 18.0 18.8 19.2
19.8 20.2 21.6 22.8 23.6 23.9 25.1 28.2 32.3 36.5
(i)求40只小鼠体重的增加量的中位数m,再分别统计两样本中小于m与不小于的数据的个数,完成如下列联表:
(ii)根据(i)中的列联表,能否有95%的把握认为小白鼠在高浓度臭氧环境中与正常环境中体重的增加量有差异.
附:
0.100
0.050
0.010
2.706
3.841
6.635
【解析】(1)依题意,的可能取值为,
则,,,
所以的分布列为:
故.
(2)(i)依题意,可知这40只小白鼠体重增量的中位数是将两组数据合在一起,从小到大排后第20位与第21位数据的平均数,观察数据可得第20位为,第21位数据为,
所以,
故列联表为:
合计
对照组
6
14
20
实验组
14
6
20
合计
20
20
40
(ii)由(i)可得,,
所以能有的把握认为小白鼠在高浓度臭氧环境中与正常环境中体重的增加量有差异.
8.(2024·黑龙江·二模)根据分类变量x与y的成对样本数据,计算得,依据的独立性检验,结论为( )参考值:
0.1
0.05
0.01
2.706
3.841
6.635
A.x与y不独立 B.x与y不独立,这个结论犯错误的概率不超过0.05
C. x与y独立 D.x与y独立,这个结论犯错误的概率不超过0.05
【解析】零假设为:x与y独立,
由,依据的独立性检验,可得成立,
故可以认为x与y独立. 故选:C.
$$