内容正文:
统计案例:线性回归、非线性回归、相关性分析与误差分析、独立性检验专项训练
统计案例:线性回归、非线性回归、相关性分析与误差分析、独立性检验专项训练
考点一 线性回归
1.(23-24高二下·江苏镇江·期末)根据一组样本数据,,…,,求得经验回归方程为,且平均数.现发现这组样本数据中有两个样本点和误差较大,去除后,重新求得的经验回归方程为,则( )
A.1.5 B.1.6 C.1.7 D.1.8
【答案】B
【详解】因为原经验回归方程为,且平均数,
所以代入方程得,
因为去除的两个样本点和,
由,
所以去除两个样本点后,样本点的中心仍为,
代入重新求得的经验回归方程,可得,
解得.
故选:B.
2.(24-25高二下·山东济宁·期末)已知由样本数据组成的一个样本,得到经验回归方程为,且,去除两个样本点和后,新得到的经验回归直线斜率不变,则新得到的经验回归方程为( )
A. B. C. D.
【答案】A
【详解】因为经验回归方程为,,
所以.
原样本有10个数据点,,
则.
去除两个样本点后,样本有8个数据点,且,
所以新样本的
因为新的经验回归直线的斜率不变,则设新的经验回归方程为,
将代入方程得,
所以新的经验回归方程为.
故选:A.
3.(24-25高二下·江苏无锡·阶段练习·多选)市物价部门对5家商场的某商品一天的线上销售量及其价格进行调查,5家商场的售价x(元)和销售量y(件)之间的一组数据如表所示:
价格x
9
9.5
10
10.5
11
销售量y
11
10
8
6
5
按公式计算,y与x的回归直线方程是:,相关系数,则下列说法正确的是( )
A. B.变量x,y线性负相关且相关性较强
C.相应于点的残差约为 D.当时,y的估计值为14.4
【答案】BD
【详解】A选项,,,
将代入回归直线方程得,,解得,A错误;
B选项,从表可以看出,随着的增大而减小,又,接近于1,
所以变量x,y线性负相关且相关性较强,B正确;
C选项,回归直线方程为,当时,,
,故相应于点的残差约为0.4,C错误;
D选项,当时,y的估计值为,D正确.
故选:BD
4.(24-25高二下·甘肃白银·期末·多选)某种细胞在培养正常的情况下,时刻(单位:分)与细胞数(单位:个)的部分数据如下表所示:
1
2
3
4
5
52
95
185
227
若与线性相关,由上表数据求得经验回归方程为,则下列说法正确的是( )
A.与正相关 B.
C.细胞数逐分增加,平均每分钟增加10个左右 D.预计10分钟后细胞数约为450个
【答案】ABD
【详解】由回归方程中的系数大于0,可知与正相关,故A项正确;
由表中数据可知,又因为回归方程为,
把代入回归方程中,解得,所以,解得,故B项正确;
由经验回归方程知细胞数逐分增加,平均每分钟增加44个左右,故C项错误;
将代入回归方程中,得,故D项正确.
故选:ABD.
5.(24-25高二下·陕西咸阳·期末)经验表明,一般树的胸径(树的主干在地面以上处的直径)越大,树就越高.在研究树高与胸径之间的关系时,某同学收集了某种树的5组观测数据(如下表):
胸径
8
9
10
11
12
树高
8.2
10
11
12
13.8
假设树高与胸径满足的经验回归方程为,则当胸径时,树高的预测值为 .
【答案】17.6
【详解】根据表中数据可求:,.
将其代入方程解得.
所以经验回归方程为.
将代入解得.
所以树高的预测值为 .
故答案为:
6.(24-25高二下·贵州安顺·期末)已知变量与的一组观测数据如下表:
1
2
3
4
5
3
5
7
9
11
根据表中数据得到关于的经验回归方程为,则 ,当时,的预测值为 .
【答案】 2 17
【详解】由题可知:,
所以,当时,的预测值为.
故答案为:2;17
7.(24-25高二下·黑龙江鸡西·期末)若关于某设备的使用年限(年)和所支出的维修费(万元)有如下统计资料:
若由资料知,对呈线性相关关系.
(参考数据:
(1)请根据上表提供的数据,用最小二乘法求出关于的线性回归方程;
(2)估计使用年限为年时,试求维修费用约是多少?(精确到两位小数)
【答案】(1)
(2)万元
【详解】(1)由题中所给数据可知,,所以线性回归方程为:.
(2)当时,(万元),故使用年限为年时估计维修费用约是万元.
8.(24-25高二下·江西·期末)某饮品店统计了一天营业时间(单位:小时)与饮品销量(单位:杯)的数据如下表:
营业时间
1
2
3
4
5
饮品销量
17
36
56
77
99
已知与线性相关.
(1)根据以上数据求饮品销量关于营业时间的回归直线方程;
(2)若平均一杯饮品的纯利润为5元,某日该饮品店计划早上9点开始营业,晚上9点结束营业,中间不休息,试预测当日饮品的总利润能否超过1000元?
参考公式:回归直线方程中,,.
【答案】(1)
(2)能,理由见详解
【详解】(1)根据题意,,
,,
,
,
所以回归直线方程为.
(2)由(1)知,回归方程为,
早上9点开始营业,晚上9点结束营业,共营业12小时,
所以估计共销售杯,盈利元,
所以试预测当日饮品的总利润能超过1000元.
9.(24-25高二下·河南商丘·期末)某兴趣小组研究发现昼夜温差变化的大小与患感冒人数之间具有较强的线性相关关系,该兴趣小组在惠民医院抄录了2025年2~5月份每月5日的昼夜温差情况以及附近的居民因患感冒到惠民医院就诊的人数,得到如下数据:
日期
2月5日
3月5日
4月5日
5月5日
昼夜温差
11
13
12
8
因患感冒就诊人数(人)
25
29
26
16
(1)求因患感冒到惠民医院就诊的人数关于昼夜温差的线性回归方程;
(2)如果8月5日昼夜温差是时,试预测因患感冒到惠民医院就诊的人数(精确到整数).
附:线性回归直线中,;
【答案】(1)
(2)19.
【详解】(1),
,
,
所以,
,
所以所求线性回归方程为.
(2)时,,
因此如果8月5日昼夜温差是时,预测因患感冒到惠民医院就诊的人数大约为19.
10.(24-25高二下·河北·期末)某工厂的某台机器工作时,分为正常运转和非正常运转两种状态.已知该机器正常运转时每天生产的零件数量x(单位:千个)与次品数y(单位:个)之间存在一定的线性关系.为了研究这种关系,质量检测部门记录了该机器正常运转下某5天的生产数据,其数据如下:
生产零件数量x/千个
3
4
5
6
7
次品数y/个
10
12
15
16
19
(1)求次品数y关于生产零件数量x的经验回归方程.
(2)根据经验,该机器正常运转的概率为0.9.该机器正常运转时,生产的零件中次品数满足第(1)问的经验回归方程;该机器非正常运转时,次品率会提高,每生产1000个零件会出现20个次品.若某天计划用该机器生产10000个零件,试估计这10000个零件中的次品数.(结果经四舍五入后取整数)
参考公式及数据:.
【答案】(1)
(2)
【详解】(1),,
则,,
所以.
(2)该机器正常运转时,把代入,得,
估计这10000个零件中的次品数为25.4.
该机器非正常运转时,估计这10000个零件中的次品数为200.
估计这10000个零件中的次品数为.
11.(24-25高二下·湖北恩施·期末)某田径协会组织开展竞走的步长和步频之间关系的课题研究,得到相应的试验数据:
步频x(单位:步/s)
0.28
0.29
0.30
0.31
0.32
步长y(单位:cm)
90
95
99
m
115
(1)若步频和步长近似为线性相关关系,当时,,,根据表中数据,求出y关于x的回归直线方程.
附:回归直线方程中,
(2)记,其中为观测值,为预测值,为对应的残差,根据表中数据,若得出y关于x的经验回归方程为,且计算出在样本点处的残差为,求实数m的值.
【答案】(1)
(2)
【详解】(1)解:根据统计表格中的数据,可得,,
又由,,可得,
则,所以回归直线方程为.
(2)解:由回归方程为,且计算出在样本点处的残差为,
可得,解得,
因为,,
可得,解得.
12.(2025·云南丽江·三模)某车间为了规定工时定额,需要确定加工零件所花费的时间,为此作了次试验,得到数据如下:
零件的个数x(个)
2
3
4
5
加工的时间y(小时)
2.5
3
4
4.5
参考公式:用最小二乘法求线性回归方程系数公式,
(1)求关于的线性回归方程;
(2)求各样本的残差;
(3)试预测加工个零件需要的时间.
【答案】(1);
(2)各样本的残差依次为:0.05,-0.15,0.15,-0.05.
(3)小时.
【详解】(1)
,,
∴所求线性回归方程为.
(2)计算每个对应的预测值:
,
,
,
;
计算残差:
所以,各样本的残差依次为:.
(3)当时,,
∴预测加工个零件需要小时.
考点二 非线性回归
1.(24-25高二下·辽宁·阶段练习)用模型去拟合与的关系,令,得到关于的回归直线方程为,则( )
A.1 B.2 C.e D.2e
【答案】C
【详解】,所以.
故选:C.
2.(24-25高二下·广东广州·阶段练习)已知变量的关系可以用模型拟合,设,其变换后得到一组数据如下:
16
17
18
19
50
34
41
31
由上表可得线性回归方程,则( )
A.-5 B. C.126.5 D.
【答案】D
【详解】由表格数据知:,,
由可得到;
由得,,
所以,即.
故选:D
3.(24-25高二下·江苏南京·期末)用模型拟合一组数据时,为了求出非线性回归方程,设,其变换后得到线性回归方程为,则c等于( )
A. B. C.2 D.
【答案】C
【详解】由回归模型,可得,即,
因为变换后得到线性回归方程为,可得,所以.
故选:B.
4.(24-25高二下·重庆·期末)某校一个课外学习小组为研究小鸡的成活率y和温度x(单位:℃)的关系,在20个不同的温度条件下进行实验,由实验数据得到下面的散点图:
由此散点图,在10℃至40℃之间,下面四个回归方程类型中最适宜作为成活率y和温度x的回归方程类型的是( )
A. B. C. D.
【答案】D
【详解】由散点图分布可知,散点图分布在一个对数函数的图象附近,
因此,最适合作为发芽率和温度的回归方程类型的是.
故选:D.
5.(24-25高二下·广东广州·期末·多选)用模型去拟合一组数据,设,将其变换后得到线性回归方程,则( )
A. B. C. D.
【答案】AD
【详解】由两边取自然对数得:,
由变换后得到线性回归方程,
则,即,故AD正确,BC错误;
故选:AD.
6.(23-24高二下·江苏苏州·期末)已知随机变量,的五组观测数据如下表:
1
2
3
4
5
由表中数据通过模型得到经验回归方程为,则实数的值为 .
【答案】
【详解】令,
则,
因为,所以,
所以,解得.
故答案为:.
7.(24-25高三上·广东江门·阶段练习)已知,之间的一组数据:若与满足经验回归方程,则此曲线必过点 .
x
y
【答案】
【详解】由已知,
设,则,
由回归直线性质可得在直线上,
又,,
所以点在直线上,故点在曲线上.
故答案为:.
8.(24-25高二下·内蒙古通辽·阶段练习)红铃虫(Pectinophora gossypiella)是棉花的主要害虫之一,其产卵数与温度有关.现收集到一只红铃虫的产卵数y(个)和温度的8组观测数据,制成图1所示的散点图.现用两种模型①,,②分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图.
根据收集到的数据,计算得到如下值:
24
2.9
646
168
422688
50.4
70308
表中,,,;
(1)根据残差图,比较模型①、②的拟合效果,模型 比较合适?
(2)根据(1)中所选择的模型,求出y关于x的回归方程是 .附:对于一组数据,,…,,其回归直线的斜率和截距的最小二乘估计分别为,.
【答案】 ①
【详解】(1)模型①更合适,理由如下:模型①残差点比较均匀地落在水平的带状区域中,且带状区域的宽度比模型②带状宽度窄,所以模型①的拟合精度更高,回归方程的预报精度相应就会越高,故选模型①比较合适;
(2)令,则,
由所给的参考数据可得,,
所以,
所以关于的线性回归方程为,即,
所以产卵数关于温度的回归方程为,
故答案为:①;.
9.(24-25高二下·广东中山·阶段练习)红铃虫(Pectinophora gossypiella)是棉花的主要害虫之一,其产卵数与温度有关.现收集到一只红铃虫的产卵数y(个)和温度x(℃)的8组观测数据,制成图1所示的散点图.现用两种模型①,②分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图.
根据收集到的数据,计算得到如下值:表中;;;;
(1)根据残差图,比较模型①、②的拟合效果,应选择哪个模型?并说明理由;
(2)根据(1)中所选择的模型,求出y关于x的回归方程(系数精确到0.01),并求温度为34℃时,产卵数y的预报值.
(参考数据:,,,)
附:对于一组数据,,…,,其回归直线的斜率和截距的最小二乘估计分别为,.
25
2.89
646
168
422688
48.48
70308
【答案】(1)应该选择模型①,理由见解析
(2);250个
【详解】(1)应该选择模型①.
由于模型①残差点比较均匀地落在水平的带状区域中,
且带状区域的宽度比模型②带状宽度窄,所以模型①的拟合精度更高,
回归方程的预报精度相应就会越高,故选模型①比较合适
(2)令,z与温度x可以用线性回归方程来拟合,则.
,
所以,
则z关于x的线性回归方程为.
于是有,
所以产卵数y关于温度x的回归方程为
当时,(个).
所以,在气温在34℃时,一个红铃虫的产卵数的预报值为250个
10.(24-25高二下·辽宁·期中)已知与及与的成对数据如下,且关于的回归直线方程为,
(1)求关于的回归直线方程;
(2)由散点图发现可以用指数型函数模型拟合与的关系,请建立关于的回归方程(,的值精确到);
(3)又得到一组新数据,,根据这对数据残差的绝对值的大小判断(1)、(2)两个方程哪个拟合效果更好.
参考数据:
其中,.
参考公式:对于一组数据,,,,
其回归直线方程为,其中,.
【答案】(1)
(2),
(3)指数函数模型拟合效果更好.
【详解】(1)方法一:设关于的回归直线方程为,
由已知,,
,
,
所以,
,
所以关于的回归直线方程为,
方法二:因为关于的回归直线方程为,
因为,,
所以,,
则,
所以关于的回归直线方程为,
(2)若用指数型函数模型拟合与的关系,则有,
设,,,
则,
,
,
所以,
所以,
所以关于的回归方程为,
(3)由(1)关于的回归直线方程为,
所以时,,
残差为,
由(2)关于的指数函数模型的回归方程为,
所以时,,
残差为,
因为,所以指数函数模型拟合效果更好.
11.(24-25高二下·湖南·阶段练习)某电动车公司为了抢占更多的市场份额,计划加大广告投入.该公司第i年的年广告费(单位:百万元)满足递推关系,且,年销售量(单位:百万辆)与年广告费相关.令,经过数据处理得到如下统计量的值:
44
4.8
10
40.3
1.612
19.5
8.06
现有模型作为年销售量y关于年广告费x的回归分析模型,其中均为常数.
(1)求;
(2)求出y关于x的回归方程,并预测年广告费为6(百万元)时,产品的年销售量是多少?
(3)该公司生产的电动车毛利润为每辆200元(不含广告费、研发经费).该公司在加大广告投入的同时也加大研发经费的投入,年研发经费为年广告费的199倍.电动车的年净利润受年广告费和年研发经费影响外还受随机变量影响,设随机变量服从正态分布,且满足,求该公司年净利润的最大值大于1000(百万元)的概率.(年净利润=毛利润×年销售量-年广告费-年研发经费-随机变量)
附:①回归直线
②参考数据:,.
【答案】(1)
(2),当年广告费为6(百万元)时,产品的销售量大概是13(百万辆)
(3)
【详解】(1)由得:
,
即,
所以,
即,
所以为等差数列,又,
所以公差为1,
所以,
(2)令,则,
由公式,
又由,,
得,
所以,即回归方程为.
当时,,
因此当年广告费为6(百万元)时,产品的销售量大概是13(百万辆).
(3)净利润为,,
令,
所以.
可得在上为增函数,在上为减函数.
所以,
由题意得:,即,
,
即该公司年净利润大于1000(百万元)的概率为.
12.(2025·福建泉州·模拟预测)泉州少年郎团队从2024年10月份以来,通过深度整合AI算法、大数据分析和自动化技术,不断优化产品与服务,显著提升了运营效率和市场竞争力,推动团队收入持续攀升.该团队在近7个月的经济收入(单位:百万元)的数据如下表:
月份编号
1
2
3
4
5
6
7
收入(百万元)
6
11
21
34
66
101
196
(1)根据以上数据绘制散点图,并根据散点图判断,与(均为大于零的常数)哪一个适宜作为该团队经济收入y关于月份x的回归方程模型?(给出判断即可,不必说明理由)并根据你的判断结果及表中的数据,求出y关于x的回归方程;
(2)请你根据所求的回归方程,预测该团队下一个月的经济收入;
(3)试从统计学角度分析,如果用所求的回归方程预测该团队接下来1年的经济收入情况是否合理?
参考数据:
462
10.78
2711
50.12
2.82
3.47
其中设,
参考公式:,.
【答案】(1)适宜,
(2)347百万元
(3)不合理
【详解】(1)散点图如图所示,
根据散点图判断,适宜作为5G经济收入y关于月代码x的回归方程类型,
,两边同时取常用对数得:,
设,,
,
,
,
,
把样本中心点代入,得:,
,,
,
y关于x的回归方程:.
(2)当时,,
所以预测该公司2025年5月份的经济收入估计为347百万元.
(3)不合理,经验回归方程一般具有时效性,解释变量越接近样本数据,预测值比较可信,否则会有显著误差.
13.(2025·山东烟台·三模)近年来,新能源汽车因其动力充沛、提速快、用车成本低等特点得到民众的追捧.某机构为研究汽油价格x(单位:元/升)与新能源汽车的月销售量y(单位:万辆)之间的关系,收集整理得到如下数据:
x
6
6.5
7
7.5
8
y
1.5
2
3
4.5
6.8
(1)若用模型模拟x与y之间关系,求出回归方程;
(2)根据建立的回归方程,预测当汽油价格上涨至9元/升时,新能源汽车的销量;
(3)假设当汽油价格为9元/升时,实际销量超过预测值的概率为0.6.现进行5次独立观测,记这5次观测中销量超过预测值的次数为,求的数学期望.
参考数据和公式:.,.
令,,,.
对于一组数据,其回归直线的斜率和截距的最小二乘估计分别为:,.
【答案】(1)
(2)约为万辆
(3)3
【详解】(1)因为,则,
又,,
由得,,解得,
所以回归方程为.
(2)当时,代入回归方程可得
,
价格上涨至9元/升时,新能源汽车的销量约为万辆.
(3)由题知,,所以,即的数学期望为3.
14.(24-25高二下·黑龙江哈尔滨·期中)即多频道网络,是一种新的网红经济运行模式,这种模式将不同类型和内容的(专业生产内容)联合起来,在资本有力支持下,保障内容的持续输出,从而最终实现商业的稳定变现,在中国以直播电商、短视频为代表的新兴网红经济的崛起,使机构的服务需求持续增长.数据显示,近年来中国市场规模迅速扩大.下表为2018年年中国市场规模(单位:百亿元),其中2018年年对应的代码依次为.
年份代码x
1
2
3
4
5
中国市场规模y
1.12
1.68
2.45
3.35
4.32
(1)由上表数据可知,可用指数函数模型拟合y与x的关系,
①建立y关于x的回归方程;
②预测2025年中国市场规模(单位:百亿元):
(2)从2018年年中国市场规模中随机抽取3个数据,记这3个数据中与的差的绝对值小于1的个数为X,求X的分布列与期望.
参考数据:
2.58
0.84
46.83
15.99
其中.
参考公式:对于一组数据,其回归直线的斜率和截距的最小二乘估计公式分别为.
参考数据:
【答案】(1)①;②12.61
(2)分布列见解析,
【详解】(1)两边同时取自然对数得.
设,则,
因为,
所以.
把代入,得,
所以,则,
所以,即y关于x的回归方程为.
2025年的年份代码是8,
故预测2025年中国市场规模为(单位:百亿元)
(2)2018年年中国市场规模的5个数据中,与的差的绝对值小于1的数据有,共3个,
所以的可能取值为,
,
所以的分布列为
1
2
3
.
考点三 相关性分析与误差分析
1.(24-25高二下·安徽安庆·期末)关于样本相关系数,下列说法正确的是( )
A.样本相关系数
B.当样本相关系数时,称成对数据成正相关
C.两个随机变量线性相关越弱,则相关系数越接近-1
D.两个随机变量线性相关越强,则相关系数越接近1
【答案】A
时,数据成负相关,时,数据成正相关,故B错误;
越接近1,线性相关性越强,越接近0,相关性越弱,故C错误;
对于D,两个随机变量线性相关越强,相关系数也可能接近,故D错误.
故选:A.
2.(24-25高二下·山东聊城·期末)某同学根据一组数据作出如图所示的散点图,并对这组数据进行回归分析后发现遗漏了点,增加点后再次进行回归分析,得到的结果和原来相比( )
A.相关系数r变大 B.决定系数变小
C.残差平方和变小 D.不变
【答案】B
【详解】增加点,从散点图中可以看出拟合效果变差;
越接近,相关程度越强,拟合效果越好,由于两个变量成正相关,所以相关系数变小;故A错误;
决定系数越接近,拟合效果越好,所以决定系数变小,故B正确;
残差平方和越小,拟合效果越好,所以残差平方和变大;故C错误;
增加点前的的平均数为,增加点后的的平均数为,所以变大,故D错误.
故选:B
3.(24-25高二下·天津河西·期末)对两组数据进行统计后得到如图所示的散点图,下列结论不正确的是( )
A.图1、图2两组数据都具有线性相关关系
B.图1数据正相关,图2数据负相关
C.图1相关系数小于图2相关系数
D.图1相关系数和图2相关系数之和小于0
【答案】C
【详解】对A,因为散点图都呈直线型,所以图1、图2两组数据都具有线性相关关系,A正确;
对B,图1散点从左至右呈上升趋势,所以数据正相关,图2散点从左至右呈下降趋势,所以数据负相关,故B正确;
对C,图1正相关,图2负相关,所以C不正确;
对D,因为图2相关程度更强,所以D正确.
故选:C.
4.(24-25高二下·四川绵阳·期末)已知在一定范围内,水稻对氮元素的吸收量与它的根长度具有线性相关关系.某盆栽水稻实验中,在确保土壤肥力及灌溉条件相对稳定的情况下,统计了根长度(单位:cm)与氮元素吸收量(单位:mg/天)的相关数据,如下表所示:
9.9
12.1
14.8
18.2
19.9
21.8
25.1
27.7
30.4
32.1
0.30
0.34
0.42
0.50
0.55
0.60
0.71
0.74
0.78
0.86
根据表中数据可得及经验回归方程为,则( )
A.
B.变量和变量的样本相关系数
C.当时,残差为0
D.水稻根长度每增加1cm,一天的氮元素吸收量一定增加mg
【答案】C
【详解】由题设,所以,可得,故A错误;
所以,又,即与正相关,则样本相关系数,故B错误;
由时,,残差为,故C正确;
由回归方程说明随变化值的变化趋势,不能说变量每增加一个单位,的值一定增加个单位,故D错误.
故选:C
5.(24-25高二下·江西抚州·期末)现调查某地区某种野生动物的数量,将该地区分成面积相近的100个地块,从这些地块中用简单随机抽样的方法抽取10个作为样本,调查得到样本数据,其中分别表示第个样本的植物覆盖面积(单位:公顷)和这种野生动物的数量,分别表示这10个样本的植物覆盖面积和这种野生动物的数量的平均值,构造向量,并计算得,由选择性必修第一册教材中的知识,我们知道对数据的相关系数,则上述数据的相关系数 .
【答案】0.96/
【详解】,故,
,
.
故答案为:0.96
6.(24-25高二下·宁夏银川·期中)近年来中国各地政府对夜间经济的扶持力度加大,夜间经济的市场发展规模稳定增长,有关部门整理了2020—2025年中国夜间经济的数据,把市场发展规模记为(单位:万亿元),并把2020—2025年对应的年份代码依次记为,经分析,判断可用函数模型拟合与的关系(为参数).令,计算得,,由最小二乘法得经验回归方程为,为判断拟合效果,通过经验回归方程求得预测值,若残差平方和,则决定系数 .
(参考公式:决定系数,参考数据:)
【答案】
【详解】
,
所以.
故答案为:.
7.(24-25高二下·贵州黔西·期末)在线性回归分析模型中,变量与相对应的四组数据为,,,,表示解释变量对于预报变量变化的贡献率,则 .
附:,,.
【答案】1
【详解】依题意,
,,
则,,
因此关于的线性回归方程为,
当时,,残差;当时,,残差;
当时,,残差;当时,,残差,
因此,所以.
故答案为:1
8.(2025·上海·模拟预测)已知高中学生的数学成绩,物理成绩,化学成绩两两成正相关关系,随机抽取10名同学,数学成绩和物理成绩的样本线性相关系数为,物理成绩与化学成绩的样本线性相关系数为,求的样本线性相关系数的最大值为 .
(附:相关系数
【答案】
【详解】设,
则有,
由相关系数公式得,
设与夹角为与夹角为,
由的样本相关系数为,的样本相关系数为,所以,
由这两个夹角均为锐角且,所以与夹角的可能性是,
则与夹角余弦值的最大值为,此时与样本相关系数最大,
即,
所以的样本线性相关系数的最大值为.
故答案为:.
9.(24-25高二下·河北石家庄·期末)一组实验数据如下:
2
5
8
9
11
12
10
8
8
7
(1)根据表中数据,计算,.
(2)根据表中数据计算样本相关系数.(保留两位小数).
(3)由数据用最小二乘法可得线性回归方程为,统计学中常用决定系数刻画回归效果,例如假设,就说明响应变量的差异有由解释变量引起.请计算本题的(保留两位小数),并指出本题中响应变量的差异在多大程度上由解释变量引起.
(附:,,,)
【答案】(1),,
(2)
(3),响应变量的差异有由解释变量引起.
【详解】(1),,
(2),
(3)由于,
响应变量的差异有由解释变量引起.
10.(24-25高二下·河北承德·期末)2025年4月,中国新能源汽车零售渗透率突破,进入“以电为主”的新阶段,充电桩的使用率也成为关注焦点.经调查,某市今年月份的充电桩日均使用时长(时)与新能源汽车保有量(万辆)及充电桩日均使用率(,为常数)的数据如下表所示:
月份
1
2
3
4
5
6
新能源汽车保有量(万辆)
8
13
15
18
23
25
充电桩日均使用时长(时)
5
7
10
12
15
17
充电桩日均使用率
0.15
0.21
0.3
0.36
0.45
0.51
(1)若用充电桩日均使用率近似估计一个充电桩一天内被使用的概率,设该市某个充电桩在3月份的某3天中被使用的天数为,求的分布列;
(2)求关于的样本相关系数,并说明线性相关程度的强弱;(精确到0.01)
(3)若关于的经验回归方程为,求的值(精确到0.1),并预测当该市某月的新能源汽车保有量为36万辆时,充电桩的日均使用率为多少.
参考数据:,.
参考公式:相关系数.
【答案】(1)分布列见解析
(2)0.99,与的线性相关程度较强.
(3),0.72.
【详解】(1)由题可知的所有可能取值为,且,
则,
,
,
,
所以的分布列为
0
1
2
3
0.343
0.441
0.189
0.027
(2)由题可知,,
则,
因为接近于1,所以与的线性相关程度较强.
(3)由题可知,
解得,
所以关于的经验回归方程为.
将代入经验回归方程,得,
又因为,所以当时,,
故预测当该市某月的新能源汽车保有量为36万辆时,充电桩的日均使用率为0.72.
11.(24-25高二下·河北唐山·期末)某人统计了2020—2024年某网站“双11”当天的交易额,统计结果如表:
年份
2020
2021
2022
2023
2024
年份代码
1
2
3
4
5
交易额百亿元
9
12
17
21
26
(1)请根据表中提供的数据,用样本相关系数说明与的线性相关程度;(样本相关系数保留三位小数,统计中用样本相关系数来衡量两个变量之间线性关系的强弱.相应于变量的取值,变量的观测值为,两个变量的样本相关系数的计算公式为.统计学认为,对于变量,当越接近1时,成对样本数据的线性相关程度越强;当越接近0时,成对样本数据的线性相关程度越弱)
(2)求出关于的经验回归方程,并预测2027年该网站“双11”当天的交易额.
附:在经验回归方程中,,.
【答案】(1)变量与的线性相关程度很强
(2),38.5百亿元
【详解】(1)由题意,根据表格中的数据,
可得,,
则,
,
,
故,
所以,
非常接近,说明变量与的线性相关程度很强.
(2)由(1)可得,
所以,
则.
可得关于的经验回归方程为,
令,可得,
所以预测2027年该网站“双11”当天的交易额为38.5百亿元.
12.(24-25高二下·辽宁鞍山·期末)自2021年起,我国居民的储蓄存款逐年增长.设某地区城乡居民人民币储蓄存款(年底余额)如下表所示:
年份
2021
2022
2023
2024
2025
时间代号
1
2
3
4
5
储蓄存款(千亿元)
4.76
4.61
5.32
5.41
5.38
(表中部分数据已精确至0.0001,表中数据可直接代入公式进行运算) 可能用到的估计值:,,
9
25.9692
130.4246
78.48
1554.2872
(1)求关于的回归方程;
(2)用(1)所求回归方程预测该地2027年()的人民币储蓄存款额;
(3)求样本的相关系数.(精确至0.01)
附:,,
【答案】(1)
(2)5.912
(3)0.85
【详解】(1),,
,,,
,
.
所以.
(2)当时,.
(3)
考点四 独立性检验
1.(24-25高二下·辽宁·期末)为了解是否喜欢羽毛球运动与性别的关系,某数学兴趣小组经统计得到如下数据,若要使是否喜欢羽毛球运动与性别无关的可能性最大,则( )
性别
羽毛球
喜欢
不喜欢
女生
男生
50
100
附:,其中.
A.4 B.2 C.1 D.
【答案】D
【详解】要使是否喜欢羽毛球运动与性别无关的可能性最大,则,所以,
所以.
故选:D
2.(24-25高二下·四川绵阳·期末)通过随机询问某中学110名中学生是否爱好跳绳,得到列联表如表所示:
跳绳
性别
合计
男
女
爱好
40
20
60
不爱好
20
30
50
合计
60
50
110
附:,其中n=a+b+c+d.
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
则以下结论正确的是( )
A.根据小概率值α=0.001的独立性检验,我们认为爱好跳绳与性别无关
B.根据小概率值α=0.001的独立性检验,我们认为爱好跳绳与性别无关,这个结论犯错误的概率不超过0.001
C.根据小概率值α=0.01的独立性检验,我们认为爱好跳绳与性别无关
D.在犯错误的概率不超过0.01的前提下,我们认为爱好跳绳与性别无关
【答案】A
【详解】零假设:我们认为爱好跳绳与性别无关,
因为,,
所以我们的假设成立,即根据小概率值α=0.001的独立性检验,
我们认为爱好跳绳与性别无关,故A正确;
在犯错误的概率不超过0.001前提下,我们认为爱好跳绳与性别无关,故B错误;
又因为,所以我们的假设不成立,
即根据小概率值α=0.01的独立性检验,我们认为爱好跳绳与性别有关,故C错误;
在犯错误的概率不超过0.01的前提下,我们认为爱好跳绳与性别有关,故D错误.
故选:A
3.(24-25高二下·福建厦门·期末)为考察药物A对预防疾病B的效果,在两个不同规模的动物种群中分别进行了试验,根据种群一的试验结果得到如下列联表:
药物A
疾病B
合计
未患病
患病
未服用
28
22
50
服用
34
16
50
合计
62
38
100
计算得到.假设种群二试验结果对应的列联表中,每个单元格的数据都为上表对应单元格数据的5倍,则根据小概率值的独立性检验,( )
附:,
0.1
0.05
0.01
0.005
2.706
3.841
6.635
7.879
A.当时,种群一中药物A对预防疾病B有效,该推断犯错误的概率不超过5%
B.当时,种群一中药物A对预防疾病B有效,该推断犯错误的概率不超过10%
C.当时,种群二中药物A对预防疾病B有效,该推断犯错误的概率不超过1%
D.当时,种群二中药物A对预防疾病B有效,该推断犯错误的概率不超过0.5%
【答案】C
【详解】对于A,B,因为,
所以当时,无法推断种群一中药物A对预防疾病B有效,故A,B错误;
对于C,由,将各项数据变为原来的5倍,
则,
所以当时,则种群二中药物A对预防疾病B有效,该推断犯错误的概率不超过.故C正确;
对于D,因为,
所以当时,无法推断种群二中药物A对预防疾病B有效,故D错误.
故选:C.
4.(24-25高二下·吉林·期末·多选)某校团委对“学生性别和喜欢运动是否有关”进行了一次调查,其中被调查的男、女生人数相同,男生喜欢运动的人数占男生人数的,女生喜欢运动的人数占女生人数的,若有95%的把握,但没有99%的把握认为“是否喜欢运动和性别有关”,则被调查人中男生可能有( )
临界值参照表:
A.25人 B.45人 C.60人 D.75人
【答案】BC
【详解】设男生人数为,则女生人数也为,列联表如下:
喜欢运动的人数
不喜欢运动的人数
合计
男生
女生
合计
,
由题意,解得,
故选:BC.
5.(24-25高二下·福建泉州·期末·多选)针对时下的“抖音热”,某校团委对“学生性别和喜欢抖音是否有关”作了一次调查,其中被调查的男女生人数相同,男生喜欢抖音的人数占男生人数的.女生喜欢抖音的人数占女生人数的,若有95%的把握认为是否喜欢抖音和性别有关,则调查人数中男生可能有( )人
附表:
0.050
0.010
3.841
6.635
附:,
A.40 B.45 C.63 D.70
【答案】BD
【详解】设男生人数为n,则男生喜欢抖音的人数占男生人数的,女生喜欢抖音的人数占女生人数的,所以,,
由题意知,,且n是5的整数倍.
故选:BD.
6.(24-25高二下·上海黄浦·期末)已知,.在检验喜欢某项体育运动与性别是否有关的过程中,某研究员搜集数据并计算得到,则根据小概率值的独立性检验,分析喜欢该体育运动与性别 (选填“有关”或“无关”).
【答案】有关
【详解】∵,∴根据小概率值的独立性检验,喜欢该体育运动与性别有关.
故答案为:有关.
7.(24-25高二下·上海·期末)针对“中学生追星问题”,某校团委对“学生性别和中学生追星是否有关”作了一次调查.在全校学生中随机抽取(是正整数)个学生,其中女生人数是男生人数的,男生追星的人数占男生人数的,女生追星的人数占女生人数的,若根据小概率值的独立性检验,判断中学生追星与性别有关,则男生至少有 人.
参考数据及公式如下:
0.050
0.010
0.001
3.841
6.635
10.828
参考公式:,其中.
【答案】
【详解】因为抽取个学生,女生人数是男生人数的,
所以抽取个男生,个女生,为了便于计算,我们令,
设男生人数为,依题意可得列联表如下:
喜欢追星
不喜欢追星
总计
男生
女生
总计
根据小概率值的独立性检验,判断中学生追星与性别有关,
则,由,解得,
由题知应为6的整数倍,
而根据小概率值的独立性检验,判断中学生追星与性别有关,
则男生至少有30人,
故答案为:30.
8.(24-25高二下·安徽六安·期末)为了解消费者对新能源汽车续航里程和充电设施的满意率,随机调查了200名新能源汽车车主,得到如下数据:
对续航里程满意
对续航里程不满意
对充电设施满意
80
30
对充电设施不满意
40
50
(1)任意调查一名新能源汽车车主,设事件“该车主对续航里程满意”为A,事件“该车主对充电设施满意”为B,求和;
(2)根据小概率值的独立性检验,能否认为消费者对续航里程的满意率与对充电设施的满意率有关?
附:
α
0.05
0.01
0.001
3.841
6.635
10.828
【答案】(1),;
(2)可以
【详解】(1)依题意,,;
(2)消费者对续航里程的满意率与对充电设施的满意率相互独立
由已知数据得,
而,则依据小概率值的独立性检验,可以认为不成立,
即认为消费者对续航里程的满意率与对充电设施的满意率有关,且此推断犯错误的概率不会超过0.01.
9.(24-25高二下·贵州贵阳·期末)某班主任对全班50名学生学习积极性和对待班级工作的态度进行了调查,统计数据如下表所示:
积极参加班级工作
不太主动参加班级工作
合计
学习积极性高
18
25
学习积极性一般
19
合计
24
50
参考数据:
0.025
0.010
0.005
0.001
5.024
6.635
7.879
10.828
(1)求,,,的值;
(2)如果通过分层抽样的方式从积极参加班级工作的学生中抽取4人,再从这4人中任选3人代表班级参加活动,记这3人中学习积极性高的人数为随机变量,求的分布列和期望;
(3)试根据小概率值的独立性检验,分析学生的学习积极性与对待班级工作的态度是否有关系?说明理由.
(参考公式:)
【答案】(1),,,.
(2)分布列见解析,数学期望为
(3)有,理由见解析
【详解】(1)因为;,,.
所以,,,.
(2)通过分层抽样的方式从积极参加班级工作的学生中抽取4人,其中学习积极性高的学生3人,学习积极性一般的学生1人.
,,
,
,
的分布列为
2
3
0.75
0.25
.
(3)由统计量的计算公式得,
由于,
根据小概率值的独立性检验分析“学生的学习积极性与对待班级工作的态度有关系”.
10.(24-25高二下·天津河东·期末)晨跑是指在早晨以跑步为主的进行身体锻炼的一种运动方式.某机构采用有放回简单随机抽样的方法对某高中学生的运动爱好者进行问答调查.得到成对样本观测数据的分类统计结果,已知被调查的运动爱好者中男生有40人,其中不喜欢晨跑的男生有10人;被调查的运动爱好者中女生有60人,其中不喜欢晨跑的女生有30人.
(1)填表:将所给数据进行整理,填到如下2×2列联表中
喜欢晨跑
不喜欢晨跑
合计
男生
10
40
女生
60
合计
100
(2)计算,并依据小概率值的独立性检验推断喜欢晨跑与性别有关?
(3)若从该校的运动爱好者中,采用分层随机抽样的方法随机抽取10名学生,再从这10名学生中随机抽取4人,设抽取的4人中男生的人数为X,求X的分布列和数学期望.
参考公式及数据: ,其中n=a+b+c+d.
α
0.10
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【答案】(1)联表见解析;
(2)喜欢晨跑与性别无关;
(3)分布列见解析,.
【详解】(1)填列联表为:
喜欢晨跑
不喜欢晨跑
合计
男生
30
10
40
女生
30
30
60
合计
60
40
100
(2),
因此,依据小概率值的独立性检验推断喜欢晨跑与性别无关;
(3)由(1)知,采用分层随机抽样的方法抽取10名学生,
其中男生人数为,女生人数为.
随机变量的所有可能取值为0,1,2,3,4.
,
.
故随机变量的分布列如下:
0
1
2
3
4
则.
11.(24-25高二下·广东梅州·期末)乒乓球,是一种世界流行的球类体育项目,被称为我国的“国球”,在2025年世界乒乓球锦标赛上,我国运动员共收获4金1银2铜,以强大统治力再次展现国乒底色.为了解学生喜爱乒乓球运动是否与性别有关,某校以“是否为乒乓球的球迷”为问题,在高二年级随机抽取了100名学生作为样本,统计得到如下的列联表:
是球迷
不是球迷
合计
男生
40
15
55
女生
20
25
45
合计
60
40
100
附:临界值表及参考公式:
α
0.10
0.05
0.01
2.706
3.841
6.635
(1)依据的独立性检验,判断学生喜爱乒乓球运动是否与性别有关联;
(2)在所调查的球迷中按男女生进行分层抽样,随机抽取6名学生,再从这6名学生中随机抽取2人去观看比赛,求这2名学生中男生人数X的分布列.
【答案】(1)依据的独立性检验,学生喜爱乒乓球运动是否与性别有关;
(2)分布列见解析.
【详解】(1)零假设为:学生喜爱乒乓球运动与性别无关,
则由列联表可得:
,
,
并根据小概率值的独立性检验,推断不成立,
因此学生喜爱乒乓球运动与性别有关.
(2)依题意,所调查的球迷人数为60人,其中男生人数为40人,女生人数为20人,男生与女生人数比为,
所以采用分层抽样的方法抽取的6人中有男生4人,女生2人,
所以从这6名学生中随机抽取2人,这2名同学中男生人数X的可能值为0,1,2,
,
,
,
X的分布列为:
0
1
2
P
12.(23-24高二下·江苏镇江·期末)“九省联考”之后,某地掀起了奥数学习热潮,某中学对学生钻研奥数课程的情况进行调查,将每周独立钻研奥数课程超过6小时的学生称为“奥数迷”,否则称为“非奥数迷”,从调查结果中随机抽取200人进行分析,得到数据如表所示:
奥数迷
非奥数迷
总计
男
48
120
女
56
80
总计
72
128
(1)补全列联表(单位:人),试问是否有95%的把握认为“奥数迷”与性别有关?
(2)现从抽取的“奥数迷”中,按性别采用分层抽样的方法抽取3人参加奥数闯关比赛,已知其中男、女学生独立闯关成功的概率分别为与.设X为独立闯关成功的人数,求X的分布列及数学期望.
附:参考数据与公式:,其中.
0.10
0.05
0.01
0.001
2.706
3.841
6.635
10.828
【答案】(1)列联表见解析;没有的把握认为“奥数迷”与性别有关;
(2)分布列见解析;
【详解】(1)补全列联表如下:
奥数迷
非奥数迷
总计
男
48
72
120
女
24
56
80
总计
72
128
200
提出假设:“奥数迷”与性别无关.
则,
因为,而
故没有的把握认为“奥数迷”与性别有关.
(2)由于在“奥数迷”中,男生与女生的比例为,
因此根据分层抽象抽取三人中有男生名,女生名.
由题意可知:的可能取值为,,,,
,,
, .
的分布列为:
所以.
2
学科网(北京)股份有限公司
$$统计案例:线性回归、非线性回归、相关性分析与误差分析、独立性检验专项训练
统计案例:线性回归、非线性回归、相关性分析与误差分析、独立性检验专项训练
考点一 线性回归
1.(23-24高二下·江苏镇江·期末)根据一组样本数据,,…,,求得经验回归方程为,且平均数.现发现这组样本数据中有两个样本点和误差较大,去除后,重新求得的经验回归方程为,则( )
A.1.5 B.1.6 C.1.7 D.1.8
2.(24-25高二下·山东济宁·期末)已知由样本数据组成的一个样本,得到经验回归方程为,且,去除两个样本点和后,新得到的经验回归直线斜率不变,则新得到的经验回归方程为( )
A. B. C. D.
3.(24-25高二下·江苏无锡·阶段练习·多选)市物价部门对5家商场的某商品一天的线上销售量及其价格进行调查,5家商场的售价x(元)和销售量y(件)之间的一组数据如表所示:
价格x
9
9.5
10
10.5
11
销售量y
11
10
8
6
5
按公式计算,y与x的回归直线方程是:,相关系数,则下列说法正确的是( )
A. B.变量x,y线性负相关且相关性较强
C.相应于点的残差约为 D.当时,y的估计值为14.4
4.(24-25高二下·甘肃白银·期末·多选)某种细胞在培养正常的情况下,时刻(单位:分)与细胞数(单位:个)的部分数据如下表所示:
1
2
3
4
5
52
95
185
227
若与线性相关,由上表数据求得经验回归方程为,则下列说法正确的是( )
A.与正相关 B.
C.细胞数逐分增加,平均每分钟增加10个左右 D.预计10分钟后细胞数约为450个
5.(24-25高二下·陕西咸阳·期末)经验表明,一般树的胸径(树的主干在地面以上处的直径)越大,树就越高.在研究树高与胸径之间的关系时,某同学收集了某种树的5组观测数据(如下表):
胸径
8
9
10
11
12
树高
8.2
10
11
12
13.8
假设树高与胸径满足的经验回归方程为,则当胸径时,树高的预测值为 .
6.(24-25高二下·贵州安顺·期末)已知变量与的一组观测数据如下表:
1
2
3
4
5
3
5
7
9
11
根据表中数据得到关于的经验回归方程为,则 ,当时,的预测值为 .
7.(24-25高二下·黑龙江鸡西·期末)若关于某设备的使用年限(年)和所支出的维修费(万元)有如下统计资料:
若由资料知,对呈线性相关关系.
(参考数据:
(1)请根据上表提供的数据,用最小二乘法求出关于的线性回归方程;
(2)估计使用年限为年时,试求维修费用约是多少?(精确到两位小数)
8.(24-25高二下·江西·期末)某饮品店统计了一天营业时间(单位:小时)与饮品销量(单位:杯)的数据如下表:
营业时间
1
2
3
4
5
饮品销量
17
36
56
77
99
已知与线性相关.
(1)根据以上数据求饮品销量关于营业时间的回归直线方程;
(2)若平均一杯饮品的纯利润为5元,某日该饮品店计划早上9点开始营业,晚上9点结束营业,中间不休息,试预测当日饮品的总利润能否超过1000元?
参考公式:回归直线方程中,,.
9.(24-25高二下·河南商丘·期末)某兴趣小组研究发现昼夜温差变化的大小与患感冒人数之间具有较强的线性相关关系,该兴趣小组在惠民医院抄录了2025年2~5月份每月5日的昼夜温差情况以及附近的居民因患感冒到惠民医院就诊的人数,得到如下数据:
日期
2月5日
3月5日
4月5日
5月5日
昼夜温差
11
13
12
8
因患感冒就诊人数(人)
25
29
26
16
(1)求因患感冒到惠民医院就诊的人数关于昼夜温差的线性回归方程;
(2)如果8月5日昼夜温差是时,试预测因患感冒到惠民医院就诊的人数(精确到整数).
附:线性回归直线中,;
10.(24-25高二下·河北·期末)某工厂的某台机器工作时,分为正常运转和非正常运转两种状态.已知该机器正常运转时每天生产的零件数量x(单位:千个)与次品数y(单位:个)之间存在一定的线性关系.为了研究这种关系,质量检测部门记录了该机器正常运转下某5天的生产数据,其数据如下:
生产零件数量x/千个
3
4
5
6
7
次品数y/个
10
12
15
16
19
(1)求次品数y关于生产零件数量x的经验回归方程.
(2)根据经验,该机器正常运转的概率为0.9.该机器正常运转时,生产的零件中次品数满足第(1)问的经验回归方程;该机器非正常运转时,次品率会提高,每生产1000个零件会出现20个次品.若某天计划用该机器生产10000个零件,试估计这10000个零件中的次品数.(结果经四舍五入后取整数)
参考公式及数据:.
11.(24-25高二下·湖北恩施·期末)某田径协会组织开展竞走的步长和步频之间关系的课题研究,得到相应的试验数据:
步频x(单位:步/s)
0.28
0.29
0.30
0.31
0.32
步长y(单位:cm)
90
95
99
m
115
(1)若步频和步长近似为线性相关关系,当时,,,根据表中数据,求出y关于x的回归直线方程.
附:回归直线方程中,
(2)记,其中为观测值,为预测值,为对应的残差,根据表中数据,若得出y关于x的经验回归方程为,且计算出在样本点处的残差为,求实数m的值.
12.(2025·云南丽江·三模)某车间为了规定工时定额,需要确定加工零件所花费的时间,为此作了次试验,得到数据如下:
零件的个数x(个)
2
3
4
5
加工的时间y(小时)
2.5
3
4
4.5
参考公式:用最小二乘法求线性回归方程系数公式,
(1)求关于的线性回归方程;
(2)求各样本的残差;
(3)试预测加工个零件需要的时间.
考点二 非线性回归
1.(24-25高二下·辽宁·阶段练习)用模型去拟合与的关系,令,得到关于的回归直线方程为,则( )
A.1 B.2 C.e D.2e
2.(24-25高二下·广东广州·阶段练习)已知变量的关系可以用模型拟合,设,其变换后得到一组数据如下:
16
17
18
19
50
34
41
31
由上表可得线性回归方程,则( )
A.-5 B. C.126.5 D.
3.(24-25高二下·江苏南京·期末)用模型拟合一组数据时,为了求出非线性回归方程,设,其变换后得到线性回归方程为,则c等于( )
A. B. C.2 D.
4.(24-25高二下·重庆·期末)某校一个课外学习小组为研究小鸡的成活率y和温度x(单位:℃)的关系,在20个不同的温度条件下进行实验,由实验数据得到下面的散点图:
由此散点图,在10℃至40℃之间,下面四个回归方程类型中最适宜作为成活率y和温度x的回归方程类型的是( )
A. B. C. D.
5.(24-25高二下·广东广州·期末·多选)用模型去拟合一组数据,设,将其变换后得到线性回归方程,则( )
A. B. C. D.
6.(23-24高二下·江苏苏州·期末)已知随机变量,的五组观测数据如下表:
1
2
3
4
5
由表中数据通过模型得到经验回归方程为,则实数的值为 .
7.(24-25高三上·广东江门·阶段练习)已知,之间的一组数据:若与满足经验回归方程,则此曲线必过点 .
x
y
8.(24-25高二下·内蒙古通辽·阶段练习)红铃虫(Pectinophora gossypiella)是棉花的主要害虫之一,其产卵数与温度有关.现收集到一只红铃虫的产卵数y(个)和温度的8组观测数据,制成图1所示的散点图.现用两种模型①,,②分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图.
根据收集到的数据,计算得到如下值:
24
2.9
646
168
422688
50.4
70308
表中,,,;
(1)根据残差图,比较模型①、②的拟合效果,模型 比较合适?
(2)根据(1)中所选择的模型,求出y关于x的回归方程是 .附:对于一组数据,,…,,其回归直线的斜率和截距的最小二乘估计分别为,.
9.(24-25高二下·广东中山·阶段练习)红铃虫(Pectinophora gossypiella)是棉花的主要害虫之一,其产卵数与温度有关.现收集到一只红铃虫的产卵数y(个)和温度x(℃)的8组观测数据,制成图1所示的散点图.现用两种模型①,②分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图.
根据收集到的数据,计算得到如下值:表中;;;;
(1)根据残差图,比较模型①、②的拟合效果,应选择哪个模型?并说明理由;
(2)根据(1)中所选择的模型,求出y关于x的回归方程(系数精确到0.01),并求温度为34℃时,产卵数y的预报值.
(参考数据:,,,)
附:对于一组数据,,…,,其回归直线的斜率和截距的最小二乘估计分别为,.
25
2.89
646
168
422688
48.48
70308
10.(24-25高二下·辽宁·期中)已知与及与的成对数据如下,且关于的回归直线方程为,
(1)求关于的回归直线方程;
(2)由散点图发现可以用指数型函数模型拟合与的关系,请建立关于的回归方程(,的值精确到);
(3)又得到一组新数据,,根据这对数据残差的绝对值的大小判断(1)、(2)两个方程哪个拟合效果更好.
参考数据:
其中,.
参考公式:对于一组数据,,,,
其回归直线方程为,其中,.
11.(24-25高二下·湖南·阶段练习)某电动车公司为了抢占更多的市场份额,计划加大广告投入.该公司第i年的年广告费(单位:百万元)满足递推关系,且,年销售量(单位:百万辆)与年广告费相关.令,经过数据处理得到如下统计量的值:
44
4.8
10
40.3
1.612
19.5
8.06
现有模型作为年销售量y关于年广告费x的回归分析模型,其中均为常数.
(1)求;
(2)求出y关于x的回归方程,并预测年广告费为6(百万元)时,产品的年销售量是多少?
(3)该公司生产的电动车毛利润为每辆200元(不含广告费、研发经费).该公司在加大广告投入的同时也加大研发经费的投入,年研发经费为年广告费的199倍.电动车的年净利润受年广告费和年研发经费影响外还受随机变量影响,设随机变量服从正态分布,且满足,求该公司年净利润的最大值大于1000(百万元)的概率.(年净利润=毛利润×年销售量-年广告费-年研发经费-随机变量)
附:①回归直线
②参考数据:,.
12.(2025·福建泉州·模拟预测)泉州少年郎团队从2024年10月份以来,通过深度整合AI算法、大数据分析和自动化技术,不断优化产品与服务,显著提升了运营效率和市场竞争力,推动团队收入持续攀升.该团队在近7个月的经济收入(单位:百万元)的数据如下表:
月份编号
1
2
3
4
5
6
7
收入(百万元)
6
11
21
34
66
101
196
(1)根据以上数据绘制散点图,并根据散点图判断,与(均为大于零的常数)哪一个适宜作为该团队经济收入y关于月份x的回归方程模型?(给出判断即可,不必说明理由)并根据你的判断结果及表中的数据,求出y关于x的回归方程;
(2)请你根据所求的回归方程,预测该团队下一个月的经济收入;
(3)试从统计学角度分析,如果用所求的回归方程预测该团队接下来1年的经济收入情况是否合理?
参考数据:
462
10.78
2711
50.12
2.82
3.47
其中设,
参考公式:,.
13.(2025·山东烟台·三模)近年来,新能源汽车因其动力充沛、提速快、用车成本低等特点得到民众的追捧.某机构为研究汽油价格x(单位:元/升)与新能源汽车的月销售量y(单位:万辆)之间的关系,收集整理得到如下数据:
x
6
6.5
7
7.5
8
y
1.5
2
3
4.5
6.8
(1)若用模型模拟x与y之间关系,求出回归方程;
(2)根据建立的回归方程,预测当汽油价格上涨至9元/升时,新能源汽车的销量;
(3)假设当汽油价格为9元/升时,实际销量超过预测值的概率为0.6.现进行5次独立观测,记这5次观测中销量超过预测值的次数为,求的数学期望.
参考数据和公式:.,.
令,,,.
对于一组数据,其回归直线的斜率和截距的最小二乘估计分别为:,.
14.(24-25高二下·黑龙江哈尔滨·期中)即多频道网络,是一种新的网红经济运行模式,这种模式将不同类型和内容的(专业生产内容)联合起来,在资本有力支持下,保障内容的持续输出,从而最终实现商业的稳定变现,在中国以直播电商、短视频为代表的新兴网红经济的崛起,使机构的服务需求持续增长.数据显示,近年来中国市场规模迅速扩大.下表为2018年年中国市场规模(单位:百亿元),其中2018年年对应的代码依次为.
年份代码x
1
2
3
4
5
中国市场规模y
1.12
1.68
2.45
3.35
4.32
(1)由上表数据可知,可用指数函数模型拟合y与x的关系,
①建立y关于x的回归方程;
②预测2025年中国市场规模(单位:百亿元):
(2)从2018年年中国市场规模中随机抽取3个数据,记这3个数据中与的差的绝对值小于1的个数为X,求X的分布列与期望.
参考数据:
2.58
0.84
46.83
15.99
其中.
参考公式:对于一组数据,其回归直线的斜率和截距的最小二乘估计公式分别为.
参考数据:
考点三 相关性分析与误差分析
1.(24-25高二下·安徽安庆·期末)关于样本相关系数,下列说法正确的是( )
A.样本相关系数
B.当样本相关系数时,称成对数据成正相关
C.两个随机变量线性相关越弱,则相关系数越接近-1
D.两个随机变量线性相关越强,则相关系数越接近1
2.(24-25高二下·山东聊城·期末)某同学根据一组数据作出如图所示的散点图,并对这组数据进行回归分析后发现遗漏了点,增加点后再次进行回归分析,得到的结果和原来相比( )
A.相关系数r变大 B.决定系数变小
C.残差平方和变小 D.不变
3.(24-25高二下·天津河西·期末)对两组数据进行统计后得到如图所示的散点图,下列结论不正确的是( )
A.图1、图2两组数据都具有线性相关关系
B.图1数据正相关,图2数据负相关
C.图1相关系数小于图2相关系数
D.图1相关系数和图2相关系数之和小于0
4.(24-25高二下·四川绵阳·期末)已知在一定范围内,水稻对氮元素的吸收量与它的根长度具有线性相关关系.某盆栽水稻实验中,在确保土壤肥力及灌溉条件相对稳定的情况下,统计了根长度(单位:cm)与氮元素吸收量(单位:mg/天)的相关数据,如下表所示:
9.9
12.1
14.8
18.2
19.9
21.8
25.1
27.7
30.4
32.1
0.30
0.34
0.42
0.50
0.55
0.60
0.71
0.74
0.78
0.86
根据表中数据可得及经验回归方程为,则( )
A.
B.变量和变量的样本相关系数
C.当时,残差为0
D.水稻根长度每增加1cm,一天的氮元素吸收量一定增加mg
5.(24-25高二下·江西抚州·期末)现调查某地区某种野生动物的数量,将该地区分成面积相近的100个地块,从这些地块中用简单随机抽样的方法抽取10个作为样本,调查得到样本数据,其中分别表示第个样本的植物覆盖面积(单位:公顷)和这种野生动物的数量,分别表示这10个样本的植物覆盖面积和这种野生动物的数量的平均值,构造向量,并计算得,由选择性必修第一册教材中的知识,我们知道对数据的相关系数,则上述数据的相关系数 .
6.(24-25高二下·宁夏银川·期中)近年来中国各地政府对夜间经济的扶持力度加大,夜间经济的市场发展规模稳定增长,有关部门整理了2020—2025年中国夜间经济的数据,把市场发展规模记为(单位:万亿元),并把2020—2025年对应的年份代码依次记为,经分析,判断可用函数模型拟合与的关系(为参数).令,计算得,,由最小二乘法得经验回归方程为,为判断拟合效果,通过经验回归方程求得预测值,若残差平方和,则决定系数 .
(参考公式:决定系数,参考数据:)
7.(24-25高二下·贵州黔西·期末)在线性回归分析模型中,变量与相对应的四组数据为,,,,表示解释变量对于预报变量变化的贡献率,则 .
附:,,.
8.(2025·上海·模拟预测)已知高中学生的数学成绩,物理成绩,化学成绩两两成正相关关系,随机抽取10名同学,数学成绩和物理成绩的样本线性相关系数为,物理成绩与化学成绩的样本线性相关系数为,求的样本线性相关系数的最大值为 .
(附:相关系数
9.(24-25高二下·河北石家庄·期末)一组实验数据如下:
2
5
8
9
11
12
10
8
8
7
(1)根据表中数据,计算,.
(2)根据表中数据计算样本相关系数.(保留两位小数).
(3)由数据用最小二乘法可得线性回归方程为,统计学中常用决定系数刻画回归效果,例如假设,就说明响应变量的差异有由解释变量引起.请计算本题的(保留两位小数),并指出本题中响应变量的差异在多大程度上由解释变量引起.
(附:,,,)
10.(24-25高二下·河北承德·期末)2025年4月,中国新能源汽车零售渗透率突破,进入“以电为主”的新阶段,充电桩的使用率也成为关注焦点.经调查,某市今年月份的充电桩日均使用时长(时)与新能源汽车保有量(万辆)及充电桩日均使用率(,为常数)的数据如下表所示:
月份
1
2
3
4
5
6
新能源汽车保有量(万辆)
8
13
15
18
23
25
充电桩日均使用时长(时)
5
7
10
12
15
17
充电桩日均使用率
0.15
0.21
0.3
0.36
0.45
0.51
(1)若用充电桩日均使用率近似估计一个充电桩一天内被使用的概率,设该市某个充电桩在3月份的某3天中被使用的天数为,求的分布列;
(2)求关于的样本相关系数,并说明线性相关程度的强弱;(精确到0.01)
(3)若关于的经验回归方程为,求的值(精确到0.1),并预测当该市某月的新能源汽车保有量为36万辆时,充电桩的日均使用率为多少.
参考数据:,.
参考公式:相关系数.
11.(24-25高二下·河北唐山·期末)某人统计了2020—2024年某网站“双11”当天的交易额,统计结果如表:
年份
2020
2021
2022
2023
2024
年份代码
1
2
3
4
5
交易额百亿元
9
12
17
21
26
(1)请根据表中提供的数据,用样本相关系数说明与的线性相关程度;(样本相关系数保留三位小数,统计中用样本相关系数来衡量两个变量之间线性关系的强弱.相应于变量的取值,变量的观测值为,两个变量的样本相关系数的计算公式为.统计学认为,对于变量,当越接近1时,成对样本数据的线性相关程度越强;当越接近0时,成对样本数据的线性相关程度越弱)
(2)求出关于的经验回归方程,并预测2027年该网站“双11”当天的交易额.
附:在经验回归方程中,,.
12.(24-25高二下·辽宁鞍山·期末)自2021年起,我国居民的储蓄存款逐年增长.设某地区城乡居民人民币储蓄存款(年底余额)如下表所示:
年份
2021
2022
2023
2024
2025
时间代号
1
2
3
4
5
储蓄存款(千亿元)
4.76
4.61
5.32
5.41
5.38
(表中部分数据已精确至0.0001,表中数据可直接代入公式进行运算) 可能用到的估计值:,,
9
25.9692
130.4246
78.48
1554.2872
(1)求关于的回归方程;
(2)用(1)所求回归方程预测该地2027年()的人民币储蓄存款额;
(3)求样本的相关系数.(精确至0.01)
附:,,
考点四 独立性检验
1.(24-25高二下·辽宁·期末)为了解是否喜欢羽毛球运动与性别的关系,某数学兴趣小组经统计得到如下数据,若要使是否喜欢羽毛球运动与性别无关的可能性最大,则( )
性别
羽毛球
喜欢
不喜欢
女生
男生
50
100
附:,其中.
A.4 B.2 C.1 D.
2.(24-25高二下·四川绵阳·期末)通过随机询问某中学110名中学生是否爱好跳绳,得到列联表如表所示:
跳绳
性别
合计
男
女
爱好
40
20
60
不爱好
20
30
50
合计
60
50
110
附:,其中n=a+b+c+d.
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
则以下结论正确的是( )
A.根据小概率值α=0.001的独立性检验,我们认为爱好跳绳与性别无关
B.根据小概率值α=0.001的独立性检验,我们认为爱好跳绳与性别无关,这个结论犯错误的概率不超过0.001
C.根据小概率值α=0.01的独立性检验,我们认为爱好跳绳与性别无关
D.在犯错误的概率不超过0.01的前提下,我们认为爱好跳绳与性别无关
3.(24-25高二下·福建厦门·期末)为考察药物A对预防疾病B的效果,在两个不同规模的动物种群中分别进行了试验,根据种群一的试验结果得到如下列联表:
药物A
疾病B
合计
未患病
患病
未服用
28
22
50
服用
34
16
50
合计
62
38
100
计算得到.假设种群二试验结果对应的列联表中,每个单元格的数据都为上表对应单元格数据的5倍,则根据小概率值的独立性检验,( )
附:,
0.1
0.05
0.01
0.005
2.706
3.841
6.635
7.879
A.当时,种群一中药物A对预防疾病B有效,该推断犯错误的概率不超过5%
B.当时,种群一中药物A对预防疾病B有效,该推断犯错误的概率不超过10%
C.当时,种群二中药物A对预防疾病B有效,该推断犯错误的概率不超过1%
D.当时,种群二中药物A对预防疾病B有效,该推断犯错误的概率不超过0.5%
4.(24-25高二下·吉林·期末·多选)某校团委对“学生性别和喜欢运动是否有关”进行了一次调查,其中被调查的男、女生人数相同,男生喜欢运动的人数占男生人数的,女生喜欢运动的人数占女生人数的,若有95%的把握,但没有99%的把握认为“是否喜欢运动和性别有关”,则被调查人中男生可能有( )
临界值参照表:
A.25人 B.45人 C.60人 D.75人
5.(24-25高二下·福建泉州·期末·多选)针对时下的“抖音热”,某校团委对“学生性别和喜欢抖音是否有关”作了一次调查,其中被调查的男女生人数相同,男生喜欢抖音的人数占男生人数的.女生喜欢抖音的人数占女生人数的,若有95%的把握认为是否喜欢抖音和性别有关,则调查人数中男生可能有( )人
附表:
0.050
0.010
3.841
6.635
附:,
A.40 B.45 C.63 D.70
6.(24-25高二下·上海黄浦·期末)已知,.在检验喜欢某项体育运动与性别是否有关的过程中,某研究员搜集数据并计算得到,则根据小概率值的独立性检验,分析喜欢该体育运动与性别 (选填“有关”或“无关”).
7.(24-25高二下·上海·期末)针对“中学生追星问题”,某校团委对“学生性别和中学生追星是否有关”作了一次调查.在全校学生中随机抽取(是正整数)个学生,其中女生人数是男生人数的,男生追星的人数占男生人数的,女生追星的人数占女生人数的,若根据小概率值的独立性检验,判断中学生追星与性别有关,则男生至少有 人.
参考数据及公式如下:
0.050
0.010
0.001
3.841
6.635
10.828
参考公式:,其中.
8.(24-25高二下·安徽六安·期末)为了解消费者对新能源汽车续航里程和充电设施的满意率,随机调查了200名新能源汽车车主,得到如下数据:
对续航里程满意
对续航里程不满意
对充电设施满意
80
30
对充电设施不满意
40
50
(1)任意调查一名新能源汽车车主,设事件“该车主对续航里程满意”为A,事件“该车主对充电设施满意”为B,求和;
(2)根据小概率值的独立性检验,能否认为消费者对续航里程的满意率与对充电设施的满意率有关?
附:
α
0.05
0.01
0.001
3.841
6.635
10.828
9.(24-25高二下·贵州贵阳·期末)某班主任对全班50名学生学习积极性和对待班级工作的态度进行了调查,统计数据如下表所示:
积极参加班级工作
不太主动参加班级工作
合计
学习积极性高
18
25
学习积极性一般
19
合计
24
50
参考数据:
0.025
0.010
0.005
0.001
5.024
6.635
7.879
10.828
(1)求,,,的值;
(2)如果通过分层抽样的方式从积极参加班级工作的学生中抽取4人,再从这4人中任选3人代表班级参加活动,记这3人中学习积极性高的人数为随机变量,求的分布列和期望;
(3)试根据小概率值的独立性检验,分析学生的学习积极性与对待班级工作的态度是否有关系?说明理由.
(参考公式:)
10.(24-25高二下·天津河东·期末)晨跑是指在早晨以跑步为主的进行身体锻炼的一种运动方式.某机构采用有放回简单随机抽样的方法对某高中学生的运动爱好者进行问答调查.得到成对样本观测数据的分类统计结果,已知被调查的运动爱好者中男生有40人,其中不喜欢晨跑的男生有10人;被调查的运动爱好者中女生有60人,其中不喜欢晨跑的女生有30人.
(1)填表:将所给数据进行整理,填到如下2×2列联表中
喜欢晨跑
不喜欢晨跑
合计
男生
10
40
女生
60
合计
100
(2)计算,并依据小概率值的独立性检验推断喜欢晨跑与性别有关?
(3)若从该校的运动爱好者中,采用分层随机抽样的方法随机抽取10名学生,再从这10名学生中随机抽取4人,设抽取的4人中男生的人数为X,求X的分布列和数学期望.
参考公式及数据: ,其中n=a+b+c+d.
α
0.10
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
11.(24-25高二下·广东梅州·期末)乒乓球,是一种世界流行的球类体育项目,被称为我国的“国球”,在2025年世界乒乓球锦标赛上,我国运动员共收获4金1银2铜,以强大统治力再次展现国乒底色.为了解学生喜爱乒乓球运动是否与性别有关,某校以“是否为乒乓球的球迷”为问题,在高二年级随机抽取了100名学生作为样本,统计得到如下的列联表:
是球迷
不是球迷
合计
男生
40
15
55
女生
20
25
45
合计
60
40
100
附:临界值表及参考公式:
α
0.10
0.05
0.01
2.706
3.841
6.635
(1)依据的独立性检验,判断学生喜爱乒乓球运动是否与性别有关联;
(2)在所调查的球迷中按男女生进行分层抽样,随机抽取6名学生,再从这6名学生中随机抽取2人去观看比赛,求这2名学生中男生人数X的分布列.
12.(23-24高二下·江苏镇江·期末)“九省联考”之后,某地掀起了奥数学习热潮,某中学对学生钻研奥数课程的情况进行调查,将每周独立钻研奥数课程超过6小时的学生称为“奥数迷”,否则称为“非奥数迷”,从调查结果中随机抽取200人进行分析,得到数据如表所示:
奥数迷
非奥数迷
总计
男
48
120
女
56
80
总计
72
128
(1)补全列联表(单位:人),试问是否有95%的把握认为“奥数迷”与性别有关?
(2)现从抽取的“奥数迷”中,按性别采用分层抽样的方法抽取3人参加奥数闯关比赛,已知其中男、女学生独立闯关成功的概率分别为与.设X为独立闯关成功的人数,求X的分布列及数学期望.
附:参考数据与公式:,其中.
0.10
0.05
0.01
0.001
2.706
3.841
6.635
10.828
2
学科网(北京)股份有限公司
$$