内容正文:
第8讲 成对数据的统计分析
【复习目录】
一、变量的相关关系
二、样本相关系数
三、线性回归方程
四、根据样本中心点求参数
五、相关指数的计算及分析
六、非线性回归
七、列联表与独立性检验
八、成对数据的统计分析综合问题
【知识归纳】
1.变量的相关关系
(1)相关关系:两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系.
(2)相关关系的分类:正相关和负相关.
(3)线性相关:一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们称这两个变量线性相关.
2.样本相关系数
(1)r=.
(2)当r>0时,成对样本数据正相关;当r<0时,成对样本数据负相关.
(3)|r|≤1;当|r|越接近1时,成对样本数据的线性相关程度越强;当|r|越接近0时,成对样本数据的线性相关程度越弱.
3.一元线性回归模型
(1)我们将=x+称为Y关于x的经验回归方程,
,
(2)残差:观测值减去预测值,称为残差.
4.列联表与独立性检验
(1)关于分类变量X和Y的抽样数据的2×2列联表:
X
Y
合计
Y=0
Y=1
X=0
a
b
a+b
X=1
c
d
c+d
合计
a+c
b+d
n=a+b+c+d
(2)计算随机变量χ2=,利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验.
【题型归纳】
题型一、变量的相关关系
1.(21-22高二下·四川雅安·期末)下列说法错误的是( )
A.线性回归直线一定过样本点中心
B.在回归分析中,为0.91的模型比为0.88的模型拟合的效果好
C.在残差图中,残差点分布的带状区域的宽度越狭窄,其模型拟合的精度越高
D.在线性回归分析中,相关系数r的值越大,变量间的相关性越强
2.(2021高二下·全国·专题练习)下列说法正确的是( )
A.两个变量的相关关系一定是线性相关
B.两个随机变量的线性相关性越强,则相关系数的绝对值就越接近于0
C.在回归直线方程=0.2x+0.8中,当解释变量x每增加1个单位时,预报变量平均增加1个单位
D.对分类变量X与Y,随机变量K2的观测值k越大,则判断“X与Y有关系”的把握程度越大
3.(21-22高二下·安徽滁州·期末)下列命题中正确的为( )
散点图可以直观的判断两个变量是否具有线性相关关系;
经验回归直线就是散点图中经过样本数据点最多的那条直线;
线性相关系数的绝对值越接近于,表明两个变量线性相关性越弱;
同一组样本数据中,决定系数越大的模型拟合效果越好
A. B. C. D.
题型二、样本相关系数
4.(23-24高二上·江西鹰潭·期末)关于的一组样本数据的散点图中,所有样本点均在直线上,则这组样本数据的样本相关系数为( )
A.-2 B.-1 C.1 D.2
5.(22-23高二下·北京东城·期末)如图(1)、(2)、(3)分别为不同样本数据的散点图,其对应的样本相关系数分别是,那么之间的关系为( )
A. B.
C. D.
6.(22-23高二下·内蒙古包头·期末)某兴趣小组研究光照时长和向日葵种子发芽数量y(颗)之间的关系,采集5组数据,作如图所示的散点图.若去掉后,下列说法正确的是( )
A.相关系数r的绝对值变小 B.相关指数变小
C.残差平方和变大 D.解释变量x与响应变量y的相关性变强
题型三、线性回归方程
7.(22-23高二下·江西赣州·期末)节能降耗是企业的生存之本,树立一种“点点滴滴降成本,分分秒秒增效益”的节能意识,以最好的管理,来实现节能效益的最大化,为此某国企进行节能降耗技术改造,下面是该国企节能降耗技术改造后连续五年的生产利润:
年号
1
2
3
4
5
年生产利润y(单位千万元)
0.7
0.8
1
1.1
1.4
预测第10年该国企的生产利润约为( )
(参考公式)
A.1.85 B.2.02 C.2.19 D.2.36
8.(22-23高二下·广东广州·期末)某外贸工厂今年的月份x与订单y(单位:万元)的几组对应数据如下:
月份x
1
2
3
4
5
订单y
20
24
36
43
52
变量x,y具有线性相关关系,其经验回归方程为:,则估计10月份该厂的订单数为( )
参考数据:,,
参考公式:
A.93.1 B.89.9 C.83.1 D.59.9
9.(2022·辽宁鞍山·模拟预测)用模型拟合一组数,若,,设,得变换后的线性回归方程为,则( )
A.12 B. C. D.7
题型四、根据样本中心点求参数
10.(23-24高二下·全国·期末)某研究机构对儿童记忆能力和识图能力进行统计分析,得到如下数据:
记忆能力
4
6
8
10
识图能力
3
5
6
8
由表中数据,求得线性回归方程为,若某儿童的记忆能力为12时,则他的识图能力为( )
A.9.2 B.9.5 C.9.8 D.10
11.(2024·广西·二模)在研究变量与之间的关系时,进行实验后得到了一组样本数据利用此样本数据求得的经验回归方程为,现发现数据和误差较大,剔除这两对数据后,求得的经验回归方程为,且则( )
A.8 B.12 C.16 D.20
12.(2024·四川绵阳·二模)已知变量x,y之间的线性回归方程为,且变量x,y之间的一组相关数据如表所示,
x
2
4
6
8
y
5
8.2
13
m
则下列说法正确的是( )
A.
B.变量y与x是负相关关系
C.该回归直线必过点
D.x增加1个单位,y一定增加2个单位
题型五、相关指数的计算及分析
13.(22-23高二下·河北承德·期末)关于样本相关系数,下列结论正确的是( )
A.越接近0,成对样本数据的线性相关程度越强
B.值越大,成对样本数据的线性相关程度越强
C.,成对样本数据正相关
D.,成对样本数据不相关
14.(22-23高二下·河南漯河·期末)有下列说法:①在残差图中,残差点比较均匀地落在以取值为0的横轴为对称轴的水平带状区域内,说明选用的模型比较合适.②决定系数用来刻画回归的效果,值越小,说明模型的拟合效果越好.③比较两个模型的拟合效果,可以比较残差平方和的大小,残差平方和越小的模型,拟合效果越不好.其中正确命题的个数是( )
A.0 B.1 C.2 D.3
15.(22-23高二下·陕西渭南·期末)已知四组不同数据的两个变量的线性相关系数如下:数据组①的相关系数;数据组②的相关系数;数据组③的相关系数;数据组④的相关系数.则下列说法正确的是( )
A.数据组①对应的数据点都在同一直线上 B.数据组②中的两个变量线性相关性最强
C.数据组③中的两个变量线性相关性最强 D.数据组④中的两个变量线性相关性最强
题型六、非线性回归
16.(2024·云南曲靖·一模)已知变量关于的回归方程为,若对两边取自然对数,可以发现与线性相关.现有一组数据如下表所示:
1
2
3
4
5
则当时,预测的值为( )
A. B. C. D.
17.(22-23高二下·浙江·期末)已知一组成对数据中关于的一元非线性回归方程,已知,,,则( )
A.3 B.1 C. D.
18.(22-23高二下·吉林长春·期末)某中学课外活动小组为了研究经济走势,根据该市1999-2021年的GDP(国内生产总值)数据绘制出下面的散点图:
该小组选择了如下2个模型来拟合GDP值y随年份x的变化情况,模型一:;模型二:,下列说法正确的是( )
A.变量y与x负相关
B.根据散点图的特征,模型一能更好地拟合GDP值随年份的变化情况
C.若选择模型二,的图象一定经过点
D.当时,通过模型计算得GDP值为70,实际GDP的值为71,则残差为1
题型七、列联表与独立性检验
19.(23-24高二下·江苏泰州·期末)为培养学生的阅读习惯,某学校规定所有学生每天在校阅读时长不得少于1小时.若认为每天在校阅读的时长不少于1小时为达标,达到2小时的学生为“阅读之星”.假设该校学生每天在校阅读时长(的单位:小时),达标学生是“阅读之星”的概率为.
(1)从该校学生中随机选出1人,求达标的概率;
(2)为进一步了解该校学生不达标是否与性别有关,随机调查了90名学生,其中男生占,已知不达标的人数恰是期望值,且不达标的学生中男生占,是否有99%的把握认为不达标与性别有关?
附:参考公式:,其中.
参考数据:
3.841
5.024
6.635
10.828
0.050
0.025
0.010
0.001
20.(2024·辽宁抚顺·模拟预测)某兴趣小组调查并统计了某班级学生期末统考中的数学成绩和建立个性化错题本的情况,用来研究这两者是否有关.若从该班级中随机抽取1名学生,设“抽取的学生期末统考中的数学成绩不及格”,“抽取的学生建立了个性化错题本”,且,,.
(1)求和.
(2)若该班级共有36名学生,请完成列联表,并讨论能否在犯错误的概率不超过0.005的前提下认为学生期末统考中的数学成绩与建立个性化错题本有关.
个性化错题本
期末统考中的数学成绩
合计
及格
不及格
建立
未建立
合计
(3)为进一步验证(2)中的判断,该兴趣小组准备在其他班级中抽取一个容量为36k的样本(假设根据新样本数据建立的列联表中,所有的数据都扩大为(2)中列联表中数据的k倍,且新列联表中的数据都为整数),若要使得在犯错误的概率不超过0.001的前提下可以肯定(2)中的判断,试确定k的最小值.
参考公式及数据:,.
0.01
0.005
0.001
6.635
7.879
10.828
题型八、成对数据的统计分析综合问题
21.(2024·河北保定·二模)某兴趣小组调查并统计了某班级学生期末统考中的数学成绩和建立个性化错题本的情况,用来研究这两者是否有关.若从该班级中随机抽取1名学生,设“抽取的学生期末统考中的数学成绩不及格”,“抽取的学生建立了个性化错题本”,且,,.
(1)求和.
(2)若该班级共有36名学生,请完成列联表,并依据小概率值的独立性检验,分析学生期末统考中的数学成绩与建立个性化错题本是否有关,
个性化错题本
期末统考中的数学成绩
合计
及格
不及格
建立
未建立
合计
(3)为进一步验证(2)中的判断,该兴趣小组准备在其他班级中抽取一个容量为的样本(假设根据新样本数据建立的列联表中,所有的数据都扩大为(2)中列联表中数据的倍,且新列联表中的数据都为整数).若要使得依据的独立性检验可以肯定(2)中的判断,试确定的最小值
参考公式及数据:,.
0.01
0.005
0.001
6.635
7.879
10.828
22.(23-24高二下·河南濮阳·期末)某植物科学研究所的最新研究表明:某种乔木类植物在沙漠中很难生存,主要原因是沙漠水土流失严重,土壤中的养料和水分相对贫瘠且该乔木类植物根系不发达.实验组调配出含钙、钾两种促进植物根系生长的生长液,将该种乔木类植物的幼苗放置在合适的环境下且每天加入等量的生长液进行培养,并记录前5天该乔木类幼苗的高度与天数的数据,如下表所示:
(天)
1
2
3
4
5
7
10
12
16
20
(1)若该实验小组通过作散点图发现与之间具有较强的线性相关关系,试用最小二乘法求出关于的经验回归方程.
(2)一般认为当该乔木类幼苗高度不小于时即可移栽到自然条件下进行种植.若在不加生长液的条件下培养,该乔木类幼苗达到移栽标准的最短培养时间一般为18天,利用(1)中的回归方程预测加了生长液后最短培养时间比不加生长液时缩短了多少天.
参考公式:在经验回归方程中,.
参考数据:.
23.(2024·山东济南·三模)近年来,我国众多新能源汽车制造企业迅速崛起.某企业着力推进技术革新,利润稳步提高.统计该企业2019年至2023年的利润(单位:亿元),得到如图所示的散点图.其中2019年至2023年对应的年份代码依次为1,2,3,4,5.
(1)根据散点图判断,和哪一个适宜作为企业利润y(单位:亿元)关于年份代码x的回归方程类型?(给出判断即可,不必说明理由)
(2)根据(1)中的判断结果,建立y关于x的回归方程;
(3)根据(2)的结果,估计2024年的企业利润.
参考公式及数据;
,,
,,,,
24.(23-24高二下·全国·期末)网上购物就是通过互联网检索商品信息,并通过电子订购单发出购物请求,厂商通过邮购的方式发货或通过快递公司送货上门,货到后通过银行转账、微信或支付宝支付等方式在线汇款.根据2019年中国消费者信息研究,超过的消费者更加频繁地使用网上购物,使得网上购物和送货上门的需求量激增,越来越多的消费者也首次通过第三方、品牌官方网站和微信社群等平台进行购物.某天猫专营店统计了2020年8月5日至9日这5天到该专营店购物的人数和时间第天间的数据,列表如表:
1
2
3
4
5
75
84
93
98
100
(1)由表中给出的数据是否可用线性回归模型拟合人数与时间之间的关系?若可用,估计8月10日到该专营店购物的人数(人数用四舍五入法取整数;若,则线性相关程度很高,可用线性回归模型拟合,计算时精确到.
(2)运用分层抽样的方法从第1天和第5天到该专营店购物的人中随机抽取7人,再从这7人中任取3人进行奖励,求这3人取自不同天的概率;
(3)该专营店为了吸引顾客,推出两种促销方案:方案一,购物金额每满100元可减10元;方案二,一次性购物金额超过800元可抽奖三次,每次中奖的概率均为,且每次抽奖互不影响,中奖一次打9折,中奖两次打8折,中奖三次打6折.某顾客计划在此专营店一次性购买1000元的商品,请从实际付款金额的数学期望的角度分析选哪种方案更优惠.
参考数据:.附:相关系数,回归直线方程的斜率:,.
【专题强化】
一、单选题
25.(23-24高二下·上海·期末)为了研究关于的线性相关关系,收集了5组样本数据(见表):若已求得一元线性回归方程,则下列选项中正确的是( )
1
2
3
4
5
0.5
0.9
1
1.1
1.5
A.
B.去掉样本点后,与的样本相关系数不会改变
C.当时,的预测值为2.2
D.与的样本是负相关
26.(23-24高二下·重庆·阶段练习)已知一系列样本点的一个经验回归方程为,若样本点的残差为1,则( )
A. B.6 C. D.8
27.(23-24高二下·吉林长春·期中)以下有关直线拟合效果的说法错误的是( )
A.通过最小二乘法得到的线性回归直线经过样本点的中心
B.相关系数r越小,表明两个变量相关性越弱
C.最小二乘法求回归直线方程,是求使最小的a,b的值
D.决定系数R2越接近1,表明直线拟合效果越好
28.(23-24高二上·江苏常州·期末)用最小二乘法得到一组数据的线性回归方程为,若,则( )
A.11 B.13 C.63 D.78
29.(23-24高二上·全国·单元测试)某学校校医研究温差(℃)与本校当天新增感冒人数y(人)的关系,该医生记录了5天的数据,且样本中心点为.由于保管不善,记录的5天数据中有两个数据看不清楚,现用代替,已知,,则下列结论正确的是( )
x
5
6
8
9
12
y
17
m
25
n
35
A.在确定的条件下,去掉样本点,则样本的相关系数r增大
B.在确定的条件下,经过拟合,发现基本符合线性回归方程,则
C.在确定的条件下,经过拟合,发现基本符合线性回归方程,则当时,残差为
D.事件“,”发生的概率为
30.(2023·四川南充·一模)某商品的地区经销商对2023年1月到5月该商品的销售情况进行了调查,得到如下统计表.发现销售量y(万件)与时间x(月)成线性相关,根据表中数据,利用最小二乘法求得y与x的回归直线方程为:.则下列说法错误的是( )
时间x(月)
1
2
3
4
5
销售量y(万件)
1
1.6
2.0
a
3
A.由回归方程可知2024年1月份该地区的销售量为6.8万件
B.表中数据的样本中心点为
C.
D.由表中数据可知,y和x成正相关
31.(2023·四川宜宾·一模)华为在过去几年面临了来自美国政府的封锁和限制,但华为并没有放弃,在自主研发和国内供应链的支持下,成功突破了封锁,实现了5G功能.某手机商城统计了最近5个月华为手机的实际销量,如下表所示:
时间(月)
1
2
3
4
5
销售量(万部)
0.5
0.8
1.0
1.2
1.5
若与线性相关,且线性回归方程为,则下列说法不正确的是( )
A.样本中心点为
B.由表中数据可知,变量与呈正相关
C.
D.预测时华为手机销量约为1.86(万部)
32.(22-23高二下·安徽合肥·期末)某学习小组用计算机软件对一组数据进行回归分析,甲同学首先求出经验回归方程,样本点的中心为.乙同学对甲的计算过程进行检查,发现甲将数据误输成,数据误输成,将这两个数据修正后得到经验回归方程,则实数( )
A. B. C. D.
33.(21-22高二下·山东滨州·期末)针对时下的“短视频热”,某高校团委对学生性别和喜欢短视频是否有关联进行了一次调查,其中被调查的男生、女生人数均为人,男生中喜欢短视频的人数占男生人数的,女生中喜欢短视频的人数占女生人数的.零假设为:喜欢短视频和性别相互独立.若依据的独立性检验认为喜欢短视频和性别不独立,则的最小值为( )
附:,附表:
0.05
0.01
3.841
6.635
A.7 B.8 C.9 D.10
34.(22-23高二下·福建泉州·期末)已知由样本数据点集合,求得的回归直线方程为,且.现发现两个数据点和误差较大,去除这两点后重新求得的回归直线方程的斜率为,则正确的是( )
A.变量与具有负相关关系
B.去除后的估计值增加速度变快
C.去除后回归方程为
D.去除后相应于样本点(2,3.75)的残差为
二、多选题
35.(23-24高二下·江苏泰州·期末)下列说法中,正确的是( )
A.公式中的和具有相关关系
B.回归直线必定经过样本点的中心
C.相关系数的绝对值越接近1,则两个变量的相关性越强
D.对分类变量与的随机变量来说,越大,判断“与有关系”的把握越大
36.(23-24高二下·江苏·期中)下列命题正确的是( )
A.若随机变量满足,则
B.以模型去拟合一组数据时,为了求出线性回归方程,设,求得线性回归方程为,则c,k的值分别是和2
C.已知,若,则事件M,N相互独立
D.根据分类变量X与Y的成对样本数据,计算得到,根据小概率值的独立性检验(),可判断X与Y有关联,此推断犯错误的概率不大于0.05
37.(22-23高二上·福建福州·期末)已知由样本数据点集合,求得的回归直线方程为,且,现发现两个数据点和误差较大,剔除后重新求得的回归直线的斜率为1.2,则( )
A.变量与具有负相关关系 B.剔除后不变
C.剔除后的回归方程为 D.剔除后相应于样本点的残差为0.05
38.(22-23高二下·吉林·期末)某课外兴趣小组通过随机调查,利用列联表和统计量研究数学成绩优秀是否与性别有关.计算得,经查阅临界值表知,则下列判断错误的是( )
A.每100个数学成绩优秀的人中就会有1名是女生
B.若某人数学成绩优秀,那么他为男生的概率是0.010
C.有的把握认为“数学成绩优秀与性别有关
D.在犯错误的概率不超过的前提下认为“数学成绩优秀与性别无关”
39.(22-23高二下·安徽合肥·期末)某制药公司为了研究某种治疗高血压的药物在饭前和饭后服用的药效差异,随机抽取了200名高血压患者开展试验,其中100名患者饭前服药,另外100名患者饭后服药,随后观察药效,将试验数据绘制成如图所示的等高条形图,已知,且,则下列说法正确的是( )
A.饭前服药的患者中,药效强的频率为
B.药效弱的患者中,饭后服药的频率为
C.在犯错误的概率不超过0.01的条件下,可以认为这种药物饭前和饭后服用的药效有差异
D.在犯错误的概率不超过0.01的条件下,不能认为这种药物饭前和饭后服用的药效有差异
40.(22-23高二下·福建莆田·期末)某学习小组收集了7组样本数据(如下表所示):
1
2
3
4
5
6
7
0.5
1.2
0.8
1.5
1.7
2.3
2.5
他们绘制了散点图并计算样本相关系数,发现与有比较强的线性相关关系.若关于的经验回归方程为,则( )
A.与呈正相关关系
B.
C.当时,的预测值为3.3
D.去掉样本点后,样本相关系数不变
三、填空题
41.(23-24高二下·河南濮阳·期末)已知变量的统计数据如下表,对表中数据作分析,发现与之间具有线性相关关系,利用最小二乘法,计算得到经验回归方程为,据此模型预测,当时的值为 .
1
2
3
4
5
3
4.5
4.8
6.4
6.3
42.(23-24高二下·江西宜春·期中)为了调查学生对网络课程是否喜爱,研究人员随机调查了相同人数的男、女学生,发现男生中有80%喜欢网络课程,女生中有40%不喜欢网络课程,且有95%的把握认为喜欢网络课程与性别有关,但没有99%的把握认为喜欢网络课程与性别有关.已知被调查的男、女学生的总人数为,则 .
附:.临界值表:
0.050
0.010
0.005
0.001
3.841
6.635
7.879
10.828
43.(22-23高二下·北京东城·期末)幸福感是个体的一种主观情感体验,生活中的多种因素都会影响人的幸福感受.为研究男生与女生的幸福感是否有差异,一位老师在某大学进行了随机抽样调查,得到如下数据:
幸福
不幸福
总计
男生
638
128
766
女生
372
46
418
总计
1010
174
1184
由此计算得到,已知,.
根据小概率值的独立性检验, (填“可以”或“不能”)认为男生与女生的幸福感有差异;根据小概率值的独立性检验, (填“可以”或“不能”)认为男生与女生的幸福感有差异.
44.(21-22高二下·福建福州·期末)为了考察某种药物预防疾病的效果,进行动物试验,得到如下列联表:
药物
疾病
合计
未患病
患病
服用
a
50
未服用
50
合计
80
20
100
若在本次考察中得出“在犯错误的概率不超过0.01的前提下认为药物有效”的结论,则a的最小值为 .(其中且)(参考数据:,)
附:,
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
四、解答题
45.(2024·山东泰安·模拟预测)某投资公司现从甲投资研究室(人)、乙投资研究室(人)中随机选出名资深投资顾问对某项目进行考察投资.
(1)记选出的名资深投资顾问中,甲投资研究室的人数为,求的分布列和均值;
(2)为给投资提供决策依据,资深投资顾问对此项目的个子项目调查了年研发经费(单位:万元)和年销售额(单位:十万元),并对数据进行了初步处理,得到一些统计量的值:,,,,根据散点图认为关于的经验回归方程为,求与的值(结果精确到).
参考公式:,其中
46.(2024·四川内江·三模)2024年2月10日至17日(正月初一至初八),“2024•内江市中区新春极光焰火草地狂欢节”在川南大草原举行,共举行了8场精彩的烟花秀节目.前5场的观众人数(单位:万人)与场次的统计数据如表所示:
场次编号
1
2
3
4
5
观众人数
0.7
0.8
1
1.2
1.3
(1)已知可用线性回归模型拟合与的关系,请建立关于的线性回归方程;
(2)若该烟花秀节目分A、B、C三个等次的票价,某机构随机调查了该烟花秀节目现场200位观众的性别与购票情况,得到的部分数据如表所示,请将列联表补充完整,并判断能否有的把握认为该烟花秀节目的观众是否购买A等票与性别有关.
购买A等票
购买非A等票
总计
男性观众
50
女性观众
60
总计
100
200
参考公式及参考数据:回归方程中斜率与截距的最小二乘法估计公式分别为,其中.
0.100
0.050
0.010
2.706
3.841
6.635
47.(2024·四川眉山·三模)某公司为改进生产,现对近5年来生产经营情况进行分析.收集了近5年的利润(单位:亿元)与年份代码共5组数据(其中年份代码分别指2019年,2020年,年),并得到如下值:.
(1)若用线性回归模型拟合变量与的相关关系,计算该样本相关系数,并判断变量与的相关程度(精确到0.01);
(2)求变量关于的线性回归方程,并求2024年利润的预报值.
附:①;②若,相关程度很强;,相关程度一般;,相关程度较弱;③一组数据,其回归直线的斜率和截距的最小二乘估计分别为;相关系数.
48.(23-24高二下·广东·期中)某地政府为提高当地农民收入,指导农民种植药材,取得较好的效果.以下是某农户近5年种植药材的年收入的统计数据:
年份
2019
2020
2021
2022
2023
年份代码
1
2
3
4
5
年收入(千元)
59
61
64
68
73
(1)根据表中数据,现决定使用模型拟合与之间的关系,请求出此模型的回归方程;(结果保留一位小数)
(2)统计学中常通过计算残差的平方和来判断模型的拟合效果.在本题中,若残差平方和小于0.5,则认为拟合效果符合要求.请判断(1)中回归方程的拟合效果是否符合要求,并说明理由.
参考数据及公式:,.设,则,.
49.(23-24高二上·江西南昌·期末)新冠肺炎疫情发生以来,中医药全面参与疫情防控救治,做出了重要贡献.某中医药企业根据市场调研与模拟,得到研发投入(亿元)与产品收益(亿元)的数据统计如下:
研发投入x(亿元)
1
2
3
4
5
产品收益y(亿元)
3
7
9
10
11
(1)计算的相关系数,并判断是否可以认为研发投入与产品收益具有较高的线性相关程度?(若,则线性相关程度一般,若,则线性相关程度较高)
(2)求出关于的线性回归方程,并预测若想收益超过50(亿元)则需研发投入至少多少亿元?(结果保留一位小数)
参考数据:;
附:相关系数公式:;
回归直线方程的斜率.
50.(23-24高二上·浙江杭州·期末)为比较甲、乙两所学校学生的数学水平,采用简单随机抽样的方法抽取80名学生.通过测验得到了如表数据:
学校
数学成绩
合计
不优秀
优秀
甲校
30
10
40
乙校
20
20
40
合计
50
30
80
(1)依据小概率值的独立性检验,分析两校学生中数学成绩优秀率之间是否存在差异;如果表中所有数据都扩大为原来的10倍.在相同的检验标准下,再用独立性检验推断学校和数学成绩之间的关联性,结论还一样吗?请你试着解释其中的原因.
(2)据调查,丙校学生数学成绩的优秀率为30%,且将频率视为概率、现根据甲、乙、丙三所学校总人数比例依次抽取了24人,30人,30人进行调查访谈.如果已知从中抽到了一名优秀学生,求该名学生来自丙校的概率.
附:临界值表:
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
51.(23-24高二上·陕西渭南·期末)某地区响应“节能减排,低碳生活”的号召,开展系列的措施控制碳排放.环保部门收集到近5年内新增碳排放数量,如下表所示,其中x为年份代号,y(单位:万吨)代表新增碳排放量.
年份
2019
2020
2021
2022
2023
年份代号
1
2
3
4
5
新增碳排放万吨
6.1
5.2
4.9
4
3.8
(1)请计算并用相关系数的数值说明与间具有较强的线性相关性(若,则线性相关程度较高);
(2)求关于的线性回归方程,并据此估计该地区年的新增碳排放.
参考数据:,,,,,,.
参考公式:对于一组数据,,…,,其回归直线的斜率和截距的最小二乘法估计公式,相关系数r的公式分别为,,.
1
学科网(北京)股份有限公司
$$
第8讲 成对数据的统计分析
【复习目录】
一、变量的相关关系
二、样本相关系数
三、线性回归方程
四、根据样本中心点求参数
五、相关指数的计算及分析
六、非线性回归
七、列联表与独立性检验
八、成对数据的统计分析综合问题
【知识归纳】
1.变量的相关关系
(1)相关关系:两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系.
(2)相关关系的分类:正相关和负相关.
(3)线性相关:一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们称这两个变量线性相关.
2.样本相关系数
(1)r=.
(2)当r>0时,成对样本数据正相关;当r<0时,成对样本数据负相关.
(3)|r|≤1;当|r|越接近1时,成对样本数据的线性相关程度越强;当|r|越接近0时,成对样本数据的线性相关程度越弱.
3.一元线性回归模型
(1)我们将=x+称为Y关于x的经验回归方程,
,
(2)残差:观测值减去预测值,称为残差.
4.列联表与独立性检验
(1)关于分类变量X和Y的抽样数据的2×2列联表:
X
Y
合计
Y=0
Y=1
X=0
a
b
a+b
X=1
c
d
c+d
合计
a+c
b+d
n=a+b+c+d
(2)计算随机变量χ2=,利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验.
【题型归纳】
题型一、变量的相关关系
1.(21-22高二下·四川雅安·期末)下列说法错误的是( )
A.线性回归直线一定过样本点中心
B.在回归分析中,为0.91的模型比为0.88的模型拟合的效果好
C.在残差图中,残差点分布的带状区域的宽度越狭窄,其模型拟合的精度越高
D.在线性回归分析中,相关系数r的值越大,变量间的相关性越强
【答案】D
【分析】根据回归方程相关知识逐项判断即可.
【详解】回归直线必过样本点中心,故A正确;
拟合系数越大拟合效果越好,故B正确;
残差点分布区域越窄,拟合精度越高,故C正确;
相关系数越接近于1,相关性越强,故当时,r的值越大,变量间的相关性越弱,故D错误.
故选:D
2.(2021高二下·全国·专题练习)下列说法正确的是( )
A.两个变量的相关关系一定是线性相关
B.两个随机变量的线性相关性越强,则相关系数的绝对值就越接近于0
C.在回归直线方程=0.2x+0.8中,当解释变量x每增加1个单位时,预报变量平均增加1个单位
D.对分类变量X与Y,随机变量K2的观测值k越大,则判断“X与Y有关系”的把握程度越大
【答案】D
【分析】根据独立性检验的概念以及基本思想即可得出选项.
【详解】A,两个变量的相关关系有线性相关或非线性相关,故A错误;
B,两个随机变量的线性相关性越强,则相关系数的绝对值就越接近于,故B错误;
C,在回归直线方程=0.2x+0.8中,当解释变量x每增加1个单位时,
预报变量平均增加个单位,故C错误;
D,由独立性检验知“判断‘X与Y有关系’的把握程度越大”正确,
故选:D.
3.(21-22高二下·安徽滁州·期末)下列命题中正确的为( )
散点图可以直观的判断两个变量是否具有线性相关关系;
经验回归直线就是散点图中经过样本数据点最多的那条直线;
线性相关系数的绝对值越接近于,表明两个变量线性相关性越弱;
同一组样本数据中,决定系数越大的模型拟合效果越好
A. B. C. D.
【答案】C
【分析】根据变量间的相关系数,一一判断即可.
【详解】解:对于,散点图可以直观的判断两个变量是否具有线性相关关系,故正确;
对于,回归直线也可能不过任何一个点,故错误;
对于,线性相关系数的绝对值越接近于,表明两个变量线性相关性越强,故错误;
对于,同一组样本数据中,决定系数越大的模型拟合效果越好,故正确.
故选:C.
题型二、样本相关系数
4.(23-24高二上·江西鹰潭·期末)关于的一组样本数据的散点图中,所有样本点均在直线上,则这组样本数据的样本相关系数为( )
A.-2 B.-1 C.1 D.2
【答案】B
【分析】由题意得回归直线方程是,由此即可得解.
【详解】因为所有样本点都在直线上,所以回归直线方程是,
可得这两个变量是负相关,故这组样本数据的样本相关系数为负值,
且所有样本点都在直线上,则有相关系数.
故选:B.
5.(22-23高二下·北京东城·期末)如图(1)、(2)、(3)分别为不同样本数据的散点图,其对应的样本相关系数分别是,那么之间的关系为( )
A. B.
C. D.
【答案】B
【分析】根据散点图,结合变量间的相关关系和相关系数的定义,即可求解.
【详解】由散点图(1)可得,变量与变量之间呈现正相关,所以;
由散点图(2)可得,变量与变量之间呈现负相关,所以;
由散点图(3)可得,变量与变量之间不相关,所以,
所以.
故选:B.
6.(22-23高二下·内蒙古包头·期末)某兴趣小组研究光照时长和向日葵种子发芽数量y(颗)之间的关系,采集5组数据,作如图所示的散点图.若去掉后,下列说法正确的是( )
A.相关系数r的绝对值变小 B.相关指数变小
C.残差平方和变大 D.解释变量x与响应变量y的相关性变强
【答案】D
【分析】观察图象,较其他的点偏离回归直线最大,去掉后,回归效果更好,结合相关系数、相关指数、残差平方和以及相关性逐项分析判断.
【详解】观察图象知:较其他的点偏离回归直线最大,因此去掉后,回归效果更好,
对于A,相关系数越接近于1,线性相关性越强,因此去掉后,相关系数的绝对值变大,A错误;
对于B,相关指数越接近于1,拟合效果越好,因此去掉后,相关指数变大,B错误;
对于C,残差平方和变大,拟合效果越差,因此去掉后,残差平方和变小,C错误
对于D,由选项A知,去掉后,相关系数的绝对值变大,因此解释变量与响应变量的相关性变强,D正确.
故选:D
题型三、线性回归方程
7.(22-23高二下·江西赣州·期末)节能降耗是企业的生存之本,树立一种“点点滴滴降成本,分分秒秒增效益”的节能意识,以最好的管理,来实现节能效益的最大化,为此某国企进行节能降耗技术改造,下面是该国企节能降耗技术改造后连续五年的生产利润:
年号
1
2
3
4
5
年生产利润y(单位千万元)
0.7
0.8
1
1.1
1.4
预测第10年该国企的生产利润约为( )
(参考公式)
A.1.85 B.2.02 C.2.19 D.2.36
【答案】C
【分析】根据已知数据求得,可得线性回归方程,再令即可得解.
【详解】,
则,
,
故,
,
所以国企的生产利润与年份的回归方程为,
当时,,
即预测第10年该国企的生产利润约为.
故选:C.
8.(22-23高二下·广东广州·期末)某外贸工厂今年的月份x与订单y(单位:万元)的几组对应数据如下:
月份x
1
2
3
4
5
订单y
20
24
36
43
52
变量x,y具有线性相关关系,其经验回归方程为:,则估计10月份该厂的订单数为( )
参考数据:,,
参考公式:
A.93.1 B.89.9 C.83.1 D.59.9
【答案】A
【分析】根据给定的数据求出样本的中心点,再利用最小二乘法公式求出经验回归方程作答.
【详解】依题意,,而,,
则,,
因此经验回归方程为:,当时,,
所以估计10月份该厂的订单数为93.1.
故选:A
9.(2022·辽宁鞍山·模拟预测)用模型拟合一组数,若,,设,得变换后的线性回归方程为,则( )
A.12 B. C. D.7
【答案】B
【分析】由已知,可根据,先计算出,然后把样本中心点带入线性回归方程为中计算出,从而得到线性回归方程,然后将方程化为指数形式,通过待定系数法分别对应出、的值,即可完成求解.
【详解】由已知,,所以,
,,所以
,
由题意,满足线性回归方程为,所以,所以,
此时线性回归方程为,即,
可将此式子化为指数形式,即为,
因为模型为模型,所以,,
所以.
故选:B.
题型四、根据样本中心点求参数
10.(23-24高二下·全国·期末)某研究机构对儿童记忆能力和识图能力进行统计分析,得到如下数据:
记忆能力
4
6
8
10
识图能力
3
5
6
8
由表中数据,求得线性回归方程为,若某儿童的记忆能力为12时,则他的识图能力为( )
A.9.2 B.9.5 C.9.8 D.10
【答案】B
【分析】根据回归方程过样本中心点得到的值,再代值计算即可.
【详解】由题意可得:,
回归方程过样本中心点,则,解得,
线性回归方程为:,
当时,利用回归方程预测他的识图能力为.
故选:B.
11.(2024·广西·二模)在研究变量与之间的关系时,进行实验后得到了一组样本数据利用此样本数据求得的经验回归方程为,现发现数据和误差较大,剔除这两对数据后,求得的经验回归方程为,且则( )
A.8 B.12 C.16 D.20
【答案】C
【分析】由题意,求出剔除后的平均数,进而求出剔除前的平均数,根据回归直线必过样本点中心得到,进而得到,将点代入,即可求解.
【详解】设没剔除两对数据前的平均数分别为,,
剔除两对数据后的平均数分别为,,
因为,
所以,,
则,
所以,
又因为,
所以,
解得.
故选:C.
12.(2024·四川绵阳·二模)已知变量x,y之间的线性回归方程为,且变量x,y之间的一组相关数据如表所示,
x
2
4
6
8
y
5
8.2
13
m
则下列说法正确的是( )
A.
B.变量y与x是负相关关系
C.该回归直线必过点
D.x增加1个单位,y一定增加2个单位
【答案】C
【分析】根据给定数据及回归方程求出样本中心点,再逐项判断即可得解.
【详解】依题意,,
由,解得,A错误;
回归方程中,,则变量y与x是正相关关系,B错误;
由于样本中心点为,因此该回归直线必过点,C正确;
由回归方程知,x增加1个单位,y大约增加2个单位,D错误.
故选:C
题型五、相关指数的计算及分析
13.(22-23高二下·河北承德·期末)关于样本相关系数,下列结论正确的是( )
A.越接近0,成对样本数据的线性相关程度越强
B.值越大,成对样本数据的线性相关程度越强
C.,成对样本数据正相关
D.,成对样本数据不相关
【答案】C
【分析】根据样本相关系数与线性相关程度的关系判断即可.
【详解】越接近0,成对样本数据的线性相关程度越弱,故A错误;
越接近1,成对样本数据的线性相关程度越强,故B错误;
,成对样本数据正相关,故C正确;
,成对样本数据负相关,故D错误.
故选:C.
14.(22-23高二下·河南漯河·期末)有下列说法:①在残差图中,残差点比较均匀地落在以取值为0的横轴为对称轴的水平带状区域内,说明选用的模型比较合适.②决定系数用来刻画回归的效果,值越小,说明模型的拟合效果越好.③比较两个模型的拟合效果,可以比较残差平方和的大小,残差平方和越小的模型,拟合效果越不好.其中正确命题的个数是( )
A.0 B.1 C.2 D.3
【答案】B
【分析】利用残差的意义、相关指数的意义即可判断.
【详解】①在残差图中,残差点比较均匀地落在以取值为0的横轴为对称轴的水平带状区域内,说明选用的模型比较合适,则①正确;
②决定系数用来刻画回归的效果,值越接近于1,效果越好,故②错误;
③比较两个模型的拟合效果,可以比较残差平方和的大小,残差平方和越小的模型,拟合效果越好,故③错误;其中正确得是①,
故选:B.
15.(22-23高二下·陕西渭南·期末)已知四组不同数据的两个变量的线性相关系数如下:数据组①的相关系数;数据组②的相关系数;数据组③的相关系数;数据组④的相关系数.则下列说法正确的是( )
A.数据组①对应的数据点都在同一直线上 B.数据组②中的两个变量线性相关性最强
C.数据组③中的两个变量线性相关性最强 D.数据组④中的两个变量线性相关性最强
【答案】B
【分析】根据相关系数的绝对值越接近于,两个变量线性相关性越强可得答案.
【详解】因为,所以数据组①中的两个变量不是线性相关关系,对应的数据点不可能都在同一直线上,故A不正确;
因为最大,所以数据组②中的两个变量线性相关性最强,故B正确,C D不正确.
故选:B
题型六、非线性回归
16.(2024·云南曲靖·一模)已知变量关于的回归方程为,若对两边取自然对数,可以发现与线性相关.现有一组数据如下表所示:
1
2
3
4
5
则当时,预测的值为( )
A. B. C. D.
【答案】C
【分析】令,可得出,求出、的值,将、的值代入,求出的值,可得出变量关于的回归方程,然后令,可得出的值.
【详解】令,由可得,如下表所示:
由表格中的数据可得,,
则有,解得,故,
当时,.
故选:C.
17.(22-23高二下·浙江·期末)已知一组成对数据中关于的一元非线性回归方程,已知,,,则( )
A.3 B.1 C. D.
【答案】B
【分析】求出、的均值,根据样本中心在回归直线上求参数即可.
【详解】由,,则,可得.
故选:B
18.(22-23高二下·吉林长春·期末)某中学课外活动小组为了研究经济走势,根据该市1999-2021年的GDP(国内生产总值)数据绘制出下面的散点图:
该小组选择了如下2个模型来拟合GDP值y随年份x的变化情况,模型一:;模型二:,下列说法正确的是( )
A.变量y与x负相关
B.根据散点图的特征,模型一能更好地拟合GDP值随年份的变化情况
C.若选择模型二,的图象一定经过点
D.当时,通过模型计算得GDP值为70,实际GDP的值为71,则残差为1
【答案】D
【分析】对于AB,由散点图的变化趋势分析判断,对于C,由线性回归方程的性判断,对于D,结合残差的定义判断.
【详解】对于A,由散点图可知y随年份x的增大而增大,所以变量y与x正相关,所以A错误,
对于B,由散点图可知变量y与x的变化趋向于一条曲线,所以模型二能更好地拟合GDP值随年份的变化情况,所以B错误,
对于C,若选择模型二:,令,则的图象经过点,所以C错误,
对于D,当时,通过模型计算得GDP值为70,实际GDP的值为71,则残差为,所以D正确,
故选:D
题型七、列联表与独立性检验
19.(23-24高二下·江苏泰州·期末)为培养学生的阅读习惯,某学校规定所有学生每天在校阅读时长不得少于1小时.若认为每天在校阅读的时长不少于1小时为达标,达到2小时的学生为“阅读之星”.假设该校学生每天在校阅读时长(的单位:小时),达标学生是“阅读之星”的概率为.
(1)从该校学生中随机选出1人,求达标的概率;
(2)为进一步了解该校学生不达标是否与性别有关,随机调查了90名学生,其中男生占,已知不达标的人数恰是期望值,且不达标的学生中男生占,是否有99%的把握认为不达标与性别有关?
附:参考公式:,其中.
参考数据:
3.841
5.024
6.635
10.828
0.050
0.025
0.010
0.001
【答案】(1)
(2)有99%的把握认为不达标与性别有关.
【分析】(1)根据条件概率公式计算即可;
(2)根据题意得出列联表后,计算出的观测值,结合临界值表可得出结论.
【详解】(1)从该校学生随机选出1人,记其达标为事件,是“阅读之星”为事件.
则,.
因为,所以.
又因为达标学生是“阅读之星”的概率为,
所以,得,
即从该校学生中随机选出1人,达标的概率为.
(2)依题意,随机调查的90名学生中,男生人数为40,女生人数为50.
设这90名学生中,不达标学生人数为.
由(1)知,不达标的概率为,则.
所以数学期望,即不达标的人数为18.
因为不达标学生中有的是男生,所以不达标的男生人数为3,不达标的女生人数为15.
则达标的男生人数为37,达标的女生人数为35,得如下列联表.
男生
女生
合计
达标
37
35
72
不达标
3
15
18
合计
40
50
90
所以.
因为,所以有99%的把握认为不达标与性别有关.
20.(2024·辽宁抚顺·模拟预测)某兴趣小组调查并统计了某班级学生期末统考中的数学成绩和建立个性化错题本的情况,用来研究这两者是否有关.若从该班级中随机抽取1名学生,设“抽取的学生期末统考中的数学成绩不及格”,“抽取的学生建立了个性化错题本”,且,,.
(1)求和.
(2)若该班级共有36名学生,请完成列联表,并讨论能否在犯错误的概率不超过0.005的前提下认为学生期末统考中的数学成绩与建立个性化错题本有关.
个性化错题本
期末统考中的数学成绩
合计
及格
不及格
建立
未建立
合计
(3)为进一步验证(2)中的判断,该兴趣小组准备在其他班级中抽取一个容量为36k的样本(假设根据新样本数据建立的列联表中,所有的数据都扩大为(2)中列联表中数据的k倍,且新列联表中的数据都为整数),若要使得在犯错误的概率不超过0.001的前提下可以肯定(2)中的判断,试确定k的最小值.
参考公式及数据:,.
0.01
0.005
0.001
6.635
7.879
10.828
【答案】(1),
(2)表格见解析,能
(3).
【分析】(1)利用条件概率和全概率公式即可求得和.
(2)先求得的值,再利用该值和表格值进行对比即可判断二者是否有关;
(3)先依据题给条件列出关于k的不等式,解之即可求得k的范围,再结合新列联表中的数据都为整数,进而求得k的最小值.
【详解】(1)因为,,,
所以,,.
由,
解得,所以.
则,解得.
(2)
个性化错题本
期末统考中的数学成绩
合计
及格
不及格
建立
20
4
24
未建立
4
8
12
合计
24
12
36
根据列联表中的数据,经计算得到.
所以在犯错误的概率不超过0.005的前提下认为学生期末统考中的数学成绩与建立个性化错题本有关.
(3)
,解得.
要使新列联表中的数据都为整数,则需.
又因为,所以4k的最小值为5,故的最小值是.
题型八、成对数据的统计分析综合问题
21.(2024·河北保定·二模)某兴趣小组调查并统计了某班级学生期末统考中的数学成绩和建立个性化错题本的情况,用来研究这两者是否有关.若从该班级中随机抽取1名学生,设“抽取的学生期末统考中的数学成绩不及格”,“抽取的学生建立了个性化错题本”,且,,.
(1)求和.
(2)若该班级共有36名学生,请完成列联表,并依据小概率值的独立性检验,分析学生期末统考中的数学成绩与建立个性化错题本是否有关,
个性化错题本
期末统考中的数学成绩
合计
及格
不及格
建立
未建立
合计
(3)为进一步验证(2)中的判断,该兴趣小组准备在其他班级中抽取一个容量为的样本(假设根据新样本数据建立的列联表中,所有的数据都扩大为(2)中列联表中数据的倍,且新列联表中的数据都为整数).若要使得依据的独立性检验可以肯定(2)中的判断,试确定的最小值
参考公式及数据:,.
0.01
0.005
0.001
6.635
7.879
10.828
【答案】(1),
(2)表格见解析,有关;
(3)
【分析】(1)利用条件概率公式结合全概率公式即可得到答案;
(2)由(1)所计算的概率即可完成列联表,再由独立性检验的知识即可得到结论;
(3)利用独立性检验的知识可得,在结合,即可得到答案.
【详解】(1)因为,,
所以,,
由于,解得,所以.
,解得.
(2)
个性化错题本
期末统考中的数学成绩
合计
及格
不及格
建立
20
4
24
未建立
4
8
12
合计
24
12
36
零假设为期末统考中的数学成绩与建立个性化错题本无关.
根据列联表中的数据,经计算得到.
根据小概率值的独立性检验,我们推断不成立,即认为期末统考中的数学成绩与建立个性化错题本有关,此推断犯错误的概率不大于0.005.
(3),解得.
要使新列联表中的数据都为整数,则需.
又因为,所以的最小值为5,故的最小值是
22.(23-24高二下·河南濮阳·期末)某植物科学研究所的最新研究表明:某种乔木类植物在沙漠中很难生存,主要原因是沙漠水土流失严重,土壤中的养料和水分相对贫瘠且该乔木类植物根系不发达.实验组调配出含钙、钾两种促进植物根系生长的生长液,将该种乔木类植物的幼苗放置在合适的环境下且每天加入等量的生长液进行培养,并记录前5天该乔木类幼苗的高度与天数的数据,如下表所示:
(天)
1
2
3
4
5
7
10
12
16
20
(1)若该实验小组通过作散点图发现与之间具有较强的线性相关关系,试用最小二乘法求出关于的经验回归方程.
(2)一般认为当该乔木类幼苗高度不小于时即可移栽到自然条件下进行种植.若在不加生长液的条件下培养,该乔木类幼苗达到移栽标准的最短培养时间一般为18天,利用(1)中的回归方程预测加了生长液后最短培养时间比不加生长液时缩短了多少天.
参考公式:在经验回归方程中,.
参考数据:.
【答案】(1)
(2)天
【分析】(1)由已知求得与的值,可得关于的线性回归方程;
(2)设加了生长液后培养时间为天,则,计算求得,即可得出结果.
【详解】(1)由题意可得 ,,
,
故,
故所求的经验回归方程为.
(2)设加了生长液后培养时间为天,则,
解得,故,
所以预测加了生长液后最短培养时间比不加生长液时缩短了天.
23.(2024·山东济南·三模)近年来,我国众多新能源汽车制造企业迅速崛起.某企业着力推进技术革新,利润稳步提高.统计该企业2019年至2023年的利润(单位:亿元),得到如图所示的散点图.其中2019年至2023年对应的年份代码依次为1,2,3,4,5.
(1)根据散点图判断,和哪一个适宜作为企业利润y(单位:亿元)关于年份代码x的回归方程类型?(给出判断即可,不必说明理由)
(2)根据(1)中的判断结果,建立y关于x的回归方程;
(3)根据(2)的结果,估计2024年的企业利润.
参考公式及数据;
,,
,,,,
【答案】(1)适宜作为企业利润y(单位:亿元)关于年份代码x的回归方程类型
(2)
(3)估计2024年的企业利润为93.3亿元
【分析】(1)利用散点图的变化趋势,即可得出答案;
(2)利用最小二乘法求出即可得解;
(3)令即可得解.
【详解】(1)由散点图的变化趋势,知适宜作为企业利润y(单位:亿元)关于年份代码x的回归方程类型;
(2)由题意得:,,
,
,
所以;
(3)令,,
估计2024年的企业利润为99.25亿元.
24.(23-24高二下·全国·期末)网上购物就是通过互联网检索商品信息,并通过电子订购单发出购物请求,厂商通过邮购的方式发货或通过快递公司送货上门,货到后通过银行转账、微信或支付宝支付等方式在线汇款.根据2019年中国消费者信息研究,超过的消费者更加频繁地使用网上购物,使得网上购物和送货上门的需求量激增,越来越多的消费者也首次通过第三方、品牌官方网站和微信社群等平台进行购物.某天猫专营店统计了2020年8月5日至9日这5天到该专营店购物的人数和时间第天间的数据,列表如表:
1
2
3
4
5
75
84
93
98
100
(1)由表中给出的数据是否可用线性回归模型拟合人数与时间之间的关系?若可用,估计8月10日到该专营店购物的人数(人数用四舍五入法取整数;若,则线性相关程度很高,可用线性回归模型拟合,计算时精确到.
(2)运用分层抽样的方法从第1天和第5天到该专营店购物的人中随机抽取7人,再从这7人中任取3人进行奖励,求这3人取自不同天的概率;
(3)该专营店为了吸引顾客,推出两种促销方案:方案一,购物金额每满100元可减10元;方案二,一次性购物金额超过800元可抽奖三次,每次中奖的概率均为,且每次抽奖互不影响,中奖一次打9折,中奖两次打8折,中奖三次打6折.某顾客计划在此专营店一次性购买1000元的商品,请从实际付款金额的数学期望的角度分析选哪种方案更优惠.
参考数据:.附:相关系数,回归直线方程的斜率:,.
【答案】(1)可用,109人
(2)
(3)选方案二更划算
【分析】(1)利用题中给出的数据和公式,求出相关系数的值,由此判断变量与具有很强的线性相关性,再求解和,得到线性回归方程,令代入求解即可;
(2)先利用分层抽样得到第1天和第5天取的人数分别为3人和4人,然后由古典概型求解即可;
(3)分别求出方案一和方案二所需付款数,比较即可得到答案.
【详解】(1)由表中的数据可得,,
,,,
故,
所以变量与具有很强的线性相关性,
故可以用线性回归模型拟合人数与天数之间的关系,
所以,
,
所以,
令,则有,
故8月10日到该专营店购物的人数为109人;
(2)因为,
所以第1天和第5天取的人数分别为3人和4人,
3人取自不同天的种数为,
故概率为;
(3)若选方案一,则需付款元,
若选方案二,设需付款元,则的可能取值为600,800,900,1000,
相应的概率为,
,
,
,
所以.
故选项方案二更划算.
【专题强化】
一、单选题
25.(23-24高二下·上海·期末)为了研究关于的线性相关关系,收集了5组样本数据(见表):若已求得一元线性回归方程,则下列选项中正确的是( )
1
2
3
4
5
0.5
0.9
1
1.1
1.5
A.
B.去掉样本点后,与的样本相关系数不会改变
C.当时,的预测值为2.2
D.与的样本是负相关
【答案】B
【分析】由表格数据求出样本点的中心坐标,代入可得的值由此即可判断A,由相关系数公式即可判断B,根据回归方程代入计算即可判断C,由的正负即可判断D.
【详解】,所以样本点的中心坐标为,
将它代入得,,解得,故A错误;
由相关系数公式可知,去掉样本点后,x与y的样本相关系数r不会改变,故B正确;
当时,y的预测值为,故C错误;
因为,所以与的样本是正相关,故D错误.
故选:B
26.(23-24高二下·重庆·阶段练习)已知一系列样本点的一个经验回归方程为,若样本点的残差为1,则( )
A. B.6 C. D.8
【答案】C
【分析】观测值减去预测值称为残差;进而利用残差的定义即可求解.
【详解】样本点的观测值为,预测值为,
则残差为,解得.
故选:C.
27.(23-24高二下·吉林长春·期中)以下有关直线拟合效果的说法错误的是( )
A.通过最小二乘法得到的线性回归直线经过样本点的中心
B.相关系数r越小,表明两个变量相关性越弱
C.最小二乘法求回归直线方程,是求使最小的a,b的值
D.决定系数R2越接近1,表明直线拟合效果越好
【答案】B
【分析】根据线性回归直线的定义,相关指数,相关系数的定义判断.
【详解】线性回归直线一定经过样本的中心,A正确;
相关系数r的绝对值越小,表明两个变量相关性越弱,越接近于1,相关性越强,B错;
最小二乘法求回归直线方程,就是求使最小的a,b的值,C正确;
越接近1,表明回归的效果越好,越接近于0,效果越差,D正确.
故选:B.
28.(23-24高二上·江苏常州·期末)用最小二乘法得到一组数据的线性回归方程为,若,则( )
A.11 B.13 C.63 D.78
【答案】D
【分析】
根据线性回归方程为一定过点,先求出,代入回归方程即可得出,进而可得的值.
【详解】依题意,
因为,所以,
因为线性回归方程为一定过点,
所以,
所以.
故选:D.
29.(23-24高二上·全国·单元测试)某学校校医研究温差(℃)与本校当天新增感冒人数y(人)的关系,该医生记录了5天的数据,且样本中心点为.由于保管不善,记录的5天数据中有两个数据看不清楚,现用代替,已知,,则下列结论正确的是( )
x
5
6
8
9
12
y
17
m
25
n
35
A.在确定的条件下,去掉样本点,则样本的相关系数r增大
B.在确定的条件下,经过拟合,发现基本符合线性回归方程,则
C.在确定的条件下,经过拟合,发现基本符合线性回归方程,则当时,残差为
D.事件“,”发生的概率为
【答案】D
【分析】根据题意,结合回归直线方程的特征及应用,以及古典摡型的概率计算公式和相关系数公式,即可求解.
【详解】对于A中,因为回归直线方程过数据的样本中心点,
所以在确定的条件下去掉样本点,则相关系数不变,所以A错误;
对于B中,由样本中心点为,可得,解得,所以B错误;
对于C中,由,当,可得,则,
所以C错误;
对于D中,由,则可取,的可取,
则的取值为,
所以,的概率为,所以D正确.
故选:D.
30.(2023·四川南充·一模)某商品的地区经销商对2023年1月到5月该商品的销售情况进行了调查,得到如下统计表.发现销售量y(万件)与时间x(月)成线性相关,根据表中数据,利用最小二乘法求得y与x的回归直线方程为:.则下列说法错误的是( )
时间x(月)
1
2
3
4
5
销售量y(万件)
1
1.6
2.0
a
3
A.由回归方程可知2024年1月份该地区的销售量为6.8万件
B.表中数据的样本中心点为
C.
D.由表中数据可知,y和x成正相关
【答案】A
【分析】根据给定数据,结合回归直线的特性逐项判断即得.
【详解】依题意,,
而y与x的回归直线方程为:,则,
解得,,表中数据的样本中心点为,BC正确;
由,得y和x成正相关,D正确;
2024年1月份,即,由回归直线方程,得,
因此2024年1月份该地区的销售量约为6.8万件,A错误.
故选:A
31.(2023·四川宜宾·一模)华为在过去几年面临了来自美国政府的封锁和限制,但华为并没有放弃,在自主研发和国内供应链的支持下,成功突破了封锁,实现了5G功能.某手机商城统计了最近5个月华为手机的实际销量,如下表所示:
时间(月)
1
2
3
4
5
销售量(万部)
0.5
0.8
1.0
1.2
1.5
若与线性相关,且线性回归方程为,则下列说法不正确的是( )
A.样本中心点为
B.由表中数据可知,变量与呈正相关
C.
D.预测时华为手机销量约为1.86(万部)
【答案】D
【分析】根据表格中数据的变换趋势,平均数的计算公式,以及回归直线方程,逐项判定,即可求解.
【详解】由表格数据可以计算出,,
则样本中心点为,即选项A说法正确;
从表格数据可得:y随着x的增加而增加,所以变量y与x正相关,即选项B说法正确;
将样本中心点代入,可得,即选项C说法正确;
由C可知线性回归方程为,
将代入可得,则选项D说法不正确.
故选:D.
32.(22-23高二下·安徽合肥·期末)某学习小组用计算机软件对一组数据进行回归分析,甲同学首先求出经验回归方程,样本点的中心为.乙同学对甲的计算过程进行检查,发现甲将数据误输成,数据误输成,将这两个数据修正后得到经验回归方程,则实数( )
A. B. C. D.
【答案】D
【分析】根据样本点的中心为,求得m=9,然后利用样本点的中心,由甲求得,,再由乙求得样本点的中心,代入回归直线方程求解.
【详解】解:由题可知,假设甲输入的为,为,
所以,,
所以,,
所以改为正确数据时得,,
所以样本点的中心为,
将其代入回归直线方程,得.
故选:D
33.(21-22高二下·山东滨州·期末)针对时下的“短视频热”,某高校团委对学生性别和喜欢短视频是否有关联进行了一次调查,其中被调查的男生、女生人数均为人,男生中喜欢短视频的人数占男生人数的,女生中喜欢短视频的人数占女生人数的.零假设为:喜欢短视频和性别相互独立.若依据的独立性检验认为喜欢短视频和性别不独立,则的最小值为( )
附:,附表:
0.05
0.01
3.841
6.635
A.7 B.8 C.9 D.10
【答案】C
【分析】由已知数据计算,根据独立性检验的结论,列不等式求的取值范围,得最小值.
【详解】根据题意,不妨设,
于是,
由于依据的独立性检验认为喜欢短视频和性别不独立,
根据表格可知,解得,于是最小值为.
故选:C
34.(22-23高二下·福建泉州·期末)已知由样本数据点集合,求得的回归直线方程为,且.现发现两个数据点和误差较大,去除这两点后重新求得的回归直线方程的斜率为,则正确的是( )
A.变量与具有负相关关系
B.去除后的估计值增加速度变快
C.去除后回归方程为
D.去除后相应于样本点(2,3.75)的残差为
【答案】D
【分析】运用回归直线方程的性质、残差的基本概念等进行解题.
【详解】解:选项A:因为去除前回归直线的斜率为,重新求得的回归直线的斜率为,两者均大于0,所以变量与具有正相关关系,所以选项A错误;
选项B:去除前回归直线的斜率为,去除后回归直线的斜率为,去除前的斜率大于去除后的斜率,所以去除后的估计值增加速度变慢,所以选项B错误;
选项C:去除前,则可得,设,,,,则去除后样本中心设为,所以,,
又因为回归直线方程的斜率为,所以去除后的回归直线方程为,
所以选项C错误;
选项D:由C选项可知,去除后的回归直线方程为,当时,,则残差为,所以选项D正确;
故选:D.
二、多选题
35.(23-24高二下·江苏泰州·期末)下列说法中,正确的是( )
A.公式中的和具有相关关系
B.回归直线必定经过样本点的中心
C.相关系数的绝对值越接近1,则两个变量的相关性越强
D.对分类变量与的随机变量来说,越大,判断“与有关系”的把握越大
【答案】BCD
【分析】利用变量间相关关系的概念和性质,可判断A,C选项,由回归直线方程的性质,判断B选项,由分类变量的独立性检验,可判断D选项.
【详解】对于A,公式中的和关系明确,属于函数关系,不是相关关系,相关关系是一种非确定的关系,故A错误;
对于B,回归直线恒过样本点的中心,故B正确;
对于C,相关系数的绝对值越接近1,则两个变量的相关性越强,则C正确;
对于D,对分类变量与的随机变量来说,越大,判断“与有关系”的把握越大,故D正确;
故选:BCD
36.(23-24高二下·江苏·期中)下列命题正确的是( )
A.若随机变量满足,则
B.以模型去拟合一组数据时,为了求出线性回归方程,设,求得线性回归方程为,则c,k的值分别是和2
C.已知,若,则事件M,N相互独立
D.根据分类变量X与Y的成对样本数据,计算得到,根据小概率值的独立性检验(),可判断X与Y有关联,此推断犯错误的概率不大于0.05
【答案】BCD
【分析】对于A,给出反例,即可判断;对于B,利用得到即可判断;对于C,利用事件独立的定义即可判断;对于D,利用独立性检验的相关知识即可判断.
【详解】对于A,若恒有,,则,且.
所以,故A错误;
对于B,由于有线性回归方程,故,即,所以,,故B正确;
对于C,由于,故,即,所以事件M,N相互独立,C正确;
对于D,由于,故有的把握判断X与Y有关联,即判断错误的概率不超过,D正确.
故选:BCD
37.(22-23高二上·福建福州·期末)已知由样本数据点集合,求得的回归直线方程为,且,现发现两个数据点和误差较大,剔除后重新求得的回归直线的斜率为1.2,则( )
A.变量与具有负相关关系 B.剔除后不变
C.剔除后的回归方程为 D.剔除后相应于样本点的残差为0.05
【答案】BC
【分析】根据给定条件,利用回归直线方程的性质、残差的基本概念等进行解题.
【详解】对于A,由剔除前回归直线的斜率为,剔除后重新求得的回归直线的斜率为,
两者均大于0,则变量与具有正相关关系,A错误;
对于B,剔除前,而剔除的两个数据点,,
因此剔除后不变,B正确;
对于C,剔除后,,而回归直线的斜率为,则回归直线方程为,C正确;
对于D,剔除后的回归直线方程为,当时,,则残差为,D错误.
故选:BC
38.(22-23高二下·吉林·期末)某课外兴趣小组通过随机调查,利用列联表和统计量研究数学成绩优秀是否与性别有关.计算得,经查阅临界值表知,则下列判断错误的是( )
A.每100个数学成绩优秀的人中就会有1名是女生
B.若某人数学成绩优秀,那么他为男生的概率是0.010
C.有的把握认为“数学成绩优秀与性别有关
D.在犯错误的概率不超过的前提下认为“数学成绩优秀与性别无关”
【答案】ABD
【分析】根据题意,由的意义即可得到结果.
【详解】每100个数学成绩优秀的人中可能没有女生,也有可能有多名女生,已知数据不能确定结论,故A错误;
若某人数学成绩优秀,已知数据不能判断他为男生的概率,故B错误;
由以及可知,有的把握认为“数学成绩优秀与性别有关,
即在犯错误率不超过的前提下认为“数学成绩优秀与性别有关”,故C正确,D错误.
故选:ABD
39.(22-23高二下·安徽合肥·期末)某制药公司为了研究某种治疗高血压的药物在饭前和饭后服用的药效差异,随机抽取了200名高血压患者开展试验,其中100名患者饭前服药,另外100名患者饭后服药,随后观察药效,将试验数据绘制成如图所示的等高条形图,已知,且,则下列说法正确的是( )
A.饭前服药的患者中,药效强的频率为
B.药效弱的患者中,饭后服药的频率为
C.在犯错误的概率不超过0.01的条件下,可以认为这种药物饭前和饭后服用的药效有差异
D.在犯错误的概率不超过0.01的条件下,不能认为这种药物饭前和饭后服用的药效有差异
【答案】AC
【分析】根据等高条形图即可得饭前饭后药效强和弱的人数,即可判断AB,计算卡方与临界值比较即可判断CD.
【详解】对于A,饭前服药的100名患者中,药效强的有80人,所以频率为,故A正确;
对于B,饭前服药的有20人药效弱,饭后服药的有70人药效弱,所以药效弱的有90名患者,饭后服药的频率为,故B错误;
对于C,D,因为,
故在犯错误的概率不超过0.01的条件下,可以认为这种药物饭前和饭后服用的药效有差异,故C正确,D错误.
故选:AC
40.(22-23高二下·福建莆田·期末)某学习小组收集了7组样本数据(如下表所示):
1
2
3
4
5
6
7
0.5
1.2
0.8
1.5
1.7
2.3
2.5
他们绘制了散点图并计算样本相关系数,发现与有比较强的线性相关关系.若关于的经验回归方程为,则( )
A.与呈正相关关系
B.
C.当时,的预测值为3.3
D.去掉样本点后,样本相关系数不变
【答案】ABD
【分析】首先求,根据样本中心求回归直线方程,即可判断选项.
【详解】由数据可知,,,样本点中心必在回归直线上,
所以,得,故AB正确;
,当时,,故C错误;
因为是样本点中心,,所以去掉这一项,样本相关系数不变,故D正确.
故选:ABD
三、填空题
41.(23-24高二下·河南濮阳·期末)已知变量的统计数据如下表,对表中数据作分析,发现与之间具有线性相关关系,利用最小二乘法,计算得到经验回归方程为,据此模型预测,当时的值为 .
1
2
3
4
5
3
4.5
4.8
6.4
6.3
【答案】10.95
【分析】经验回归直线方程过样本点的中心,所以把代入求得的值,再代入求解即可.
【详解】由已知得,即样本点中心,
因为经验回归直线方程过样本点的中心,
所以,解得,
所以,当时,.
故答案为:10.95
42.(23-24高二下·江西宜春·期中)为了调查学生对网络课程是否喜爱,研究人员随机调查了相同人数的男、女学生,发现男生中有80%喜欢网络课程,女生中有40%不喜欢网络课程,且有95%的把握认为喜欢网络课程与性别有关,但没有99%的把握认为喜欢网络课程与性别有关.已知被调查的男、女学生的总人数为,则 .
附:.临界值表:
0.050
0.010
0.005
0.001
3.841
6.635
7.879
10.828
【答案】5或6/6或5
【分析】由题意,写出列联表,根据独立性检验的公式,结合题意列出不等式,可得答案.
【详解】设男、女学生的总人数为,则,并把列联表的数据补充完整:
喜欢
不喜欢
合计
男生
0.8n
0.2n
n
女生
0.6n
0.4n
n
合计
1.4n
0.6n
2n
所以,
又因为有95%的把握认为喜欢网络课程与性别有关,但没有99%的把握认为喜欢网络课程与性别有关,
所以,
又,所以,
所以或,
故答案为:5或6.
43.(22-23高二下·北京东城·期末)幸福感是个体的一种主观情感体验,生活中的多种因素都会影响人的幸福感受.为研究男生与女生的幸福感是否有差异,一位老师在某大学进行了随机抽样调查,得到如下数据:
幸福
不幸福
总计
男生
638
128
766
女生
372
46
418
总计
1010
174
1184
由此计算得到,已知,.
根据小概率值的独立性检验, (填“可以”或“不能”)认为男生与女生的幸福感有差异;根据小概率值的独立性检验, (填“可以”或“不能”)认为男生与女生的幸福感有差异.
【答案】 可以 不能
【分析】根据假设性检验中的值对比小概率值进行判断即可.
【详解】由于,则根据小概率值的独立性检验,可以认为男生与女生的幸福感有差异
由于,根据小概率值的独立性检验,不能认为男生与女生的幸福感有差异.
故答案为:可以;不能.
44.(21-22高二下·福建福州·期末)为了考察某种药物预防疾病的效果,进行动物试验,得到如下列联表:
药物
疾病
合计
未患病
患病
服用
a
50
未服用
50
合计
80
20
100
若在本次考察中得出“在犯错误的概率不超过0.01的前提下认为药物有效”的结论,则a的最小值为 .(其中且)(参考数据:,)
附:,
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
【答案】46
【分析】根据公式列不等式求解.
【详解】由题意可得,
整理得,
所以或,
解得或,
又因为且,
所以,
所以a的最小值为46.
故答案为:46.
四、解答题
45.(2024·山东泰安·模拟预测)某投资公司现从甲投资研究室(人)、乙投资研究室(人)中随机选出名资深投资顾问对某项目进行考察投资.
(1)记选出的名资深投资顾问中,甲投资研究室的人数为,求的分布列和均值;
(2)为给投资提供决策依据,资深投资顾问对此项目的个子项目调查了年研发经费(单位:万元)和年销售额(单位:十万元),并对数据进行了初步处理,得到一些统计量的值:,,,,根据散点图认为关于的经验回归方程为,求与的值(结果精确到).
参考公式:,其中
【答案】(1)分布列见解析,均值
(2),
【分析】(1)根据超几何分布,求出对应的概率,得到分布列和均值;
(2)先求均值,再代入公式可求以及.
【详解】(1)的可能取值为,
故,
,
,
故的分布列为
故均值.
(2)由题中数据,,
又因为,,
故,
.
46.(2024·四川内江·三模)2024年2月10日至17日(正月初一至初八),“2024•内江市中区新春极光焰火草地狂欢节”在川南大草原举行,共举行了8场精彩的烟花秀节目.前5场的观众人数(单位:万人)与场次的统计数据如表所示:
场次编号
1
2
3
4
5
观众人数
0.7
0.8
1
1.2
1.3
(1)已知可用线性回归模型拟合与的关系,请建立关于的线性回归方程;
(2)若该烟花秀节目分A、B、C三个等次的票价,某机构随机调查了该烟花秀节目现场200位观众的性别与购票情况,得到的部分数据如表所示,请将列联表补充完整,并判断能否有的把握认为该烟花秀节目的观众是否购买A等票与性别有关.
购买A等票
购买非A等票
总计
男性观众
50
女性观众
60
总计
100
200
参考公式及参考数据:回归方程中斜率与截距的最小二乘法估计公式分别为,其中.
0.100
0.050
0.010
2.706
3.841
6.635
【答案】(1)
(2)表格见解析,没有
【分析】(1)利用表中数据结合最小二乘法计算回归直线即可;
(2)根据题意补全列联表即可,再由卡方公式及独立性检验的思想判定结果即可.
【详解】(1)由表格可知,
,,所以,
则;
(2)根据数据补全表格如下:
购买A等票
购买非A等票
总计
男性观众
40
50
90
女性观众
60
50
110
总计
100
100
200
所以,
故没有的把握认为该烟花秀节目的观众是否购买A等票与性别有关.
47.(2024·四川眉山·三模)某公司为改进生产,现对近5年来生产经营情况进行分析.收集了近5年的利润(单位:亿元)与年份代码共5组数据(其中年份代码分别指2019年,2020年,年),并得到如下值:.
(1)若用线性回归模型拟合变量与的相关关系,计算该样本相关系数,并判断变量与的相关程度(精确到0.01);
(2)求变量关于的线性回归方程,并求2024年利润的预报值.
附:①;②若,相关程度很强;,相关程度一般;,相关程度较弱;③一组数据,其回归直线的斜率和截距的最小二乘估计分别为;相关系数.
【答案】(1),变量与的相关程度很强
(2),78(亿元)
【分析】(1)根据题意,由相关系数的计算公式代入计算,即可得到结果;
(2)根据题意,由最小二乘法的计算公式代入计算即可得到,,从而得到线性回归方程.
【详解】(1)依题意,,
,
则,
则,故变量与的相关程度很强.
(2)令变量与的线性回归方程为.
,
所以,
所以,变量关于的回归方程为.
2024年,即时,(亿元).
所以,该公司2024年利润的预报值为78(亿元).
48.(23-24高二下·广东·期中)某地政府为提高当地农民收入,指导农民种植药材,取得较好的效果.以下是某农户近5年种植药材的年收入的统计数据:
年份
2019
2020
2021
2022
2023
年份代码
1
2
3
4
5
年收入(千元)
59
61
64
68
73
(1)根据表中数据,现决定使用模型拟合与之间的关系,请求出此模型的回归方程;(结果保留一位小数)
(2)统计学中常通过计算残差的平方和来判断模型的拟合效果.在本题中,若残差平方和小于0.5,则认为拟合效果符合要求.请判断(1)中回归方程的拟合效果是否符合要求,并说明理由.
参考数据及公式:,.设,则,.
【答案】(1)
(2)拟合效果符合要求,理由见解析
【分析】(1)设,根据数据计算,根据最小二乘法公式计算即可;
(2)先利用(1)的方程计算预测值,再利用残差的定义计算残差平方和判定结果即可.
【详解】(1)根据农户近5年种植药材的收入情况的统计数据可得:
,,
设,则,所以,
则,.
所以,回归方程为.
(2)将值代入可得估计值分别为59,60.8,63.8,68,73.4,
则残差平方和为.
因为,所以回归方程拟合效果符合要求.
49.(23-24高二上·江西南昌·期末)新冠肺炎疫情发生以来,中医药全面参与疫情防控救治,做出了重要贡献.某中医药企业根据市场调研与模拟,得到研发投入(亿元)与产品收益(亿元)的数据统计如下:
研发投入x(亿元)
1
2
3
4
5
产品收益y(亿元)
3
7
9
10
11
(1)计算的相关系数,并判断是否可以认为研发投入与产品收益具有较高的线性相关程度?(若,则线性相关程度一般,若,则线性相关程度较高)
(2)求出关于的线性回归方程,并预测若想收益超过50(亿元)则需研发投入至少多少亿元?(结果保留一位小数)
参考数据:;
附:相关系数公式:;
回归直线方程的斜率.
【答案】(1),相关程度较高
(2);投入至少亿元
【分析】(1)直接通过计算相关系数来进行判断;
(2)先计算回归直线方程,然后再做出预测.
【详解】(1),
,
,
,
所以,所以相关程度较高;
(2)由(1)得,,
所以,,
所以,令,
得,所以研发投入至少亿元.
50.(23-24高二上·浙江杭州·期末)为比较甲、乙两所学校学生的数学水平,采用简单随机抽样的方法抽取80名学生.通过测验得到了如表数据:
学校
数学成绩
合计
不优秀
优秀
甲校
30
10
40
乙校
20
20
40
合计
50
30
80
(1)依据小概率值的独立性检验,分析两校学生中数学成绩优秀率之间是否存在差异;如果表中所有数据都扩大为原来的10倍.在相同的检验标准下,再用独立性检验推断学校和数学成绩之间的关联性,结论还一样吗?请你试着解释其中的原因.
(2)据调查,丙校学生数学成绩的优秀率为30%,且将频率视为概率、现根据甲、乙、丙三所学校总人数比例依次抽取了24人,30人,30人进行调查访谈.如果已知从中抽到了一名优秀学生,求该名学生来自丙校的概率.
附:临界值表:
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
【答案】(1)答案见解析
(2)
【分析】(1)由卡方公式进行求解即可;
(2)利用全概率公式、条件概率公式进行求解即可.
【详解】(1)因为,
所以两校学生中数学成绩优秀率之间没有关系,
所有数据都扩大10倍后:
这时两校学生中数学成绩优秀率之间有关系,
所以相同的检验标准下,再用独立性检验推断学校和数学成绩之间的关联性,结论不一样,
主要是因为样本容量的不同,只有当样本容量越大时,用样本估计总体的准确性会越高.
(2)抽取甲、乙、丙三所学校优秀学生人数分别为:
,
记分别为事件“抽到的学生来自甲、乙、丙学校”,为事件“抽到一名优秀学生”,
则,
,
所以
,
所以从中抽到了一名优秀学生,该名学生来自丙校的概率为:
.
51.(23-24高二上·陕西渭南·期末)某地区响应“节能减排,低碳生活”的号召,开展系列的措施控制碳排放.环保部门收集到近5年内新增碳排放数量,如下表所示,其中x为年份代号,y(单位:万吨)代表新增碳排放量.
年份
2019
2020
2021
2022
2023
年份代号
1
2
3
4
5
新增碳排放万吨
6.1
5.2
4.9
4
3.8
(1)请计算并用相关系数的数值说明与间具有较强的线性相关性(若,则线性相关程度较高);
(2)求关于的线性回归方程,并据此估计该地区年的新增碳排放.
参考数据:,,,,,,.
参考公式:对于一组数据,,…,,其回归直线的斜率和截距的最小二乘法估计公式,相关系数r的公式分别为,,.
【答案】(1),线性相关程度较高
(2),估计该地区年的新增碳排放万吨
【分析】(1)通过计算相关系数来确定正确答案.
(2)根据回归方程的求法求得回归方程,并由此作出预测.
【详解】(1)依题意,
,
所以,所以线性相关程度较高.
(2),
,
所以,
当时,万吨.
1
学科网(北京)股份有限公司
$$