内容正文:
9.3 统计案例分析
1.(2017·四川成都·三模)AQI是表示空气质量的指数,AQI指数值越小,表明空气质量越好,当AQI指数值不大于100时称空气质量为“优良”.如图是某地4月1日到12日AQI指数值的统计数据,图中点A表示4月1日的AQI指数值为201,则下列叙述不正确的是( )
A.这12天中有6天空气质量为“优良”
B.这12天中空气质量最好的是4月9日
C.这12天的AQI指数值的中位数是90
D.从4日到9日,空气质量越来越好
2.(2018·广东惠州·一模)某城市为了解游客人数的变化规律,提高旅游服务质量,收集并整理了2014年1月至2016年12月期间月接待游客量(单位:万人)的数据,绘制了如图所示的折线图.根据该折线图,下列结论错误的是( )
A.月接待游客量逐月增加
B.年接待游客量逐年增加
C.各年的月接待游客量高峰期大致在7,8月
D.各年1月至6月的月接待游客量相对于7月至12月,波动性更小,变化比较平稳
3.(20-21高三上·天津·期末)随着人口红利的消失和智能制造趋势的演进,工业机器人逐渐成为企业提高产品质量、向智能化转型升级的核心力量.经过多年的发展,我国的工业机器人产业已经达到了定的规模,不仅在焊接、装配、搬运、冲压、喷涂等专业领域涌现出大量的机器人产品,同时机器人关键零部件方面也已经接近或达到了世界领先水平.下图是“中投产业研究院”发布的《年中国机器人产业投资分析及前景预测报告》中关于年全国工业机器人产量数据的统计图数据来源:国家统计局,根据统计图分析,以下结论不正确的是( )
A.年月,全国工业机器人本月同比增长最低的是月份,最高的是月份
B.年月,全国工业机器人本月累计同比增长均在以下
C.年月,全国工业机器人本月累计同比增长最低值是4月份
D.年月,全国工业机器人在12月份同比增长超过
4.(2023高三上·全国·专题练习)2022年7月15日,国家统计局发布了2022年上半年居民人均消费支出及构成情况如图所示,根据图中的信息,针对2022年上半年,下列结论不正确的是( )
A.居民在“教育文化娱乐”上的人均消费支出的占比为9.8%
B.居民人均消费支出为11440元
C.居民在“居住”“生活用品及服务”“医疗保健”上的人均消费支出之和大于在“食品烟酒”上的人均消费支出
D.居民在“衣着”上的人均消费支出比在“交通通信”上的人均消费支出的一半少
5.(2024·上海徐汇·二模)为了研究y关于x的线性相关关系,收集了5组样本数据(见下表):
x
1
2
3
4
5
y
0.5
0.9
1
1.1
1.5
若已求得一元线性回归方程为,则下列选项中正确的是( )
A.
B.当时,y的预测值为2.2
C.样本数据y的第40百分位数为1
D.去掉样本点后,x与y的样本相关系数r不会改变
6.(23-24高二下·陕西·阶段练习)设变量和变量的样本相关系数为,变量和变量的样本相关系数为,且,,则( )
A.和之间呈正线性相关关系,且和的线性相关程度强于和的线性相关程度
B.和之间呈负线性相关关系,且和的线性相关程度强于和的线性相关程度
C.和之间呈负线性相关关系,且和的线性相关程度弱于和的线性相关程度
D.和之间呈正线性相关关系,且和的线性相关程度弱于和的线性相关程度
7.(2024高二下·全国·专题练习)对四组数据进行统计,获得以下散点图,关于其相关系数的比较,正确的是( ).
A. B.
C. D.
8.(2024高三下·天津·专题练习)下列说法错误的是( )
A.线性相关系数时,两变量正相关
B.两个随机变量的线性相关性越强,则相关系数r的值就越接近于1
C.在回归直线方程中,当解释变量x每增加1个单位时,预报变量平均增加0.2个单位
D.对分类变量X与Y,随机变量χ2的观测值越大,则判断“X与Y有关系”的把握程度越大
9.(23-24高二下·河南南阳·阶段练习)对甲、乙两组数据进行统计,获得以下散点图(左图为甲,右图为乙),下列结论不正确的是( )
A.甲、乙两组数据都呈线性相关 B.乙组数据的相关程度比甲强
C.乙组数据的相关系数r比甲大 D.乙组数据的相关系数r的绝对值更接近1
10.(23-24高二下·全国·课后作业)调查某种群花萼长度和花瓣长度,所得数据如图所示,其中相关系数,下列说法正确的是( )
A.花瓣长度和花萼长度没有相关性
B.花瓣长度和花萼长度呈现负相关
C.花瓣长度和花萼长度呈现正相关
D.若从样本中抽取一部分,则这部分的相关系数一定是
11.(2024·四川成都·三模)有甲、乙两个班级进行数学考试,按照大于等于85分为优秀,85分以下为非优秀统计成绩,得到如下所示的列联表:
优秀
非优秀
甲班
10
乙班
30
附:(),
0.05
0.025
0.010
0.005
3.841
5.024
6.635
7.879
已知在全部105人中随机抽取1人,成绩优秀的概率为,则下列说法正确的是( )
A.甲班人数少于乙班人数
B.甲班的优秀率高于乙班的优秀率
C.表中的值为15,的值为50
D.根据表中的数据,若按的可靠性要求,能认为“成绩与班级有关系”
12.(2024·上海闵行·二模)某疾病预防中心随机调查了339名50岁以上的公民,研究吸烟习惯与慢性气管炎患病的关系,调查数据如下表:
不吸烟者
吸烟者
总计
不患慢性气管炎者
121
162
283
患慢性气管炎者
13
43
56
总计
134
205
339
假设:患慢性气管炎与吸烟没有关系,即它们相互独立.通过计算统计量,得,根据分布概率表:,,,.给出下列3个命题,其中正确的个数是( )
①“患慢性气管炎与吸烟没有关系”成立的可能性小于;
②有的把握认为患慢性气管炎与吸烟有关;
③分布概率表中的、等小概率值在统计上称为显著性水平,小概率事件一般认为不太可能发生.
A.个 B.个 C.个 D.个
13.(20-21高二上·江西鹰潭·期中)已知变量之间的线性回归方程为且变量之间的一组相关数据如图所示,则下列说法错误的是( )
6
8
10
12
6
3
2
A.变量x,y之间呈负相关关系
B.可以预测,当时,
C.
D.该回归直线必过点
14.(23-24高二下·辽宁·阶段练习)(多选题)下列有关回归分析的结论中,正确的是( )
A.若回归方程为,则变量y与x负相关
B.运用最小二乘法求得的经验回归直线一定经过样本点的中心
C.若线性相关系数越小,说明两个变量之间的线性相关性越强
D.若散点图中所有点都在直线,则相关系数
15.(23-24高二下·江西吉安·阶段练习)(多选题)下列说法中正确的是( )
A.公式中的和不具有线性相关关系
B.已知变量的对数据为,则回归直线可以不经过点,其中
C.若相关系数的绝对值越接近1,则两个变量的线性相关性越强
D.对于变量与的统计量来说,越大,判断“与有关系”的把握越大
16.(2024·山东淄博·一模)(多选题)下列命题为真命题的是( )
A.若样本数据的方差为2,则数据的方差为17
B.一组数据8,9,10,11,12的第80百分位数是11.5
C.用决定系数比较两个模型的拟合效果时,若越大,则相应模型的拟合效果越好
D.以模型 去拟合一组数据时,为了求出经验回归方程,设,求得线性回归方程为,则c,k的值分别是和2
17.(23-24高三上·云南·阶段练习)(多选题)下列命题正确的是( )
A.若样本数据的方差为3,则数据的方差为12
B.以模型去拟合一组数据时,为了求出经验回归方程,设,求得线性回归方程为,则
C.若某校高三(1)班8位同学身高(单位)分别为:,,,,,,,,则这组数据的下四分位数(即第25百分位数)为170
D.根据变量与的样本数据计算得到,根据的独立性检验,可判断与有关,且犯错误的概率不超过0.05
18.(23-24高三上·广东广州·阶段练习)(多选题)下列命题正确的是( )
A.若样本数据的方差为2,则数据的方差为8
B.以模型去拟合一组数据时,为了求出经验回归方程,设,求得线性回归方程为,则的值分别是和4
C.若某校高三(1)班8位同学身高(单位)分别为:,则这组数据的上四分位数(即第75百分位数)为174
D.根据变量与的样本数据计算得到,根据的独立性检验,可判断与有关,且犯错误的概率不超过0.05
19.(2024高二下·全国·专题练习)已知x和y的散点图如图所示,在相关关系中,若用拟合时的决定系数为,用拟合时的决定系数为,则,中较大的是 .
20.(22-23高二下·上海浦东新·期末)近五年来某草原羊只数量与草地植被指数两变量间的关系如表所示,绘制相应的散点图,如图所示:
年份
1
2
3
4
5
羊只数量/万只
1.4
0.9
0.75
0.6
0.3
草地植被指数
1.1
4.3
15.6
31.3
49.7
若利用这五组数据得到的两变量间的相关系数为,去掉第一年数据后得到的相关系数为,则 (填,,,)
21.(22-23高二下·四川成都·期中)以下是标号分别为①、②、③、④的四幅散点图,它们的样本相关系数分别为,那么相关系数的大小关系为 (按由小到大的顺序排列).
22.(2023·陕西安康·模拟预测)某池塘中水生植物的覆盖水塘面积(单位:)与水生植物的株数(单位:株)之间的相关关系,收集了4组数据,用模型去拟合与的关系,设,与的数据如表格所示:
3
4
6
7
2.5
3
4
5.9
得到与的线性回归方程,则 .
23.(2021·江西南昌·一模)2020年,全球展开了某疫苗研发竞赛,我为处于领先地位,为了研究疫苗的有效率,在某地进行临床试验,对符合一定条件的10000名试验者注射了该疫苗,一周后有20人感染,为了验证疫苗的有效率,同期,从相同条件下未注射疫苗的人群中抽取2500人,分成5组,各组感染人数如下:
调查人数
300
400
500
600
700
感染人数
3
3
6
6
7
并求得与的回归方程为,同期,在人数为10000的条件下,以拟合结果估算未注射疫苗的人群中感染人数,记为;注射疫苗后仍被感染的人数记为,则估计该疫苗的有效率为 . (疫苗的有效率为;参考数据:;结果保留3位有效数字)
24.(16-17高二上·河北张家口·期末)某地区2007年至2013年农村居民家庭人均纯收入(单位:千元)的数据如下表:
关于的线性回归方程为,则的值为 .
25.(2024·全国·模拟预测)为提高居家养老服务质量,某机构组织调查某地区老年人是否需要志愿者提供帮助,用简单随机抽样方法从该地区抽取了500位老年人,统计结果如下:
性别
需要志愿者
不需要志愿者
男
40
160
女
30
270
(1)估计该地区老年人中,需要志愿者提供帮助的比例;
(2)能否有的把握认为该地区的老年人是否需要志愿者提供帮助与性别有关?
(3)根据(2)中的结论,能否提出更好的调查方法来估计该地区的老年人中,需要志愿者提供帮助的比例?说明理由.
附:,
0.050
0.010
0.001
3.841
6.635
10.828
26.(2024·全国·模拟预测)近期一个被网友戏称为“科目三”的魔性舞蹈横空出世,欢快的场景、强烈的节奏加上夸张、土味的肢体动作,成为年轻人争相模仿学习的舞蹈新宠.然而任何事物都有其两面性,丝滑魔性的舞蹈动作在吸引人模仿的同时,脚踝的循环内翻、外翻这个动作,如果平衡节奏把握不当,就容易引起脚踝处的损伤:为了解小学生是否知道“科目三”舞蹈会带来损伤,志愿者随机走访了90名小学生,得到相关数据如下:
知道
不知道
总计
低年龄段
14
26
40
高年龄段
35
15
50
总计
49
41
90
(1)根据统计数据,依据小概率值的独立性检验,分析“知道‘科目三’舞蹈会带来损伤”与“学生的年龄段”是否有关;
(2)为了解小学生们对待新鲜事物的态度,按低年龄段、高年龄段进行分层,用分层随机抽样的方式从上述走访的知道“科目三”舞蹈会带来损伤的学生中邀请了7名学生,从这7名学生中随机抽取3名填写调查表,记X为这3名学生中为高年龄段的人数,求X的分布列和数学期望.
附表及公式:
0.1
0.05
0.01
0.05
0.001
2.706
3.841
6.635
7.879
10.828
,其中.
27.(2024·贵州黔东南·二模)在科技飞速发展的今天,人工智能领域迎来革命性的突破.类似于OpenAI的人工智能大模型不仅具有高度智能化、自主化和自适应的特点,它们的学习能力和信息储存能力也远远超越人类,更是拥有强大的语音识别和语言理解能力.某机构分别用,两种人工智能大模型进行对比研究,检验这两种大模型在答题时哪种更可靠,从某知识领域随机选取180个问题进行分组回答,其中人工智能大模型回答100个问题,有90个正确;人工智能大模型回答剩下的80个问题,有65个正确.
(1)完成下列列联表,并根据小概率值的独立性检验,能否判断人工智能大模型的选择和回答正确有关?
回答正确
回答错误
合计
人工智能大模型
人工智能大模型
合计
(2)将频率视为概率,用人工智能大模型回答该知识领域的3道题目,且各题回答正确与否,相互之间没有影响,设回答题目正确的个数为,求的分布列和数学期望.
参考公式及参考数据:,.
0.15
0.10
0.05
0.010
2.072
2.706
3.841
6.635
28.(2024·湖南长沙·模拟预测)为了了解高中生运动达标情况和性别之间的关系,某调查机构随机调查了100名高中生的情况,统计他们在暑假期间每天参加体育运动的时间,并把每天参加体育运动时间超过30分钟的记为“运动达标”,时间不超过30分钟的记为“运动欠佳”,已知运动达标与运动欠佳的人数比为3∶2,运动达标的女生与男生的人数比为2∶1,运动欠佳的男生有5人.
(1)根据上述数据,完成下面2×2列联表,并依据小概率值的独立性检验,能否认为学生体育运动时间达标与性别因素有关系;
性别
运动达标情况
合计
运动达标
运动欠佳
男生
女生
合计
(2)现从“运动达标”的学生中按性别用分层随机抽样的方法抽取6人,再从这6人中任选2.人进行体能测试,求选中的2人中恰有一人是女生的概率.
参考公式,.
0.1
0.05
0.01
2.706
3.841
6.635
29.(23-24高二下·河北沧州·期中)2023年全国竞走大奖赛(第1站)暨世锦赛及亚运会选拔赛3月4日在安徽黄山开赛.重庆队的贺相红以2小时22分55秒的成绩打破男子35公里竞走亚洲纪录.某田径协会组织开展竞走的步长和步频之间的关系的课题研究,得到相应的试验数据:
步频(单位:)
0.28
0.29
0.30
0.31
0.32
步长(单位:)
90
95
99
103
117
(1)根据表中数据,得到步频和步长近似为线性相关关系,求出关于的回归直线方程,并利用回归方程预测,当步长为时,步频约是多少?
(2)记,其中为观测值,为预测值,为对应的残差,求(1)中步长的残差的和,并探究这个结果是否对任意具有线性相关关系的两个变量都成立?若成立,请证明;若不成立,请说明理由.
参考数据:,.
参考公式:,.
30.(23-24高二下·河南南阳·阶段练习)某中学课外活动小组为了研究经济走势,根据该市1999-2021年的GDP(国内生产总值)数据绘制出下面的散点图,该小组选择了如下2个模型来拟合GDP值随年份的变化情况,模型一:;模型二:,下列说法正确的是( )
A.变量与负相关
B.根据散点图的特征,模型一能更好地拟合GDP值随年份的变化情况
C.变量与有较强的线性相关性
D.若选择模型二,的图象不一定经过点
31.(22-23高二下·吉林长春·期末)某中学课外活动小组为了研究经济走势,根据该市1999-2021年的GDP(国内生产总值)数据绘制出下面的散点图:
该小组选择了如下2个模型来拟合GDP值y随年份x的变化情况,模型一:;模型二:,下列说法正确的是( )
A.变量y与x负相关
B.根据散点图的特征,模型一能更好地拟合GDP值随年份的变化情况
C.若选择模型二,的图象一定经过点
D.当时,通过模型计算得GDP值为70,实际GDP的值为71,则残差为1
32.(21-22高二下·江苏徐州·期末)下表所示是我国2015年至2021年生活垃圾无害化处理量(单位:亿吨).
年份
2015
2016
2017
2018
2019
2020
2021
处理量(亿吨)
1.8
1.97
2.1
2.26
2.4
2.55
2.69
(1)由数据可知,可用线性回归模型拟合y与t的关系,请用相关系数加以说明;
(2)建立y关于t的回归方程(系数精确到0.01),并预测2023年我国生活垃圾无害化处理量.
附:,,,.相关系数;回归方程中斜率和截距的最小二乘估计公式分别为:,.
33.(2024·陕西安康·模拟预测)随着移动互联网和直播带货技术的发展,直播带货已经成为一种热门的销售方式,特别是商家通过展示产品,使顾客对商品有更全面的了解.下面统计了某新手开启直播带货后从6月份到10月份每个月的销售量(万件)的数据,得到如图所示的散点图.其中6月份至10月份相应的代码为,如:表示6月份.
(1)根据散点图判断,模型①与模型②哪一个更适宜作为月销售量关于月份代码的回归方程?(给出判断即可,不必说明理由)
(2)(i)根据(1)的判断结果,建立关于的回归方程;(计算结果精确到0.01)
(ⅱ)根据结果预测12月份的销售量大约是多少万件?
参考公式与数据:, ,,其中.
34.(2024·浙江台州·二模)台州是全国三大电动车生产基地之一,拥有完整的产业链和突出的设计优势.某电动车公司为了抢占更多的市场份额,计划加大广告投入、该公司近5年的年广告费(单位:百万元)和年销售量(单位:百万辆)关系如图所示:令,数据经过初步处理得:
44
4.8
10
40.3
1.612
19.5
8.06
现有①和②两种方案作为年销售量y关于年广告费x的回归分析模型,其中a,b,m,n均为常数.
(1)请从相关系数的角度,分析哪一个模型拟合程度更好?
(2)根据(1)的分析选取拟合程度更好的回归分析模型及表中数据,求出y关于x的回归方程,并预测年广告费为6(百万元)时,产品的年销售量是多少?
(3)该公司生产的电动车毛利润为每辆200元(不含广告费、研发经费).该公司在加大广告投入的同时也加大研发经费的投入,年研发经费为年广告费的199倍.电动车的年净利润受年广告费和年研发经费影响外还受随机变量影响,设随机变量服从正态分布,且满足.在(2)的条件下,求该公司年净利润的最大值大于1000(百万元)的概率.(年净利润=毛利润×年销售量-年广告费-年研发经费-随机变量).
附:①相关系数,
回归直线中公式分别为,;
②参考数据:,,,.
原创精品资源学科网独家享有版权,侵权必究!1
学科网(北京)股份有限公司
$$
9.3 统计案例分析
1.(2017·四川成都·三模)AQI是表示空气质量的指数,AQI指数值越小,表明空气质量越好,当AQI指数值不大于100时称空气质量为“优良”.如图是某地4月1日到12日AQI指数值的统计数据,图中点A表示4月1日的AQI指数值为201,则下列叙述不正确的是( )
A.这12天中有6天空气质量为“优良”
B.这12天中空气质量最好的是4月9日
C.这12天的AQI指数值的中位数是90
D.从4日到9日,空气质量越来越好
【答案】C
【详解】由图可知,不大于100天有6日到11日,共6天,所以A对,不选. 最小的一天为10日,所以B对,不选.中位为是,C错.从图中可以4日到9日越来越小,D对.所以选C.
2.(2018·广东惠州·一模)某城市为了解游客人数的变化规律,提高旅游服务质量,收集并整理了2014年1月至2016年12月期间月接待游客量(单位:万人)的数据,绘制了如图所示的折线图.根据该折线图,下列结论错误的是( )
A.月接待游客量逐月增加
B.年接待游客量逐年增加
C.各年的月接待游客量高峰期大致在7,8月
D.各年1月至6月的月接待游客量相对于7月至12月,波动性更小,变化比较平稳
【答案】A
【分析】观察折线图,结合选项逐一判断即可
【详解】对于选项A,由图易知月接待游客量每年7,8月份明显高于12月份,故A错;
对于选项B,观察折线图的变化趋势可知年接待游客量逐年增加,故B正确;
对于选项C,观察折线图,各年的月接待游客量高峰期大致在7,8月份,故C正确;
对于D选项,观察折线图,各年1月至6月的月接待游客量相对7月至12月,波动性更小,变化比较平稳,故D正确.
故选:A
3.(20-21高三上·天津·期末)随着人口红利的消失和智能制造趋势的演进,工业机器人逐渐成为企业提高产品质量、向智能化转型升级的核心力量.经过多年的发展,我国的工业机器人产业已经达到了定的规模,不仅在焊接、装配、搬运、冲压、喷涂等专业领域涌现出大量的机器人产品,同时机器人关键零部件方面也已经接近或达到了世界领先水平.下图是“中投产业研究院”发布的《年中国机器人产业投资分析及前景预测报告》中关于年全国工业机器人产量数据的统计图数据来源:国家统计局,根据统计图分析,以下结论不正确的是( )
A.年月,全国工业机器人本月同比增长最低的是月份,最高的是月份
B.年月,全国工业机器人本月累计同比增长均在以下
C.年月,全国工业机器人本月累计同比增长最低值是4月份
D.年月,全国工业机器人在12月份同比增长超过
【答案】C
【解析】根据统计图分别对四个选项逐一判断即可得正确答案.
【详解】对于选项A:由图知年月,全国工业机器人本月同比增长最低的是月份,最高的是月份,故选项A正确;
对于选项B:由图知年月,全国工业机器人本月累计同比增长均在以下,故选项B正确;
对于选项C:年月,全国工业机器人本月累计同比增长最低值是月份,故选项C不正确;
对于选项D:年月,全国工业机器人在12月份同比增长为,超过,故选项D正确,
故选:C.
4.(2023高三上·全国·专题练习)2022年7月15日,国家统计局发布了2022年上半年居民人均消费支出及构成情况如图所示,根据图中的信息,针对2022年上半年,下列结论不正确的是( )
A.居民在“教育文化娱乐”上的人均消费支出的占比为9.8%
B.居民人均消费支出为11440元
C.居民在“居住”“生活用品及服务”“医疗保健”上的人均消费支出之和大于在“食品烟酒”上的人均消费支出
D.居民在“衣着”上的人均消费支出比在“交通通信”上的人均消费支出的一半少
【答案】D
【分析】根据饼状图的信息可对各个选项进行分析运算即可判断,从而得出结论.
【详解】对于A,由题中饼状图可知,居民在“教育文化娱乐”上的人均消费支出的占比为:
,故A正确;
对于B,居民在“其他用品及服务”上的人均消费支出为286元,占比2.5%,
所以居民人均消费支出为 (元),故B正确;
对于C,居民在“居住”“生活用品及服务”“医疗保健”上的人均消费支出之和占比为 ,
在“食品烟酒”上的人均消费支出占比为30.8%, ,故C正确;
对于D,居民在“衣着”上的人均消费支出的占比为6.5%,在“交通通信”上的人均消费支出的占比为12.7%, ,故D错误.
故选:D.
5.(2024·上海徐汇·二模)为了研究y关于x的线性相关关系,收集了5组样本数据(见下表):
x
1
2
3
4
5
y
0.5
0.9
1
1.1
1.5
若已求得一元线性回归方程为,则下列选项中正确的是( )
A.
B.当时,y的预测值为2.2
C.样本数据y的第40百分位数为1
D.去掉样本点后,x与y的样本相关系数r不会改变
【答案】D
【分析】由表格数据求出样本点的中心坐标,代入可得的值由此即可判断A,进一步可得回归方程,由此即可验算B选项,由百分位数的概念即可判断C,由相关系数公式即可判断D.
【详解】,所以样本点的中心坐标为,
将它代入得,,解得,故A错误;
对于B,当时,y的预测值为,故B错误;
对于C,样本数据y的第40百分位数为,故C错误;
对于D,由相关系数公式可知,去掉样本点后,x与y的样本相关系数r不会改变,故D正确.
故选:D.
6.(23-24高二下·陕西·阶段练习)设变量和变量的样本相关系数为,变量和变量的样本相关系数为,且,,则( )
A.和之间呈正线性相关关系,且和的线性相关程度强于和的线性相关程度
B.和之间呈负线性相关关系,且和的线性相关程度强于和的线性相关程度
C.和之间呈负线性相关关系,且和的线性相关程度弱于和的线性相关程度
D.和之间呈正线性相关关系,且和的线性相关程度弱于和的线性相关程度
【答案】D
【分析】根据对变量间的相关系数的意义和辨析即可得出结果.
【详解】由线性相关系数,可知变量与之间呈负线性相关关系,
由线性相关系数,可知变量与之间呈正线性相关关系,
又,
所以变量与的线性相关程度比变量与的线性相关程度强.
故选:D.
7.(2024高二下·全国·专题练习)对四组数据进行统计,获得以下散点图,关于其相关系数的比较,正确的是( ).
A. B.
C. D.
【答案】A
【分析】根据散点图中点的分布的特征,结合线性相关定义可得答案.
【详解】由给出的散点图可以看出,题图①和题图③是正相关,相关系数大于0,
题图②和题图④是负相关,相关系数小于0.
题图①和题图②的点相对更加集中,所以相关性更强,所以接近于1,接近于,
由此可得.
故选:A.
8.(2024高三下·天津·专题练习)下列说法错误的是( )
A.线性相关系数时,两变量正相关
B.两个随机变量的线性相关性越强,则相关系数r的值就越接近于1
C.在回归直线方程中,当解释变量x每增加1个单位时,预报变量平均增加0.2个单位
D.对分类变量X与Y,随机变量χ2的观测值越大,则判断“X与Y有关系”的把握程度越大
【答案】B
【分析】根据线性关系系数的意义判断变量的正负相关性、相关强弱关系,根据回归方程判断单位增量,根据独立检验的观测值大小与可靠程度的关系,判断变量关系的把握程度即可.
【详解】A:线性相关系数为正时,变量为正相关关系,正确;
B:两个随机变量的线性相关性越强,相关系数r的绝对值就越接近于1,错误;
C:在回归直线方程中,当时,,正确;
D:随机变量χ2的观测值越大,变量间的关系把握程度越大,正确.
故选:B.
9.(23-24高二下·河南南阳·阶段练习)对甲、乙两组数据进行统计,获得以下散点图(左图为甲,右图为乙),下列结论不正确的是( )
A.甲、乙两组数据都呈线性相关 B.乙组数据的相关程度比甲强
C.乙组数据的相关系数r比甲大 D.乙组数据的相关系数r的绝对值更接近1
【答案】C
【分析】利用线性相关的定义进行求解即可.
【详解】由散点图可以看出,甲、乙两组数据都呈线性相关,所以A正确;
乙图的点相对更加集中,所以其相关性较强,更接近1,所以B,D正确;
甲图是正相关,其相关系数大于0,乙图是负相关,其相关系数小于0,所以C错误.
故选:C.
10.(23-24高二下·全国·课后作业)调查某种群花萼长度和花瓣长度,所得数据如图所示,其中相关系数,下列说法正确的是( )
A.花瓣长度和花萼长度没有相关性
B.花瓣长度和花萼长度呈现负相关
C.花瓣长度和花萼长度呈现正相关
D.若从样本中抽取一部分,则这部分的相关系数一定是
【答案】C
【分析】根据散点图的特点可分析出相关性的问题,从而判断ABC选项,根据相关系数的定义可以判断D选项.
【详解】根据散点的集中程度可知,花瓣长度和花萼长度有相关性,A选项错误
散点的分布是从左下到右上,从而花瓣长度和花萼长度呈现正相关性,B选项错误,C选项正确;
由于是全部数据的相关系数,取出来一部分数据,相关性可能变强,可能变弱,即取出的数据的相关系数不一定是,D选项错误
故选:C
11.(2024·四川成都·三模)有甲、乙两个班级进行数学考试,按照大于等于85分为优秀,85分以下为非优秀统计成绩,得到如下所示的列联表:
优秀
非优秀
甲班
10
乙班
30
附:(),
0.05
0.025
0.010
0.005
3.841
5.024
6.635
7.879
已知在全部105人中随机抽取1人,成绩优秀的概率为,则下列说法正确的是( )
A.甲班人数少于乙班人数
B.甲班的优秀率高于乙班的优秀率
C.表中的值为15,的值为50
D.根据表中的数据,若按的可靠性要求,能认为“成绩与班级有关系”
【答案】D
【分析】根据条件解出,,然后直接计算即可判断A,B,C错误,使用的计算公式计算,并将其与比较,即可得到D正确.
【详解】对于C,由条件知,,故,.
所以,,故C错误;
对于A,由于甲班人数为,
乙班人数为,故A错误;
对于B,由于甲班优秀率为,乙班优秀率为,故B错误;
对于D,由于,故D正确.
故选:D.
12.(2024·上海闵行·二模)某疾病预防中心随机调查了339名50岁以上的公民,研究吸烟习惯与慢性气管炎患病的关系,调查数据如下表:
不吸烟者
吸烟者
总计
不患慢性气管炎者
121
162
283
患慢性气管炎者
13
43
56
总计
134
205
339
假设:患慢性气管炎与吸烟没有关系,即它们相互独立.通过计算统计量,得,根据分布概率表:,,,.给出下列3个命题,其中正确的个数是( )
①“患慢性气管炎与吸烟没有关系”成立的可能性小于;
②有的把握认为患慢性气管炎与吸烟有关;
③分布概率表中的、等小概率值在统计上称为显著性水平,小概率事件一般认为不太可能发生.
A.个 B.个 C.个 D.个
【答案】D
【分析】根据,与临界值表对照判断.
【详解】解:因为,且,
所以有的把握认为患慢性气管炎与吸烟有关,
即“患慢性气管炎与吸烟没有关系”成立的可能性小于,
故①②正确;
分布概率表中的、等小概率值在统计上称为显著性水平,小概率事件一般认为不太可能发生. 故③正确;
故选:D
13.(20-21高二上·江西鹰潭·期中)已知变量之间的线性回归方程为且变量之间的一组相关数据如图所示,则下列说法错误的是( )
6
8
10
12
6
3
2
A.变量x,y之间呈负相关关系
B.可以预测,当时,
C.
D.该回归直线必过点
【答案】C
【分析】根据题意,结合线性回归分析,一一判断即可求解.
【详解】对于选线A,因,所以变量x,y之间呈负相关关系,故A正确;
对于选项B,当时,,故B正确;
对于选项C,由题意可知,,故,
又因,所以,故C错;
对于选项D,由C可知,样本中心点为,因此该回归直线必过点,故D正确.
故选:C.
14.(23-24高二下·辽宁·阶段练习)(多选题)下列有关回归分析的结论中,正确的是( )
A.若回归方程为,则变量y与x负相关
B.运用最小二乘法求得的经验回归直线一定经过样本点的中心
C.若线性相关系数越小,说明两个变量之间的线性相关性越强
D.若散点图中所有点都在直线,则相关系数
【答案】AB
【分析】根据回归方程的含义可判断A,B;根据相关系数的含义可判断C,D.
【详解】对于A,由于回归方程为,有,故变量y与x负相关,A正确;
对于B,运用最小二乘法求得的经验回归直线一定经过样本点的中心,正确;
对于C,线性相关系数越小,说明两个变量之间的线性相关性越弱,C错误;
对于D,散点图中所有点都在直线,则相关系数,D错误,
故选:AB
15.(23-24高二下·江西吉安·阶段练习)(多选题)下列说法中正确的是( )
A.公式中的和不具有线性相关关系
B.已知变量的对数据为,则回归直线可以不经过点,其中
C.若相关系数的绝对值越接近1,则两个变量的线性相关性越强
D.对于变量与的统计量来说,越大,判断“与有关系”的把握越大
【答案】ACD
【分析】A选项,根据线性相关的定义进行判断;B选项,回归直线一定经过样本中心点;C选项,由相关系数的性质进行判断;D选项,根据的定义判断D正确.
【详解】A选,公式中的和为二次函数关系,故不具有线性相关关系,A正确;
B选项,回归直线一定经过样本中心点,即,B错误;
C选项,若相关系数的绝对值越接近1,则两个变量的线性相关性越强,C正确;
D选项,对于变量与的统计量来说,越大,判断“与有关系”的把握越大,D正确.
故选:ACD
16.(2024·山东淄博·一模)(多选题)下列命题为真命题的是( )
A.若样本数据的方差为2,则数据的方差为17
B.一组数据8,9,10,11,12的第80百分位数是11.5
C.用决定系数比较两个模型的拟合效果时,若越大,则相应模型的拟合效果越好
D.以模型 去拟合一组数据时,为了求出经验回归方程,设,求得线性回归方程为,则c,k的值分别是和2
【答案】BCD
【分析】根据方差的性质即可判断A;根据百分位数计算公式即可判断B;根据决定系数的概念即可判断C;根据非线性回归方程的求法并结合对数运算性质即可判断D.
【详解】对A:若样本数据的方差为2,则数据的方差为,故A错误;
对B:,则其第80百分位数是,故B正确;
对C,根据决定系数的含义知越大,则相应模型的拟合效果越好,故C正确;
对D,以模型去拟合一组数据时,为了求出经验回归方程,设,
则,由题线性回归方程为,则,故的值分别是和2,故D正确.
故选:BCD.
17.(23-24高三上·云南·阶段练习)(多选题)下列命题正确的是( )
A.若样本数据的方差为3,则数据的方差为12
B.以模型去拟合一组数据时,为了求出经验回归方程,设,求得线性回归方程为,则
C.若某校高三(1)班8位同学身高(单位)分别为:,,,,,,,,则这组数据的下四分位数(即第25百分位数)为170
D.根据变量与的样本数据计算得到,根据的独立性检验,可判断与有关,且犯错误的概率不超过0.05
【答案】AB
【分析】
根据一组数据加上同一个数或乘以同一个数后的方差的性质,可判断A;根据非线性回归转化为线性回归的解法,结合对数运算,可判断B;根据百分位数的求法可判断C,根据独立性检验的思想可判断D.
【详解】
对于A,根据,可得数据的方差为,故A正确;
对于B,对两边同时取对数可得,
因为,,所以,所以,故B正确;
对于C,从小到大可得这组数据为,
,则这组数据的下四分位数(即第25百分位数)为,故C错误;
对于D,因为,在犯错误的概率不超过0.05的情况下,不能判断与有关,故D错误,
故选:AB.
18.(23-24高三上·广东广州·阶段练习)(多选题)下列命题正确的是( )
A.若样本数据的方差为2,则数据的方差为8
B.以模型去拟合一组数据时,为了求出经验回归方程,设,求得线性回归方程为,则的值分别是和4
C.若某校高三(1)班8位同学身高(单位)分别为:,则这组数据的上四分位数(即第75百分位数)为174
D.根据变量与的样本数据计算得到,根据的独立性检验,可判断与有关,且犯错误的概率不超过0.05
【答案】AB
【分析】根据可判断A;对两边同时取对数可得可判断B;从小到大排列这组数据,由第75百分位数计算可判断C;可判断D.
【详解】对于A,根据可得数据的方差为,故A正确;
对于B,对两边同时取对数可得,因为,所以
,所以的值分别是和4,故B正确;
对于C,从小到大可得这组数据为,,则这组数据的上四分位数(即第75百分位数)为,故C错误;
对于D,因为,在犯错误的概率不超过0.05的情况下,可判断与无关,故D错误.
故选:AB.
19.(2024高二下·全国·专题练习)已知x和y的散点图如图所示,在相关关系中,若用拟合时的决定系数为,用拟合时的决定系数为,则,中较大的是 .
【答案】
【分析】根据给定的散点图中点的变化趋势确定拟合效果较好的关系,进而得出决定系数大小.
【详解】由散点图知,各个点的变化趋势呈指数型函数变化,
则用拟合的效果比用拟合的效果要好,即,
所以较大者为.
故答案为:
20.(22-23高二下·上海浦东新·期末)近五年来某草原羊只数量与草地植被指数两变量间的关系如表所示,绘制相应的散点图,如图所示:
年份
1
2
3
4
5
羊只数量/万只
1.4
0.9
0.75
0.6
0.3
草地植被指数
1.1
4.3
15.6
31.3
49.7
若利用这五组数据得到的两变量间的相关系数为,去掉第一年数据后得到的相关系数为,则 (填,,,)
【答案】
【分析】根据散点图可知两个量呈负相关,且去掉数据后相关性变强,结合相关系数的概念判断即可.
【详解】根据散点图可知,羊只数量与草地植被指数呈负相关,则相关系数,,
当去掉第一年数据后,数据的线性相关性变强,所以,所以.
故答案为:
21.(22-23高二下·四川成都·期中)以下是标号分别为①、②、③、④的四幅散点图,它们的样本相关系数分别为,那么相关系数的大小关系为 (按由小到大的顺序排列).
【答案】
【分析】利用样本相关系数的性质即可判断出的大小关系
【详解】根据散点图可知,图①③成正相关,图②④成负相关,
∴,
又图①②的散点图近似在一条直线上,则图①②两变量的线性相关程度比较高,
图③④的散点图比较分散,故图③④两变量的线性相关程度比较低,
即与比较大,与比较小,∴,
故答案为:.
22.(2023·陕西安康·模拟预测)某池塘中水生植物的覆盖水塘面积(单位:)与水生植物的株数(单位:株)之间的相关关系,收集了4组数据,用模型去拟合与的关系,设,与的数据如表格所示:
3
4
6
7
2.5
3
4
5.9
得到与的线性回归方程,则 .
【答案】
【分析】根据已知求得,,进而代入回归方程可求得,从而得出.然后代入,根据指对互化,即可得出答案.
【详解】由已知可得,,,
所以,有,解得,
所以.
由,得,
所以,
所以.
故答案为:.
23.(2021·江西南昌·一模)2020年,全球展开了某疫苗研发竞赛,我为处于领先地位,为了研究疫苗的有效率,在某地进行临床试验,对符合一定条件的10000名试验者注射了该疫苗,一周后有20人感染,为了验证疫苗的有效率,同期,从相同条件下未注射疫苗的人群中抽取2500人,分成5组,各组感染人数如下:
调查人数
300
400
500
600
700
感染人数
3
3
6
6
7
并求得与的回归方程为,同期,在人数为10000的条件下,以拟合结果估算未注射疫苗的人群中感染人数,记为;注射疫苗后仍被感染的人数记为,则估计该疫苗的有效率为 . (疫苗的有效率为;参考数据:;结果保留3位有效数字)
【答案】
【分析】先求出线性回归方程中的值,从而可求,再根据题设中的计算方法可求疫苗的有效率.
【详解】由题设表格中的数据可得,故,
故,而,
故疫苗有效率为,
故答案为:.
24.(16-17高二上·河北张家口·期末)某地区2007年至2013年农村居民家庭人均纯收入(单位:千元)的数据如下表:
关于的线性回归方程为,则的值为 .
【答案】4.8
【详解】由回归方程必过样本中心,可知.
25.(2024·全国·模拟预测)为提高居家养老服务质量,某机构组织调查某地区老年人是否需要志愿者提供帮助,用简单随机抽样方法从该地区抽取了500位老年人,统计结果如下:
性别
需要志愿者
不需要志愿者
男
40
160
女
30
270
(1)估计该地区老年人中,需要志愿者提供帮助的比例;
(2)能否有的把握认为该地区的老年人是否需要志愿者提供帮助与性别有关?
(3)根据(2)中的结论,能否提出更好的调查方法来估计该地区的老年人中,需要志愿者提供帮助的比例?说明理由.
附:,
0.050
0.010
0.001
3.841
6.635
10.828
【答案】(1)14%
(2)有关
(3)答案见解析
【分析】(1)根据题意给数据可得需要帮助的老年人的比例估计值为;
(2)根据卡方的计算公式,结合独立性检测的思想即可下结论;
(3)由(2)可知该地区的老年人是否需要志愿者提供帮助与性别有关,因此先利用分层抽样方法调查男女比例.
【详解】(1)调查的500位老年人中有70位需要志愿者提供帮助,
因此该地区老年人中,需要帮助的老年人的比例估计值为.
(2)零假设:老年人是否需要志愿者提供帮助与性别无关.
,
所以有99%的把握认为该地区的老年人是否需要志愿者提供帮助与性别有关.
(3)由(2)的结论知道,该地区的老年人是否需要志愿者提供帮助与性别有关,
并且从样本数据能看出该地区男性老年人与女性老年人中需要帮助的比例有明显的差异,
因此在调查时,先确定该地区老年人中男、女的比例,
再把老年人分成男、女两层并采用分层抽样方法比采用简单随机抽样方法更好.
26.(2024·全国·模拟预测)近期一个被网友戏称为“科目三”的魔性舞蹈横空出世,欢快的场景、强烈的节奏加上夸张、土味的肢体动作,成为年轻人争相模仿学习的舞蹈新宠.然而任何事物都有其两面性,丝滑魔性的舞蹈动作在吸引人模仿的同时,脚踝的循环内翻、外翻这个动作,如果平衡节奏把握不当,就容易引起脚踝处的损伤:为了解小学生是否知道“科目三”舞蹈会带来损伤,志愿者随机走访了90名小学生,得到相关数据如下:
知道
不知道
总计
低年龄段
14
26
40
高年龄段
35
15
50
总计
49
41
90
(1)根据统计数据,依据小概率值的独立性检验,分析“知道‘科目三’舞蹈会带来损伤”与“学生的年龄段”是否有关;
(2)为了解小学生们对待新鲜事物的态度,按低年龄段、高年龄段进行分层,用分层随机抽样的方式从上述走访的知道“科目三”舞蹈会带来损伤的学生中邀请了7名学生,从这7名学生中随机抽取3名填写调查表,记X为这3名学生中为高年龄段的人数,求X的分布列和数学期望.
附表及公式:
0.1
0.05
0.01
0.05
0.001
2.706
3.841
6.635
7.879
10.828
,其中.
【答案】(1)有关;
(2)分布列见解析,
【分析】(1)根据列联表中的数据,计算的值,与比较可得结果.
(2)先求出随机变量的取值及对应的概率,再利用分布列的定义写出分布列,利用数学期望公式求解期望即可.
【详解】(1)提出零假设:“知道‘科目三’舞蹈会带来损伤”与“学生的年龄段”无关,
根据列联表中的数据,得.
根据小概率值的独立性检验,我们推断不成立,
即认为“知道‘科目三’舞蹈会带来损伤”与“学生的年龄段”有关,此推断犯错误的概率不大于0.001.
(2)由题意数据知:知道‘科目三’舞蹈会带来损伤同学中,
低年龄段的人数和高年龄段的人数比为,
故邀请的7名学生中,低年龄段的有2人,高年龄段的有5人,
所以X的所有可能取值为1,2,3,可得,,,
所以随机变量X的分布列为
X
1
2
3
P
.
27.(2024·贵州黔东南·二模)在科技飞速发展的今天,人工智能领域迎来革命性的突破.类似于OpenAI的人工智能大模型不仅具有高度智能化、自主化和自适应的特点,它们的学习能力和信息储存能力也远远超越人类,更是拥有强大的语音识别和语言理解能力.某机构分别用,两种人工智能大模型进行对比研究,检验这两种大模型在答题时哪种更可靠,从某知识领域随机选取180个问题进行分组回答,其中人工智能大模型回答100个问题,有90个正确;人工智能大模型回答剩下的80个问题,有65个正确.
(1)完成下列列联表,并根据小概率值的独立性检验,能否判断人工智能大模型的选择和回答正确有关?
回答正确
回答错误
合计
人工智能大模型
人工智能大模型
合计
(2)将频率视为概率,用人工智能大模型回答该知识领域的3道题目,且各题回答正确与否,相互之间没有影响,设回答题目正确的个数为,求的分布列和数学期望.
参考公式及参考数据:,.
0.15
0.10
0.05
0.010
2.072
2.706
3.841
6.635
【答案】(1)列联表见解析,可以判断人工智能大模型的选择和回答正确有关
(2)分布列见解析,
【分析】(1)根据题意,得到的列联表,利用公式求得,结合附表,即可得到结论;
(2)根据题意,得到随机变量,求得相应的概率,列出分布列,利用期望的公式,即可求解.
【详解】(1)解:根据题意可得列联表如下表所示:
回答正确
回答错误
合计
人工智能大模型
90
10
100
人工智能大模型
65
15
80
合计
155
25
180
零假设:人工智能大模型的选择和回答正确无关.
故可得:,
故根据小概率值的独立性检验,推断不成立,
故可以判断人工智能大模型的选择和回答正确有关.
(2)解:由题意知,人工智能大模型回答题目正确的概率为,
所以随机变量,
所以,,
,.
故的分布列如下所示:
0
1
2
3
所以期望为.
28.(2024·湖南长沙·模拟预测)为了了解高中生运动达标情况和性别之间的关系,某调查机构随机调查了100名高中生的情况,统计他们在暑假期间每天参加体育运动的时间,并把每天参加体育运动时间超过30分钟的记为“运动达标”,时间不超过30分钟的记为“运动欠佳”,已知运动达标与运动欠佳的人数比为3∶2,运动达标的女生与男生的人数比为2∶1,运动欠佳的男生有5人.
(1)根据上述数据,完成下面2×2列联表,并依据小概率值的独立性检验,能否认为学生体育运动时间达标与性别因素有关系;
性别
运动达标情况
合计
运动达标
运动欠佳
男生
女生
合计
(2)现从“运动达标”的学生中按性别用分层随机抽样的方法抽取6人,再从这6人中任选2.人进行体能测试,求选中的2人中恰有一人是女生的概率.
参考公式,.
0.1
0.05
0.01
2.706
3.841
6.635
【答案】(1)列联表见解析,能
(2)
【分析】(1)由已知数据完成列联表,计算,与临界值比较得结论;
(2)由分层抽样确定男女生人数,利用组合数公式和古典概型求解.
【详解】(1)100名高中生,运动达标与运动欠佳的人数比为3∶2,则运动达标人数为,
运动达标的女生与男生的人数比为2∶1,则运动达标的女生有40人,运动达标的男生有20人,
列联表为
性别
运动达标情况
合计
运动达标
运动欠佳
男生
20
5
25
女生
40
35
75
合计
60
40
100
零假设为:性别与锻炼情况独立,即学生体育运动时间达标与性别因素无关,
根据小概率值的独立性检验,推断不成立,
即学生体育运动时间达标与性别因素有关系,此推断犯错误的概率不超过0.05.
(2)因为“运动达标”的男生、女生分别有20人和40人,
按分层随机抽样的方法从中抽取6人,则男生、女生分别抽到2人和4人,
则选中的2人中恰有一人是女生的概率为.
29.(23-24高二下·河北沧州·期中)2023年全国竞走大奖赛(第1站)暨世锦赛及亚运会选拔赛3月4日在安徽黄山开赛.重庆队的贺相红以2小时22分55秒的成绩打破男子35公里竞走亚洲纪录.某田径协会组织开展竞走的步长和步频之间的关系的课题研究,得到相应的试验数据:
步频(单位:)
0.28
0.29
0.30
0.31
0.32
步长(单位:)
90
95
99
103
117
(1)根据表中数据,得到步频和步长近似为线性相关关系,求出关于的回归直线方程,并利用回归方程预测,当步长为时,步频约是多少?
(2)记,其中为观测值,为预测值,为对应的残差,求(1)中步长的残差的和,并探究这个结果是否对任意具有线性相关关系的两个变量都成立?若成立,请证明;若不成立,请说明理由.
参考数据:,.
参考公式:,.
【答案】(1), 0.27秒,;
(2)成立,证明见解析.
【分析】(1)根据已知条件求得回归方程的系数,即可得回归方程,将代入回归方程,即可得到答案;
(2)结合题中数据进行计算,可求得步长的残差和,从而可得结论,结合回归方程系数的计算公式即可证明.。
【详解】(1),,
,,
所以回归直线方程为,
将代入得,解得,所以当步长为时,步频约是0.27秒.
(2)根据(1)得到,;
,;
,;
,;
,,
所以,即步长残差和为0.
对任意具有线性相关关系的两个变量都成立,证明如下:
.
30.(23-24高二下·河南南阳·阶段练习)某中学课外活动小组为了研究经济走势,根据该市1999-2021年的GDP(国内生产总值)数据绘制出下面的散点图,该小组选择了如下2个模型来拟合GDP值随年份的变化情况,模型一:;模型二:,下列说法正确的是( )
A.变量与负相关
B.根据散点图的特征,模型一能更好地拟合GDP值随年份的变化情况
C.变量与有较强的线性相关性
D.若选择模型二,的图象不一定经过点
【答案】D
【分析】对于ABC,由散点图的变化趋势分析判断;对于D,由线性回归方程的性判断.
【详解】对于 A,由散点图可知 随年份 的增大而增大,所以变量 与 正相关,所以 A 错误;
对于 BC,由散点图可知变量 与 的变化趋向于一条曲线,所以模型二能更好地 拟合 GDP 值随年份的变化情况,所以 B 错误,C错误;
对于 D,若选择模型二:,令,则的图像一定过点,不一定过点,故D正确.
故选:D.
31.(22-23高二下·吉林长春·期末)某中学课外活动小组为了研究经济走势,根据该市1999-2021年的GDP(国内生产总值)数据绘制出下面的散点图:
该小组选择了如下2个模型来拟合GDP值y随年份x的变化情况,模型一:;模型二:,下列说法正确的是( )
A.变量y与x负相关
B.根据散点图的特征,模型一能更好地拟合GDP值随年份的变化情况
C.若选择模型二,的图象一定经过点
D.当时,通过模型计算得GDP值为70,实际GDP的值为71,则残差为1
【答案】D
【分析】对于AB,由散点图的变化趋势分析判断,对于C,由线性回归方程的性判断,对于D,结合残差的定义判断.
【详解】对于A,由散点图可知y随年份x的增大而增大,所以变量y与x正相关,所以A错误,
对于B,由散点图可知变量y与x的变化趋向于一条曲线,所以模型二能更好地拟合GDP值随年份的变化情况,所以B错误,
对于C,若选择模型二:,令,则的图象经过点,所以C错误,
对于D,当时,通过模型计算得GDP值为70,实际GDP的值为71,则残差为,所以D正确,
故选:D
32.(21-22高二下·江苏徐州·期末)下表所示是我国2015年至2021年生活垃圾无害化处理量(单位:亿吨).
年份
2015
2016
2017
2018
2019
2020
2021
处理量(亿吨)
1.8
1.97
2.1
2.26
2.4
2.55
2.69
(1)由数据可知,可用线性回归模型拟合y与t的关系,请用相关系数加以说明;
(2)建立y关于t的回归方程(系数精确到0.01),并预测2023年我国生活垃圾无害化处理量.
附:,,,.相关系数;回归方程中斜率和截距的最小二乘估计公式分别为:,.
【答案】(1)答案见解析
(2),预测2023年我国生活垃圾无害化处理量将约3亿吨
【分析】(1)根据相关系数的计算公式,直接计算求解即可.
(2)根据题意,列方程计算出回归方程,进而代入预测值,即可求解.
【详解】(1)由表中数据和附注中数据可得:,,
所以.
因为y与t的相关系数近似为0.999,说明y与t的线性相关相当高,
从而可以用线性回归模型拟合y与t的关系.
(2)由(1)得,
.
所以y关于t的回归方程为:.
将2023代入回归方程得:.
所以预测2023年我国生活垃圾无害化处理量将约3亿吨.
33.(2024·陕西安康·模拟预测)随着移动互联网和直播带货技术的发展,直播带货已经成为一种热门的销售方式,特别是商家通过展示产品,使顾客对商品有更全面的了解.下面统计了某新手开启直播带货后从6月份到10月份每个月的销售量(万件)的数据,得到如图所示的散点图.其中6月份至10月份相应的代码为,如:表示6月份.
(1)根据散点图判断,模型①与模型②哪一个更适宜作为月销售量关于月份代码的回归方程?(给出判断即可,不必说明理由)
(2)(i)根据(1)的判断结果,建立关于的回归方程;(计算结果精确到0.01)
(ⅱ)根据结果预测12月份的销售量大约是多少万件?
参考公式与数据:, ,,其中.
【答案】(1)模型②
(2)(i);(ⅱ)预测12月份的销售量大约是13.9万件
【分析】(1)根据散点图结合一次函数以及二次函数图象特征分析判断;
(2)(i)令,根据题中数据和公式求回归方程;
(ⅱ)令,代入回归方程运算求解即可.
【详解】(1)由散点图可知增加幅度不一致,且散点图接近于曲线,非线性,
结合图象故选模型②.
(2)(i)令,则,
可得,,
则,,
所以关于的回归方程为,
即关于的回归方程;
(ⅱ)令,可得,
预测12月份的销售量大约是13.9万件.
34.(2024·浙江台州·二模)台州是全国三大电动车生产基地之一,拥有完整的产业链和突出的设计优势.某电动车公司为了抢占更多的市场份额,计划加大广告投入、该公司近5年的年广告费(单位:百万元)和年销售量(单位:百万辆)关系如图所示:令,数据经过初步处理得:
44
4.8
10
40.3
1.612
19.5
8.06
现有①和②两种方案作为年销售量y关于年广告费x的回归分析模型,其中a,b,m,n均为常数.
(1)请从相关系数的角度,分析哪一个模型拟合程度更好?
(2)根据(1)的分析选取拟合程度更好的回归分析模型及表中数据,求出y关于x的回归方程,并预测年广告费为6(百万元)时,产品的年销售量是多少?
(3)该公司生产的电动车毛利润为每辆200元(不含广告费、研发经费).该公司在加大广告投入的同时也加大研发经费的投入,年研发经费为年广告费的199倍.电动车的年净利润受年广告费和年研发经费影响外还受随机变量影响,设随机变量服从正态分布,且满足.在(2)的条件下,求该公司年净利润的最大值大于1000(百万元)的概率.(年净利润=毛利润×年销售量-年广告费-年研发经费-随机变量).
附:①相关系数,
回归直线中公式分别为,;
②参考数据:,,,.
【答案】(1)模型②的拟合程度更好
(2),当年广告费为6(百万元)时,产品的销售量大概是13(百万辆)
(3)0.3
【分析】(1)分别求得模型①和②的相关系数,,然后比较得出结论;
(2)利用最小二乘法求解;
(3)由净利润为,求解.
【详解】(1)解:设模型①和②的相关系数分别为,.
由题意可得:,
.
所以,由相关系数的相关性质可得,模型②的拟合程度更好.
(2)因为,
又由,,
得,
所以,即回归方程为.
当时,,
因此当年广告费为6(百万元)时,产品的销售量大概是13(百万辆).
(3)净利润为,,
令,
所以.
可得在上为增函数,在上为减函数.
所以,
由题意得:,即,
,
即该公司年净利润大于1000(百万元)的概率为0.3.
原创精品资源学科网独家享有版权,侵权必究!1
学科网(北京)股份有限公司
$$