内容正文:
第11讲:成对数据的统计相关性
【考点梳理】
· 考点一、变量间相关关系的判断
· 考点二:判断正、负相关
· 考点三:相关系数的意义
· 考点四、样本相关系数的计算及应用
· 考点五:残差和相关指数的计算和分析
· 考点六:统计相关性的综合问题
【知识梳理】
知识点一:相关关系
1.相关关系的定义:两个变量有关系,但没有确切到可由其中一个去精确地决定另一个的程度,这种关系称为相关关系.
2.相关关系的分类
(1)按变量间的增减性分为正相关和负相关.
①正相关:当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势;
②负相关:当一个变量的值增加时,另一个变量的相应值呈现减少的趋势.
(2)按变量间是否有线性特征分为线性相关和非线性相关(曲线相关).
①线性相关:如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们称这两个变量线性相关;
②非线性相关或曲线相关:如果两个变量具有相关性,但不是线性相关,我们称这两个变量非线性相关或曲线相关.
知识点二:相关关系的刻画
1.散点图:为了直观描述成对样本数据的变化特征,把每对成对样本数据都用直角坐标系中的点表示出来,
由这些点组成的统计图,叫做散点图.
2.样本相关系数
(1)我们常用样本相关系数r来确切地反映成对样本数据(xi,yi)的相关程度,其中r=.
(2)样本相关系数r的取值范围为[-1,1].
①若r>0时,成对样本数据正相关;
②若r<0时,成对样本数据负相关;
③当|r|越接近1时,成对样本数据的线性相关程度越强;
④当|r|越接近0时,成对样本数据的线性相关程度越弱.
【题型归纳】
题型一、变量间相关关系的判断
1.(23-24高二下·安徽·期末)下列两个变量之间的关系是相关关系的是( )
A.等边三角形的边长a与其面积S
B.匀速直线行驶的汽车的位移s与行驶时间t
C.杂交水稻植株的高度h与土壤湿润度r
D.某班的学生人数n与该班某次数学考试的平均分x
【答案】C
【分析】根据相关关系的定义即可逐一判断.
【详解】对于A选项,因为,边长a与面积S是确定的函数关系,故A错误;
对于B选项,设匀速直线行驶的汽车的速度为,,所以位移s与行驶时间t是确定的函数关系,故B错误;
对于C选项,杂交水稻植株的高度h与土壤湿润度r具有相关关系,通常情况下,土壤湿润度r会一定程度上影响杂交水稻植株的高度h值的,故C正确;
对于D选项,因为班级某次数学考试的平均分x等于班级总分除以学生人数n,所以当班级总分确定的情况下,某班的学生人数n与该班某次数学考试的平均分x是一种确定关系,故D正确;
故选:C.
2.(23-24高二下·辽宁·期中)下列变量之间的关系不是相关关系的是( )
A.光照时间与大棚内蔬菜的产量 B.举重运动员所能举起的最大重量与他的体重
C.某正方形的边长与此正方形的面积 D.人的身高与体重
【答案】C
【分析】根据变量间的相关关系和函数关系判断即可.
【详解】C中的两个变量之间是确定的函数关系,A,B,D中的两个变量之间的关系都是相关关系.
故选:C
3.(23-24高二下·山东潍坊·期中)下列两个变量之间的关系是相关关系的是( )
A.正方形的边长与对角线长 B.球的体积与表面积
C.一个人的身高与学习成绩 D.平均学习时间与学习成绩
【答案】D
【分析】根据相关关系的定义判断.
【详解】选项AB中两个变量间是一种函数关系,选项C中两个变量之间没有什么关系,
选项D中,学习成绩与平均学习时间有关,但不仅与时间有关,
还与其他变量有关如学习时专注性,个人的学习习惯等有关,因此D是相关关系.
故选:D.
题型二:判断正、负相关
4.(2025·天津河西·一模)对变量,有观测数据,得散点图;对变量,有观测数据,得散点图2.由这两个散点图可以判断( )
A.变量与正相关,与正相关 B.变量与正相关,与负相关
C.变量与负相关,与正相关 D.变量与负相关,与负相关
【答案】B
【分析】根据散点图点的变化关系确定正负相关性即可.
【详解】由变量,的散点图,知随增大,也增大,变量与正相关,
由变量,的散点图,知随增大,减小,与负相关.
故选:B
5.(24-25高二上·广西桂林·期末)根据如下两组数据,下列说法正确的是( )
5
6
7
8
9
10
Y
5
4.8
3.5
4
3
2
2
4
6
7
9
3
4
9
7
11
A.和呈正相关,和呈正相关
B.和呈负相关,和呈负相关
C.和呈正相关,和呈负相关
D.和呈负相关,和呈正相关
【答案】D
【分析】由正、负相关的概念得解.
【详解】由所给数据可知,当增大时减小,和呈负相关;当增大时和增大,和呈正相关.
故选:D
6.(23-24高二下·北京东城·期末)某校学生科研兴趣小组为了解1~12岁儿童的体质健康情况,随机调查了20名儿童的相关数据,分别制作了肺活量、视力、肢体柔韧度、BMI指数和身高之间的散点图,则与身高之间具有正相关关系的是( )
A.肺活量 B.视力 C.肢体柔韧度 D.BMI指数
【答案】A
【分析】根据给定的散点图,结合正相关的意义判断即得.
【详解】对于A,儿童的身高越高,其肺活量越大,肺活量与身高具有正相关关系,A正确;
对于B,儿童的视力随身高的增大先增大,后减小,视力与身高不具有正相关关系,B错误;
对于C,肢体柔韧度随身高增大而减小,肢体柔韧度与身高不具有正相关关系,C错误;
对于D,BMI指数与身高的相关性很弱,不具有正相关关系,D错误.
故选:A
题型三:相关系数的意义
7.(23-24高二下·山西大同·期中)对两个变量进行线性相关性检验,得线性相关系数,对两个变量进行线性相关性检验,得线性相关系数,则下列判断正确的是( )
A.变量与变量正相关,变量与变量负相关,变量与变量的线性相关性更强
B.变量与变量负相关,变量与变量正相关,变量与变量的线性相关性更强
C.变量与变量负相关,变量与变量正相关,变量与变量的线性相关性更强
D.变量与变量正相关,变量与变量负相关,变量与变量的线性相关性更强
【答案】D
【分析】根据相关系数的符号的正负决定两个变量的正相关、负相关,以及相关系数绝对值越大,两个变量的线性相关性越强,进而可得出结论.
【详解】由线性相关系数知与正相关,
由线性相关系数知与负相关,
又,所以变量与变量的线性相关性比变量与变量的线性相关性更强.
故选:D.
8.(23-24高二下·山西长治·期中)根据变量的观测数据,绘制成散点图1;根据变量的观测数据,绘制成散点图2.若用线性回归进行分析,设表示变量的样本相关系数,表示变量的样本相关系数,则( )
A. B.
C. D.
【答案】A
【分析】根据散点图,结合相关系数知识即可得出答案.
【详解】由图可得随增大而减小,随增大而减小,
所以与增呈负相关关系,与呈负相关关系,故,
又由图可知图1相关性更强,故更接近,
所以.
故选:A.
9.(23-24高二下·福建漳州·期末)某统计部门对四组数据进行统计,获得如图所示的散点图,将四组数据相应的相关系数进行比较,正确的是( )
A. B.
C. D.
【答案】A
【分析】根据题中给出的散点图,先判断是正相关还是负相关,然后根据散点图的集中程度分析相关系数的大小.
【详解】由图可知,从左到右第一幅图、第三幅图是正相关,第二幅图、第四幅图是负相关,
且第一幅图、第二幅图的点相对更加集中,所以更加接近1,更加接近,
所以.
故选:A.
题型四、样本相关系数的计算及应用
10.(24-25高二下·全国)某企业不断扩大规模,提高经营收入.统计得到该企业2018-2022年产值(单位:亿元)与企业员工数(单位:千人)之间的数据如下:
年份
2018
2019
2020
2021
2022
千人
1
2
3
4
5
亿元
5
8
10
24
28
从表中数据可知与呈线性相关,根据这5年的数据计算与的相关系数 (保留三位小数).
附:.
【答案】
【分析】根据题意,结合表格中的数据,利用相关系数的计算公式,准确计算,即可求解.
【详解】由表格中的数据,可得,,
则,
,,
故.
故答案为:.
11.(24-25高二下·全国·课后作业)近年来,随着社会对教育越来越重视,家庭的平均教育支出呈现出逐年增长的趋势,下表反映了2018-2022年某市家庭平均教育支出占家庭总支出的比例(百分比)与年份编号之间的关系:
年份
2018
2019
2020
2021
2022
1
2
3
4
5
21
26
40
49
54
则与的样本相关系数 (保留3位小数).
附:,.
【答案】0.976
【分析】根据题中数据分别求,代入相应公式运算即可.
【详解】由题意可知:,
可得,
所以.
故答案为:0.976.
12.(2024高三·全国·)学习于才干信仰,犹如运动于健康体魄,持之已久、行之愈远愈受益.为实现中华民族伟大复兴,全国各行各业掀起了“学习强国”的高潮.某老师很喜欢“学习强国”中“挑战答题”模块,他记录了自己连续七天每天一次最多答对的题数如下表:
天数x
1
2
3
4
5
6
7
一次最多答对题数y
12
15
16
18
21
24
27
参考数据:,,,,,
相关系数
由表中数据可知该老师每天一次最多答对题数y与天数x之间是正相关,其相关系数 (结果保留两位小数).
【答案】0.99
【分析】根据题意,由相关系数的计算公式代入计算,即可得到结果.
【详解】由题意
.
故答案为:.
题型五:残差和相关指数的计算和分析
13.(24-25高二上·吉林·期末)某地根据以往数据,得到当地16岁男性的身高与其父亲身高的经验回归方程为,当地人小王16岁时身高167cm,他父亲身高180cm,则小王身高的残差为( )
A. B. C.2cm D.3cm
【答案】A
【分析】首先根据回归方程求小王身高的预测值,再计算残差.
【详解】当时,得,则(),
所以小王身高的残差为.
故选:A
14.(2024·湖北荆州·三模)根据变量和的成对样本数据,由一元线性回归模型得到经验回归模型,求得如图所示的残差图.模型误差( )
A.满足一元线性回归模型的所有假设
B.不满足一元线性回归模型的的假设
C.不满足一元线性回归模型的假设
D.不满足一元线性回归模型的和的假设
【答案】D
【分析】根据一元线性回归模型的有关概念即可判断.
【详解】用一元线性回归模型得到经验回归模型,
根据对应的残差图,残差的均值不可能成立,且残差图中的点分布在一条拋物线形状的弯曲带状区域上,
说明残差与坐标轴变量有二次关系,不满足一元线性回归模型,
故选:D.
15.(2022高三·全国·专题练习)中国茶文化博大精深,茶水的口感与茶叶类型和水的温度有关为了建立茶水温度随时间变化的函数模型,小明每隔分钟测量一次茶水温度,得到若干组数据、、、,绘制了如图所示的散点图.小明选择了如下个函数模型来拟合茶水温度随时间的变化情况,函数模型一:;函数模型二:,下列说法不正确的是( )
A.变量与具有负的相关关系
B.由于水温开始降得快,后面降得慢,最后趋于平缓,故模型二能更好的拟合茶水温度随时间的变化情况
C.若选择函数模型二,利用最小二乘法求得到的图象一定经过点
D.当时,通过函数模型二计算得,用温度计测得实际茶水温度为,则残差为
【答案】C
【分析】根据题中所给散点图,根据正负相关的概念即可判断A选项;根据水温的变化情况,以及指数函数的单调性,即可判断B选项;根据最小二乘法可求出的回归方程一定经过,即可判断C选项;根据残差的定义可判断D选项.
【详解】对于A选项,观察散点图,变量与具有负的相关关系,A对;
对于B选项,由于函数模型二中的函数,
在时,函数单调递减,且递减速度越来越慢,
所以,模型二能更好的拟合茶水温度随时间的变化情况,B对;
对于C选项,若选择函数模型二,利用最小二乘法求出的回归方程一定经过,C错;
对于D选项,根据残差的定义可知,残差真实值预测值,故残差为,D对.
故选:C.
题型六:统计相关性的综合问题
16.(24-25高三上·重庆)广阳岛,作为长江上游最大的江心岛,其面积在枯水期约为10平方公里.自2017年起,重庆市开始对广阳岛进行系统的生态修复,摒弃了曾经的商业开发计划,转而建设“长江风景眼,重庆生态岛”.经过数年的努力,广阳岛的生态得到了显著的改善,不仅植被丰富,生物多样性也得到了极大的提升.据监测,岛上的鸟类从生态修复前的124种增加到213种,其中包括中华秋沙鸭、游隼、白琵鹭等珍稀鸟类.为调查广阳岛某种鸟的数量,将其分成面积相近的50个地块,从这些地块中用简单随机抽样的方法抽取5个作为样区,调查得到样本数据,其中和分别表示第个样区的植被覆盖面积(单位:平方公里)和这种鸟的数量.
1
2
3
4
5
0.171
0.152
0.192
0.189
0.196
12
10
16
14
18
(1)求广阳岛这种鸟数量的估计值(这种鸟数量的估计值等于样区这种鸟数量的平均数乘以地块数);
(2)求样本的相关系数(精确到0.01);
(3)根据统计资料,各地块间植物覆盖面积差异较大.为提高样本的代表性以获得广阳岛这种鸟数量更准确的估计,请给出一种你认为更合理的抽样方法,并说明理由.
附:相关系数,,.
【答案】(1)700
(2)0.94
(3)分层抽样:根据植物覆盖面积的大小对地块分层,再对50个地块进行分层抽样,理由见解析
【分析】(1)求出样本平均数,再乘以地块数可得出结果;
(2)根据题中所给数据,代入,可得出结果;
(3)由(2)知知各样区的这种鸟数量与植物覆盖面积有很强的正相关,各地块间这种植物数量差异也很大,适合采用分层抽样.
【详解】(1)由已知得样本平均数,
从而广阳岛这种鸟数量的估计值为.
(2),
,
故样本的相关系数
(3)分层抽样:根据植物覆盖面积的大小对地块分层,再对50个地块进行分层抽样.
理由如下:由(2)知各样区的这种鸟数量与植物覆盖面积有很强的正相关,
由于各地块间植物覆盖面积差异很大,从而各地块间这种鸟数量差异也很大,
采用分层抽样的方法较好地保持了样本结构与总体结构的一致性,提高了样本的代表性,从而可以获得广阳岛这种鸟数量更准确的估计.
17.(23-24高二下·吉林长春·期末)将保护区分为面积大小相近的多个区域,用简单随机抽样的方法抽取其中15个区域进行编号,统计抽取到的每个区域的某种水源指标和区域内该植物分布的数量,得到数组.已知,.
(1)求样本的样本相关系数;
(2)假设该植物的寿命为随机变量X(X可取任意正整数),研究人员统计大量数据后发现,对于任意的,寿命为的样本在寿命超过k的样本里的数量占比与寿命为1的样本在全体样本中的数量占比相同,均为0.1,这种现象被称为“几何分布的无记忆性”.用含k的式子表示,并求的值.
附:样本相关系数;当k足够大时,.
【答案】(1)0.8
(2),,
【分析】(1)利用相关系公式计算即可;
(2)由题意可得,进而可得,可得,最后再代入即可.
【详解】(1)由,,.
得样本相关系数.
(2)依题意,,
又,
则,
当时,把换成,
则,
两式相减得,
即,
又,
所以对任意都成立,
从而是首项为0.1,公比为0.9的等比数列,
所以,.
18.(2024·四川南充·三模)近年来,国内掀起了全民新中式热潮,新中式穿搭,新中式茶饮,新中式快餐,新中式烘焙等,以下为某纺织厂生产“新中式”面料近5个月的利润y(万元)的统计表.
月份
2023.11
2023.12
2024.01
2024.02
2024.03
月份编号x
1
2
3
4
5
利润y(万元)
27
23
20
17
13
(1)根据统计表,试求y与x之间的相关系数r(精确到0.001),并利用r说明y与x是否具有较强的线性相关关系;(若,则认为两个变量具有较强的线性相关性);
(2)该纺织厂现有甲、乙两条流水线生产同一种产品.为对产品质量进行监控,质检人员先用简单随机抽样的方法从甲、乙两条流水线上分别抽取了4件、2件产品进行初检,再从中随机选取3件做进一步的质检,记抽到“甲流水线产品”的件数为X,试求X的分布列与期望.
附:参考数据:
相关系数.
【答案】(1);具有较强的线性相关关系
(2)分布列见解析;
【分析】(1)由相关系数的公式结合题中的数据计算即可;
(2)由题意可得的可能取值有,再由古典概率计算其对应的概率,列出分布列,求出期望即可.
【详解】(1),,
,
又,
所以可以判断与具有较强的线性相关关系.
(2)的可能取值有,
因为,,,
其分布列为:
1
2
3
期望.
【双基达标】
一、单选题
1.(24-25高二下·全国)为考察两个变量,的相关性,搜集数据如表,则两个变量的线性相关程度( )
5
10
15
20
25
103
105
110
111
114
(参考数据:,,)
A.很强 B.很弱 C.无相关 D.不确定
【答案】A
【分析】根据已知计算相关系数,再根据相关系数的值判断线性相关程度.
【详解】由题可得,,
则
,
因为相关系数很接近于1,故两个变量的线性相关程度很强.
故选:A.
2.(2024·浙江·一模)为研究光照时长(小时)和种子发芽数量(颗)之间的关系,某课题研究小组采集了9组数据,绘制散点图如图所示,并对,进行线性回归分析.若在此图中加上点后,再次对,进行线性回归分析,则下列说法正确的是( )
A.,不具有线性相关性 B.决定系数变大
C.相关系数变小 D.残差平方和变小
【答案】C
【分析】从图中分析得到加入点后,回归效果会变差,再由决定系数,相关系数,残差平方和及相关性的概念和性质作出判断即可.
【详解】对于A,加入点后,变量与预报变量相关性变弱,
但不能说,不具有线性相关性,所以A不正确
对于B,决定系数越接近于1,拟合效果越好,所以加上点后,决定系数变小,故B不正确;
对于C,从图中可以看出点较其他点,偏离直线远,所以加上点后,回归效果变差.
所以相关系数的绝对值越趋于0,故C正确;
对于D,残差平方和变大,拟合效果越差,所以加上点后,残差平方和变大,故D不正确;
故选:C.
3.(24-25高二下·全国)某团队尝试用回归模型甲、乙、丙、丁描述人的1000米跑步成绩与肺活量的关系,已知模型甲、乙、丙、丁对应的决定系数分别为,则拟合效果最好的模型是( )
A.甲 B.乙 C.丙 D.丁
【答案】D
【分析】线性回归模型中越接近1,效果越好,即可得出答案.
【详解】越大,则回归模型的拟合效果越好,
因为,所以拟合效果最好的是模型丁.
故选:D.
22.(23-24高二下·四川眉山·期末)根据物理中的胡克定律,弹簧伸长的长度与所受的外力成正比.测得一根弹簧伸长长度x和相应所受外力F的一组数据如下:
编号
1
2
3
4
5
6
1
1.2
1.4
1.6
1.8
2.0
3.08
3.76
4.31
5.02
5.51
6.25
据此给出以下结论:
①这两变量不相关;②这两个变量负相关;③这两个变量正相关.
其中所有正确结论的个数是( )
A.3 B.2 C.1 D.0
【答案】C
【分析】根据散点图判断.
【详解】画出弹簧伸长长度x和相应所受外力F的散点图,
可以判断这两变量相关,且为正相关,故①②错误,③正确.
故选:C
4.(23-24高二下·广东珠海·阶段练习)一唱片公司欲知唱片费用(十万元)与唱片销售量(千张)之间的关系,从其所发行的唱片中随机抽选了10张,得如下的资料:,则与的相关系数的绝对值为( )(相关系数:)
A.0.6 B.0.5 C.0.4 D.0.3
【答案】D
【分析】运用相关系数公式进行求解即可.
【详解】因为,,所以,
,
故选:D.
5.(23-24高二下·四川乐山·期末)对变量x,y由观测数据得散点图1;对变量u,v由观测数据得散点图2.表示变量x,y之间的线性相关系数,表示变量u,v之间的线性相关系数,则下列说法正确的是( )
A.变量x与y呈现正相关,且 B.变量x与y呈现负相关,且
C.变量u与v呈现正相关,且 D.变量u与v呈现负相关,且
【答案】A
【分析】利用散点图,结合相关系数的知识可得答案.
【详解】观察散点图,得变量x与y呈现正相关,变量u与v呈现负相关,BC错误;
图1中各点比图2中各点更加集中,相关性更好,因此,A正确,D错误.
故选:A
二、多选题
6.(24-25高二下·全国)在某线性回归模型中,计算其决定系数,则下面说法正确的是( )
A.该经验回归方程的拟合效果较好 B.解释变量对于响应变量变化的贡献率约为
C.随机误差对响应变量的影响约占 D.有的样本点在经验回归直线上
【答案】ABC
【分析】首先明确决定系数的意义,决定系数越接近于1,表示回归的效果越好,即可判断A,表示解释变量对于响应变量变化的贡献率,即可判断B,表示随机误差对响应变量的影响,即可判断C.
【详解】对于A,接近1,所以该经验回归方程的拟合效果较好,选项A正确;
对于B,意味着解释变量对于响应变量变化的贡献率约为,选项B正确;
对于C,根据,所以随机误差对响应变量的影响约占,选项C正确;
对于D,绝大部分样本点分布在经验回归直线附近,但不一定有的样本点在经验回归直线上,选项D错误.
故选:ABC.
6.(24-25高二下·全国)记变量与相对应的一组数据的样本相关系数为,变量与相对应的一组数据的样本相关系数为,则( )
A.当与不相关
B.当与呈函数关系
C.当与的相关性强于与的相关性
D.当与的相关性强弱等于与的相关性
【答案】BD
【分析】根据题意,结合相关系数的含义,逐项判定,即可求解.
【详解】对于A中,当样本相关系数为0,只能说明两变量不是线性相关关系,不能说明两变量之间没有其他关系,所以A错误;
对于B中,当样本相关系数为1,两变量呈确定的函数关系,所以B正确;
对于C中,当与的相关性强于与的相关性,所以C错误;
对于D中,样本相关系数相等,说明相关性强弱相等,所以D正确.
故选:BD.
8.(24-25高二下·全国)/年月日,人社部官网发布全国各地区最低工资标准情况,从月最低工资标准来看,上海、深圳、北京位列前三.某学生为了研究居民收入与幸福指数的相关关系,查询到如下数据,后来发现其中一个数据记录有误,去掉该数据,则( )
A.样本相关系数变大 B.居民收入与幸福指数呈现负相关
C.样本相关系数 D.居民收入与幸福指数的线性相关程度变强
【答案】AD
【分析】根据散点图进行分析,利用相关系数的意义可得结论.、
【详解】由散点图知,去掉后,幸福指数与居民收入的线性相关程度变强,
且为正相关,变大,故A,D正确,B错误.
又该四组数据不在一条直线上,故,故C错误.
故选:AD.
9.(23-24高二下·陕西宝鸡·期末)关于成对数据统计分析的下列结论中,正确的是( )
A.若两个变量与的相关系数,则这两个变量负相关
B.若两个变量与的相关系数越大,则这两个变量的线性相关程度越强
C.若两个变量与的相关系数,则这两个变量不具有相关关系
D.对于两个变量与的经验回归方程,若决定系数越大,则经验回归方程的拟合效果越好
【答案】AD
【分析】根据相关系数的意义判断ABC三个选项,根据决定系数的意义判断D选项.
【详解】由相关系数的意义知“若两个变量与的相关系数,则这两个变量负相关”A正确;
“两个变量与的相关系数的绝对值越大,则这两个变量的线性相关程度越强”,B错误;
两个变量与的相关系数只能说明两个变量没有线性相关关系,不能排除它们之间有其他相关关系,C错误;
由决定系数的意义知“对于两个变量与的经验回归方程,若决定系数越大,则经验回归方程的拟合效果越好”,D正确;
故选:AD.
10.(23-24高二下·福建·期末)对具有相关关系的两个变量x和进行回归分析时,下列结论正确的是( )
A.若A,B两组成对数据的样本相关系数分别为,,则A组数据比B组数据的相关性较强
B.若所有样本点都落在一条斜率为非零实数的直线上,则决定系数的值为1
C.若样本点的经验回归方程为,则在样本点处的残差为0.3
D.以模型去拟合一组数据时,为求出回归方程,设,将其变换后得到线性方程,则c,k的值分别是和2
【答案】BD
【分析】对于A,根据相关系数的性质分析判断,对于B,根据决定系数的性质分析判断,对于C,根据残差的定义计算判断,对于D,对两边取对数化简与比较可求出c,k的值.
【详解】对于A,因为相关系数的绝对值越大,数据的相关性越强,而,
所以B组数据比A组数据的相关性较强,所以A错误,
对于B,因为所有样本点都落在一条斜率为非零实数的直线上,所以两个变量x和之间是一次函数,所以决定系数的值为1,所以B正确,
对于C,因为样本点的经验回归方程为,所以当时,,
所以残差为,所以C错误,
对于D,由,得,因为,所以,
因为,所以,得,所以D正确.
故选:BD
三、填空题
11.(24-25高二下·全国)相关系数的性质
(1)的取值范围是.当时,称变量和变量 ;当时,称变量和变量 .
(2)越接近于1,变量,的线性相关程度越高,这时数据分散在一条直线附近.
(3)越接近于0,变量的线性相关程度越低.
(4)具有对称性,即.
(5)仅仅是变量与之间线性相关程度的一个度量.只表示两个变量之间不存在线性相关关系,并不说明变量之间没有关系,它们之间可能存在非线性关系.
【答案】 正相关 负相关
【分析】略
【详解】略
12.(24-25高二下·全国)在成对数据中,已知是的2倍,是的1.2倍,则这组数据的相关系数 .(精确到0.001,)
【答案】0.849
【分析】根据已知数据计算出相关系数即可.
【详解】由题意可知,
相关系数.
故答案为:.
13.(23-24高二下·河南)为了比较E、F、G、H四组数据的线性相关性强弱,某同学分别计算了E、F、G、H四组数据的线性相关系数,求得数值依次为,,,,则这四组数据中线性相关性最强的是 组数据.
【答案】
【分析】借助相关系数的性质计算即可得.
【详解】因为线性相关系数的绝对值越大,线性相关性越强,
且,
所以H组数据的线性相关性最强.
故答案为:.
14.(23-24高二下·安徽蚌埠·期中)若一组观测值之间满足,且恒为0,则为 ;(参考公式:)
【答案】1
【分析】由恒为0,可得,再结合公式可求.
【详解】由恒为0,知恒成立,即恒成立,故.
故答案为:1
四、解答题
15.(2025·河南·一模)某景区试卖一款纪念品,现统计了该款纪念品的定价(单位:元)与销量(单位:百件)的对应数据,如下表所示:
12
12.5
13
13.5
14
14
13
11
9
8
(1)求该纪念品定价的平均值和销量的平均值;
(2)计算与的相关系数;
(3)由(2)的计算结果,判断能否用线性回归模型拟合与的关系,并说明理由.
参考数据:.
参考公式:相关系数.
【答案】(1)13;11
(2)
(3)可以用线性回归模型拟合与之间的关系,理由见解析
【分析】(1)根据已知数据直接求平均值即可;
(2)分别求出和,再代入公式即可求解;
(3)根据相关系数的绝对值大于0.75且非常接近1判断即可.
【详解】(1)由题可知,;
(2)计算得,
故;
(3)由(2)可知,与的相关系数的绝对值近似为0.992,大于0.75且非常接近1,
说明与的线性相关性很强,从而可以用线性回归模型拟合与之间的关系.
16.(24-25高二下·全国·课堂例题)某企业坚持以市场需求为导向,合理配置生产资源,不断探索、改革销售模式.下表是该企业每月生产的一种核心产品的产量(件)与相应的生产总成本(万元)的五组对照数据:
产量(件)
1
2
3
4
5
生产总成本(万元)
3
7
8
10
12
试求与的相关系数,并利用相关系数说明与是否高度正相关.(结果保留两位小数)
参考公式:.
参考数据:.
【答案】0.98,与高度正相关.
【分析】根据公式代入计算即可.
【详解】解:,
,
,
,
,
故相关系数,
,
与高度正相关.
17.(23-24高二下·福建宁德·阶段练习)某地经过多年的环境治理,已将荒山改造成了绿水青山.为估计一林区某种树木的总材积量,随机选取了10棵这种树木,测量每棵树的根部横截面积(单位:)和材积量(单位:),得到如下数据:
样本号i
1
2
3
4
5
6
根部横截面积
0.04
0.06
0.04
0.08
0.08
0.05
材积量
0.25
0.40
0.22
0.54
0.51
0.34
样本号i
7
8
9
10
总和
根部横截面积
0.05
0.07
0.07
0.06
0.6
材积量
0.36
0.46
0.42
0.40
3.9
并计算得,,.
(1)估计该林区这种树木平均一棵的根部横截面积与平均一棵的材积量;
(2)求该林区这种树木的根部横截面积与材积量的样本相关系数(精确到0.01);
(3)现测量了该林区所有这种树木的根部横截面积,并得到所有这种树木的根部横截面积总和为.已知树木的材积量与其根部横截面积近似成正比.利用以上数据给出该林区这种树木的总材积量的估计值.
附:相关系数,.
【答案】(1)
(2)0.97
(3)
【分析】(1)根据平均数的计算个数即可求解,
(2)根据相关系数的计算公式即可求解,
(3)根据比例即可求解.
【详解】(1)估计该林区这种树木平均一棵的根部横截面积为,平均一棵的材积量为.
(2)样本相关系数
.
(3)设这种树木的根部横截总面积为X ,总材积量为Y ,则,则,
所以该林区这种树木的总材积量的估计值为.
18.(23-24高二下·黑龙江哈尔滨·期末)某校高一新生共1000人,男女比例为1:1,经统计身高大于170cm的学生共600人,其中女生200人.该校为了解高一新生身高和体重的关系,在新生中随机抽测了10人的身高(单位:cm)和体重(单位:kg)作为一个样本,所得样本数据如下表所示:
编号
1
2
3
4
5
6
7
8
9
10
身高
164
165
170
172
173
174
176
177
179
180
体重
57
58
65
65
90
70
75
76
80
84
(1)在对这10个学生组成的样本的检测过程中,采用不放回的方式,每次随机抽取1人检测
(ⅰ)若已进行了三次抽取,求抽取的这三人中至少有两人体重大于74kg的概率;
(ⅱ)求第一次抽取的学生体重大于79kg且第二次抽取的学生身高大于175cm的概率;
(2)由表中数据的散点图和残差分析,编号为5的数据残差过大,确定其为离群点,所以应去掉该数据后再求经验回归方程.已知未去掉离群点的样本相关系数约为0.802,请用样本相关系数说明去掉离群点的合理性(相关系数r保留三位小数).
参考公式及数据:样本相关系数
,,,,.
【答案】(1)(ⅰ);(ⅱ)
(2)答案见解析
【分析】(1)(ⅰ)由超几何分布的概率公式计算得出;(ⅱ)记第一次抽取的学生体重大于79kg为事件A,第二次抽取的学生身高大于175cm为事件B,由乘法公式计算得出;
(2)根据题设公式计算去掉离群点后的样本相关系数,由相比更接近1得出去掉离群点的合理性.
【详解】(1)(ⅰ)记抽取的这三人中至少有两人体重大于74kg为事件M,则,得.
(ⅱ)记第一次抽取的学生体重大于79kg为事件A,第二次抽取的学生身高大于175cm为事件B.
因为样本中学生身高大于175cm的有4人,身高大于175cm且体重大于79kg的有2人,
身高小于175cm且体重大于79kg的有1人,
所以.
(2)设未去离群点的样本相关系数为,去掉离群点后的样本相关系数为,则.
去掉离群点后,,,
,,
,
由
得
因为,且相比更接近1,所以y与x的线性相关性更强,所以去掉离群点是合理的.
19.(2024·重庆开州·模拟预测)2006年,在国家节能减排的宏观政策指导下,科技部在“十一五”启动了“863”计划新能源汽车重大项目.自2011年起,国家相关部门重点扶持新能源汽车的发展,也逐步得到消费者的认可.如下表是统计的2014年-2023年全国新能源汽车保有量(百万辆)数据:
年份代码
1
2
3
4
5
6
7
8
9
10
年份
2014
2015
2016
2017
2018
2019
2020
2021
2022
2023
保有量
0.12
0.50
1.09
1.60
2.61
3.81
4.92
7.84
13.10
20.41
并计算得:.
(1)根据表中数据,求相关年份与全国新能源汽车保有量的样本相关系数(精确到0.01);
(2)现苏同学购买第1辆汽车时随机在新能源汽车和非新能源汽车中选择.如果第1辆购买新能源汽车,那么第2辆仍选择购买新能源汽车的概率为0.6;如果第1辆购买非新能源汽车,那么第2辆购买新能源汽车的概率为0.8,计算苏同学第2辆购买新能源汽车的概率;
(3)某汽车网站为调查新能源汽车车主的用车体验,决定从12名候选车主中选3名车主进行访谈,已知有4名候选车主是新能源汽车车主,假设每名候选人都有相同的机会被选到,求被选到新能源汽车车主的分布列及数学期望.
附:相关系数:.
【答案】(1)0.89
(2)0.7
(3)分布列见详解,1
【分析】(1)直接根据公式计算即可;
(2)利用全概率公式即可求解;
(3)设被选到新能源汽车车主人数为,则可能取值为,分别计算出其概率,然后列出分布列,由公式算出数学期望.
【详解】(1)由,
则.
(2)设“第1辆购买新能源汽车”,“第1辆购买非新能源汽车”,
“第2辆购买新能源汽车”,
,
由全概率公式得,,
所以苏同学第2辆购买新能源汽车的概率为.
(3)设被选到新能源汽车车主人数为,则可能取值为,
,
,
则被选到新能源汽车车主的分布列为,
0
1
2
3
所以.
学科网(北京)股份有限公司
$$
第11讲:成对数据的统计相关性
【考点梳理】
· 考点一、变量间相关关系的判断
· 考点二:判断正、负相关
· 考点三:相关系数的意义
· 考点四、样本相关系数的计算及应用
· 考点五:残差和相关指数的计算和分析
· 考点六:统计相关性的综合问题
【知识梳理】
知识点一:相关关系
1.相关关系的定义:两个变量有关系,但没有确切到可由其中一个去精确地决定另一个的程度,这种关系称为相关关系.
2.相关关系的分类
(1)按变量间的增减性分为正相关和负相关.
①正相关:当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势;
②负相关:当一个变量的值增加时,另一个变量的相应值呈现减少的趋势.
(2)按变量间是否有线性特征分为线性相关和非线性相关(曲线相关).
①线性相关:如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们称这两个变量线性相关;
②非线性相关或曲线相关:如果两个变量具有相关性,但不是线性相关,我们称这两个变量非线性相关或曲线相关.
知识点二:相关关系的刻画
1.散点图:为了直观描述成对样本数据的变化特征,把每对成对样本数据都用直角坐标系中的点表示出来,
由这些点组成的统计图,叫做散点图.
2.样本相关系数
(1)我们常用样本相关系数r来确切地反映成对样本数据(xi,yi)的相关程度,其中r=.
(2)样本相关系数r的取值范围为[-1,1].
①若r>0时,成对样本数据正相关;
②若r<0时,成对样本数据负相关;
③当|r|越接近1时,成对样本数据的线性相关程度越强;
④当|r|越接近0时,成对样本数据的线性相关程度越弱.
【题型归纳】
题型一、变量间相关关系的判断
1.(23-24高二下·安徽·期末)下列两个变量之间的关系是相关关系的是( )
A.等边三角形的边长a与其面积S
B.匀速直线行驶的汽车的位移s与行驶时间t
C.杂交水稻植株的高度h与土壤湿润度r
D.某班的学生人数n与该班某次数学考试的平均分x
2.(23-24高二下·辽宁·期中)下列变量之间的关系不是相关关系的是( )
A.光照时间与大棚内蔬菜的产量 B.举重运动员所能举起的最大重量与他的体重
C.某正方形的边长与此正方形的面积 D.人的身高与体重
3.(23-24高二下·山东潍坊·期中)下列两个变量之间的关系是相关关系的是( )
A.正方形的边长与对角线长 B.球的体积与表面积
C.一个人的身高与学习成绩 D.平均学习时间与学习成绩
题型二:判断正、负相关
4.(2025·天津河西·一模)对变量,有观测数据,得散点图;对变量,有观测数据,得散点图2.由这两个散点图可以判断( )
A.变量与正相关,与正相关 B.变量与正相关,与负相关
C.变量与负相关,与正相关 D.变量与负相关,与负相关
5.(24-25高二上·广西桂林·期末)根据如下两组数据,下列说法正确的是( )
5
6
7
8
9
10
Y
5
4.8
3.5
4
3
2
2
4
6
7
9
3
4
9
7
11
A.和呈正相关,和呈正相关
B.和呈负相关,和呈负相关
C.和呈正相关,和呈负相关
D.和呈负相关,和呈正相关
6.(23-24高二下·北京东城·期末)某校学生科研兴趣小组为了解1~12岁儿童的体质健康情况,随机调查了20名儿童的相关数据,分别制作了肺活量、视力、肢体柔韧度、BMI指数和身高之间的散点图,则与身高之间具有正相关关系的是( )
A.肺活量 B.视力 C.肢体柔韧度 D.BMI指数
题型三:相关系数的意义
7.(23-24高二下·山西大同·期中)对两个变量进行线性相关性检验,得线性相关系数,对两个变量进行线性相关性检验,得线性相关系数,则下列判断正确的是( )
A.变量与变量正相关,变量与变量负相关,变量与变量的线性相关性更强
B.变量与变量负相关,变量与变量正相关,变量与变量的线性相关性更强
C.变量与变量负相关,变量与变量正相关,变量与变量的线性相关性更强
D.变量与变量正相关,变量与变量负相关,变量与变量的线性相关性更强
8.(23-24高二下·山西长治·期中)根据变量的观测数据,绘制成散点图1;根据变量的观测数据,绘制成散点图2.若用线性回归进行分析,设表示变量的样本相关系数,表示变量的样本相关系数,则( )
A. B.
C. D.
9.(23-24高二下·福建漳州·期末)某统计部门对四组数据进行统计,获得如图所示的散点图,将四组数据相应的相关系数进行比较,正确的是( )
A. B.
C. D.
题型四、样本相关系数的计算及应用
10.(24-25高二下·全国)某企业不断扩大规模,提高经营收入.统计得到该企业2018-2022年产值(单位:亿元)与企业员工数(单位:千人)之间的数据如下:
年份
2018
2019
2020
2021
2022
千人
1
2
3
4
5
亿元
5
8
10
24
28
从表中数据可知与呈线性相关,根据这5年的数据计算与的相关系数 (保留三位小数).
附:.
11.(24-25高二下·全国)近年来,随着社会对教育越来越重视,家庭的平均教育支出呈现出逐年增长的趋势,下表反映了2018-2022年某市家庭平均教育支出占家庭总支出的比例(百分比)与年份编号之间的关系:
年份
2018
2019
2020
2021
2022
1
2
3
4
5
21
26
40
49
54
则与的样本相关系数 (保留3位小数).
附:,.
12.(2024高三·全国·)学习于才干信仰,犹如运动于健康体魄,持之已久、行之愈远愈受益.为实现中华民族伟大复兴,全国各行各业掀起了“学习强国”的高潮.某老师很喜欢“学习强国”中“挑战答题”模块,他记录了自己连续七天每天一次最多答对的题数如下表:
天数x
1
2
3
4
5
6
7
一次最多答对题数y
12
15
16
18
21
24
27
参考数据:,,,,,
相关系数
由表中数据可知该老师每天一次最多答对题数y与天数x之间是正相关,其相关系数 (结果保留两位小数).
题型五:残差和相关指数的计算和分析
13.(24-25高二上·吉林·期末)某地根据以往数据,得到当地16岁男性的身高与其父亲身高的经验回归方程为,当地人小王16岁时身高167cm,他父亲身高180cm,则小王身高的残差为( )
A. B. C.2cm D.3cm
14.(2024·湖北荆州·三模)根据变量和的成对样本数据,由一元线性回归模型得到经验回归模型,求得如图所示的残差图.模型误差( )
A.满足一元线性回归模型的所有假设
B.不满足一元线性回归模型的的假设
C.不满足一元线性回归模型的假设
D.不满足一元线性回归模型的和的假设
15.(2022高三·全国·专题练习)中国茶文化博大精深,茶水的口感与茶叶类型和水的温度有关为了建立茶水温度随时间变化的函数模型,小明每隔分钟测量一次茶水温度,得到若干组数据、、、,绘制了如图所示的散点图.小明选择了如下个函数模型来拟合茶水温度随时间的变化情况,函数模型一:;函数模型二:,下列说法不正确的是( )
A.变量与具有负的相关关系
B.由于水温开始降得快,后面降得慢,最后趋于平缓,故模型二能更好的拟合茶水温度随时间的变化情况
C.若选择函数模型二,利用最小二乘法求得到的图象一定经过点
D.当时,通过函数模型二计算得,用温度计测得实际茶水温度为,则残差为
题型六:统计相关性的综合问题
16.(24-25高三上·重庆)广阳岛,作为长江上游最大的江心岛,其面积在枯水期约为10平方公里.自2017年起,重庆市开始对广阳岛进行系统的生态修复,摒弃了曾经的商业开发计划,转而建设“长江风景眼,重庆生态岛”.经过数年的努力,广阳岛的生态得到了显著的改善,不仅植被丰富,生物多样性也得到了极大的提升.据监测,岛上的鸟类从生态修复前的124种增加到213种,其中包括中华秋沙鸭、游隼、白琵鹭等珍稀鸟类.为调查广阳岛某种鸟的数量,将其分成面积相近的50个地块,从这些地块中用简单随机抽样的方法抽取5个作为样区,调查得到样本数据,其中和分别表示第个样区的植被覆盖面积(单位:平方公里)和这种鸟的数量.
1
2
3
4
5
0.171
0.152
0.192
0.189
0.196
12
10
16
14
18
(1)求广阳岛这种鸟数量的估计值(这种鸟数量的估计值等于样区这种鸟数量的平均数乘以地块数);
(2)求样本的相关系数(精确到0.01);
(3)根据统计资料,各地块间植物覆盖面积差异较大.为提高样本的代表性以获得广阳岛这种鸟数量更准确的估计,请给出一种你认为更合理的抽样方法,并说明理由.
附:相关系数,,.
17.(23-24高二下·吉林长春·期末)将保护区分为面积大小相近的多个区域,用简单随机抽样的方法抽取其中15个区域进行编号,统计抽取到的每个区域的某种水源指标和区域内该植物分布的数量,得到数组.已知,.
(1)求样本的样本相关系数;
(2)假设该植物的寿命为随机变量X(X可取任意正整数),研究人员统计大量数据后发现,对于任意的,寿命为的样本在寿命超过k的样本里的数量占比与寿命为1的样本在全体样本中的数量占比相同,均为0.1,这种现象被称为“几何分布的无记忆性”.用含k的式子表示,并求的值.
附:样本相关系数;当k足够大时,.
18.(2024·四川南充·三模)近年来,国内掀起了全民新中式热潮,新中式穿搭,新中式茶饮,新中式快餐,新中式烘焙等,以下为某纺织厂生产“新中式”面料近5个月的利润y(万元)的统计表.
月份
2023.11
2023.12
2024.01
2024.02
2024.03
月份编号x
1
2
3
4
5
利润y(万元)
27
23
20
17
13
(1)根据统计表,试求y与x之间的相关系数r(精确到0.001),并利用r说明y与x是否具有较强的线性相关关系;(若,则认为两个变量具有较强的线性相关性);
(2)该纺织厂现有甲、乙两条流水线生产同一种产品.为对产品质量进行监控,质检人员先用简单随机抽样的方法从甲、乙两条流水线上分别抽取了4件、2件产品进行初检,再从中随机选取3件做进一步的质检,记抽到“甲流水线产品”的件数为X,试求X的分布列与期望.
附:参考数据:
相关系数.
【双基达标】
一、单选题
1.(24-25高二下·全国)为考察两个变量,的相关性,搜集数据如表,则两个变量的线性相关程度( )
5
10
15
20
25
103
105
110
111
114
(参考数据:,,)
A.很强 B.很弱 C.无相关 D.不确定
2.(2024·浙江·一模)为研究光照时长(小时)和种子发芽数量(颗)之间的关系,某课题研究小组采集了9组数据,绘制散点图如图所示,并对,进行线性回归分析.若在此图中加上点后,再次对,进行线性回归分析,则下列说法正确的是( )
A.,不具有线性相关性 B.决定系数变大
C.相关系数变小 D.残差平方和变小
3.(24-25高二下·全国)某团队尝试用回归模型甲、乙、丙、丁描述人的1000米跑步成绩与肺活量的关系,已知模型甲、乙、丙、丁对应的决定系数分别为,则拟合效果最好的模型是( )
A.甲 B.乙 C.丙 D.丁
22.(23-24高二下·四川眉山·期末)根据物理中的胡克定律,弹簧伸长的长度与所受的外力成正比.测得一根弹簧伸长长度x和相应所受外力F的一组数据如下:
编号
1
2
3
4
5
6
1
1.2
1.4
1.6
1.8
2.0
3.08
3.76
4.31
5.02
5.51
6.25
据此给出以下结论:
①这两变量不相关;②这两个变量负相关;③这两个变量正相关.
其中所有正确结论的个数是( )
A.3 B.2 C.1 D.0
4.(23-24高二下·广东珠海)一唱片公司欲知唱片费用(十万元)与唱片销售量(千张)之间的关系,从其所发行的唱片中随机抽选了10张,得如下的资料:,则与的相关系数的绝对值为( )(相关系数:)
A.0.6 B.0.5 C.0.4 D.0.3
5.(23-24高二下·四川乐山·期末)对变量x,y由观测数据得散点图1;对变量u,v由观测数据得散点图2.表示变量x,y之间的线性相关系数,表示变量u,v之间的线性相关系数,则下列说法正确的是( )
A.变量x与y呈现正相关,且 B.变量x与y呈现负相关,且
C.变量u与v呈现正相关,且 D.变量u与v呈现负相关,且
二、多选题
6.(24-25高二下·全国)在某线性回归模型中,计算其决定系数,则下面说法正确的是( )
A.该经验回归方程的拟合效果较好 B.解释变量对于响应变量变化的贡献率约为
C.随机误差对响应变量的影响约占 D.有的样本点在经验回归直线上
6.(24-25高二下·全国)记变量与相对应的一组数据的样本相关系数为,变量与相对应的一组数据的样本相关系数为,则( )
A.当与不相关
B.当与呈函数关系
C.当与的相关性强于与的相关性
D.当与的相关性强弱等于与的相关性
8.(24-25高二下·全国)/年月日,人社部官网发布全国各地区最低工资标准情况,从月最低工资标准来看,上海、深圳、北京位列前三.某学生为了研究居民收入与幸福指数的相关关系,查询到如下数据,后来发现其中一个数据记录有误,去掉该数据,则( )
A.样本相关系数变大 B.居民收入与幸福指数呈现负相关
C.样本相关系数 D.居民收入与幸福指数的线性相关程度变强
9.(23-24高二下·陕西宝鸡·期末)关于成对数据统计分析的下列结论中,正确的是( )
A.若两个变量与的相关系数,则这两个变量负相关
B.若两个变量与的相关系数越大,则这两个变量的线性相关程度越强
C.若两个变量与的相关系数,则这两个变量不具有相关关系
D.对于两个变量与的经验回归方程,若决定系数越大,则经验回归方程的拟合效果越好
10.(23-24高二下·福建·期末)对具有相关关系的两个变量x和进行回归分析时,下列结论正确的是( )
A.若A,B两组成对数据的样本相关系数分别为,,则A组数据比B组数据的相关性较强
B.若所有样本点都落在一条斜率为非零实数的直线上,则决定系数的值为1
C.若样本点的经验回归方程为,则在样本点处的残差为0.3
D.以模型去拟合一组数据时,为求出回归方程,设,将其变换后得到线性方程,则c,k的值分别是和2
三、填空题
11.(24-25高二下·全国)相关系数的性质
(1)的取值范围是.当时,称变量和变量 ;当时,称变量和变量 .
(2)越接近于1,变量,的线性相关程度越高,这时数据分散在一条直线附近.
(3)越接近于0,变量的线性相关程度越低.
(4)具有对称性,即.
(5)仅仅是变量与之间线性相关程度的一个度量.只表示两个变量之间不存在线性相关关系,并不说明变量之间没有关系,它们之间可能存在非线性关系.
12.(24-25高二下·全国)在成对数据中,已知是的2倍,是的1.2倍,则这组数据的相关系数 .(精确到0.001,)
13.(23-24高二下·河南)为了比较E、F、G、H四组数据的线性相关性强弱,某同学分别计算了E、F、G、H四组数据的线性相关系数,求得数值依次为,,,,则这四组数据中线性相关性最强的是 组数据.
14.(23-24高二下·安徽蚌埠·期中)若一组观测值之间满足,且恒为0,则为 ;(参考公式:)
四、解答题
15.(2025·河南·一模)某景区试卖一款纪念品,现统计了该款纪念品的定价(单位:元)与销量(单位:百件)的对应数据,如下表所示:
12
12.5
13
13.5
14
14
13
11
9
8
(1)求该纪念品定价的平均值和销量的平均值;
(2)计算与的相关系数;
(3)由(2)的计算结果,判断能否用线性回归模型拟合与的关系,并说明理由.
参考数据:.
参考公式:相关系数.
16.(24-25高二下·全国·课堂例题)某企业坚持以市场需求为导向,合理配置生产资源,不断探索、改革销售模式.下表是该企业每月生产的一种核心产品的产量(件)与相应的生产总成本(万元)的五组对照数据:
产量(件)
1
2
3
4
5
生产总成本(万元)
3
7
8
10
12
试求与的相关系数,并利用相关系数说明与是否高度正相关.(结果保留两位小数)
参考公式:.
参考数据:.
17.(23-24高二下·福建宁德·阶段练习)某地经过多年的环境治理,已将荒山改造成了绿水青山.为估计一林区某种树木的总材积量,随机选取了10棵这种树木,测量每棵树的根部横截面积(单位:)和材积量(单位:),得到如下数据:
样本号i
1
2
3
4
5
6
根部横截面积
0.04
0.06
0.04
0.08
0.08
0.05
材积量
0.25
0.40
0.22
0.54
0.51
0.34
样本号i
7
8
9
10
总和
根部横截面积
0.05
0.07
0.07
0.06
0.6
材积量
0.36
0.46
0.42
0.40
3.9
并计算得,,.
(1)估计该林区这种树木平均一棵的根部横截面积与平均一棵的材积量;
(2)求该林区这种树木的根部横截面积与材积量的样本相关系数(精确到0.01);
(3)现测量了该林区所有这种树木的根部横截面积,并得到所有这种树木的根部横截面积总和为.已知树木的材积量与其根部横截面积近似成正比.利用以上数据给出该林区这种树木的总材积量的估计值.
附:相关系数,.
18.(23-24高二下·黑龙江哈尔滨·期末)某校高一新生共1000人,男女比例为1:1,经统计身高大于170cm的学生共600人,其中女生200人.该校为了解高一新生身高和体重的关系,在新生中随机抽测了10人的身高(单位:cm)和体重(单位:kg)作为一个样本,所得样本数据如下表所示:
编号
1
2
3
4
5
6
7
8
9
10
身高
164
165
170
172
173
174
176
177
179
180
体重
57
58
65
65
90
70
75
76
80
84
(1)在对这10个学生组成的样本的检测过程中,采用不放回的方式,每次随机抽取1人检测
(ⅰ)若已进行了三次抽取,求抽取的这三人中至少有两人体重大于74kg的概率;
(ⅱ)求第一次抽取的学生体重大于79kg且第二次抽取的学生身高大于175cm的概率;
(2)由表中数据的散点图和残差分析,编号为5的数据残差过大,确定其为离群点,所以应去掉该数据后再求经验回归方程.已知未去掉离群点的样本相关系数约为0.802,请用样本相关系数说明去掉离群点的合理性(相关系数r保留三位小数).
参考公式及数据:样本相关系数
,,,,.
19.(2024·重庆开州·模拟预测)2006年,在国家节能减排的宏观政策指导下,科技部在“十一五”启动了“863”计划新能源汽车重大项目.自2011年起,国家相关部门重点扶持新能源汽车的发展,也逐步得到消费者的认可.如下表是统计的2014年-2023年全国新能源汽车保有量(百万辆)数据:
年份代码
1
2
3
4
5
6
7
8
9
10
年份
2014
2015
2016
2017
2018
2019
2020
2021
2022
2023
保有量
0.12
0.50
1.09
1.60
2.61
3.81
4.92
7.84
13.10
20.41
并计算得:.
(1)根据表中数据,求相关年份与全国新能源汽车保有量的样本相关系数(精确到0.01);
(2)现苏同学购买第1辆汽车时随机在新能源汽车和非新能源汽车中选择.如果第1辆购买新能源汽车,那么第2辆仍选择购买新能源汽车的概率为0.6;如果第1辆购买非新能源汽车,那么第2辆购买新能源汽车的概率为0.8,计算苏同学第2辆购买新能源汽车的概率;
(3)某汽车网站为调查新能源汽车车主的用车体验,决定从12名候选车主中选3名车主进行访谈,已知有4名候选车主是新能源汽车车主,假设每名候选人都有相同的机会被选到,求被选到新能源汽车车主的分布列及数学期望.
附:相关系数:.
(
1
)
学科网(北京)股份有限公司
$$