内容正文:
第7章 统计案例
知识点一、变量的相关关系
两个变量 ,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系,即不确定性关系.
知识点二、相关关系的分类
(1)按变量间的增减性分为 相关和 相关.
①正相关:当一个变量的值增加时,另一个变量的相应值也呈现 的趋势;
②负相关:当一个变量的值增加时,另一个变量的相应值呈现 的趋势.
(2)按变量间是否有线性特征分为 相关和 相关(曲线相关).
①线性相关:如果两个变量的取值呈现正相关或负相关,而且散点落在 附近,我们称这两个变量线性相关;
②非线性相关或曲线相关:如果两个变量具有相关性,但不是 相关,我们称这两个变量非线性相关或曲线相关.
知识点三、相关关系的刻画
1.散点图:
成对样本数据都可用直角坐标系中的点表示出来,由这些点组成的统计图,叫做散点图.
2.样本相关系数r的计算式
3.样本相关系数r的性质
①样本相关系数r的取值范围为 ;
②若r>0时,成对样本数据 相关;
③若r<0时,成对样本数据 相关;
④样本相关系数与相关程度
当|r|越接近 时,成对样本数据的线性相关程度越强;
当|r|越接近0时,成对样本数据的线性相关程度越弱.
特别说明:当两个变量的样本相关系数|r|=1时,两个变量呈函数关系.
知识点四、一元线性回归模型与最小二乘法
1.一元线性回归模型
称为Y关于x的一元线性回归模型.其中,Y称为 或响应变量,x称为 或解释变量, 称为截距参数, 称为斜率参数;e是Y与 之间的随机误差,如果e= ,那么Y与x之间的关系就可以用一元线性函数模型来描述.
2.最小二乘法
将=x+称为Y关于x的经验回归方程,也称经验回归函数或经验回归公式,其图形称为经验回归直线,这种求经验回归方程的方法叫做最小二乘法,求得的,叫做b,a的最小二乘估计,其中
= ,= .
特别说明:经验回归直线必过样本点的中心().
知识点五、刻画回归效果的方式
1.残差图法
在残差图中,残差比较均匀地分布在以横轴为对称轴的水平的带状区域中,说明满足一元线性回归模型的假设,这样的带状区域的宽度越窄,说明模型拟合精度越高.
2.残差平方和法
残差平方和为 ,残差平方和越 ,模型拟合效果越好.
3.决定系数法
R2=R2的值越趋近于1,模型的拟合效果越好.
知识点六、列联表与独立性检验
(1)分类变量X,Y的2×2列联表:
X
Y
合计
Y=0
Y=1
X=0
a
b
a+b
X=1
c
d
c+d
合计
a+c
b+d
n=a+b+c+d
则χ2=
(2)利用χ2的取值推断分类变量X和Y是否 的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验.
(3)χ2独立性检验中几个常用的小概率值和相应的临界值.
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
【易错点】01 混淆函数关系与相关关系
辨析:未明确区分确定性关系(函数关系)和非确定性关系(相关关系),误认为所有关联均可精确计算.
【典例1】下列关系中属于相关关系的是()
A.圆的面积与半径
C.匀速运动中路程与时间
B.身高与体重
D.底面积为定值的长方体的体积和高
【典例2】下列两个量之间的关系是相关关系的是( )
A.匀速直线运动中时间与位移的关系 B.学生的成绩和身高
C.儿童的年龄与体重 D.物体的体积和质量
【易错点】02 忽略线性相关的适用条件
辨析:未验证散点是否集中在直线附近,盲目假设变量间存在线性相关关系,导致错误判断关联类型.
【典例1】某实验测得变量与的20组数据,散点图如下,变量间存在什么关系?
【典例2】【多选】下图是两个分类变量x,y取值绘制成的散点图,则图中变量x,y具有线性相关关系的是( )
A. B.
C. D.
【易错点】03 误判相关系数符号与相关性强度
辨析:将相关系数正负号与相关性强弱直接挂钩.
【典例1】下列关于统计概率知识的判断,则下列结论正确的是()
①若样本数据,,…,的方差为4,则数据,,…,的标准差为4;
②在研究成对数据的相关关系时,相关关系越强,相关系数越接近于1;
③若事件,满足,则事件与事件相互独立;
④某医院住院的位新冠患者的潜伏天数分别为,则该样本数据的第百分位数为.
A.只有一个正确 B.只有两个正确
C.只有一个错误 D.四个题是错误的
【典例2】对两组数据进行统计后得到如图所示的散点图,下列结论不正确的是( )
A.图1、图2两组数据都具有线性相关关系
B.图1数据正相关,图2数据负相关
C.图1相关系数小于图2相关系数
D.图1相关系数和图2相关系数之和小于0
【易错点】04 忽略回归直线必过样本中心点
辨析:截距公式应用错误,导致回归直线未过点.
【典例1】某小吃店的日盈利y(单位:百元)与当天平均气温x(单位:℃)之间有如下数据:
x/℃
0
1
2
y/百元
5
4
2
2
1
甲、乙、丙3位同学对上述数据进行了分析,发现y与x之间具有线性相关关系,他们通过计算分别得到3个线性回归方程:①;②;③.其中正确的是 .(填序号)
【典例2】(多选)某公司为了增加某商品的销售利润,调查了该商品投入的广告费用:x(单位:万元)与销售利润y(单位:万元)的相关数据,如表所示,根据表中数据,得到经验回归方程,则下列结论正确的是( )
广告费用x
3
4
5
8
销售利润y
4
5
7
8
A. B.
C.直线l必过点 D.直线l必过点
【易错点】05 陷入独立性检验误区
辨析:回归方程参数计算错误,误用公式计算回归系数,未正确应用中心化公式(临界值使用错误或误判临界值的比较方向),独立性检验中,结论依赖"临界值"而非"临界值".
【典例1】某研究分析学习时间(,小时)与考试成绩(,分)的关系,数据如下:
x
2
4
5
7
8
10
11
12
y
30
40
50
60
70
80
90
100
(1)求线性回归方程;
(2)在下检验x与y的线性相关性(已知).
由题意,
【典例2】为了解是否喜欢羽毛球运动与性别的关系,某数学兴趣小组经统计得到如下数据,若要使是否喜欢羽毛球运动与性别无关的可能性最大,则( )
性别
羽毛球
喜欢
不喜欢
女生
男生
50
100
附:,其中.
A.4 B.2 C.1 D.
重难点01 散点图
为了直观描述成对样本数据的变化特征,把每对成对样本数据都用直角坐标系中的点表示出来,由这些点组成的统计图,叫做散点图.
1.(24-25高二下·全国·课后作业)下列散点图中,两个变量呈负相关的个数是( )
A.1 B.2 C.3 D.4
2.(24-25高二上·新疆和田·期末)对于变量,有以下四个散点图,由这四个散点图可以判断变量与成负相关的是( )
A. B.
C. D.
3.(23-24高二下·北京东城·期末)某校学生科研兴趣小组为了解1~12岁儿童的体质健康情况,随机调查了20名儿童的相关数据,分别制作了肺活量、视力、肢体柔韧度、BMI指数和身高之间的散点图,则与身高之间具有正相关关系的是( )
A.肺活量 B.视力 C.肢体柔韧度 D.BMI指数
重难点02 变量的相关关系
两个变量是否相关的两种判断方法
(1)根据实际经验:借助积累的经验进行分析判断.
(2)利用散点图:通过散点图,观察它们的分布是否存在一定的规律,直观地进行判断.如果发现点的分布从整体上看大致在一条直线附近,那么这两个变量就是线性相关的,注意不要受个别点的位置的影响.
4.(25-26高二上·全国·单元测试)下列变量之间的关系不是相关关系的是( )
A.光照时间和果树亩产量 B.降雪量和交通事故发生率
C.每亩田施肥量和粮食亩产量 D.圆的面积和半径
5.(2025高二·全国·专题练习)下列关系中,是因果关系的为( )
A.学生的学习态度与学习成绩之间的关系
B.教师的教学水平与学生的学习成绩之间的关系
C.学生的身高与学生的学习成绩之间的关系
D.家庭的经济条件与学生的学习成绩之间的关系
6.(24-25高二·全国·课堂例题)(多选)以下两个变量呈负相关的是( )
A.学生的学籍号与学生的数学成绩
B.坚持每天吃早餐的人数与患胃病的人数
C.气温与冷饮销售量
D.变量和变量对应的成对数据关于均值平移后的散点大多数分布在第二象限、第四象限,则变量和变量是负相关
重难点03相关系数
(1)我们常用样本相关系数r来确切地反映成对样本数据(xi,yi)的相关程度,
现实生活中的数据,由于度量对象和单位的不同等,数值会有大有小,为了去除这些因素的影响,统计学里一般用来衡量与的线性相关性强弱,我们称为变量和变量的样本相关系数.
①样本相关系数r的取值范围为[-1,1].
②当时,称成对数据正相关;当时,称成对数据负相关.
③ 越接近于,两个变量的线性相关性越强;
接近于时,两个变量之间几乎不存在线性相关关系.
注:通常|r|大于0.75时,认为两个变量有很强的线性相关性.
7.(25-26高三上·四川成都·开学考试)某市环保部门研究近十年空气质量数据,得到以下结论:
结论一:PM2.5浓度与机动车保有量的样本相关系数;
结论二:绿化覆盖率与呼吸道疾病发病率的样本相关系数;
结论三:工业能耗与近地面臭氧浓度的样本相关系数.
下列说法正确的是( )
A.由结论一可知,机动车保有量增加是PM2.5浓度升高的直接原因
B.由结论二可知,绿化覆盖率与呼吸道疾病发病率无关联
C.结论三表明工业能耗与近地面臭氧浓度呈正相关,且线性相关性比结论一更强
D.结论一中接近1,说明PM2.5浓度与机动车保有量存在极强的线性相关关系
8.(25-26高三上·贵州·开学考试)已知四组成对样本数据对应的线性相关系数分别为,,则线性相关程度最强的是( )
A.A组 B.B组 C.C组 D.D组
9.(24-25高二下·甘肃临夏·期末)已知10个成对数据的散点图如图所示,并对进行线性回归分析.若在此图中去掉点后,再次对进行线性回归分析,则下列说法正确的是( )
A.相关系数变大 B.变量与的线性相关程度变低
C.相关系数变小 D.变量与呈负相关
10.(25-26高三上·湖北宜昌·阶段练习)随着科技的发展,人工智能生成的虚拟角色正逐步取代传统的真人直播带货.某公司使用虚拟角色直播带货后销售金额逐步提升,根据该公司使用虚拟角色直播带货后20个月的销售金额的情况统计,得到一组样本数据,其中和分别表示月份编号和销售金额(单位:万元),并计算得,,.
(1)求样本的相关系数(精确到),并推断销售金额(单位:万元)和月份编号的相关程度;
(2)已知这20个月中有8个月的销售金额低于平均数,从这20个月中随机抽取2个月的销售金额,记抽到销售金额低于平均数的月份数为,求随机变量的分布列.
附:相关系数.
0
1
2
11.(24-25高二·全国·课堂例题)为了对2020年某校月考成绩进行分析,在60分以上的全体同学中随机抽取8位,他们的数学、物理成绩对应如下表:
学生编号
1
2
3
4
5
6
7
8
数学成绩
68
72
78
81
85
88
91
93
物理成绩
70
66
81
83
79
80
92
89
用变量与的样本相关系数(精确到0.01)说明物理成绩与数学成绩的线性相关程度的强弱,并说明它们的变化趋势特征.
参考数据:,.
12.(24-25高二·全国·课堂例题)某食品加工厂新研制出一种袋装食品(规格:500g/袋),下面是近六个月每袋的出厂价格(单位:元)与销售量(单位:万袋)的对应关系表:
月份序号
1
2
3
4
5
6
每袋的出厂价格(元)
10.5
10.9
11
11.5
12
12.5
月销售量(万袋)
2.2
2
1.9
1.8
1.5
1.4
(1)计算该食品加工厂这六个月内这种袋装食品平均每袋的出厂价格、平均月销售量和平均月销售收入;
(2)求每袋的出厂价格与月销售量的样本相关系数(精确到0.01);
(3)若,则认为相关性很强,试判断该食品加工厂研制的袋装食品每袋的出厂价格与月销售量是否有较强的相关性.
附:样本相关系数.
重难点04 样本中心点
经验回归直线一定过点,点通常称为样本点的中心;
13.(25-26高三上·天津东丽·开学考试)已知变量和满足经验回归方程,且变量和之间的一组相关数据如表所示,则下列说法错误的是( )
5
6
9
12
8
7
2.4
A. B.当时,
C.变量和呈负相关 D.该经验回归直线必过点
14.(24-25高二下·福建厦门·期末)已知变量的4组相关数据分别为,则关于的线性回归直线必经过点( )
A. B. C. D.
15.(24-25高二下·广东梅州·期末)我国新能源汽车的卓越性能赢得全球人民的信赖,某品牌新能源汽车凭借科研创新、广告宣传和可靠的售后保障,在全球赢得了很好的营销局面,下表为该品牌新能源汽车的科研经费投入和全球市场规模统计.
科研经费(单位:百亿元)
2
4
6
12
16
市场规模(单位:百万辆)
1
1.5
2
3
3.5
如此得到y关于x的经验回归方程:,估计当该品牌新能源汽车的科研经费投入20(百亿元)时,全球市场规模将达到( )百万辆.
A.4 B.4.14 C.4.36 D.4.58
16.(24-25高二下·陕西渭南·期末)2023年第5届藏博会在拉萨举行,藏博会上本地核桃油深受大家喜爱,某商家统计了最近5个月销量,如表所示:
时间x
1
2
3
4
5
销售量y/万瓶
5.7
4.8
3.8
3.2
2.5
若y与x线性相关,且线性回归方程为,则下列说法不正确的是( )
A.由题中数据可知,变量y与x负相关 B.样本中心点为
C.可以预测当时销量约为1.8万瓶 D.线性回归方程中
17.(24-25高二下·湖北黄冈·期末)已知由一组样本数据确定的经验回归方程为,且.发现有两对数据与误差较大,去掉这两对数据后重新求得经验回归方程为,则( )
A.2 B.1.6 C.7.4 D.0.8
重难点05 线性回归方程
将=x+称为Y关于x的经验回归方程,也称经验回归函数或经验回归公式,其图形称为经验回归直线,这种求经验回归方程的方法叫做最小二乘法,求得的,叫做b,a的最小二乘估计,其中
,=-.
18.(25-26高三上·云南曲靖·阶段练习)根据统计数据和研究报告,2025年中国新能源汽车产销呈现强劲增长态势,渗透率(渗透率=新能源汽车销量÷当月汽车总销量)持续攀升,行业格局加速分化.2025年3月新能源汽车渗透率首次超过,2025年1月至6月,全国新能源汽车的渗透率统计如下:
2025年1月至6月新能源汽车渗透率统计表
月份
1
2
3
4
5
6
渗透率
41.4
49.4
51.1
51.5
53.0
53.3
(1)2025年6月全国汽车销量为208.4万辆,计算该月新能源汽车的销量(精确到0.1).
(2)根据以上数据,建立y关于月份x的经验回归方程,并预测2025年7月新能源汽车的渗透率.
(3)实际7月新能源汽车的渗透率为,请:
①结合预测值分析误差原因;
②提出改进模型的建议.
(参考数据及公式:,.)
19.(2025·广东广州·模拟预测)经验表明,一般树的胸径(树的主干在地面以上m处的直径)越大,树就越高.由于测量树高比测量胸径困难,因此研究人员希望由胸径预测树高.在研究树高与胸径之间的关系时,某林场收集了某种树的一些数据,并根据数据作出如下的散点图.
经计算得,,,,.
(1)推断两个变量是否线性相关,计算样本相关系数(精确到),并推断它们的相关程度;
(2)试根据以上数据建立树高关于胸径的经验回归方程(系数精确到),并预测胸径为cm的树高.
附:相关系数,回归方程中,,.
20.(25-26高三上·山东青岛·开学考试)下表是某公司从2020年至2024年某种产品盈利额的近似值(单位:万元)
年份
2020
2021
2022
2023
2024
年份代号
1
2
3
4
5
盈利额
50
56
64
72
83
(1)求关于的相关系数的值(精确到0.001),并判断它们是否具有较强的线性相关关系(如果,则认为与的线性相关关系较强,否则认为线性相关关系较弱);
(2)求关于的线性回归方程,并预测2025年该种产品的盈利额.
附:
①相关系数;
②经验回归方程中的和的最小二乘估计公式为
③.
21.(25-26高三上·广西南宁·阶段练习)前几年随着网购的普及,线下零售遭遇挑战,但随着新零售模式的不断出现,零售行业近几年呈现增长趋势,下表为2021~2024年百货零售业的销售额(单位:亿元,数据经过处理,1~4分别对应2021~2024年)
年份代码
1
2
3
4
销售额
95
165
230
310
(1)建立关于的回归方程,并预测2025年我国百货零售业的销售额;
(2)从2021~2024年这4年的百货零售业销售额及2025年预测销售额这5个数据中任取2个数据,求这2个数据之差的绝对值大于200亿元的概率.
参考数据:,
参考公式:回归方程中斜率和截距的最小二乘估计公式分别为
22.(25-26高三上·安徽蚌埠·开学考试)7月1日,电影《哪吒之魔童闹海》(以下简称《哪吒2》在中国内地电影院线正式下映,结束了自今年1月29日以来153天的线下放映.据统计,《哪吒2》在中国内地最终斩获154.4亿元票房,总观影人次3.24亿,两项数据均创下中国影史纪录,并遥遥领先第二名,成为了又一部现象级电影.下表统计了《哪吒2》上映前15天累计票房到达(单位:亿元)与所用时间(单位:天)的数据:
累计票房
20
40
60
80
100
用时
4
7
9
10
15
(1)利用表中的数据,计算相关系数(结果精确到0.01),并推断两个变量的线性相关程度;
(2)求关于的经验回归方程(系数精确到0.01),并预测153天时的累计票房,判断这种预测方法是否合理.
参考公式:经验回归方程,其中.
相关系数.
参考数据:.
重难点06残差
(1)残差
对于响应变量Y,通过观测得到的数据称为观测值,通过经验回归方程得到的称为预测值,观测值减去预测值称为残差.
(2)残差分析
残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果,以及判断原始数据中是否存在可疑数据等,这方面工作称为残差分析.通过观察残差图可以直观判断模型是否满足一元线性回归模型中对随机误差的假设,那残差应是均值为,方差为的随机变量的观测值.
(3)残差图法
作图时纵坐标为残差,横坐标可以选为样本编号,或身高数据,或体重估计值等,这样作出的图形称为残差图.在残差图中,残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,这样的带状区域的宽度越窄,说明模型拟合精度越高,回归方程的预报精度越高.
(4)残差平方和法
残差平方和越小,模型的拟合效果越好.
23.(24-25高二下·山东淄博·阶段练习)已知某产品的色度y和色差x之间满足线性相关关系,且现有一对测量数据为,则该数据的残差为( )
色差x
色度y
15
18
19
20
A. B. C.0.6 D.0.76
24.(2025·海南·模拟预测)已知由样本数据组成的一个样本,得到经验回归方程为,且,增加两个样本点和后,得到新样本的经验回归方程为.在新的经验回归方程下,样本的残差为( )
A. B. C. D.2
25.(24-25高二下·山东·期中)已知变量x,y具有线性相关关系,根据样本点得到y关于x的经验回归方程为,则样本点的残差为( )
A. B. C.1 D.2
26.(24-25高二下·江苏南京·阶段练习)某种产品的投入x(单位:万元)与收入y(单位:万元)之间的关系如下表所示:
x/万元
2
4
5
6
8
y/万元
30
40
60
50
70
若y与x的经验回归方程为,则相应于点的残差为( )
A. B.0.5 C. D.1.5
27.(22-23高二下·山东青岛·期中)根据变量Y和x的成对样本数据,由一元线性回归模型得到经验回归模型,求得残差图.对于以下四幅残差图,满足一元线性回归模型中对随机误差假设的是( )
A. B.
C. D.
28.(2025·江西新余·模拟预测)样本点数据,且大致呈线性分布,其经验回归方程为,若,数据的80%分位数为7,则当时,随机误差的残差为:( ).
A.-0.5 B.0.5 C.-1.5 D.1.5
重难点07相关指数
在回归分析中,可以用来刻画回归的效果,它表示解释变量对于预报变量变化的贡献率,R2越接近于1,表示回归的效果越好.
模型的拟合效果用相关指数来表示,,表达式中,与经验回归方程无关,残差平方和与经验回归方程有关,因此,越大,意味着残差平方和越小,即模型的拟合效果越好;越小,残差平方和越大,即模型的拟合效果越差
注:决定系数与相关系数的联系与区别
①相关系数反映两个变量的相关关系的强弱及正相关或负相关,决定系数反映回归模型的拟合效果.
②在含有一个解释变量的线性模型中,决定系数的数值是相关系数的平方,其变化范围为,而相关系数的变化范围为.
③当相关系数接近于1时,说明两变量的相关性较强,当接近于0时,说明两变量的相关性较弱;而当接近于1时,说明经验回归方程的拟合效果较好.
29.(24-25高二下·山东聊城·期末)某同学根据一组数据作出如图所示的散点图,并对这组数据进行回归分析后发现遗漏了点,增加点后再次进行回归分析,得到的结果和原来相比( )
A.相关系数r变大 B.决定系数变小
C.残差平方和变小 D.不变
30.(24-25高二下·河南·期末)某团队尝试用回归模型甲、乙、丙、丁描述人的1000米跑步成绩与肺活量的关系,已知模型甲、乙、丙、丁对应的决定系数分别为0.14,0.17,0.72,0.45,则拟合效果最好的模型是( )
A.甲 B.乙 C.丙 D.丁
31.(24-25高二下·山西·期中)下图为根据某组成对数据绘制的散点图,根据最小二乘法得到了经验回归直线1(实线)与经验回归曲线2(虚线)如图,并分别计算了两模型的决定系数,则( )
A. B.
C. D.
32.(23-24高二下·河北石家庄·期末)已知一组观测值,,…,满足,若恒为0,则( )
A.0 B.0.5 C.0.9 D.1
重难点08非线性回归
非线性问题处理策略要通过换元、取对数等手段把非线性问题转化为线性问题.
33.(24-25高二下·广东中山·阶段练习)红铃虫(Pectinophora gossypiella)是棉花的主要害虫之一,其产卵数与温度有关.现收集到一只红铃虫的产卵数y(个)和温度x(℃)的8组观测数据,制成图1所示的散点图.现用两种模型①,②分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图.
根据收集到的数据,计算得到如下值:表中;;;;
(1)根据残差图,比较模型①、②的拟合效果,应选择哪个模型?并说明理由;
(2)根据(1)中所选择的模型,求出y关于x的回归方程(系数精确到0.01),并求温度为34℃时,产卵数y的预报值.
(参考数据:,,,)
附:对于一组数据,,…,,其回归直线的斜率和截距的最小二乘估计分别为,.
25
2.89
646
168
422688
48.48
70308
34.(2023·江苏镇江·三模)经观测,长江中某鱼类的产卵数与温度有关,现将收集到的温度(单位:)和产卵数的10组观测数据作了初步处理,得到如图所示的散点图及一些统计量表.
360
54.5
1360
44
384
3
588
32
6430
表中,,.
(1)根据散点图判断,,与哪一个适宜作为与之间的回归方程模型(给出判断即可,不必说明理由),并求出关于的回归方程;
(2)某兴趣小组抽取两批鱼卵,已知第一批中共有5个鱼卵,其中“死卵”有2个;第二批中共有6个鱼卵,其中“死卵”有3个.现随机挑选一批,然后从该批次中随机取出2个鱼卵,求取出“死卵”个数的分布列及数学期望.
附:对于一组数据,,…,,其回归直线的斜率和截距的最小二乘估计分别为,.
35.(23-24高二下·湖北·期末)某乡村企业希望通过技术革新增加产品收益,根据市场调研,技术革新投入经费(单位:万元)和增加收益(单位:万元)的数据如下表:
4
6
8
10
12
27
42
55
56
60
为了进一步了解技术革新投入经费对增加收益的影响,通过对表中数据进行分析,分别提出了两个回归模型:①,②.
(1)根据以上数据,计算模型①中与的相关系数(结果精确到0.01);
(2)若,则选择模型①;否则选择模型②.根据(1)的结果,试建立增加收益关于技术革新投入经费的回归模型,并预测时的值(结果精确到0.01).
附:i)回归直线的斜率、截距的最小二乘估计以及相关系数分别为:,,
ii)参考数据:设,,,,,.
36.(2024·浙江台州·二模)台州是全国三大电动车生产基地之一,拥有完整的产业链和突出的设计优势.某电动车公司为了抢占更多的市场份额,计划加大广告投入、该公司近5年的年广告费(单位:百万元)和年销售量(单位:百万辆)关系如图所示:令,数据经过初步处理得:
44
4.8
10
40.3
1.612
19.5
8.06
现有①和②两种方案作为年销售量y关于年广告费x的回归分析模型,其中a,b,m,n均为常数.
(1)请从相关系数的角度,分析哪一个模型拟合程度更好?
(2)根据(1)的分析选取拟合程度更好的回归分析模型及表中数据,求出y关于x的回归方程,并预测年广告费为6(百万元)时,产品的年销售量是多少?
(3)该公司生产的电动车毛利润为每辆200元(不含广告费、研发经费).该公司在加大广告投入的同时也加大研发经费的投入,年研发经费为年广告费的199倍.电动车的年净利润受年广告费和年研发经费影响外还受随机变量影响,设随机变量服从正态分布,且满足.在(2)的条件下,求该公司年净利润的最大值大于1000(百万元)的概率.(年净利润=毛利润×年销售量-年广告费-年研发经费-随机变量).
附:①相关系数,
回归直线中公式分别为,;
②参考数据:,,,.
37.(22-23高二下·江西萍乡·期中)某研发小组为了解年研发资金投入量(单位:亿元)对年销售额(单位:亿元)的影响,结合近10年的年研发资金投入量和年销售额的数据(),建立了两个函数模型:①,②,其中,,,均为常数,为自然对数的底数.设,,经过计算得如下数据.
20
66
770
200
14
460
4.20
3125000
0.308
21500
(1)设和的相关系数为,和的相关系数为,请从相关系数的角度,选择一个拟合程度更好的模型.
(2)根据(1)中选择的模型及表中数据,建立关于的线性回归方程(系数精确到0.01),根据线性回归方程,若当年的销售额大致为亿元,则估计当年的研发资金投入量为多少亿元.
参考公式:相关系数,
线性回归直线中斜率和截距的最小二乘法估计参数分别为,.
重难点09分类变量与列联表
可通过计算列联表中|ad−bc|的值,值越大说明两分类变量有关系的可能性越大。也可利用等高堆积条形图直观判断,还可通过独立性检验,计算χ2的值并与临界值比较,从而推断两个分类变量是否有关系及判断的可靠程度
38.(24-25高二下·山西·期末)在统计中,研究两个分类变量之间的关联性时常用的图是( )
A.散点图 B.残差图 C.频率分布直方图 D.等高堆积条形图
39.(24-25高二下·宁夏银川·阶段练习)为考查、两种药物预防某疾病的效果,进行动物实验,分别得到如下等高条形图:根据图中信息,在下列各项中,说法最佳的一项是( )
A.药物的预防效果优于药物的预防效果
B.药物的预防效果优于药物的预防效果
C.药物、对该疾病均有显著的预防效果
D.药物、对该疾病均没有预防效果
40.(24-25高二·全国·课堂例题)一个列联表如下:
合计
35
45
7
合计
73
则表中,的值分别是 ( )
A.10,38 B.17,45 C.10,45 D.17,38
41.(24-25高三·上海·课堂例题)某村庄对该村内50名村民每年是否体检的情况进行了调查,统计数据如下表所示:
每年体检(人)
每年未体检(人)
合计(人)
老年人
7
年轻人
6
合计
50
已知抽取的村民中老年人、年轻人各25名,则对列联表数据的分析错误的是( )
A. B. C. D.
42.(2023·四川达州·一模)四川省将从2022年秋季入学的高一年级学生开始实行高考综合改革,高考采用“3+1+2”模式,其中“1”为首选科目,即物理与历史二选一.某校为了解学生的首选意愿,对部分高一学生进行了抽样调查,制作出如下两个等高条形图,根据条形图信息,下列结论正确的是( )
A.样本中选择物理意愿的男生人数少于选择历史意愿的女生人数
B.样本中女生选择历史意愿的人数多于男生选择历史意愿的人数
C.样本中选择物理学科的人数较多
D.样本中男生人数少于女生人数
重难点10 独立性概念与计算
1.有关“相关的检验”
用χ2进行“相关的检验”步骤
①零假设:即先假设两变量间没关系.
②计算χ2:套用χ2的公式求得χ2值.
③查临界值:结合所给小概率值α查得相应的临界值xα.
④下结论:比较χ2与xα的大小,并作出结论.
2.有关“无关的检验”
运用独立性检验的方法
①列出2×2列联表,根据公式计算χ2.
②比较χ2与xα的大小作出结论.
43.(25-26高三上·湖北恩施·开学考试)根据分类变量与的观测数据,计算得到,依据小概率值()的独立性检验,则( )
A.变量与不独立
B.变量与独立
C.变量与不独立,这个结论犯错误的概率不超过0.1
D.变量与独立,这个结论犯错误的概率不超过0.1
44.(25-26高二上·全国·单元测试)某班主任对全班50名学生进行了作业量的调查,数据如下表:
性别
作业量
大
不大
总计
男
18
9
27
女
8
15
23
总计
26
24
50
则推断“学生的性别与认为作业量大有关”的把握为( )
附表:
A. B. C. D.
45.(25-26高三上·江苏镇江·开学考试)某医疗研究所为了检验某种血清能起到预防感冒的作用,把500名使用血清的人与另外500名未使用血清的人一年中的感冒记录作比较,利用列联表计算得的观测值.
附表:
0.15
0.10
0.05
0.025
0.010
2.072
2.706
3.841
5.024
6.635
则作出“这种血清能起到预防感冒的作用”出错的可能性不超过( )
A. B. C. D.
46.(25-26高二上·全国·单元测试)为了研究高中学生中性别与对乡村音乐态度(喜欢和不喜欢两种态度)的关系,运用2×2列联表进行独立性检验,得到的结论是有99%的把握认为性别与喜欢乡村音乐有关系,则的值可以为( )
A.2.853 B.3.841 C.6.758 D.6.451
47.(25-26高三上·吉林白城·开学考试)针对“中学生追星问题”,某校团委对“学生性别和中学生追星是否有关”作了一次调查,调查样本中女生人数是男生人数的,男生追星的人数占男生人数的,女生追星的人数占女生人数的,若在犯错误的概率不超过5%的前提下认为是否追星和性别有关,则调查样本中男生至少有( )
参考数据及公式如下:,
0.050
0.010
0.001
3.841
6.635
10.828
A.12人 B.11人 C.10人 D.18人
重难点11独立性检验的实际应用
独立性检验解决实际问题的主要环节
①提出零假设H0:X和Y相互独立,并给出在问题中的解释.
②根据抽样数据整理出2×2列联表,计算χ2的值,并与临界值xα比较.
③根据检验规则得出推断结论.
④在X和Y不独立的情况下,根据需要,通过比较相应的频率,分析X和Y间的影响规律.
注:独立性检验和反证法:反证法不会出错,而独立性检验依据的是小概率事件几乎不发生.
48.(25-26高三上·贵州贵阳·阶段练习)某校生物科技班开展“核酸自组装”实验,记录200名学生在限制性末端配对实验中的操作表现:
组别
操作评级
合计
优
良
男生
35
100
女生
45
合计
200
(1)完成列联表,依据的独立性检验,能否认为学生组别与操作评级存在关联?
(2)在后续的“环状核酸构建”实验中,需处理条线性核酸片段:每条片段有两个末端;每次随机选取2个未配对的末端进行连接;连接后可能形成一个或多个环状结构,所有核酸片段末端连接完毕视为结束.
(i)当时,记随机变量为最终形成的环状结构数,求的分布列与数学期望;
(ii)求证:所有核酸片段连接成一个完整环状结构的概率为.
附:,其中.
0.05
0.01
0.005
0.001
3.841
6.635
7.879
10.828
49.(25-26高三上·河北·开学考试)人工智能对人们的生活有较大的影响,为了让教师更加重视人工智能,某校随机抽取30名男教师和20名女教师参加学校组织的“人工智能”相关知识问卷调查(满分100分),若分数为80分及以上的为优秀,其他为非优秀,统计并得到如下列联表:
男教师
女教师
总计
优秀
20
10
30
非优秀
10
10
20
总计
30
20
50
(1)根据小概率值的独立性检验,能否认为这次成绩是否优秀与性别有关?
(2)从样本中成绩优秀的30名教师中,随机抽取2人进行调研,记抽取的2人中女教师的人数为,求的分布列和数学期望.
附:,其中.
0.1
0.05
0.01
0.001
2.706
3.841
6.635
10.828
50.(25-26高三上·黑龙江佳木斯·开学考试)为了解某地初中学生体育锻炼时长与学业成绩的关系,从该地区29000名学生中随机抽取580人,得到日均体育锻炼时长(单位:小时)与学业成绩的数据如表所示:
学业
成绩
日均体育锻炼时长/小时
优秀
5
44
42
3
1
不优秀
134
147
137
40
27
(1)该地区29000名学生中日均体育锻炼时长不小于1小时的人数约为多少?
(2)估计该地区初中学生日均体育锻炼时长(精确到0.1小时);
(3)依据小概率值的独立性检验能否认为学业成绩优秀与日均体育锻炼时长不小于1小时且小于2小时有关?
附:.
51.(24-25高二下·上海·阶段练习)已知某区组建了一支人的志愿者队伍,并由其中人组成“志愿模范队”.经过一年的实践,全队共有人的周平均服务时长超过2小时,其中有人来自“志愿模范队”,如下表所示.
是“志愿模范队”成员
不是“志愿模范队”成员
总计
周平均服务时长超过2小时
周平均服务时长不超过2小时
总计
(1)已知一名志愿者是“志愿模范队”成员,求其周平均服务时长超过2小时的概率.
(2)请完成列联表,并根据表中数据回答:是否有的把握认为“是‘志愿模范队’成员”与“周平均服务时长超过2小时”有关系?
附录:,其中.
52.(25-26高三上·安徽合肥·开学考试)随着科技的发展,AI技术已经深度介入普通人的生活,正在改变着人们的生活和工作.为了调查AI技术在普通人中的使用情况,一调查机构对此进行了调查,并从参与调查的市民中分别抽取男,女各100人进行统计分析,整理得到如下列联表:
性别
经常借助AI技术
不经常借助AI技术
合计
男
女
50
合计
120
(1)完成上述列联表,并根据小概率值的独立性检验,分析是否经常借助AI技术与性别有关联;
(2)采用按比例分配的分层随机抽样的方法,从表中不经常借助AI技术的人中抽取8人,再从这8人中随机抽取3人,记3人中男性人数为随机变量,求的分布列和数学期望.
参考公式:,.
0.050
0.010
0.005
3.841
6.635
7.879
53.(2025·全国·模拟预测)在卡塔尔世界杯的开幕式上中国元素随处可见.从体育场建设到电力保障,从赛场内的裁判到赛场外的吉祥物,……,中国制造为世界杯提供了强有力的支持.国内也再次掀起足球热潮.某地足球协会组建球队参加业余比赛.该足球队教练组对球员的使用是依据数据分析,为了调查球员乙对球队的贡献,作出如下数据统计(乙参加过的比赛均分出了胜负):
乙
球队
总计
胜
负
未参加比赛
30
70
参加比赛
10
总计
70
(1)根据小概率值的独立性检验,能否认为该球队胜利与乙球员参赛有关联?
(2)根据以往的数据统计,甲球员能够胜任边锋、中锋、后腰以及后卫四个位置,且出场率分别为:,当出任边锋、中锋、后腰以及后卫时,球队输球的概率依次为:0.4,0.3,0.4,0.2.则:
①当甲球员参加比赛时,求球队某场比赛输球的概率;
②当甲球员参加比赛时,在球队输了某场比赛的条件下,求甲球员担任边锋的概率;
③如果你是教练员,应用概率统计有关知识,该如何使用甲球员?
附表及公式:
0.15
0.10
0.05
0.025
0.010
0.005
0.001
2.072
2.706
3.841
5.024
6.635
7.879
10.828
.
12 / 49
学科网(北京)股份有限公司
$
第7章 统计案例
知识点一、变量的相关关系
两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系,即不确定性关系.
知识点二、相关关系的分类
(1)按变量间的增减性分为正相关和负相关.
①正相关:当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势;
②负相关:当一个变量的值增加时,另一个变量的相应值呈现减小的趋势.
(2)按变量间是否有线性特征分为线性相关和非线性相关(曲线相关).
①线性相关:如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们称这两个变量线性相关;
②非线性相关或曲线相关:如果两个变量具有相关性,但不是线性相关,我们称这两个变量非线性相关或曲线相关.
知识点三、相关关系的刻画
1.散点图:
成对样本数据都可用直角坐标系中的点表示出来,由这些点组成的统计图,叫做散点图.
2.样本相关系数r的计算式
3.样本相关系数r的性质
①样本相关系数r的取值范围为[-1,1];
②若r>0时,成对样本数据正相关;
③若r<0时,成对样本数据负相关;
④样本相关系数与相关程度
当|r|越接近1时,成对样本数据的线性相关程度越强;
当|r|越接近0时,成对样本数据的线性相关程度越弱.
特别说明:当两个变量的样本相关系数|r|=1时,两个变量呈函数关系.
知识点四、一元线性回归模型与最小二乘法
1.一元线性回归模型
称为Y关于x的一元线性回归模型.其中,Y称为因变量或响应变量,x称为自变量或解释变量,a称为截距参数,b称为斜率参数;e是Y与bx+a之间的随机误差,如果e=0,那么Y与x之间的关系就可以用一元线性函数模型来描述.
2.最小二乘法
将=x+称为Y关于x的经验回归方程,也称经验回归函数或经验回归公式,其图形称为经验回归直线,这种求经验回归方程的方法叫做最小二乘法,求得的,叫做b,a的最小二乘估计,其中
=,=-.
特别说明:经验回归直线必过样本点的中心().
知识点五、刻画回归效果的方式
1.残差图法
在残差图中,残差比较均匀地分布在以横轴为对称轴的水平的带状区域中,说明满足一元线性回归模型的假设,这样的带状区域的宽度越窄,说明模型拟合精度越高.
2.残差平方和法
残差平方和为,残差平方和越小,模型拟合效果越好.
3.决定系数法
R2=R2的值越趋近于1,模型的拟合效果越好.
知识点六、列联表与独立性检验
(1)分类变量X,Y的2×2列联表:
X
Y
合计
Y=0
Y=1
X=0
a
b
a+b
X=1
c
d
c+d
合计
a+c
b+d
n=a+b+c+d
则χ2=.
(2)利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验.
(3)χ2独立性检验中几个常用的小概率值和相应的临界值.
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
【易错点】01 混淆函数关系与相关关系
辨析:未明确区分确定性关系(函数关系)和非确定性关系(相关关系),误认为所有关联均可精确计算.
【典例1】下列关系中属于相关关系的是()
A.圆的面积与半径
C.匀速运动中路程与时间
B.身高与体重
D.底面积为定值的长方体的体积和高
【解析】由题意,
A选项中圆的面积与半径具有确定性关系,故选项A错误;
B选项中的身高与体重存在趋势性关联,但非精确对应,如相同身高者的体重可能不同,故选项正确;
C选项中匀速运动中路程与时间具有确定性关系,故选项C正确;
D选项中底面积为定值的长方体的体积和高具有确定性关系,故选项D错误.
故选:B.
【典例2】下列两个量之间的关系是相关关系的是( )
A.匀速直线运动中时间与位移的关系 B.学生的成绩和身高
C.儿童的年龄与体重 D.物体的体积和质量
【答案】C
【分析】根据相关关系和函数关系的概念即可判断
【详解】A、D是函数关系;B是不相关关系;C是相关关系,
故选:C
【易错点】02 忽略线性相关的适用条件
辨析:未验证散点是否集中在直线附近,盲目假设变量间存在线性相关关系,导致错误判断关联类型.
【典例1】某实验测得变量与的20组数据,散点图如下,变量间存在什么关系?
【解析】由题意,
最低点将趋势分为两段不同方向,而散点整体形成形曲线,无直线分布特征.
得出结论:变量间存在非线性相关(二次曲线趋势).
【典例2】【多选】下图是两个分类变量x,y取值绘制成的散点图,则图中变量x,y具有线性相关关系的是( )
A. B.
C. D.
【答案】BC
【分析】根据散点图的特征逐一验证即可得到答案.
【详解】由题意,
对于A:散点杂乱无章,无规律可言,看不出两个变量有什么相关性;故A错误;
对于B:呈正相关关系,分布在一条直线附近,具有线性相关关系;故B正确;
对于C:两个变量具有负相关关系,分布在一条直线附近,具有线性相关关系;故C正确;
对于D:两个变量具有相关性,但不是正相关,也不是负相关,故D错误.
故选:BC.
【易错点】03 误判相关系数符号与相关性强度
辨析:将相关系数正负号与相关性强弱直接挂钩.
【典例1】下列关于统计概率知识的判断,则下列结论正确的是()
①若样本数据,,…,的方差为4,则数据,,…,的标准差为4;
②在研究成对数据的相关关系时,相关关系越强,相关系数越接近于1;
③若事件,满足,则事件与事件相互独立;
④某医院住院的位新冠患者的潜伏天数分别为,则该样本数据的第百分位数为.
A.只有一个正确 B.只有两个正确
C.只有一个错误 D.四个题是错误的
【解析】由题意,
对于命题①,因为样本数据,,…,的方差为4,则数据,,…,的方差为,
标准差为,所以命题①正确,
对于命题②,相关关系越强,相关系数越接近于1,所以命题②错误,
对于命题③,因为,得到,
则事件与事件相互独立,所以命题③正确,
对于命题④,将数据从小排到大得到,
又,所以该样本数据的第百分位数为,故命题④错误,
故选:B.
【典例2】对两组数据进行统计后得到如图所示的散点图,下列结论不正确的是( )
A.图1、图2两组数据都具有线性相关关系
B.图1数据正相关,图2数据负相关
C.图1相关系数小于图2相关系数
D.图1相关系数和图2相关系数之和小于0
【答案】C
【分析】根据散点图及相关性判断AB,由相关系数性质判断CD.
【详解】对A,因为散点图都呈直线型,所以图1、图2两组数据都具有线性相关关系,A正确;
对B,图1散点从左至右呈上升趋势,所以数据正相关,图2散点从左至右呈下降趋势,所以数据负相关,故B正确;
对C,图1正相关,图2负相关,所以C不正确;
对D,因为图2相关程度更强,所以D正确.
故选:C.
【易错点】04 忽略回归直线必过样本中心点
辨析:截距公式应用错误,导致回归直线未过点.
【典例1】某小吃店的日盈利y(单位:百元)与当天平均气温x(单位:℃)之间有如下数据:
x/℃
0
1
2
y/百元
5
4
2
2
1
甲、乙、丙3位同学对上述数据进行了分析,发现y与x之间具有线性相关关系,他们通过计算分别得到3个线性回归方程:①;②;③.其中正确的是 .(填序号)
【解析】由题意,
由已知数据,,
代入,只有①满足,
故答案为:①.
【典例2】(多选)某公司为了增加某商品的销售利润,调查了该商品投入的广告费用:x(单位:万元)与销售利润y(单位:万元)的相关数据,如表所示,根据表中数据,得到经验回归方程,则下列结论正确的是( )
广告费用x
3
4
5
8
销售利润y
4
5
7
8
A. B.
C.直线l必过点 D.直线l必过点
【答案】ABD
【分析】求解回归方程以及根据样本中心必满足回归方程可得结果.
【详解】由表中数据计算,,
所以样本中心为,所以直线l必过点,所以D正确,C错误;
,
,
所以,所以A,B正确.
故选:ABD.
【易错点】05 陷入独立性检验误区
辨析:回归方程参数计算错误,误用公式计算回归系数,未正确应用中心化公式(临界值使用错误或误判临界值的比较方向),独立性检验中,结论依赖"临界值"而非"临界值".
【典例1】某研究分析学习时间(,小时)与考试成绩(,分)的关系,数据如下:
x
2
4
5
7
8
10
11
12
y
30
40
50
60
70
80
90
100
(1)求线性回归方程;
(2)在下检验x与y的线性相关性(已知).
由题意,
【解析】(1)中心化计算:
;
分子:;
分母:;
斜率:;
截距:;
∴方程:.
(2)相关性检验:
计算;
比较:;
∴线性相关显著.
【典例2】为了解是否喜欢羽毛球运动与性别的关系,某数学兴趣小组经统计得到如下数据,若要使是否喜欢羽毛球运动与性别无关的可能性最大,则( )
性别
羽毛球
喜欢
不喜欢
女生
男生
50
100
附:,其中.
A.4 B.2 C.1 D.
【答案】D
【分析】结合,只需,即可求得答案.
【详解】要使是否喜欢羽毛球运动与性别无关的可能性最大,则,所以,
所以.
故选:D
重难点01 散点图
为了直观描述成对样本数据的变化特征,把每对成对样本数据都用直角坐标系中的点表示出来,由这些点组成的统计图,叫做散点图.
1.(24-25高二下·全国·课后作业)下列散点图中,两个变量呈负相关的个数是( )
A.1 B.2 C.3 D.4
【答案】B
【分析】由正、负相关的概念逐项判断即可.
【详解】从整体上看,当一个变量的值增加时,另一个变量的相应值呈现减少的趋势,则这两个变量为负相关.
结合散点图可知,①②满足题意,即两个变量呈负相关的个数为2个.
故选:B
2.(24-25高二上·新疆和田·期末)对于变量,有以下四个散点图,由这四个散点图可以判断变量与成负相关的是( )
A. B.
C. D.
【答案】B
【分析】根据各图中点的分布,分析变量的相关关系即可.
【详解】A:各点分布没有明显相关性,不符;
B:各点分布在一条直线附近,且有负相关性,符合;
C:各点分布在一条抛物线附近,变量之间先呈正相关,后呈负相关,不符;
D:各点分布在一条直线附近,且有正相关性,不符.
故选:B
3.(23-24高二下·北京东城·期末)某校学生科研兴趣小组为了解1~12岁儿童的体质健康情况,随机调查了20名儿童的相关数据,分别制作了肺活量、视力、肢体柔韧度、BMI指数和身高之间的散点图,则与身高之间具有正相关关系的是( )
A.肺活量 B.视力 C.肢体柔韧度 D.BMI指数
【答案】A
【分析】根据给定的散点图,结合正相关的意义判断即得.
【详解】对于A,儿童的身高越高,其肺活量越大,肺活量与身高具有正相关关系,A正确;
对于B,儿童的视力随身高的增大先增大,后减小,视力与身高不具有正相关关系,B错误;
对于C,肢体柔韧度随身高增大而减小,肢体柔韧度与身高不具有正相关关系,C错误;
对于D,BMI指数与身高的相关性很弱,不具有正相关关系,D错误.
故选:A
重难点02 变量的相关关系
两个变量是否相关的两种判断方法
(1)根据实际经验:借助积累的经验进行分析判断.
(2)利用散点图:通过散点图,观察它们的分布是否存在一定的规律,直观地进行判断.如果发现点的分布从整体上看大致在一条直线附近,那么这两个变量就是线性相关的,注意不要受个别点的位置的影响.
4.(25-26高二上·全国·单元测试)下列变量之间的关系不是相关关系的是( )
A.光照时间和果树亩产量 B.降雪量和交通事故发生率
C.每亩田施肥量和粮食亩产量 D.圆的面积和半径
【答案】D
【分析】利用两变量相关关系的意义判断即可.
【详解】列表解析
选项
是否是相关关系
原因
A
是
果树亩产量与光照时间有关,是相关关系.
B
是
降雪量的大小对交通事故发生率有影响,是相关关系.
C
是
粮食亩产量与每亩田施肥量有关,是相关关系.
D
否
圆的面积S和半径r是函数关系.
故选:D.
5.(2025高二·全国·专题练习)下列关系中,是因果关系的为( )
A.学生的学习态度与学习成绩之间的关系
B.教师的教学水平与学生的学习成绩之间的关系
C.学生的身高与学生的学习成绩之间的关系
D.家庭的经济条件与学生的学习成绩之间的关系
【答案】B
【分析】由两个变量的相关关系与因果关系的定义,结合各项描述理解判断.
【详解】A:学生的学习态度与学习成绩之间不是因果关系,但具有相关性,不是因果关系;
B:教师的教学水平与学生的学习成绩之间的关系是因果关系;
C,D:学生的身高与学生的学习成绩、家庭的经济条件与学生的学习成绩都不是因果关系.
故选:B
6.(24-25高二·全国·课堂例题)(多选)以下两个变量呈负相关的是( )
A.学生的学籍号与学生的数学成绩
B.坚持每天吃早餐的人数与患胃病的人数
C.气温与冷饮销售量
D.变量和变量对应的成对数据关于均值平移后的散点大多数分布在第二象限、第四象限,则变量和变量是负相关
【答案】BD
【分析】A选项,无相关关系;B选项,具有负相关关系;C选项,具有正相关关系;D选项,由题意得到与具有负相关关系,不妨设,,得到,,所以变量和变量具有负相关关系,D正确.
【详解】A选项中学生的学籍号与学生的数学成绩,两个变量无相关关系;
B选项中坚持每天吃早餐的人数与患胃病的人数,两个变量具有负相关关系;
C选项中气温与冷饮销售量,两个变量具有正相关关系;
D选项中成对数据,以为零点平移,
即均值平移后的散点坐标为,
由于大多数分布在第二象限,第四象限,
故与具有负相关关系,不妨设,,
则,,
则变量和变量具有负相关关系,D正确.
综上可知,两个变量呈负相关的是B,D.
故选:BD
重难点03相关系数
(1)我们常用样本相关系数r来确切地反映成对样本数据(xi,yi)的相关程度,
现实生活中的数据,由于度量对象和单位的不同等,数值会有大有小,为了去除这些因素的影响,统计学里一般用来衡量与的线性相关性强弱,我们称为变量和变量的样本相关系数.
①样本相关系数r的取值范围为[-1,1].
②当时,称成对数据正相关;当时,称成对数据负相关.
③ 越接近于,两个变量的线性相关性越强;
接近于时,两个变量之间几乎不存在线性相关关系.
注:通常|r|大于0.75时,认为两个变量有很强的线性相关性.
7.(25-26高三上·四川成都·开学考试)某市环保部门研究近十年空气质量数据,得到以下结论:
结论一:PM2.5浓度与机动车保有量的样本相关系数;
结论二:绿化覆盖率与呼吸道疾病发病率的样本相关系数;
结论三:工业能耗与近地面臭氧浓度的样本相关系数.
下列说法正确的是( )
A.由结论一可知,机动车保有量增加是PM2.5浓度升高的直接原因
B.由结论二可知,绿化覆盖率与呼吸道疾病发病率无关联
C.结论三表明工业能耗与近地面臭氧浓度呈正相关,且线性相关性比结论一更强
D.结论一中接近1,说明PM2.5浓度与机动车保有量存在极强的线性相关关系
【答案】D
【分析】根据相关系数的性质即可结合选项逐一求解.
【详解】由,可知PM2.5浓度与机动车保有量存在极强的线性相关关系,但并不能说明机动车保有量增加是PM2.5浓度升高的直接原因,故A错误,D正确;
由于,,则表明工业能耗与近地面臭氧浓度呈正相关,但线性相关性没有结论一的强,故C错误,
由,可知绿化覆盖率与呼吸道疾病发病率呈负相关,相关性不是很强,但不能说绿化覆盖率与呼吸道疾病发病率无关联,故B错误,
故选:D
8.(25-26高三上·贵州·开学考试)已知四组成对样本数据对应的线性相关系数分别为,,则线性相关程度最强的是( )
A.A组 B.B组 C.C组 D.D组
【答案】A
【分析】比较相关系数的绝对值大小,即可得结论.
【详解】由,即,
所以线性相关程度最强的是组.
故选:A
9.(24-25高二下·甘肃临夏·期末)已知10个成对数据的散点图如图所示,并对进行线性回归分析.若在此图中去掉点后,再次对进行线性回归分析,则下列说法正确的是( )
A.相关系数变大 B.变量与的线性相关程度变低
C.相关系数变小 D.变量与呈负相关
【答案】A
【分析】根据数据的散点图,结合回归系数概念与含义,逐项判定,即可求解.
【详解】去掉点后,散点图中点的分布更接近一条直线,因此变量与的线性相关程度变强,故选项B错误;
由散点图,点的分布从左下角到右上角,故变量与呈正相关,故选项D错误;
因为变量与呈正相关,且相关性变强,所以相关系数变大,故A正确,C错误.
故选:A.
10.(25-26高三上·湖北宜昌·阶段练习)随着科技的发展,人工智能生成的虚拟角色正逐步取代传统的真人直播带货.某公司使用虚拟角色直播带货后销售金额逐步提升,根据该公司使用虚拟角色直播带货后20个月的销售金额的情况统计,得到一组样本数据,其中和分别表示月份编号和销售金额(单位:万元),并计算得,,.
(1)求样本的相关系数(精确到),并推断销售金额(单位:万元)和月份编号的相关程度;
(2)已知这20个月中有8个月的销售金额低于平均数,从这20个月中随机抽取2个月的销售金额,记抽到销售金额低于平均数的月份数为,求随机变量的分布列.
附:相关系数.
【答案】(1),相关性强
(2)分布列见解析
【分析】(1)由条件结合相关系数公式求出相关系数,根据相关系数性质判断结论;
(2)由条件确定的可能取值,再求取各值的概率,由此可得其分布列.
【详解】(1)样本的相关系数为
.
由于相关系数,则相关性很强,的值越大,相关性越强.
故,故销售金额和月份编号成很强的正相关性.
(2)由题意得:的可能取值为0,1,2,
20个月中有8个月的销售金额低于平均数,有12个月的销售金额不低于平均数,
所以,
所以的分布列为:
0
1
2
11.(24-25高二·全国·课堂例题)为了对2020年某校月考成绩进行分析,在60分以上的全体同学中随机抽取8位,他们的数学、物理成绩对应如下表:
学生编号
1
2
3
4
5
6
7
8
数学成绩
68
72
78
81
85
88
91
93
物理成绩
70
66
81
83
79
80
92
89
用变量与的样本相关系数(精确到0.01)说明物理成绩与数学成绩的线性相关程度的强弱,并说明它们的变化趋势特征.
参考数据:,.
【答案】答案见解析
【分析】分别计算出、,然后求出相关系数说明物理与数学的相关程度.
【详解】因为:,
,
所以.
所以,由样本估计总体,可知物理成绩与数学成绩的线性相关程度较强,且呈正相关,它们的变化趋势相同.
12.(24-25高二·全国·课堂例题)某食品加工厂新研制出一种袋装食品(规格:500g/袋),下面是近六个月每袋的出厂价格(单位:元)与销售量(单位:万袋)的对应关系表:
月份序号
1
2
3
4
5
6
每袋的出厂价格(元)
10.5
10.9
11
11.5
12
12.5
月销售量(万袋)
2.2
2
1.9
1.8
1.5
1.4
(1)计算该食品加工厂这六个月内这种袋装食品平均每袋的出厂价格、平均月销售量和平均月销售收入;
(2)求每袋的出厂价格与月销售量的样本相关系数(精确到0.01);
(3)若,则认为相关性很强,试判断该食品加工厂研制的袋装食品每袋的出厂价格与月销售量是否有较强的相关性.
附:样本相关系数.
【答案】(1)11.4(元),(万元).
(2)-0.98
(3)该食品加工厂研制的袋装食品每袋的出厂价格与月销售量有较强的相关性.
【分析】(1)由表格中的数据求相应的平均值;
(2)利用样本相关系数公式计算;
(3)由样本相关系数的值判断相关性的强弱.
【详解】(1)由题表得,该食品加工厂这六个月内这种袋装食品平均每袋的出厂价格为(元).
平均月销售量为(万袋),
平均月销售收入为(万元).
(2)由题表及(1)得,
所以样本相关系数
.
(3)因为,所以该食品加工厂研制的袋装食品每袋的出厂价格与月销售量有较强的相关性.
重难点04 样本中心点
经验回归直线一定过点,点通常称为样本点的中心;
13.(25-26高三上·天津东丽·开学考试)已知变量和满足经验回归方程,且变量和之间的一组相关数据如表所示,则下列说法错误的是( )
5
6
9
12
8
7
2.4
A. B.当时,
C.变量和呈负相关 D.该经验回归直线必过点
【答案】D
【分析】对A、D:借助线性回归方程必过样本中心点计算即可得;对B:将代入方程计算即可得;对C:借助回归方程的斜率即可得.
【详解】对于A,由表可得,,
因为经验回归直线必过样本中心点,
所以,解得,故A正确;
对于B,当时,,故B正确;
对于C,因为经验回归方程中,斜率,所以变量和呈负相关,故C正确;
对于D,该经验回归直线必过点为样本中心点,故D错误.
故选:D.
14.(24-25高二下·福建厦门·期末)已知变量的4组相关数据分别为,则关于的线性回归直线必经过点( )
A. B. C. D.
【答案】B
【分析】计算出样本中心点即可求解.
【详解】因为,
线性回归直线必经过样本中心点.
故选:B.
15.(24-25高二下·广东梅州·期末)我国新能源汽车的卓越性能赢得全球人民的信赖,某品牌新能源汽车凭借科研创新、广告宣传和可靠的售后保障,在全球赢得了很好的营销局面,下表为该品牌新能源汽车的科研经费投入和全球市场规模统计.
科研经费(单位:百亿元)
2
4
6
12
16
市场规模(单位:百万辆)
1
1.5
2
3
3.5
如此得到y关于x的经验回归方程:,估计当该品牌新能源汽车的科研经费投入20(百亿元)时,全球市场规模将达到( )百万辆.
A.4 B.4.14 C.4.36 D.4.58
【答案】C
【分析】求出样本中心代入方程可得值,即可根据代入求解.
【详解】由表中数据可得,
故样本中心为,
故,
故当时,,
故选:C
16.(24-25高二下·陕西渭南·期末)2023年第5届藏博会在拉萨举行,藏博会上本地核桃油深受大家喜爱,某商家统计了最近5个月销量,如表所示:
时间x
1
2
3
4
5
销售量y/万瓶
5.7
4.8
3.8
3.2
2.5
若y与x线性相关,且线性回归方程为,则下列说法不正确的是( )
A.由题中数据可知,变量y与x负相关 B.样本中心点为
C.可以预测当时销量约为1.8万瓶 D.线性回归方程中
【答案】C
【分析】对于A,利用表中的数据变化情况分析判断,对于B,利用计算平均数即可求出样本中心点,对于C,利用回归方程可求出预测值,对于D,利用回归方程一定过样本中心点即可求解.
【详解】对于A,从表中的数据看,随的增大而减小,所以变量负相关,所以A正确,
对于B,,则样本中心点为,所以B正确,
对于C,当时,,
所以可以预测当时销量约为1.6万瓶,所以C错误,
对于D,由选项B可得,得,所以D正确.
故选:C
17.(24-25高二下·湖北黄冈·期末)已知由一组样本数据确定的经验回归方程为,且.发现有两对数据与误差较大,去掉这两对数据后重新求得经验回归方程为,则( )
A.2 B.1.6 C.7.4 D.0.8
【答案】C
【分析】依据回归方程必过样本中心点,代入计算即可得结果.
【详解】根据可知,因此经验回归方程必过,
易知去掉与的两组数据的平均值为,则剩余数据均值不变,
因此新求得经验回归方程也过,
即可得,解得.
故选:C
重难点05 线性回归方程
最小二乘法
将=x+称为Y关于x的经验回归方程,也称经验回归函数或经验回归公式,其图形称为经验回归直线,这种求经验回归方程的方法叫做最小二乘法,求得的,叫做b,a的最小二乘估计,其中
,=-.
18.(25-26高三上·云南曲靖·阶段练习)根据统计数据和研究报告,2025年中国新能源汽车产销呈现强劲增长态势,渗透率(渗透率=新能源汽车销量÷当月汽车总销量)持续攀升,行业格局加速分化.2025年3月新能源汽车渗透率首次超过,2025年1月至6月,全国新能源汽车的渗透率统计如下:
2025年1月至6月新能源汽车渗透率统计表
月份
1
2
3
4
5
6
渗透率
41.4
49.4
51.1
51.5
53.0
53.3
(1)2025年6月全国汽车销量为208.4万辆,计算该月新能源汽车的销量(精确到0.1).
(2)根据以上数据,建立y关于月份x的经验回归方程,并预测2025年7月新能源汽车的渗透率.
(3)实际7月新能源汽车的渗透率为,请:
①结合预测值分析误差原因;
②提出改进模型的建议.
(参考数据及公式:,.)
【答案】(1)111.1万辆
(2),
(3)①答案见解析;②答案见解析
【分析】(1)根据条件,利用新能源汽车销量汽车总销量渗透率,即可求解;
(2)先计算出,结合条件,可求出,即可求解;
(3)①结合(2)中结果和实际情况,即可作出判断;②根据实际情况,即可提出建议.
【详解】(1)因为新能源汽车销量汽车总销量渗透率,则(万辆),
所以2025年6月新能源汽车的销量约为111.1万辆.
(2)因为,
又,所以,
所以回归方程为,
令,则,
所以7月新能源汽车的渗透率的估计值为.
(3)①估计值与实际值的绝对误差为,估计值偏高,
产生误差的原因是:模型局限性;渗透率超过后,增长自然放缓;
线性模型假设“增速永远不变”,但实际增长会先快后慢.
②改进建议:用非线性模型替代线性回归模型(例:,逻辑函数模型等);
用减速增长模型,体现“先快后慢”规律.
19.(2025·广东广州·模拟预测)经验表明,一般树的胸径(树的主干在地面以上m处的直径)越大,树就越高.由于测量树高比测量胸径困难,因此研究人员希望由胸径预测树高.在研究树高与胸径之间的关系时,某林场收集了某种树的一些数据,并根据数据作出如下的散点图.
经计算得,,,,.
(1)推断两个变量是否线性相关,计算样本相关系数(精确到),并推断它们的相关程度;
(2)试根据以上数据建立树高关于胸径的经验回归方程(系数精确到),并预测胸径为cm的树高.
附:相关系数,回归方程中,,.
【答案】(1)两个变量线性相关;相关性较强.
(2);m.
【分析】(1)根据树高与胸径的散点图判断它们是否线性相关,再通过相关系数判断它们相关的程度;
(2)根据最小二乘法估计计算经验回归方程的系数,得到经验回归方程,再用经验回归方程做出预测.
【详解】(1)根据树高与树的胸径的散点图,可判断两个变量是线性相关.
根据题中所给数据,得,,.
所以.
由于的值接近于1,故相关性较强.
故两个变量线性相关,且相关程度较强.
(2)由(1)知,,.
所以,.
所以经验回归方程为.
当时,,即树高的预测值大约为m.
故树高关于胸径的经验回归方程为,预测胸径为cm的树高为m.
20.(25-26高三上·山东青岛·开学考试)下表是某公司从2020年至2024年某种产品盈利额的近似值(单位:万元)
年份
2020
2021
2022
2023
2024
年份代号
1
2
3
4
5
盈利额
50
56
64
72
83
(1)求关于的相关系数的值(精确到0.001),并判断它们是否具有较强的线性相关关系(如果,则认为与的线性相关关系较强,否则认为线性相关关系较弱);
(2)求关于的线性回归方程,并预测2025年该种产品的盈利额.
附:
①相关系数;
②经验回归方程中的和的最小二乘估计公式为
③.
【答案】(1),因为,所以与具有较强的线性相关关系;
(2),万元.
【分析】(1)利用给定的相关系数公式计算相关系数,通过与比较判断线性相关关系强弱;
(2)根据最小二乘估计公式计算线性回归方程的系数和,得到线性回归方程,最后利用该方程进行预测.
【详解】(1)已知,,则,
,则,
,
,所以,
已知,,
将以上值代入相关系数公式,
可得:,
因为,所以与具有较强的线性相关关系.
(2)根据,
而,,
所以.
由,已知,,,则.
所以关于的线性回归方程为.
2025年年份代号,将代入线性回归方程(万元).
21.(25-26高三上·广西南宁·阶段练习)前几年随着网购的普及,线下零售遭遇挑战,但随着新零售模式的不断出现,零售行业近几年呈现增长趋势,下表为2021~2024年百货零售业的销售额(单位:亿元,数据经过处理,1~4分别对应2021~2024年)
年份代码
1
2
3
4
销售额
95
165
230
310
(1)建立关于的回归方程,并预测2025年我国百货零售业的销售额;
(2)从2021~2024年这4年的百货零售业销售额及2025年预测销售额这5个数据中任取2个数据,求这2个数据之差的绝对值大于200亿元的概率.
参考数据:,
参考公式:回归方程中斜率和截距的最小二乘估计公式分别为
【答案】(1),377.5
(2)
【分析】(1)由最小二乘法即可求解,
(2)列举所有情况,即可根据古典概型的概率公式求解.
【详解】(1)由题意可知,
故
故,
故关于的回归方程为,
当时,.
(2)从2021~2024年这4年的百货零售业销售额及2025年预测销售额这5个数据中任取2个数据,所有的情况有
共有10种情况,
则这2个数据之差的绝对值大于200亿元的有,共有3种情况,
故概率为
22.(25-26高三上·安徽蚌埠·开学考试)7月1日,电影《哪吒之魔童闹海》(以下简称《哪吒2》在中国内地电影院线正式下映,结束了自今年1月29日以来153天的线下放映.据统计,《哪吒2》在中国内地最终斩获154.4亿元票房,总观影人次3.24亿,两项数据均创下中国影史纪录,并遥遥领先第二名,成为了又一部现象级电影.下表统计了《哪吒2》上映前15天累计票房到达(单位:亿元)与所用时间(单位:天)的数据:
累计票房
20
40
60
80
100
用时
4
7
9
10
15
(1)利用表中的数据,计算相关系数(结果精确到0.01),并推断两个变量的线性相关程度;
(2)求关于的经验回归方程(系数精确到0.01),并预测153天时的累计票房,判断这种预测方法是否合理.
参考公式:经验回归方程,其中.
相关系数.
参考数据:.
【答案】(1)两个变量具有很强的相关程度
(2),预测153天时的累计票房为1151.56亿元,该预测方法不合理
【分析】(1)先计算,代入相关系数公式计算即可;
(2)先计算,进而得经验回归方程,令,代入回归方程即可求解.
【详解】(1)由题意有,
则
所以两个变量具有很强的相关程度.
(2)由题意有,
所求经验回归方程为,
令,得,
预测153天时的累计票房为1151.56亿元,远超过实际票房,故该预测方法不合理.
重难点06残差
(1)残差
对于响应变量Y,通过观测得到的数据称为观测值,通过经验回归方程得到的称为预测值,观测值减去预测值称为残差.
(2)残差分析
残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果,以及判断原始数据中是否存在可疑数据等,这方面工作称为残差分析.通过观察残差图可以直观判断模型是否满足一元线性回归模型中对随机误差的假设,那残差应是均值为,方差为的随机变量的观测值.
(3)残差图法
作图时纵坐标为残差,横坐标可以选为样本编号,或身高数据,或体重估计值等,这样作出的图形称为残差图.在残差图中,残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,这样的带状区域的宽度越窄,说明模型拟合精度越高,回归方程的预报精度越高.
(4)残差平方和法
残差平方和越小,模型的拟合效果越好.
23.(24-25高二下·山东淄博·阶段练习)已知某产品的色度y和色差x之间满足线性相关关系,且现有一对测量数据为,则该数据的残差为( )
色差x
色度y
15
18
19
20
A. B. C.0.6 D.0.76
【答案】C
【分析】求得样本中心代入回归方程后,将代入回归方程,求出预测值,从而求出残差.
【详解】因为,,
所以样本中心为,,
即色度y和色差x之间满足线性回归方程为:,
当时,,
故残差为.
故选:C.
24.(2025·海南·模拟预测)已知由样本数据组成的一个样本,得到经验回归方程为,且,增加两个样本点和后,得到新样本的经验回归方程为.在新的经验回归方程下,样本的残差为( )
A. B. C. D.2
【答案】C
【分析】先计算新样本的,代入到新样本回归方程中,求出,再计算残差即可.
【详解】设新样本得均值为,
则,
又回归方程过均值点,所以,解得,
所以新样本的经验回归方程为,
预测值,
所以残差为.
故选:C.
25.(24-25高二下·山东·期中)已知变量x,y具有线性相关关系,根据样本点得到y关于x的经验回归方程为,则样本点的残差为( )
A. B. C.1 D.2
【答案】C
【分析】将代入,得到预测值,再由残差=观测值-预测值,即可得出答案
【详解】因为经验回归方程为,
所以当时,预测值,
又样本点为,
所以残差为
故选:C
26.(24-25高二下·江苏南京·阶段练习)某种产品的投入x(单位:万元)与收入y(单位:万元)之间的关系如下表所示:
x/万元
2
4
5
6
8
y/万元
30
40
60
50
70
若y与x的经验回归方程为,则相应于点的残差为( )
A. B.0.5 C. D.1.5
【答案】A
【分析】首先将点的横坐标代入回归方程中求出其预测值,然后根据残差的定义即可求出答案.
【详解】将代入回归方程中可得.
所以预测值为30.5,而实际值为30,
所以残差为.
故选:A.
27.(22-23高二下·山东青岛·期中)根据变量Y和x的成对样本数据,由一元线性回归模型得到经验回归模型,求得残差图.对于以下四幅残差图,满足一元线性回归模型中对随机误差假设的是( )
A. B.
C. D.
【答案】D
【分析】根据一元线性回归模型中对随机误差的假定进行判断.
【详解】根据一元线性回归模型中对随机误差的假定,残差应是均值为、方差为的随机变量的观测值.
对于A选项,残差与有线性关系,故A错误;
对于B选项,残差的方差不是一个常数,随着观测时间变大而变小,故B错;
对于C选项,残差与有非线性关系,故C错;
对于D选项,残差比较均匀地分布在以取值为的横轴为对称轴的水平带状区域内,故D正确.
故选:D.
28.(2025·江西新余·模拟预测)样本点数据,且大致呈线性分布,其经验回归方程为,若,数据的80%分位数为7,则当时,随机误差的残差为:( ).
A.-0.5 B.0.5 C.-1.5 D.1.5
【答案】B
【分析】根据题意计算出观测值与预估值,再计算残差即可.
【详解】将从小到大排列,,所以,预测值为,
所以残差为观测值-预测值=6-5.5=0.5
故选:B.
重难点07相关指数
在回归分析中,可以用来刻画回归的效果,它表示解释变量对于预报变量变化的贡献率,R2越接近于1,表示回归的效果越好.
模型的拟合效果用相关指数来表示,,表达式中,与经验回归方程无关,残差平方和与经验回归方程有关,因此,越大,意味着残差平方和越小,即模型的拟合效果越好;越小,残差平方和越大,即模型的拟合效果越差
注:决定系数与相关系数的联系与区别
①相关系数反映两个变量的相关关系的强弱及正相关或负相关,决定系数反映回归模型的拟合效果.
②在含有一个解释变量的线性模型中,决定系数的数值是相关系数的平方,其变化范围为,而相关系数的变化范围为.
③当相关系数接近于1时,说明两变量的相关性较强,当接近于0时,说明两变量的相关性较弱;而当接近于1时,说明经验回归方程的拟合效果较好.
29.(24-25高二下·山东聊城·期末)某同学根据一组数据作出如图所示的散点图,并对这组数据进行回归分析后发现遗漏了点,增加点后再次进行回归分析,得到的结果和原来相比( )
A.相关系数r变大 B.决定系数变小
C.残差平方和变小 D.不变
【答案】B
【分析】从图中分析得到加入点后,回归效果会变差,再由平均数,相关系数,决定系数,残差平方和及相关性的概念和性质作出判断即可.
【详解】增加点,从散点图中可以看出拟合效果变差;
越接近,相关程度越强,拟合效果越好,由于两个变量成正相关,所以相关系数变小;故A错误;
决定系数越接近,拟合效果越好,所以决定系数变小,故B正确;
残差平方和越小,拟合效果越好,所以残差平方和变大;故C错误;
增加点前的的平均数为,增加点后的的平均数为,所以变大,故D错误.
故选:B
30.(24-25高二下·河南·期末)某团队尝试用回归模型甲、乙、丙、丁描述人的1000米跑步成绩与肺活量的关系,已知模型甲、乙、丙、丁对应的决定系数分别为0.14,0.17,0.72,0.45,则拟合效果最好的模型是( )
A.甲 B.乙 C.丙 D.丁
【答案】C
【分析】线性回归模型中越接近1,效果越好,即可得出答案.
【详解】越大,模型的拟合效果越好,因为,
所以模型丙拟合效果最好.
故选:C
31.(24-25高二下·山西·期中)下图为根据某组成对数据绘制的散点图,根据最小二乘法得到了经验回归直线1(实线)与经验回归曲线2(虚线)如图,并分别计算了两模型的决定系数,则( )
A. B.
C. D.
【答案】C
【分析】根据决定系数越大,拟合效果越好,结合图象即可判断
【详解】由图可知,模型2拟合效果更好,故.
故选:.
32.(23-24高二下·河北石家庄·期末)已知一组观测值,,…,满足,若恒为0,则( )
A.0 B.0.5 C.0.9 D.1
【答案】D
【分析】由恒为0,可得,再结合公式可求.
【详解】由恒为0,知恒成立,即恒成立,
故.
故选:D.
重难点08非线性回归
非线性问题处理策略要通过换元、取对数等手段把非线性问题转化为线性问题.
33.(24-25高二下·广东中山·阶段练习)红铃虫(Pectinophora gossypiella)是棉花的主要害虫之一,其产卵数与温度有关.现收集到一只红铃虫的产卵数y(个)和温度x(℃)的8组观测数据,制成图1所示的散点图.现用两种模型①,②分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图.
根据收集到的数据,计算得到如下值:表中;;;;
(1)根据残差图,比较模型①、②的拟合效果,应选择哪个模型?并说明理由;
(2)根据(1)中所选择的模型,求出y关于x的回归方程(系数精确到0.01),并求温度为34℃时,产卵数y的预报值.
(参考数据:,,,)
附:对于一组数据,,…,,其回归直线的斜率和截距的最小二乘估计分别为,.
25
2.89
646
168
422688
48.48
70308
【答案】(1)应该选择模型①,理由见解析
(2);250个
【分析】(1)由模型①的残差点比较均匀落在水平的带状区域以及带状区域的宽度窄,所以选择模型①比较合适;
(2)令,z与温度x可以用线性回归方程来拟合,则,利用公式和数据求出和,则可以得到y关于温度x的回归方程,当时,可求出产卵数y的预报值.
【详解】(1)应该选择模型①.
由于模型①残差点比较均匀地落在水平的带状区域中,
且带状区域的宽度比模型②带状宽度窄,所以模型①的拟合精度更高,
回归方程的预报精度相应就会越高,故选模型①比较合适
(2)令,z与温度x可以用线性回归方程来拟合,则.
,
所以,
则z关于x的线性回归方程为.
于是有,
所以产卵数y关于温度x的回归方程为
当时,(个).
所以,在气温在34℃时,一个红铃虫的产卵数的预报值为250个
34.(2023·江苏镇江·三模)经观测,长江中某鱼类的产卵数与温度有关,现将收集到的温度(单位:)和产卵数的10组观测数据作了初步处理,得到如图所示的散点图及一些统计量表.
360
54.5
1360
44
384
3
588
32
6430
表中,,.
(1)根据散点图判断,,与哪一个适宜作为与之间的回归方程模型(给出判断即可,不必说明理由),并求出关于的回归方程;
(2)某兴趣小组抽取两批鱼卵,已知第一批中共有5个鱼卵,其中“死卵”有2个;第二批中共有6个鱼卵,其中“死卵”有3个.现随机挑选一批,然后从该批次中随机取出2个鱼卵,求取出“死卵”个数的分布列及数学期望.
附:对于一组数据,,…,,其回归直线的斜率和截距的最小二乘估计分别为,.
【答案】(1)适宜作为与之间的回归方程模型,
(2)答案见解析,.
【分析】(1)根据散点图确定模型,代入数据计算即可;
(2)确定随机变量取值,结合全概率公式计算概率,进而可求解;
【详解】(1)根据散点图判断,看出样本点分布在一条指数函数的周围,所以适宜作为与之间的回归方程模型.
令,则,
,
,
所以,
所以关于的回归方程为.
(2)由题意设随机挑选一批,取出两个鱼卵,其中“死卵”个数为,则的可能取值为,,,
设“所取两个鱼卵来自第批”,
所以,
设“所取两个鱼卵有个‘死卵’”,
由全概率公式得
,
,
,
所以取出“死卵”个数的分布列为
0
1
2
所以,
所以取出“死卵”个数的数学期望为.
35.(23-24高二下·湖北·期末)某乡村企业希望通过技术革新增加产品收益,根据市场调研,技术革新投入经费(单位:万元)和增加收益(单位:万元)的数据如下表:
4
6
8
10
12
27
42
55
56
60
为了进一步了解技术革新投入经费对增加收益的影响,通过对表中数据进行分析,分别提出了两个回归模型:①,②.
(1)根据以上数据,计算模型①中与的相关系数(结果精确到0.01);
(2)若,则选择模型①;否则选择模型②.根据(1)的结果,试建立增加收益关于技术革新投入经费的回归模型,并预测时的值(结果精确到0.01).
附:i)回归直线的斜率、截距的最小二乘估计以及相关系数分别为:,,
ii)参考数据:设,,,,,.
【答案】(1)
(2),约为万元
【分析】(1)根据所给数据求出,,,,,即可求出相关系数;
(2)根据(1)的结论,可判断选择模型②,令,求出关于的线性回归方程,即可求出关于的经验方程,再代入计算可得.
【详解】(1)因为,
,
所以,
,
,
模型①中,相关系数,
(2)因为,所以选择模型②,
令,先建立关于的线性回归方程,
由于,
,
所以关于的线性回归方程为,
即,
当时,(万元),
所以若投入经费万元,收益约为万元.
36.(2024·浙江台州·二模)台州是全国三大电动车生产基地之一,拥有完整的产业链和突出的设计优势.某电动车公司为了抢占更多的市场份额,计划加大广告投入、该公司近5年的年广告费(单位:百万元)和年销售量(单位:百万辆)关系如图所示:令,数据经过初步处理得:
44
4.8
10
40.3
1.612
19.5
8.06
现有①和②两种方案作为年销售量y关于年广告费x的回归分析模型,其中a,b,m,n均为常数.
(1)请从相关系数的角度,分析哪一个模型拟合程度更好?
(2)根据(1)的分析选取拟合程度更好的回归分析模型及表中数据,求出y关于x的回归方程,并预测年广告费为6(百万元)时,产品的年销售量是多少?
(3)该公司生产的电动车毛利润为每辆200元(不含广告费、研发经费).该公司在加大广告投入的同时也加大研发经费的投入,年研发经费为年广告费的199倍.电动车的年净利润受年广告费和年研发经费影响外还受随机变量影响,设随机变量服从正态分布,且满足.在(2)的条件下,求该公司年净利润的最大值大于1000(百万元)的概率.(年净利润=毛利润×年销售量-年广告费-年研发经费-随机变量).
附:①相关系数,
回归直线中公式分别为,;
②参考数据:,,,.
【答案】(1)模型②的拟合程度更好
(2),当年广告费为6(百万元)时,产品的销售量大概是13(百万辆)
(3)0.3
【分析】(1)分别求得模型①和②的相关系数,,然后比较得出结论;
(2)利用最小二乘法求解;
(3)由净利润为,求解.
【详解】(1)解:设模型①和②的相关系数分别为,.
由题意可得:,
.
所以,由相关系数的相关性质可得,模型②的拟合程度更好.
(2)因为,
又由,,
得,
所以,即回归方程为.
当时,,
因此当年广告费为6(百万元)时,产品的销售量大概是13(百万辆).
(3)净利润为,,
令,
所以.
可得在上为增函数,在上为减函数.
所以,
由题意得:,即,
,
即该公司年净利润大于1000(百万元)的概率为0.3.
37.(22-23高二下·江西萍乡·期中)某研发小组为了解年研发资金投入量(单位:亿元)对年销售额(单位:亿元)的影响,结合近10年的年研发资金投入量和年销售额的数据(),建立了两个函数模型:①,②,其中,,,均为常数,为自然对数的底数.设,,经过计算得如下数据.
20
66
770
200
14
460
4.20
3125000
0.308
21500
(1)设和的相关系数为,和的相关系数为,请从相关系数的角度,选择一个拟合程度更好的模型.
(2)根据(1)中选择的模型及表中数据,建立关于的线性回归方程(系数精确到0.01),根据线性回归方程,若当年的销售额大致为亿元,则估计当年的研发资金投入量为多少亿元.
参考公式:相关系数,
线性回归直线中斜率和截距的最小二乘法估计参数分别为,.
【答案】(1)模型的拟合程度更好
(2),8亿元
【分析】(1)根据题干所给数据求出相关系数为、即可判断;
(2)由(1)可得两边取对数可得,即,再由所给数据求出、,即可得到回归方程,再代入求出即可.
【详解】(1)由题意可知,
因为,所以从相关系数的角度,模型的拟合程度更好.
(2)因为,所以,即.
由题中数据可得,
则,从而关于的线性回归方程为,
故,即.
将年销售额亿元,代入,得,解得,
故估计当年的研发资金投入量为亿元.
重难点09分类变量与列联表
可通过计算列联表中|ad−bc|的值,值越大说明两分类变量有关系的可能性越大。也可利用等高堆积条形图直观判断,还可通过独立性检验,计算χ2的值并与临界值比较,从而推断两个分类变量是否有关系及判断的可靠程度
38.(24-25高二下·山西·期末)在统计中,研究两个分类变量之间的关联性时常用的图是( )
A.散点图 B.残差图 C.频率分布直方图 D.等高堆积条形图
【答案】D
【分析】根据统计图的适用对象即可求解.
【详解】在统计中,研究两个分类变量之间的关联性时常用的图是等高堆积条形图,
散点图是研究两个变量之间相关关系时用,残差是研究拟合效果时用到的,频率分布直方图是研究频率分布时用到的,
故选:D
39.(24-25高二下·宁夏银川·阶段练习)为考查、两种药物预防某疾病的效果,进行动物实验,分别得到如下等高条形图:根据图中信息,在下列各项中,说法最佳的一项是( )
A.药物的预防效果优于药物的预防效果
B.药物的预防效果优于药物的预防效果
C.药物、对该疾病均有显著的预防效果
D.药物、对该疾病均没有预防效果
【答案】B
【分析】根据等高条形图中的数据即可得出选项.
【详解】根据两个表中的等高条形图知,药物实验显示不服药与服药时患病差异较药物实验显示明显大,
所以药物的预防效果优于药物的预防效果,
故选:B.
40.(24-25高二·全国·课堂例题)一个列联表如下:
合计
35
45
7
合计
73
则表中,的值分别是 ( )
A.10,38 B.17,45 C.10,45 D.17,38
【答案】B
【分析】由列联表数据,列出等式即可求解;
【详解】由,得.
由,得.
由,得.
由,得.
故选:B
41.(24-25高三·上海·课堂例题)某村庄对该村内50名村民每年是否体检的情况进行了调查,统计数据如下表所示:
每年体检(人)
每年未体检(人)
合计(人)
老年人
7
年轻人
6
合计
50
已知抽取的村民中老年人、年轻人各25名,则对列联表数据的分析错误的是( )
A. B. C. D.
【答案】D
【分析】根据题意先得出的值,进而再得的值,进而可知的值.
【详解】因为抽取的村民中,老年人有25名,年轻人有25名,所以,
所以,A、B对;
所以,则对;
则错.
故选:.
42.(2023·四川达州·一模)四川省将从2022年秋季入学的高一年级学生开始实行高考综合改革,高考采用“3+1+2”模式,其中“1”为首选科目,即物理与历史二选一.某校为了解学生的首选意愿,对部分高一学生进行了抽样调查,制作出如下两个等高条形图,根据条形图信息,下列结论正确的是( )
A.样本中选择物理意愿的男生人数少于选择历史意愿的女生人数
B.样本中女生选择历史意愿的人数多于男生选择历史意愿的人数
C.样本中选择物理学科的人数较多
D.样本中男生人数少于女生人数
【答案】C
【分析】根据等高条形图的概念结合条件逐项分析即得.
【详解】根据等高条形图图1可知样本中选择物理学科的人数较多,故C正确;
根据等高条形图图2可知样本中男生人数多于女生人数,故D错误;
样本中选择物理学科的人数多于选择历史意愿的人数,而选择物理意愿的男生比例高,选择历史意愿的女生比例低,
所以样本中选择物理意愿的男生人数多于选择历史意愿的女生人数,故A错误;
样本中女生选择历史意愿的人数不一定多于男生选择历史意愿的人数,故B错误.
故选:C.
重难点10 独立性概念与计算
1.有关“相关的检验”
用χ2进行“相关的检验”步骤
①零假设:即先假设两变量间没关系.
②计算χ2:套用χ2的公式求得χ2值.
③查临界值:结合所给小概率值α查得相应的临界值xα.
④下结论:比较χ2与xα的大小,并作出结论.
2.有关“无关的检验”
运用独立性检验的方法
①列出2×2列联表,根据公式计算χ2.
②比较χ2与xα的大小作出结论.
43.(25-26高三上·湖北恩施·开学考试)根据分类变量与的观测数据,计算得到,依据小概率值()的独立性检验,则( )
A.变量与不独立
B.变量与独立
C.变量与不独立,这个结论犯错误的概率不超过0.1
D.变量与独立,这个结论犯错误的概率不超过0.1
【答案】B
【分析】根据独立性检验的概念可得正确的选项.
【详解】因为,所以在显著性水平下,
没有充分证据拒绝原假设,因此我们认为变量与是独立的,
故选:B
44.(25-26高二上·全国·单元测试)某班主任对全班50名学生进行了作业量的调查,数据如下表:
性别
作业量
大
不大
总计
男
18
9
27
女
8
15
23
总计
26
24
50
则推断“学生的性别与认为作业量大有关”的把握为( )
附表:
A. B. C. D.
【答案】A
【分析】由独立性检验知识可判断选项正误.
【详解】由独立性检验公式得,
所以推断“学生的性别与认为作业量大有关”的把握为.
故选:A
45.(25-26高三上·江苏镇江·开学考试)某医疗研究所为了检验某种血清能起到预防感冒的作用,把500名使用血清的人与另外500名未使用血清的人一年中的感冒记录作比较,利用列联表计算得的观测值.
附表:
0.15
0.10
0.05
0.025
0.010
2.072
2.706
3.841
5.024
6.635
则作出“这种血清能起到预防感冒的作用”出错的可能性不超过( )
A. B. C. D.
【答案】B
【分析】由独立性检验的原理的理解辨析可判断.
【详解】由题意知观测值,所以对照题中的附表可作出“这种血清能起到预防感冒的作用”出错的可能性不超过的结论.
故选:B
46.(25-26高二上·全国·单元测试)为了研究高中学生中性别与对乡村音乐态度(喜欢和不喜欢两种态度)的关系,运用2×2列联表进行独立性检验,得到的结论是有99%的把握认为性别与喜欢乡村音乐有关系,则的值可以为( )
A.2.853 B.3.841 C.6.758 D.6.451
【答案】C
【分析】由题意,对比选项即可得解.
【详解】有的把握认为性别与喜欢乡村音乐有关系,则.
故选:C.
47.(25-26高三上·吉林白城·开学考试)针对“中学生追星问题”,某校团委对“学生性别和中学生追星是否有关”作了一次调查,调查样本中女生人数是男生人数的,男生追星的人数占男生人数的,女生追星的人数占女生人数的,若在犯错误的概率不超过5%的前提下认为是否追星和性别有关,则调查样本中男生至少有( )
参考数据及公式如下:,
0.050
0.010
0.001
3.841
6.635
10.828
A.12人 B.11人 C.10人 D.18人
【答案】A
【分析】设男生人数为,根据独立性检验的原理,列出不等式,求出x的范围,结合题意确定其值,即可求得答案.
【详解】设男生人数为,则女生人数为,依题意可得列联表如下:
性别
追星
合计
喜欢追星
不喜欢追星
男生
女生
合计
若在犯错误的概率不超过5%的前提下认为是否喜欢追星和性别有关,则,
由,解得,
因为,为整数,所以若在犯错误的概率不超过5%的前提下认为是否喜欢追星和性别有关,
则x至少为12,即男生至少有12人.
故选:A.
重难点11独立性检验的实际应用
独立性检验解决实际问题的主要环节
①提出零假设H0:X和Y相互独立,并给出在问题中的解释.
②根据抽样数据整理出2×2列联表,计算χ2的值,并与临界值xα比较.
③根据检验规则得出推断结论.
④在X和Y不独立的情况下,根据需要,通过比较相应的频率,分析X和Y间的影响规律.
注:独立性检验和反证法:反证法不会出错,而独立性检验依据的是小概率事件几乎不发生.
48.(25-26高三上·贵州贵阳·阶段练习)某校生物科技班开展“核酸自组装”实验,记录200名学生在限制性末端配对实验中的操作表现:
组别
操作评级
合计
优
良
男生
35
100
女生
45
合计
200
(1)完成列联表,依据的独立性检验,能否认为学生组别与操作评级存在关联?
(2)在后续的“环状核酸构建”实验中,需处理条线性核酸片段:每条片段有两个末端;每次随机选取2个未配对的末端进行连接;连接后可能形成一个或多个环状结构,所有核酸片段末端连接完毕视为结束.
(i)当时,记随机变量为最终形成的环状结构数,求的分布列与数学期望;
(ii)求证:所有核酸片段连接成一个完整环状结构的概率为.
附:,其中.
0.05
0.01
0.005
0.001
3.841
6.635
7.879
10.828
【答案】(1)列联表答案见解析,能认为学生组别与操作评级有关联
(2)(i)分布列答案见解析,数学期望为;(ii)证明见解析
【分析】(1)补充列联表,再计算卡方值比较即可;
(2)(i)利用组合公式和古典概型公式计算概率,得到分布列,利用公式计算数学期望即可;(ii)记条线性核酸片段连接后可形成环状结构的种数为,利用累乘法得,求得对个末端进行任意2个末端连接的种数,再由算出概率即可证得.
【详解】(1)
组别
操作评级
合计
优
良
男生
65
35
100
女生
45
55
100
合计
110
90
200
零假设:组别与操作评级没有关联,
经计算得,
依据小概率值的独立性检验,推断不成立,
即认为组别与操作评级有关联.
(2)(i)由题知的所有可能取值为,
,
其分布列为
1
2
3
.
(ii)记末端编号为,可与末端1连接形成一个环状结构的末端有种可能,
假设末端1与末端3连接,那么相当于剩下的条线性核酸片段进行连接,
记条线性核酸片段连接后可形成环状结构的种数为,
那么经过一次连接后,剩下的条线性核酸片段连接后可形成环状结构的种数为,
则,即,
,
又也满足上式,,
对个末端进行任意2个末端连接,
共有种,
.
即所有核酸片段连接成一个完整环状结构的概率为.
49.(25-26高三上·河北·开学考试)人工智能对人们的生活有较大的影响,为了让教师更加重视人工智能,某校随机抽取30名男教师和20名女教师参加学校组织的“人工智能”相关知识问卷调查(满分100分),若分数为80分及以上的为优秀,其他为非优秀,统计并得到如下列联表:
男教师
女教师
总计
优秀
20
10
30
非优秀
10
10
20
总计
30
20
50
(1)根据小概率值的独立性检验,能否认为这次成绩是否优秀与性别有关?
(2)从样本中成绩优秀的30名教师中,随机抽取2人进行调研,记抽取的2人中女教师的人数为,求的分布列和数学期望.
附:,其中.
0.1
0.05
0.01
0.001
2.706
3.841
6.635
10.828
【答案】(1)不能认为这次成绩是否优秀与性别有关
(2)分布列见解析,
【分析】(1)根据题意,代入的计算公式,根据独立性检验的概念求解即可;
(2)根据题意随机变量的可能取值为0,1,2,分别利用古典概型的概率公式结合组合知识计算出对应的概率,进而可解出答案.
【详解】(1)零假设:这次成绩是否优秀与性别无关,
由列联表中的数据,可得,
因为,所以根据判断,我们可以推断成立,
即不能认为这次成绩是否优秀与性别有关.
(2)由题意得,随机变量的可能取值为0,1,2,
则;;,
所以随机变量的分布列为:
0
1
2
所以期望为.
50.(25-26高三上·黑龙江佳木斯·开学考试)为了解某地初中学生体育锻炼时长与学业成绩的关系,从该地区29000名学生中随机抽取580人,得到日均体育锻炼时长(单位:小时)与学业成绩的数据如表所示:
学业
成绩
日均体育锻炼时长/小时
优秀
5
44
42
3
1
不优秀
134
147
137
40
27
(1)该地区29000名学生中日均体育锻炼时长不小于1小时的人数约为多少?
(2)估计该地区初中学生日均体育锻炼时长(精确到0.1小时);
(3)依据小概率值的独立性检验能否认为学业成绩优秀与日均体育锻炼时长不小于1小时且小于2小时有关?
附:.
【答案】(1)12500
(2)0.9小时
(3)认为学业成绩优秀与日均体育锻炼时长不小于1小时且小于2小时有关,该推断犯错误的概率不超过0.05
【分析】(1)求出相关占比,乘以总人数即可;
(2)根据平均数的计算公式即可得到答案;
(3)作出列联表,再提出零假设,计算卡方值和临界值比较大小即可得到结论.
【详解】(1)抽取的样本中日均体育锻炼时长不小于1小时的人数为42+3+1+137+40+27=250.
设该地区29000名学生中有人的日均体育锻炼时长不小于1小时,则,
解得.
故该地区29000名学生中日均体育锻炼时长不小于1小时的人数约为12500.
(2)依题意得,该地区初中学生日均体育锻炼时长为(0.25×139+0.75×191+1.25×179+1.75.
所以该地区初中学生日均体育锻炼时长约为0.9小时.
(3)对数据重新组合,得到列联表
学业
成绩
日均体育锻炼时长/小时
其他
合计
优秀
45
50
95
不优秀
177
308
485
合计
222
358
580
提出原假设:学业成绩优秀与日均体育锻炼时长不小于1小时且小于2小时无关.
,
我们推断不成立,即认为学业成绩优秀与日均体育锻炼时长不小于1小时且小于2小时有关,该推断犯错误的概率不超过0.05.
51.(24-25高二下·上海·阶段练习)已知某区组建了一支人的志愿者队伍,并由其中人组成“志愿模范队”.经过一年的实践,全队共有人的周平均服务时长超过2小时,其中有人来自“志愿模范队”,如下表所示.
是“志愿模范队”成员
不是“志愿模范队”成员
总计
周平均服务时长超过2小时
周平均服务时长不超过2小时
总计
(1)已知一名志愿者是“志愿模范队”成员,求其周平均服务时长超过2小时的概率.
(2)请完成列联表,并根据表中数据回答:是否有的把握认为“是‘志愿模范队’成员”与“周平均服务时长超过2小时”有关系?
附录:,其中.
【答案】(1)
(2)答案见解析.
【分析】(1)根据等可能性事件的概率和条件概率公式直接可得.
(2)根据独立性检验直接可得.
【详解】(1)设事件表示志愿者是“志愿模范队”成员的事件,事件表示志愿者周平均服务时长超过2小时的事件.
由题可知,,,因为每个志愿者被抽到的可能性相等,
根据古典概型的概率公式得,,.
由条件概率公式可得,则.
故一名志愿者是“志愿模范队”成员的条件下其周平均服务时长超过2小时的概率为.
(2)由题可得如下列联表:
是“志愿模范队”成员
不是“志愿模范队”成员
总计
周平均服务时长超过2小时
周平均服务时长不超过2小时
总计
提出零假设:是否‘志愿模范队’成员”与“周平均服务时长超过2小时”无关,确定显著性水平.
可得,由于,拒绝零假设,
故有的把握认为“是‘志愿模范队’成员”与“周平均服务时长超过2小时”有关.
52.(25-26高三上·安徽合肥·开学考试)随着科技的发展,AI技术已经深度介入普通人的生活,正在改变着人们的生活和工作.为了调查AI技术在普通人中的使用情况,一调查机构对此进行了调查,并从参与调查的市民中分别抽取男,女各100人进行统计分析,整理得到如下列联表:
性别
经常借助AI技术
不经常借助AI技术
合计
男
女
50
合计
120
(1)完成上述列联表,并根据小概率值的独立性检验,分析是否经常借助AI技术与性别有关联;
(2)采用按比例分配的分层随机抽样的方法,从表中不经常借助AI技术的人中抽取8人,再从这8人中随机抽取3人,记3人中男性人数为随机变量,求的分布列和数学期望.
参考公式:,.
0.050
0.010
0.005
3.841
6.635
7.879
【答案】(1)填表见解析;有关联
(2)分布列见解析;期望为
【分析】(1)根据题意完成表格,然后利用公式计算的值进行分析即可;
(2)根据题意先利用分层抽样的方法抽取男、女生人数,找出随机变量的值,计算出各值对应的概率,计算出数学期望值即可.
【详解】(1)列联表为:
性别
经常借助AI技术
不经常借助AI技术
合计
男
70
30
100
女
50
50
100
合计
120
80
200
零假设为:是否经常借助AI技术与性别无关联.
根据表中数据,得:
,
根据小概率值的独立性检验,可以推断不成立,即是否经常借助AI技术与性别有关联,这种推断犯错误的概率不超过0.005.
(2)采用按比例分配的分层随机抽样,
男性抽取人数为,女性抽取人数为,
所以随机变量的可能取值为,
,
,
,
,
所以的分布列为:
0
1
2
3
所以.
53.(2025·全国·模拟预测)在卡塔尔世界杯的开幕式上中国元素随处可见.从体育场建设到电力保障,从赛场内的裁判到赛场外的吉祥物,……,中国制造为世界杯提供了强有力的支持.国内也再次掀起足球热潮.某地足球协会组建球队参加业余比赛.该足球队教练组对球员的使用是依据数据分析,为了调查球员乙对球队的贡献,作出如下数据统计(乙参加过的比赛均分出了胜负):
乙
球队
总计
胜
负
未参加比赛
30
70
参加比赛
10
总计
70
(1)根据小概率值的独立性检验,能否认为该球队胜利与乙球员参赛有关联?
(2)根据以往的数据统计,甲球员能够胜任边锋、中锋、后腰以及后卫四个位置,且出场率分别为:,当出任边锋、中锋、后腰以及后卫时,球队输球的概率依次为:0.4,0.3,0.4,0.2.则:
①当甲球员参加比赛时,求球队某场比赛输球的概率;
②当甲球员参加比赛时,在球队输了某场比赛的条件下,求甲球员担任边锋的概率;
③如果你是教练员,应用概率统计有关知识,该如何使用甲球员?
附表及公式:
0.15
0.10
0.05
0.025
0.010
0.005
0.001
2.072
2.706
3.841
5.024
6.635
7.879
10.828
.
【答案】(1)认为该球队胜利与乙球员参赛有关联;
(2)①0.34;②;③答案见解析.
【分析】(1)应用卡方公式计算卡方值,结合独立检验的基本思想得结论;
(2)①应用全概率公式求概率;②由贝叶斯公式及条件概率公式求概率;③应用贝叶斯公式及条件概率公式求概率,并比较大小,即可得结论.
【详解】(1)依题意,,
零假设为:球队胜利与乙球员参赛无关,
则观测值,
根据小概率值的独立性检验,我们推断不成立,
即认为该球队胜利与乙球员参赛有关联,此推断犯错误的概率不超过0.001;
(2)①设表示“甲球员担当边锋”;表示“甲球员担当中锋”;表示“甲球员担当后腰”;表示“甲球员担当后卫”;表示“球队输掉某场比赛”.
则
.
②;
③因为,
,
,
所以最小,因为当甲球员担任后卫时,球队输球的概率 在四个位置中是最小的,所以应该多让甲球员担当后卫.
12 / 49
学科网(北京)股份有限公司
$