第八章 成对数据的统计分析(高效培优讲义)数学沪教版选择性必修第二册
2026-03-13
|
2份
|
55页
|
521人阅读
|
20人下载
精品
内容正文:
第八章 成对数据的统计分析
教学目标
1. 熟练掌握成对数据的统计分析全章知识点;
2. 熟练运用全章知识点解决相应的题目题型;
3. 通过学习本章知识点及解决相关题型锻炼逻辑思维,解决复杂问题的能力等。
教学重难点
1. 重点
(1)熟练运用相关系数与最小二乘法公式的各种问题;
(2)熟练运用卡方公式的各种问题;
2. 难点
(1)灵活分析成对数据的统计分析与其他知识结合等问题;
考点01 成对数据的相关分析
一、成对数据与相关分析
把这样来自同一对象的两组数据称为成对数据;研究成对数据相关性的方法称为相关分析.
相关关系与函数关系的异同点
函数关系
相关关系
相同点
都是两个变量间的关系
不同点
是一种确定关系
是一种非确定关系
是一种因果关系
不一定是因果关系,也可能是伴随关系
二、散点图与变量的相关关系
(1)散点图:为直观地描述成对样本数据中两个变量间的关系,用横轴表示其中的一个变量,纵轴表示另一个变量,则成对样本数据都可以用直角坐标系中的点表示出来,由这些点组成的统计图叫做散点图.
(2)散点图的作用
如果散点图中变量的对应点分布在某条曲线的附近,我们就可以得出结论:这两个变量具有相关性,如图(1)(2).如果变量的对应点分布没有规律,我们就可以得出结论:这两个变量不具有相关性,如图(3).
(3)正相关与负相关
从整体上看,当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势,我们就称这两个变量正相关;当一个变量的值增加时,另一个变量的相应值呈现减小的趋势,则称这两个变量负相关.
(4)线性相关与曲线相关
一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们就称这两个变量线性相关.
一般地,如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量非线性相关或曲线相关.
三、样本相关系数
(1)一般地,如果变量x和y正相关,那么关于均值平移后的大多数散点将分布在第一象限、第三象限,对应的成对数据同号的居多;如果变量x和y负相关,那么关于均值平移后的大多数散点将分布在第二象限、第四象限,对应的成对数据异号的居多.
(2)样本相关系数r=.
(3)样本相关系数r的取值范围为[-1,1].
当|r|越接近1时,成对样本数据的线性相关程度越强;
当|r|越接近0时,成对样本数据的线性相关程度越弱.
【特别提醒】 样本相关系数r是一个描述成对样本数据的数字特征,它的正负性可以反映成对样本数据的变化特征:
当r>0时,称成对样本数据正相关;
当r<0时,称成对样本数据负相关;
当|r|=1时,表明成对样本数据都在一条直线上,即两个变量之间满足一种线性关系.
当r=0时,只表明成对样本数据间没有线性相关关系,但不排除它们之间有其他相关关系.
【题型1】有一散点图如图,在5个数据中去掉后,下列说法正确的是( )
A.变量与变量的线性相关性变弱 B.数据的方差变大
C.相关系数变小 D.离差平方和变小
【题型2】若甲、乙、丙、丁四组数据的相关系数分别为,,0.23,0.88,则在这四组数据中,线性相关性最强的是( )
A.甲组 B.乙组 C.丙组 D.丁组
【题型3】对四组数据进行统计,获得如图所示的散点图,关于其样本相关系数的比较,正确的是( )
A. B.
C. D.
【题型4】对四组数据进行统计,获得如图所示的散点图,关于其样本相关系数的比较,正确的是( )
A. B.
C. D.
【题型5】下面是四个散点图中的点的分布状态,直观上判断两个变量之间具有线性相关关系的是 (填序号).
【题型6】学习于才干信仰,犹如运动于健康体魄,持之已久、行之愈远愈受益.为实现中华民族伟大复兴,全国各行各业掀起了“学习强国”的高潮.某老师很喜欢“学习强国”中“挑战答题”模块,他记录了自己连续七天每天一次最多答对的题数如下表:
天数x
1
2
3
4
5
6
7
一次最多答对题数y
12
15
16
18
21
24
27
参考数据:,,,,,
相关系数
由表中数据可知该老师每天一次最多答对题数y与天数x之间是 相关(填“正”或“负”),其相关系数 (结果保留两位小数)
【题型7】某种机械设备随着使用年限的增加,它的使用功能逐渐减退,使用价值逐年减少,通常把它使用价值逐年减少的“量”换算成费用,称之为“失效费”.某种机械设备的使用年限x(单位:年)与失效费y(单位:万元)的统计数据如下表所示:
使用年限x(单位:年)
1
2
3
4
5
6
7
失效费y(单位:万元)
2.90
3.30
3.60
4.40
4.80
5.20
5.90
由上表数据可知,y与x的相关系数为 .(精确到0.01,参考数据:,,)
【题型8】为分析肥胖程度对总胆固醇与空腹血糖的影响,在肥胖人群中随机抽出8人,他们的肥胖指数BMI值、总胆固醇TC指标值(单位:mmol/L),空腹血糖GLU指标值(单位:mmol/L)如表所示:
人员编号
1
2
3
4
5
6
7
8
BMI值x
25
27
30
32
33
35
40
42
TC指标值y
5.3
5.4
5.5
5.6
5.7
6.5
6.9
7.1
GLU指标值z
6.7
7.2
7.3
8.0
8.1
8.6
9.0
9.1
用变量y与x,z与x的相关系数,分别说明TC指标值与BMI值、GLU指标值与BMI值的相关程度.
参考公式:
相关系数,
参考数据:,,,,,,,.
【题型9】为了对2020年某校月考成绩进行分析,在60分以上的全体同学中随机抽取8位,他们的数学、物理成绩对应如下表:
学生编号
1
2
3
4
5
6
7
8
数学成绩
68
72
78
81
85
88
91
93
物理成绩
70
66
81
83
79
80
92
89
用变量与的样本相关系数(精确到0.01)说明物理成绩与数学成绩的线性相关程度的强弱,并说明它们的变化趋势特征.
参考数据:,.
【题型10】广阳岛,作为长江上游最大的江心岛,其面积在枯水期约为10平方公里.自2017年起,重庆市开始对广阳岛进行系统的生态修复,摒弃了曾经的商业开发计划,转而建设“长江风景眼,重庆生态岛”.经过数年的努力,广阳岛的生态得到了显著的改善,不仅植被丰富,生物多样性也得到了极大的提升.据监测,岛上的鸟类从生态修复前的124种增加到213种,其中包括中华秋沙鸭、游隼、白琵鹭等珍稀鸟类.为调查广阳岛某种鸟的数量,将其分成面积相近的50个地块,从这些地块中用简单随机抽样的方法抽取5个作为样区,调查得到样本数据,其中和分别表示第个样区的植被覆盖面积(单位:平方公里)和这种鸟的数量.
1
2
3
4
5
0.171
0.152
0.192
0.189
0.196
12
10
16
14
18
(1)求广阳岛这种鸟数量的估计值(这种鸟数量的估计值等于样区这种鸟数量的平均数乘以地块数);
(2)求样本的相关系数(精确到0.01);
(3)根据统计资料,各地块间植物覆盖面积差异较大.为提高样本的代表性以获得广阳岛这种鸟数量更准确的估计,请给出一种你认为更合理的抽样方法,并说明理由.
附:相关系数,,.
考点02 成对数据的相关分析
一、离差的概念与作用
一般地,设给定一组有线性相关关系的成对数据、、…、和一个线性方程(或称线性模型); ①
如何描述数据与此线性方程的贴近度呢?
当变量取值(=1,2,…,)时,令,它是变量与对应的理想值;
但数据中的与不一定相同,它们的差称为在处的离差;
当时称为正离差,而当时称为负离差;
显然,离差直观地描述了单对数据与线性方程①的贴近度;
二、拟合误差
可以像计算方差那样,用离差的平方和Q=(yi-)2来刻画直线与点之间的拟合程度;称为拟合误差;它是一个很好的描述数据与线性方程①贴近度的指标;
离差平方和:离差平方和(yi-)2越小,模型的拟合效果越好.
三、回归分析及其相关概念
我们把拟合误差取得最小值时得到的线性方程(线性模型)记为
并称之为变量随波动的回归方程或回归模型,其中自变量称为解释变量,因变量称为反应变量;回归方程所定义的直线称为回归直线,回归方程的系数(或称回归模型的参数)与称为回归系数;
由一组有离差种线性关系的成对数据求其回归方程的方法称为一元线性回归分析;
回归系数与的计算方法如下:
其中,与分别是数据与(=1,2,…,)的算术平均数;数对称为样本点的中心。
最小二乘法与最小二乘估计量
我们的回归分析是基于取最小值的假设,即基于所有离差的平方和取最小值的假设进行的;这种回归分析的方法称为最小二乘法,由最小二乘法导出的估计量称为最小二乘估计量,所得到的回归系数与又称为模型参数与的最小二乘估计;
【题型1】某饮料店某5天的日销售收入(单位:百元)与当天平均气温(单位:℃)之间的数据如下表:
0
1
2
5
4
2
2
1
若与之间是线性相关关系,且关于的经验回归方程是,则实数的值是( )
A.3 B.2.8 C.2.6 D.2.4
【题型2】已知经验回归方程的斜率的估计值是1.23,样本点的中心为,则经验回归的方程是( )
A. B. C. D.
【题型3】具有相关关系的变量与的一组样本数据如下,若已求得线性回归方程为,则下列选项错误的是( )
1
2
3
4
5
16
12
11
10
6
A.
B.与具有负相关关系
C.当时,的预测值为0
D.去掉其中某对样本数据,与的样本相关系数可能不变
【题型4】用模型去拟合与的关系,令,得到关于的回归直线方程为,则( )
A.1 B.2 C.3 D.4
【题型5】已知两个线性相关变量x与y的统计数据如下表:
x
3
4
5
6
7
y
2.4
m
4
4.6
5.2
其经验回归方程为 则m=( )
A.2.8 B.3 C.3.2 D.3.4
【题型6】为了研究物理成绩与数学成绩之间的关系,随机抽取100名学生的成绩,用最小二乘法得到关于的线性回归方程为,则样本点的离差为( )
A.2.5 B.3.5 C.3.5 D.2.5
【题型7】已知变量和的成对样本数据的经验回归方程为,且,当增加1个样本数据后,重新得到的经验回归方程的斜率为,则在新的经验回归方程的估计下,样本数据所对应的离差为( )
A. B. C.1 D.2
【题型8】某单位为了解日用电量(单位:千瓦时)与当天平均温度(单位:摄氏度)之间的关系,随机统计了4天的日用电量与当天的平均温度,绘制了如下表格,由表中数据可得线性回归方程,则实数 .
5
15
24
60
40
20
【题型9】用(为自然对数的底数)拟合一组数据时,为了求出回归方程,令,变换后得到的线性回归方程为,则
【题型10】某工厂为研究某种产品的产量(单位:吨)与所需某种原材料(单位:吨)的相关性,在生产过程中收集了4组对应数据,如下表所示
3
4
6
7
2.5
3.5
4
根据表中数据,得出关于的线性回归方程为,据此计算出样本处的离差为0.25,则表中 ,处的离差为 .
【题型11】某无人机的研发费用x(单位:万元)与销售量y(单位:万件)之间的对应数据如表所示:
研发费用x
3.4
4.7
5
5.6
6.3
销售量y
15
16.9
19.2
18
20.9
根据表中数据可得经验回归方程为,则第三个样本点对应的离差为 .
【题型12】某工厂每日生产一种产品吨,每日生产的该产品当日销售完毕,日销售额为y万元,产品价格随着产量的变化而有所变化,经过一段时间的产销,得到了x,y的一组统计数据,如下表:
日产量x(吨)
1
2
3
4
5
日销售额y(万元)
5
12
16
19
21
(1)请判断与中哪个模型更适合刻画x,y之间的关系,并从函数增长趋势方面给出简单的理由;
(2)根据你的判断及下面的公式和数据,求出y关于x的回归方程,并估计当日产量为6吨时,日销售额是多少.(结果保留整数)
参数公式:经验回归方程中,.
参考数据:令,,,.
【题型13】随着新能源产业的发展,我市近年来新能源汽车保有量快速增长,为了研究我市充电桩建设的情况,能源部门收集到了2021年到2025年充电桩数量(单位:万个),为方便研究,年份代码用表示(如:表示2021年),具体参考数据如下表:
55
72.6
21
(1)请根据表中数据,建立关于的回归直线方程;
(2)假设我市某区域现有9个充电桩,其中4个为快充桩,现对该地区现有的9个充电桩进行检查,随机抽取3个充电桩进行检查,记抽到的快充桩个数为,求的分布列及均值.
(参考公式:,.)
【题型14】班主任为了对本班学生的考试成绩进行分析,决定从本班24名女同学、18名男同学中随机抽取一个容量为7的样本进行分析.
(1)如果按照性别比例分层抽样,可以得到多少个不同的样本?(写出算式即可,不必计算出结果)
(2)如果随机抽取的7名同学的数学、物理成绩(单位:分)对应如下表:
学生序号
1
2
3
4
5
6
7
数学成绩
60
65
70
75
85
87
90
物理成绩
70
77
80
85
90
86
93
①若规定85分以上(包括85分)为优秀,从这7名同学中抽取3名同学,记3名同学中数学和物理成绩均为优秀的人数为,求的分布列和数学期望.
②根据上表数据,求物理成绩关于数学成绩的经验回归方程(系数精确到0.01).若班上某位同学的数学成绩为96分,预测该同学的物理成绩.
【题型15】某数字文创公司统计了AI数字复原技术各组研发人员数(人)与月度非遗纹样复原作品数(件)的情况,统计结果如下表:
各组AI研发人员数(人)
3
4
5
6
非遗纹样复原数(件)
5
8
14
17
研发成果类型
基础型
创新型
创新型
创新型
(1)已知与具有较强的线性相关关系,求关于的经验回归方程.
(2)为推广AI非遗复原的模式,现从4个研发小组中随机选取2组进行经验交流,记其中“创新型”的个数为,求的分布列与数学期望.
参考公式:经验回归方程,其中.
参考数据:
【题型16】随着国内人均收入的增加,居民的健康意识也不断增加,健身器材行业发展迅速,下面为年中国健身器材市场规模(单位:百亿元).
年份
2020
2021
2022
2023
2024
年份代码
1
2
3
4
5
市场规模
4.1
4.4
4.8
5.5
6.3
(1)由上面数据可知,可用指数型函数模型拟合与的关系,请建立关于的回归方程(,的值精确到);
(2)数据显示2024年购买过体育用品类的中国消费者中购买过运动防护类的占比为,用频率估计概率,现从2024年购买过体育用品类的中国消费者中国随机抽取3人,记购买过运动防护类的消费者人数为,求的分布列与数学期望.
参考数据:
其中.
参考公式:对于一组数据,,,,其经验回归直线的斜率与截距的最小二乘法公式为:,.
考点03 2x2列联表
一、2×2列联表
分类变量:这里所说的变量和值不一定是具体的数值,例如性别变量,其取值为男和女两种.我们经常会使用一种特殊的随机变量,以区别不同的现象或性质,这类随机变量称为分类变量,分类变量的取值可以用实数表示.
2×2列联表
定义一对分类变量X和Y,我们整理数据如表所示:
X
Y
合计
Y=0
Y=1
X=0
a
b
a+b
X=1
c
d
c+d
合计
a+c
b+d
n=a+b+c+d
上表是关于分类变量X和Y的抽样数据的2×2列联表,最后一行的前两个数分别是事件{Y=0}和{Y=1}中样本点的个数;最后一列的前两个数分别是事件{X=0}和{X=1}中样本点的个数;中间的四个数a,b,c,d是事件{X=x,Y=y}(x,y=0,1)中样本点的个数;右下角格中的数n是样本空间中样本点的总数.
二、独立性检验
零假设:要检验两个随机变量是否有关,统计上一般先假设它们没有关系,即相互独立,再进行统计检验;这种假设称为原假设,也称为零假设;习惯上用H0表示;
独立性检验:利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验.
独立性检验的公式:由χ2=经过变形可得到
χ2=,其中n=a+b+c+d,用随机变量χ2取值的大小作为判断零假设H0是否成立的依据,当它比较大时推断H0不成立,否则认为H0成立.
临界值:对于任何小概率值α,可以找到相应的正实数xα,使P(χ2≥xα)=α.称xα为α的临界值.临界值可作为判断χ2大小的标准.概率值α越小,临界值xα越大.
χ2独立性检验中五个常用的小概率值和相应的临界值.
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
【特别提醒】 (1)χ2越小,独立性越强,相关性越弱;χ2越大,独立性越弱,相关性越强.
(2)对于零假设H0:分类变量X和Y独立,基于小概率值α的检验规则:
①当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α;
②当χ2<xα时,我们没有充分证据推断H0不成立 ,可以认为X和Y独立.
【题型1】假设有两个分类变量X,Y,它们的可能取值分别为和,其列联表为
合计
合计
以下各组数据中,对于同一样本能说明与有关系的可能性最大的一组为( )
A. B.
C. D.
【题型2】为考查、两种药物预防某疾病的效果,进行动物实验,分别得到如下等高条形图:根据图中信息,在下列各项中,说法最佳的一项是( )
A.药物的预防效果优于药物的预防效果
B.药物的预防效果优于药物的预防效果
C.药物、对该疾病均有显著的预防效果
D.药物、对该疾病均没有预防效果
【题型3】为了检测某种药物对预防疾病的效果,进行了小动物试验,得到如下列联表:
药物
疾病
合计
未患病
患病
服用
18
7
25
未服用
12
8
20
合计
30
15
45
已知,.根据小概率值的独立性检验,则下列结论正确的是( )
A.药物对预防疾病有效果
B.药物对预防疾病有效果,这个结论犯错误的概率不超过0.05
C.药物对预防疾病无效果
D.药物对预防疾病无效果,这个结论犯错误的概率不超过0.05
【题型4】为了研究蜜蜂进入不同颜色的蜂蜡罐与蜜蜂种类的关系,某研究团队收集了黄、褐两种颜色的蜂蜡罐,对两个品种的蜜蜂进行研究,收集整理数据后将所得结果填入相应的列联表中.由列联表中的数据计算得,参照临界值表,下列结论正确的是( )
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
A.在犯错误的概率不超过1%的前提下,认为“进入不同颜色的蜂蜡罐与蜜蜂种类有关”
B.在犯错误的概率不超过5%的前提下,认为“进入不同颜色的蜂蜡罐与蜜蜂种类有关”
C.有95%以上的把握认为“进入不同颜色的蜂蜡罐与蜜蜂种类无关”
D.有99%以上的把握认为“进入不同颜色的蜂蜡罐与蜜蜂种类无关”
【题型5】下列命题中错误的是( )
A.在回归分析中,相关系数r的绝对值越大,两个变量的线性相关性越强
B.若变量y与x之间存在线性相关关系,且根据最小二乘法得到的经验回归方程为,样本点中心为,则样本点的离差为1.5
C.在回归分析中,离差平方和越小,模型的拟合效果越好
D.对分类变量X与Y,它们的随机变量的观测值k越小,说明“X与Y有关系”的把握越大
【题型6】一款短视频手机应用最近在某校学生中流行起来,某校团委对“学生性别和喜欢该手机应用是否有关”做了一次调查,其中被调查的女生人数是男生人数的,男生喜欢该手机应用的人数占男生人数的,女生喜欢该手机应用的人数占女生人数的,若有的把握认为是否喜欢该手机应用和性别有关,则被调查的男生人数至少为( )
0.05
0.01
3.841
6.635
A.12 B.6 C.10 D.18
【题型7】根据下面的列联表判断患肝病与嗜酒有关系的把握有( )
肝病
酒性
合计
嗜酒
不嗜酒
患肝病
7775
42
7817
未患肝病
2099
49
2148
合计
9874
91
9965
A. B. C. D.
【题型8】下列说法正确的是( )
的部分临界值如表:
0.1
0.05
0.025
0.01
2.706
3.841
5.024
6.635
A.一组数据的标准差为0,则这组数据中的数均相等
B.两组数据的标准差相等,则这两组数据的平均数相等
C.若两个变量的相关系数越接近于0,则这两个变量的相关性越强
D.已知变量,由它们的样本数据计算得到的观测值,则在犯错误的概率不超过0.025的前提下认为变量没有关系
【题型9】下列说法中正确的是( )
A.一组数据1,1,2,3,5,8,13,21的第60百分位数为4
B.两个随机变量的线性相关程度越强,则样本相关系数越接近于1
C.根据分类变量与的成对样本数据,计算得到,根据小概率值的独立性检验:,可判断与有关联,此推断犯错误的概率不超过0.5%
D.若随机变量服从正态分布,且,则
【题型10】博鳌亚洲论坛2024年年会于3月26日至29日在海南博鳌举行.为了搞好对外宣传工作,会务组选聘了30名记者担任对外翻译工作,在下面“性别与是否会俄语”的列联表中, .
性别
是否会俄语
合计
会
不会
男
20
女
6
合计
18
30
【题型11】若两个分类变量和的列联表为:
合计
5
15
20
40
10
50
合计
45
25
70
则有 的把握认为与之间有关系.
附:
【题型12】如下是一个列联表,则 .
y1
y2
总计
x1
a
35
45
x2
7
b
n
总计
m
73
s
【题型13】为了解某班学生喜爱打篮球是否与性别有关,对本班48人进行了问卷调查,得到了如下的列联表:
性别
打篮球
合计
喜爱
不喜爱
男生
6
女生
10
合计
48
已知在全班48人中随机抽取1人,抽到喜爱打篮球的学生的概率为.
(1)请将上面的列联表补充完整(不用写计算过程);
(2)能否在犯错误的概率不超过0.05的前提下认为喜爱打篮球与性别有关?说明你的理由;
(3)现从女生中抽取2人进一步调查,设其中喜爱打篮球的女生人数为X,求X的分布列与均值.
【题型14】为了了解心肺疾病是否与年龄相关,现随机抽取了40名市民,得到数据如下表:
年龄
心肺疾病
合计
患心肺疾病
不患心肺疾病
大于40岁
16
小于等于40岁
12
合计
40
已知在40人中随机抽取1人,抽到不患心肺疾病的市民的概率为.
(1)请将列联表补充完整;
(2)已知在大于40岁且患心肺疾病的市民中,有4名重症患者,专家建议以重症患者住院治疗,现从这16名患者中选出2人,记需住院治疗的人数为,求的分布列和数学期望;
(3)能否在犯错误的概率不超过0.01的前提下认为患心肺疾病与年龄有关?
【题型15】目前AI技术蓬勃发展,某市投放了一批AI无人驾驶出租车.为了了解不同年龄的人对无人驾驶出租车的使用体验.随机选取了100名使用无人驾驶出租车的体验者,让他们根据体验效果进行评分.
(1)现将100名消费者的年龄划分为“青年”和“中老年”,评分划分为“好评”和“差评”,整理得到如下数据,请将列联表补充完整,并判断是否有的把握认为对无人驾驶出租车的评价与年龄有关.
好评
差评
合计
青年
20
中老年
10
合计
40
100
(2)设消费者的年龄为,对无人驾驶出租车的体验评分为.若根据统计数据,用最小二乘法得到关于的线性回归方程为,且年龄的方差为,评分的方差为,求y与x的相关系数r,并据此判断对无人驾驶出租车使用体验的评分与年龄的相关性强弱(当时,认为相关性强,否则认为相关性弱).
附:.独立性检验中的,其中.
临界值表:
0.050
0.010
0.001
3.841
6.635
10.828
【题型16】某高校拟与某网络平台合作组织学生参加与AI知识有关的网络答题活动,为了解男女学生参与答题意愿的差异,男生、女生各取100人.设事件“学生愿意报名参加答题活动”,“学生为男生”,据统计
(1)根据已知条件,完成下列2×2列联表,并依据小概率值的独立性检验,能否推断该校学生报名参加答题活动的意愿与性别有关?
性别
男生
女生
合计
不愿报名参加答题活动
愿意报名参加答题活动
合计
200
(2)网络答题规则:假设甲每道题回答是否正确相互独立,且每次答对的概率均为若答题活动设置4道题,且答题规则如下:每次答一题,一旦答对,则结束答题;答错则继续答题,直到4道题答完.已知甲同学报名参加答题活动,用X表示在本次答题的题目数量,求X的分布列和期望.
参考公式与数据:其中.
0.10
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
原创精品资源学科网独家享有版权,侵权必究!2
学科网(北京)股份有限公司
$
第八章 成对数据的统计分析
教学目标
1. 熟练掌握成对数据的统计分析全章知识点;
2. 熟练运用全章知识点解决相应的题目题型;
3. 通过学习本章知识点及解决相关题型锻炼逻辑思维,解决复杂问题的能力等。
教学重难点
1. 重点
(1)熟练运用相关系数与最小二乘法公式的各种问题;
(2)熟练运用卡方公式的各种问题;
2. 难点
(1)灵活分析成对数据的统计分析与其他知识结合等问题;
考点01 成对数据的相关分析
一、成对数据与相关分析
把这样来自同一对象的两组数据称为成对数据;研究成对数据相关性的方法称为相关分析.
相关关系与函数关系的异同点
函数关系
相关关系
相同点
都是两个变量间的关系
不同点
是一种确定关系
是一种非确定关系
是一种因果关系
不一定是因果关系,也可能是伴随关系
二、散点图与变量的相关关系
(1)散点图:为直观地描述成对样本数据中两个变量间的关系,用横轴表示其中的一个变量,纵轴表示另一个变量,则成对样本数据都可以用直角坐标系中的点表示出来,由这些点组成的统计图叫做散点图.
(2)散点图的作用
如果散点图中变量的对应点分布在某条曲线的附近,我们就可以得出结论:这两个变量具有相关性,如图(1)(2).如果变量的对应点分布没有规律,我们就可以得出结论:这两个变量不具有相关性,如图(3).
(3)正相关与负相关
从整体上看,当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势,我们就称这两个变量正相关;当一个变量的值增加时,另一个变量的相应值呈现减小的趋势,则称这两个变量负相关.
(4)线性相关与曲线相关
一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们就称这两个变量线性相关.
一般地,如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量非线性相关或曲线相关.
三、样本相关系数
(1)一般地,如果变量x和y正相关,那么关于均值平移后的大多数散点将分布在第一象限、第三象限,对应的成对数据同号的居多;如果变量x和y负相关,那么关于均值平移后的大多数散点将分布在第二象限、第四象限,对应的成对数据异号的居多.
(2)样本相关系数r=.
(3)样本相关系数r的取值范围为[-1,1].
当|r|越接近1时,成对样本数据的线性相关程度越强;
当|r|越接近0时,成对样本数据的线性相关程度越弱.
【特别提醒】 样本相关系数r是一个描述成对样本数据的数字特征,它的正负性可以反映成对样本数据的变化特征:
当r>0时,称成对样本数据正相关;
当r<0时,称成对样本数据负相关;
当|r|=1时,表明成对样本数据都在一条直线上,即两个变量之间满足一种线性关系.
当r=0时,只表明成对样本数据间没有线性相关关系,但不排除它们之间有其他相关关系.
【题型1】有一散点图如图,在5个数据中去掉后,下列说法正确的是( )
A.变量与变量的线性相关性变弱 B.数据的方差变大
C.相关系数变小 D.离差平方和变小
【答案】D
【分析】利用散点图分析数据,判断相关系数,方差,离差的平方和的变化情况.
【详解】从散点图可分析出,若去掉点,则剩下的点更能集中在一条直线附近,
所以解释变量与响应变量的线性相关性变强,
数据的离散程度减小,所以方差变小,相关系数会变大,
因为拟合效果越好,所以离差平方和变小.
故选:D
【题型2】若甲、乙、丙、丁四组数据的相关系数分别为,,0.23,0.88,则在这四组数据中,线性相关性最强的是( )
A.甲组 B.乙组 C.丙组 D.丁组
【答案】A
【分析】根据相关系数的含义,其绝对值越接近1,线性相关性越强.
【详解】根据题意,线性相关系数的绝对值越大,线性相关性越强.
因为,
故线性相关性最强的是甲组.
故选:A.
【题型3】对四组数据进行统计,获得如图所示的散点图,关于其样本相关系数的比较,正确的是( )
A. B.
C. D.
【答案】D
【分析】由散点图的特征,结合相关系数的定义即可得到答案.
【详解】由散点图的趋势可知,,,,
又图一的散点图比图三的散点图更为集中,则,所以,
又图二的散点图比图四的散点图更为集中,则,所以,
所以.
故选:D.
【题型4】对四组数据进行统计,获得如图所示的散点图,关于其样本相关系数的比较,正确的是( )
A. B.
C. D.
【答案】D
【分析】由散点图结合相关系数关系结合选项可得答案.
【详解】由散点图,可得,又由图可得图1,图2相关性强于图3,图4,
则,,结合选项,可得满足题意.
故选:D
【题型5】下面是四个散点图中的点的分布状态,直观上判断两个变量之间具有线性相关关系的是 (填序号).
【答案】③
【分析】根据具有线性相关关系的散点图特点,分别分析散点图即可.
【详解】散点图①中的点无规律的分布,范围很广,表明两个变量之间的相关程度很小;
②中所有的点都在同一条直线上,是函数关系;
③中点的分布在一条带状区域上,即点分布在一条直线的附近,是线性相关关系;
④中的点也分布在一条带状区域内,但不是线性的,
而是一条曲线附近,所以不是线性相关关系,故填③.
故答案为:③
【题型6】学习于才干信仰,犹如运动于健康体魄,持之已久、行之愈远愈受益.为实现中华民族伟大复兴,全国各行各业掀起了“学习强国”的高潮.某老师很喜欢“学习强国”中“挑战答题”模块,他记录了自己连续七天每天一次最多答对的题数如下表:
天数x
1
2
3
4
5
6
7
一次最多答对题数y
12
15
16
18
21
24
27
参考数据:,,,,,
相关系数
由表中数据可知该老师每天一次最多答对题数y与天数x之间是 相关(填“正”或“负”),其相关系数 (结果保留两位小数)
【答案】 正 0.99
【分析】根据正相关和负相关的定义即可得出结论;根据相关系数公式求相关系数即可.
【详解】由表中数据得随的增大而增大,
所以该老师每天一次最多答对题数y与天数x之间是正相关,
.
故答案为:正;.
【题型7】某种机械设备随着使用年限的增加,它的使用功能逐渐减退,使用价值逐年减少,通常把它使用价值逐年减少的“量”换算成费用,称之为“失效费”.某种机械设备的使用年限x(单位:年)与失效费y(单位:万元)的统计数据如下表所示:
使用年限x(单位:年)
1
2
3
4
5
6
7
失效费y(单位:万元)
2.90
3.30
3.60
4.40
4.80
5.20
5.90
由上表数据可知,y与x的相关系数为 .(精确到0.01,参考数据:,,)
【答案】0.99/
【分析】根据表中的数据结合公式直接求解即可.
【详解】由题意,知,
所以.
所以结合参考数据知:.
所以y与x的相关系数近似为0.99.
故答案为:
【题型8】为分析肥胖程度对总胆固醇与空腹血糖的影响,在肥胖人群中随机抽出8人,他们的肥胖指数BMI值、总胆固醇TC指标值(单位:mmol/L),空腹血糖GLU指标值(单位:mmol/L)如表所示:
人员编号
1
2
3
4
5
6
7
8
BMI值x
25
27
30
32
33
35
40
42
TC指标值y
5.3
5.4
5.5
5.6
5.7
6.5
6.9
7.1
GLU指标值z
6.7
7.2
7.3
8.0
8.1
8.6
9.0
9.1
用变量y与x,z与x的相关系数,分别说明TC指标值与BMI值、GLU指标值与BMI值的相关程度.
参考公式:
相关系数,
参考数据:,,,,,,,.
【答案】答案见解析
【分析】根据相关系数的计算结果来判断变量之间的相关性.
【详解】由题意,变量与的相关系数,
变量与的相关系数是,
可以看出TC指标值与BMI值,GLU指标值与BMI值都是高度正相关.
【题型9】为了对2020年某校月考成绩进行分析,在60分以上的全体同学中随机抽取8位,他们的数学、物理成绩对应如下表:
学生编号
1
2
3
4
5
6
7
8
数学成绩
68
72
78
81
85
88
91
93
物理成绩
70
66
81
83
79
80
92
89
用变量与的样本相关系数(精确到0.01)说明物理成绩与数学成绩的线性相关程度的强弱,并说明它们的变化趋势特征.
参考数据:,.
【答案】答案见解析
【分析】分别计算出、,然后求出相关系数说明物理与数学的相关程度.
【详解】因为:,
,
所以.
所以,由样本估计总体,可知物理成绩与数学成绩的线性相关程度较强,且呈正相关,它们的变化趋势相同.
【题型10】广阳岛,作为长江上游最大的江心岛,其面积在枯水期约为10平方公里.自2017年起,重庆市开始对广阳岛进行系统的生态修复,摒弃了曾经的商业开发计划,转而建设“长江风景眼,重庆生态岛”.经过数年的努力,广阳岛的生态得到了显著的改善,不仅植被丰富,生物多样性也得到了极大的提升.据监测,岛上的鸟类从生态修复前的124种增加到213种,其中包括中华秋沙鸭、游隼、白琵鹭等珍稀鸟类.为调查广阳岛某种鸟的数量,将其分成面积相近的50个地块,从这些地块中用简单随机抽样的方法抽取5个作为样区,调查得到样本数据,其中和分别表示第个样区的植被覆盖面积(单位:平方公里)和这种鸟的数量.
1
2
3
4
5
0.171
0.152
0.192
0.189
0.196
12
10
16
14
18
(1)求广阳岛这种鸟数量的估计值(这种鸟数量的估计值等于样区这种鸟数量的平均数乘以地块数);
(2)求样本的相关系数(精确到0.01);
(3)根据统计资料,各地块间植物覆盖面积差异较大.为提高样本的代表性以获得广阳岛这种鸟数量更准确的估计,请给出一种你认为更合理的抽样方法,并说明理由.
附:相关系数,,.
【答案】(1)700
(2)0.94
(3)分层抽样:根据植物覆盖面积的大小对地块分层,再对50个地块进行分层抽样,理由见解析
【分析】(1)求出样本平均数,再乘以地块数可得出结果;
(2)根据题中所给数据,代入,可得出结果;
(3)由(2)知知各样区的这种鸟数量与植物覆盖面积有很强的正相关,各地块间这种植物数量差异也很大,适合采用分层抽样.
【详解】(1)由已知得样本平均数,
从而广阳岛这种鸟数量的估计值为.
(2),
,
故样本的相关系数
(3)分层抽样:根据植物覆盖面积的大小对地块分层,再对50个地块进行分层抽样.
理由如下:由(2)知各样区的这种鸟数量与植物覆盖面积有很强的正相关,
由于各地块间植物覆盖面积差异很大,从而各地块间这种鸟数量差异也很大,
采用分层抽样的方法较好地保持了样本结构与总体结构的一致性,提高了样本的代表性,从而可以获得广阳岛这种鸟数量更准确的估计.
考点02 成对数据的相关分析
一、离差的概念与作用
一般地,设给定一组有线性相关关系的成对数据、、…、和一个线性方程(或称线性模型); ①
如何描述数据与此线性方程的贴近度呢?
当变量取值(=1,2,…,)时,令,它是变量与对应的理想值;
但数据中的与不一定相同,它们的差称为在处的离差;
当时称为正离差,而当时称为负离差;
显然,离差直观地描述了单对数据与线性方程①的贴近度;
二、拟合误差
可以像计算方差那样,用离差的平方和Q=(yi-)2来刻画直线与点之间的拟合程度;称为拟合误差;它是一个很好的描述数据与线性方程①贴近度的指标;
离差平方和:离差平方和(yi-)2越小,模型的拟合效果越好.
三、回归分析及其相关概念
我们把拟合误差取得最小值时得到的线性方程(线性模型)记为
并称之为变量随波动的回归方程或回归模型,其中自变量称为解释变量,因变量称为反应变量;回归方程所定义的直线称为回归直线,回归方程的系数(或称回归模型的参数)与称为回归系数;
由一组有离差种线性关系的成对数据求其回归方程的方法称为一元线性回归分析;
回归系数与的计算方法如下:
其中,与分别是数据与(=1,2,…,)的算术平均数;数对称为样本点的中心。
最小二乘法与最小二乘估计量
我们的回归分析是基于取最小值的假设,即基于所有离差的平方和取最小值的假设进行的;这种回归分析的方法称为最小二乘法,由最小二乘法导出的估计量称为最小二乘估计量,所得到的回归系数与又称为模型参数与的最小二乘估计;
【题型1】某饮料店某5天的日销售收入(单位:百元)与当天平均气温(单位:℃)之间的数据如下表:
0
1
2
5
4
2
2
1
若与之间是线性相关关系,且关于的经验回归方程是,则实数的值是( )
A.3 B.2.8 C.2.6 D.2.4
【答案】B
【分析】根据表格中的数据,求得样本点的中心是,将其代入回归方程,即可求解.
【详解】由统计表格中的数据,可得,,
所以统计数据的样本点的中心为,
因为关于的经验回归方程是,
代入可得,解得.
故选:B.
【题型2】已知经验回归方程的斜率的估计值是1.23,样本点的中心为,则经验回归的方程是( )
A. B. C. D.
【答案】C
【分析】先根据斜率值设经验回归方程,再代入样本中心点求出参数得出经验回归方程即可.
【详解】由条件知,,设经验回归方程为,
则,
∴经验回归的方程是.
故选:C.
【题型3】具有相关关系的变量与的一组样本数据如下,若已求得线性回归方程为,则下列选项错误的是( )
1
2
3
4
5
16
12
11
10
6
A.
B.与具有负相关关系
C.当时,的预测值为0
D.去掉其中某对样本数据,与的样本相关系数可能不变
【答案】C
【分析】由表格数据求出样本点的中心坐标,代入计算可判断A;由正负可判断B;代入计算可判断C;根据样本点的性质可判断D.
【详解】对于A,根据表中数据计算可得,,
代入线性回归方程得,得,故A正确;
对于B,因为,所以与具有负相关关系,故B正确;
对于C,当时,,故C错误;
对于D,样本点为样本中心点,去掉这个样本点,与的样本相关系数不变,故D正确.
故选:C
【题型4】用模型去拟合与的关系,令,得到关于的回归直线方程为,则( )
A.1 B.2 C.3 D.4
【答案】A
【分析】根据对数运算法则将表达式化简即可求出的值.
【详解】由模型可得,所以;
令,所以,可得;
又因为回归直线方程为,因此,可得.
故选:A
【题型5】已知两个线性相关变量x与y的统计数据如下表:
x
3
4
5
6
7
y
2.4
m
4
4.6
5.2
其经验回归方程为 则m=( )
A.2.8 B.3 C.3.2 D.3.4
【答案】A
【分析】利用经验回归方程经过求出.
【详解】,,经验回归方程经过点,
所以,解得.
故选:A.
【题型6】为了研究物理成绩与数学成绩之间的关系,随机抽取100名学生的成绩,用最小二乘法得到关于的线性回归方程为,则样本点的离差为( )
A.2.5 B.3.5 C.3.5 D.2.5
【答案】D
【分析】先求出对应的物理成绩的预测值,再根据离差的定义计算即可.
【详解】将代入得,
则样本点的离差为.
故选:D
【题型7】已知变量和的成对样本数据的经验回归方程为,且,当增加1个样本数据后,重新得到的经验回归方程的斜率为,则在新的经验回归方程的估计下,样本数据所对应的离差为( )
A. B. C.1 D.2
【答案】B
【分析】先计算新的数据的平均值,后得到经验回归方程,再结合离差概念计算即可.
【详解】由,可得增加1个样本数据后的平均数为,
因为,所以,
则增加1个样本数据后的平均数为,
所以,解得,
所以新的经验回归方程为,
则当时,,
样本点的离差为.
故选:B.
【题型8】某单位为了解日用电量(单位:千瓦时)与当天平均温度(单位:摄氏度)之间的关系,随机统计了4天的日用电量与当天的平均温度,绘制了如下表格,由表中数据可得线性回归方程,则实数 .
5
15
24
60
40
20
【答案】4
【分析】由线性回归方程必过样本中心点求解.
【详解】由表数据可得,
所以线性回归方程必过点,
所以,解得,
故答案为:.
【题型9】用(为自然对数的底数)拟合一组数据时,为了求出回归方程,令,变换后得到的线性回归方程为,则
【答案】
【分析】化简已知得,得,即得解.
【详解】因,两边取对数得:,
令,则,而,于是得,即.
故答案为:.
【题型10】某工厂为研究某种产品的产量(单位:吨)与所需某种原材料(单位:吨)的相关性,在生产过程中收集了4组对应数据,如下表所示
3
4
6
7
2.5
3.5
4
根据表中数据,得出关于的线性回归方程为,据此计算出样本处的离差为0.25,则表中 ,处的离差为 .
【答案】 6 0.5/
【分析】由离差的定义得到回归直线方程,进而根据回归直线过样本的中心点,得到的值即可求解.
【详解】根据样本处的离差为0.25,得,
可得,即回归直线的方程为.
又,
所以,解得,故处的离差为.
故答案为:6,0.5
【题型11】某无人机的研发费用x(单位:万元)与销售量y(单位:万件)之间的对应数据如表所示:
研发费用x
3.4
4.7
5
5.6
6.3
销售量y
15
16.9
19.2
18
20.9
根据表中数据可得经验回归方程为,则第三个样本点对应的离差为 .
【答案】1.2
【分析】由表格中的数据,根据平均数求得样本中心,代入回归方程可得参数的值,代入第三个样本点的值,集合离差的定义,可得答案.
【详解】由已知,得,,
所以,于是,
当时,,
因此,第三个样本点对应的离差为.
故答案为:.
【题型12】某工厂每日生产一种产品吨,每日生产的该产品当日销售完毕,日销售额为y万元,产品价格随着产量的变化而有所变化,经过一段时间的产销,得到了x,y的一组统计数据,如下表:
日产量x(吨)
1
2
3
4
5
日销售额y(万元)
5
12
16
19
21
(1)请判断与中哪个模型更适合刻画x,y之间的关系,并从函数增长趋势方面给出简单的理由;
(2)根据你的判断及下面的公式和数据,求出y关于x的回归方程,并估计当日产量为6吨时,日销售额是多少.(结果保留整数)
参数公式:经验回归方程中,.
参考数据:令,,,.
【答案】(1)更适合,理由见解析
(2),日销售额为23(万元)
【分析】(1)由题可知数据呈现增长趋势,但增长速度逐渐减慢,故符合;
(2)通过令将关于的非线性经验回归方程转化为关于的线性经验回归方程,根据表中数据求出该经验回归方程后再转化为关于的经验回归方程,代入即可求出预报值.
【详解】(1)更适合刻画,之间的关系.理由:由题表中的数据可知,的值每增加1,函数值的增加量分别为7,4,3,2,增加得越来越缓慢,符合对数函数模型的增长规律,与一元线性回归模型的均匀增长存在较大差异,故更适合刻画,之间的关系.
(2)令,由题意得,
所以,
,
所以关于的回归方程为.
当时,日销售额为(万元).
【题型13】随着新能源产业的发展,我市近年来新能源汽车保有量快速增长,为了研究我市充电桩建设的情况,能源部门收集到了2021年到2025年充电桩数量(单位:万个),为方便研究,年份代码用表示(如:表示2021年),具体参考数据如下表:
55
72.6
21
(1)请根据表中数据,建立关于的回归直线方程;
(2)假设我市某区域现有9个充电桩,其中4个为快充桩,现对该地区现有的9个充电桩进行检查,随机抽取3个充电桩进行检查,记抽到的快充桩个数为,求的分布列及均值.
(参考公式:,.)
【答案】(1)
(2)分布列见解析,.
【分析】(1)首先求出,,再根据公式求解即可;
(2)根据题意得到X的可能取值为,分别求出对应的概率,即可得到分布列和均值.
【详解】(1)由题意,得,,
则,,
所以回归直线方程为.
(2)由题意,的可能取值为,
则,,
,,
所以分布列为:
故均值.
【题型14】班主任为了对本班学生的考试成绩进行分析,决定从本班24名女同学、18名男同学中随机抽取一个容量为7的样本进行分析.
(1)如果按照性别比例分层抽样,可以得到多少个不同的样本?(写出算式即可,不必计算出结果)
(2)如果随机抽取的7名同学的数学、物理成绩(单位:分)对应如下表:
学生序号
1
2
3
4
5
6
7
数学成绩
60
65
70
75
85
87
90
物理成绩
70
77
80
85
90
86
93
①若规定85分以上(包括85分)为优秀,从这7名同学中抽取3名同学,记3名同学中数学和物理成绩均为优秀的人数为,求的分布列和数学期望.
②根据上表数据,求物理成绩关于数学成绩的经验回归方程(系数精确到0.01).若班上某位同学的数学成绩为96分,预测该同学的物理成绩.
【答案】(1)
(2)①分布列见解析,;②,96分
【分析】(1)根据分层抽样的方法,女同学应取4人,男同学应取3人,故不同的样本的个数为.
(2)(i)首先得到的取值,分别求出相应的概率,即可求出分布列及期望.
(ii)首先通过已知条件得出线性回归方程,代入即可得解.
【详解】(1)依据分层随机抽样的方法,24名女同学中应抽取的人数为,18名男同学中应抽取的人数为,
故不同的样本的个数为.
(2)①名同学中数学和物理成绩均为优秀的人数为3,
的取值范围为.
,,,.
的分布列为
0
1
2
3
.
②,
,
,.
∴经验回归方程为.
当时,
∴预测该同学的物理成绩为96分.
【题型15】某数字文创公司统计了AI数字复原技术各组研发人员数(人)与月度非遗纹样复原作品数(件)的情况,统计结果如下表:
各组AI研发人员数(人)
3
4
5
6
非遗纹样复原数(件)
5
8
14
17
研发成果类型
基础型
创新型
创新型
创新型
(1)已知与具有较强的线性相关关系,求关于的经验回归方程.
(2)为推广AI非遗复原的模式,现从4个研发小组中随机选取2组进行经验交流,记其中“创新型”的个数为,求的分布列与数学期望.
参考公式:经验回归方程,其中.
参考数据:
【答案】(1)
(2)分布列见解析,
【分析】(1)根据已知数据计算,进而计算求出回归方程;
(2)先计算概率得出分布列,再应用数学期望公式计算即可.
【详解】(1)由题知
所以
所以关于的经验回归方程为
(2)由题意得的取值为1,2
1
2
.
【题型16】随着国内人均收入的增加,居民的健康意识也不断增加,健身器材行业发展迅速,下面为年中国健身器材市场规模(单位:百亿元).
年份
2020
2021
2022
2023
2024
年份代码
1
2
3
4
5
市场规模
4.1
4.4
4.8
5.5
6.3
(1)由上面数据可知,可用指数型函数模型拟合与的关系,请建立关于的回归方程(,的值精确到);
(2)数据显示2024年购买过体育用品类的中国消费者中购买过运动防护类的占比为,用频率估计概率,现从2024年购买过体育用品类的中国消费者中国随机抽取3人,记购买过运动防护类的消费者人数为,求的分布列与数学期望.
参考数据:
其中.
参考公式:对于一组数据,,,,其经验回归直线的斜率与截距的最小二乘法公式为:,.
【答案】(1)
(2)答案详见解析
【分析】(1)由 ,得模型线性化为:,然后利用最小二乘法的公式计算即可;
(2)利用二项分布的概率计算公式与期望计算公式可得答案.
【详解】(1)由 ,则模型线性化为:,
,,,
由,,
得:,
由,,
得:,
代入最小二乘法估计公式,得:
,
,
,
故关于的回归方程为:.
(2)由题意知: 服从二项分布,即.
由二项分布的概率计算公式得:
,
,
,
,
故的分布列为:
0
1
2
3
数学期望.
考点03 2x2列联表
一、2×2列联表
分类变量:这里所说的变量和值不一定是具体的数值,例如性别变量,其取值为男和女两种.我们经常会使用一种特殊的随机变量,以区别不同的现象或性质,这类随机变量称为分类变量,分类变量的取值可以用实数表示.
2×2列联表
定义一对分类变量X和Y,我们整理数据如表所示:
X
Y
合计
Y=0
Y=1
X=0
a
b
a+b
X=1
c
d
c+d
合计
a+c
b+d
n=a+b+c+d
上表是关于分类变量X和Y的抽样数据的2×2列联表,最后一行的前两个数分别是事件{Y=0}和{Y=1}中样本点的个数;最后一列的前两个数分别是事件{X=0}和{X=1}中样本点的个数;中间的四个数a,b,c,d是事件{X=x,Y=y}(x,y=0,1)中样本点的个数;右下角格中的数n是样本空间中样本点的总数.
二、独立性检验
零假设:要检验两个随机变量是否有关,统计上一般先假设它们没有关系,即相互独立,再进行统计检验;这种假设称为原假设,也称为零假设;习惯上用H0表示;
独立性检验:利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验.
独立性检验的公式:由χ2=经过变形可得到
χ2=,其中n=a+b+c+d,用随机变量χ2取值的大小作为判断零假设H0是否成立的依据,当它比较大时推断H0不成立,否则认为H0成立.
临界值:对于任何小概率值α,可以找到相应的正实数xα,使P(χ2≥xα)=α.称xα为α的临界值.临界值可作为判断χ2大小的标准.概率值α越小,临界值xα越大.
χ2独立性检验中五个常用的小概率值和相应的临界值.
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
【特别提醒】 (1)χ2越小,独立性越强,相关性越弱;χ2越大,独立性越弱,相关性越强.
(2)对于零假设H0:分类变量X和Y独立,基于小概率值α的检验规则:
①当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α;
②当χ2<xα时,我们没有充分证据推断H0不成立 ,可以认为X和Y独立.
【题型1】假设有两个分类变量X,Y,它们的可能取值分别为和,其列联表为
合计
合计
以下各组数据中,对于同一样本能说明与有关系的可能性最大的一组为( )
A. B.
C. D.
【答案】C
【分析】计算各选项中的值,比较大小,即可得答案.
【详解】计算各选项中的值,值越大,说明相应的两个分类变量有关系的可能性越大;
对于A,,
对于B,,
对于C,,
对于D,,
由于,
故选:C
【题型2】为考查、两种药物预防某疾病的效果,进行动物实验,分别得到如下等高条形图:根据图中信息,在下列各项中,说法最佳的一项是( )
A.药物的预防效果优于药物的预防效果
B.药物的预防效果优于药物的预防效果
C.药物、对该疾病均有显著的预防效果
D.药物、对该疾病均没有预防效果
【答案】B
【分析】根据等高条形图中的数据即可得出选项.
【详解】根据两个表中的等高条形图知,药物实验显示不服药与服药时患病差异较药物实验显示明显大,
所以药物的预防效果优于药物的预防效果,
故选:B.
【题型3】为了检测某种药物对预防疾病的效果,进行了小动物试验,得到如下列联表:
药物
疾病
合计
未患病
患病
服用
18
7
25
未服用
12
8
20
合计
30
15
45
已知,.根据小概率值的独立性检验,则下列结论正确的是( )
A.药物对预防疾病有效果
B.药物对预防疾病有效果,这个结论犯错误的概率不超过0.05
C.药物对预防疾病无效果
D.药物对预防疾病无效果,这个结论犯错误的概率不超过0.05
【答案】C
【分析】通过计算列联表的统计量,与给定的临界值比较,来判断药物对预防疾病是否有效果.
【详解】零假设:药物对预防疾病无效果,
根据列联表数据,,
根据,将数据代入可得:
,
,根据小概率值的独立性检验,,
所以我们没有充分证据拒绝原假设,即认为药物对预防疾病无效果.
故选:C.
【题型4】为了研究蜜蜂进入不同颜色的蜂蜡罐与蜜蜂种类的关系,某研究团队收集了黄、褐两种颜色的蜂蜡罐,对两个品种的蜜蜂进行研究,收集整理数据后将所得结果填入相应的列联表中.由列联表中的数据计算得,参照临界值表,下列结论正确的是( )
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
A.在犯错误的概率不超过1%的前提下,认为“进入不同颜色的蜂蜡罐与蜜蜂种类有关”
B.在犯错误的概率不超过5%的前提下,认为“进入不同颜色的蜂蜡罐与蜜蜂种类有关”
C.有95%以上的把握认为“进入不同颜色的蜂蜡罐与蜜蜂种类无关”
D.有99%以上的把握认为“进入不同颜色的蜂蜡罐与蜜蜂种类无关”
【答案】B
【分析】根据与临界值的大小关系,结合独立性检验的性质判断结论.
【详解】因为,,
所以根据小概率值的独立性检验,认为“进入不同颜色的蜂蜡罐与蜜蜂种类有关”,B正确,C错误;
因为,,
所以根据小概率值的独立性检验,认为“进入不同颜色的蜂蜡罐与蜜蜂种类无关”,但不是有的把握法认为“进入不同颜色的蜂蜡罐与蜜蜂种类无关”,A错误,D错误;
故选:B.
【题型5】下列命题中错误的是( )
A.在回归分析中,相关系数r的绝对值越大,两个变量的线性相关性越强
B.若变量y与x之间存在线性相关关系,且根据最小二乘法得到的经验回归方程为,样本点中心为,则样本点的离差为1.5
C.在回归分析中,离差平方和越小,模型的拟合效果越好
D.对分类变量X与Y,它们的随机变量的观测值k越小,说明“X与Y有关系”的把握越大
【答案】D
【分析】根据相关变量的回归分析,以及独立性检验的相关知识,即可判断选项.
【详解】A.由相关系数的意义可知,相关系数r的绝对值越大,越接近于1,两个变量的线性相关性越强,故A说法正确;
B.由条件可知,,得,即,时,,
所以样本点的离差为,故B说法正确;
C. 在回归分析中,离差平方和越小,模型的拟合效果越好,故C说法正确;
D. 对分类变量X与Y,它们的随机变量的观测值k越小,说明“X与Y有关系”的把握越小,故D说法错误.
故选:D
【题型6】一款短视频手机应用最近在某校学生中流行起来,某校团委对“学生性别和喜欢该手机应用是否有关”做了一次调查,其中被调查的女生人数是男生人数的,男生喜欢该手机应用的人数占男生人数的,女生喜欢该手机应用的人数占女生人数的,若有的把握认为是否喜欢该手机应用和性别有关,则被调查的男生人数至少为( )
0.05
0.01
3.841
6.635
A.12 B.6 C.10 D.18
【答案】A
【分析】设被调查的男生人数为,则女生人数为,根据题意得到列联表,由计算公式,及独立性检验思想,得到关于的不等式,求解可得.
【详解】设被调查的男生人数为,则女生人数为,可得列联表如下:
喜欢
不喜欢
合计
男生
女生
合计
由公式算得,因为有的把握认为是否喜欢该手机应用和性别有关,所以,
则.而都是整数,所以的值至少为12.
故选:A.
【题型7】根据下面的列联表判断患肝病与嗜酒有关系的把握有( )
肝病
酒性
合计
嗜酒
不嗜酒
患肝病
7775
42
7817
未患肝病
2099
49
2148
合计
9874
91
9965
A. B. C. D.
【答案】D
【分析】由列联表中的数据,求得,即可得到答案.
【详解】由列联表中的数据,计算得,
故有的把握认为患肝病与嗜酒有关系.
故选:D.
【题型8】下列说法正确的是( )
的部分临界值如表:
0.1
0.05
0.025
0.01
2.706
3.841
5.024
6.635
A.一组数据的标准差为0,则这组数据中的数均相等
B.两组数据的标准差相等,则这两组数据的平均数相等
C.若两个变量的相关系数越接近于0,则这两个变量的相关性越强
D.已知变量,由它们的样本数据计算得到的观测值,则在犯错误的概率不超过0.025的前提下认为变量没有关系
【答案】A
【分析】根据标准差定义可判断A项;通过取反例可排除B项;利用相关系数的概念易排除C项;利用独立性检验的规定,可判断D结论不成立.
【详解】对于A,根据标准差定义,一组数据的标准差时,
显然有,故A正确;
对于B,两组数据的标准差相等,这两组数据的平均数未必相等,
如都为1和都为2的两组数据,它们的标准差均为0,但它们的平均数分别为1和,故B错误;
对于C,两个变量的相关系数越接近于0,两个变量的相关性越弱,故C错误;
对于D,,根据独立性检验原理,
在犯错误的概率不超过0.025的前提下认为变量有关系,故D错误.
故选:A
【题型9】下列说法中正确的是( )
A.一组数据1,1,2,3,5,8,13,21的第60百分位数为4
B.两个随机变量的线性相关程度越强,则样本相关系数越接近于1
C.根据分类变量与的成对样本数据,计算得到,根据小概率值的独立性检验:,可判断与有关联,此推断犯错误的概率不超过0.5%
D.若随机变量服从正态分布,且,则
【答案】D
【分析】利用百分位数的定义计算可判断A;利用相关系数的意义可判断B;利用独立性检验的意义可判断C,根据正态分布的对称性求解可判断D.
【详解】对于A,由,所以这组数据的第60百分位数为从小到大排列得到的第五个数5,故A错误;
对于B,两个随机变量的线性相关程度越强,则样本相关系数越接近于1,故B错误;
对于C,根据小概率值的独立性检验:,因为,则不能推断出犯错误的概率不超过0.5%,故C错误;
对于D,因为服从正态分布,且,
所以,故D正确;
故选:D.
【题型10】博鳌亚洲论坛2024年年会于3月26日至29日在海南博鳌举行.为了搞好对外宣传工作,会务组选聘了30名记者担任对外翻译工作,在下面“性别与是否会俄语”的列联表中, .
性别
是否会俄语
合计
会
不会
男
20
女
6
合计
18
30
【答案】8
【分析】根据列联表的性质,求出a,b,d的值,即可得答案.
【详解】由列联表的性质,可得:,可得,
所以.
故答案为:8
【题型11】若两个分类变量和的列联表为:
合计
5
15
20
40
10
50
合计
45
25
70
则有 的把握认为与之间有关系.
附:
【答案】/
【分析】根据列联表,求得观测值,对照临界值表即可解答.
【详解】零假设为:与独立,
由题可知,.
因为,
所以有的把握认为与之间有关系.
故答案为:.
【题型12】如下是一个列联表,则 .
y1
y2
总计
x1
a
35
45
x2
7
b
n
总计
m
73
s
【答案】90
【分析】完善列联表即可求解.
【详解】由表格有,
故答案为:.
【题型13】为了解某班学生喜爱打篮球是否与性别有关,对本班48人进行了问卷调查,得到了如下的列联表:
性别
打篮球
合计
喜爱
不喜爱
男生
6
女生
10
合计
48
已知在全班48人中随机抽取1人,抽到喜爱打篮球的学生的概率为.
(1)请将上面的列联表补充完整(不用写计算过程);
(2)能否在犯错误的概率不超过0.05的前提下认为喜爱打篮球与性别有关?说明你的理由;
(3)现从女生中抽取2人进一步调查,设其中喜爱打篮球的女生人数为X,求X的分布列与均值.
【答案】(1)答案见解析
(2)能,理由见解析
(3)分布列见解析,1
【分析】(1)根据题意可计算出喜爱打篮球的学生人数,即可得出列联表;
(2)根据独立性检验的基本原理,计算的值,与临界值表比较,可得结论;
(3)确定的可能取值,计算每个值对应的概率,即可得分布列,继而可计算出期望.
【详解】(1)喜爱打篮球的学生有人,喜爱打篮球的男生有人,
不喜爱打篮球的学生有人,不喜爱打篮球的女生有人,
故列联表如下:
性别
打篮球
合计
喜爱
不喜爱
男生
22
6
28
女生
10
10
20
合计
32
16
48
(2)零假设,假设是否喜爱打篮球与性别无关.
因为,所以能在犯错误的概率不超过0.05的前提下认为喜爱打篮球与性别有关.
(3)喜爱打篮球的女生人数的可能取值为0,1,2.其概率分别为,,,
故的分布列为
0
1
2
的均值为.
【题型14】为了了解心肺疾病是否与年龄相关,现随机抽取了40名市民,得到数据如下表:
年龄
心肺疾病
合计
患心肺疾病
不患心肺疾病
大于40岁
16
小于等于40岁
12
合计
40
已知在40人中随机抽取1人,抽到不患心肺疾病的市民的概率为.
(1)请将列联表补充完整;
(2)已知在大于40岁且患心肺疾病的市民中,有4名重症患者,专家建议以重症患者住院治疗,现从这16名患者中选出2人,记需住院治疗的人数为,求的分布列和数学期望;
(3)能否在犯错误的概率不超过0.01的前提下认为患心肺疾病与年龄有关?
【答案】(1)答案见解析
(2)分布列见解析,
(3)能在犯错误的概率不超过0.01的前提下认为患心肺疾病与年龄有关.
【分析】(1)根据题意,求得抽到不患心肺疾病的市民的人数为人,进而完成列联表
(2)根据题意,得到需住院治疗的人数为可能取值为,利用超几何分布的概率公式,求得相应的概率,列出分布列,结合期望的公式,即可求解;
(3)由(1)中的列联表,求得,结合附表,即可得到结论.
【详解】(1)解:由题意知,在40人中随机抽取1人,抽到不患心肺疾病的市民的概率为,
所以抽到不患心肺疾病的市民的人数为人,
将列联表补充完整,如下表所示:
年龄
心肺疾病
合计
患心肺疾病
不患心肺疾病
大于40岁
16
4
20
小于等于40岁
8
12
20
合计
24
16
40
(2)解:由题意知,需住院治疗的人数为可能取值为,
可得,,,
所以随机变量的分布列为
0
1
2
所以随机变量的数学期望.
(3)解:零假设为:是否患心肺疾病与年龄无关,
由(1)中的列联表,可得,
所以能在犯错误的概率不超过0.01的前提下认为患心肺疾病与年龄有关.
【题型15】目前AI技术蓬勃发展,某市投放了一批AI无人驾驶出租车.为了了解不同年龄的人对无人驾驶出租车的使用体验.随机选取了100名使用无人驾驶出租车的体验者,让他们根据体验效果进行评分.
(1)现将100名消费者的年龄划分为“青年”和“中老年”,评分划分为“好评”和“差评”,整理得到如下数据,请将列联表补充完整,并判断是否有的把握认为对无人驾驶出租车的评价与年龄有关.
好评
差评
合计
青年
20
中老年
10
合计
40
100
(2)设消费者的年龄为,对无人驾驶出租车的体验评分为.若根据统计数据,用最小二乘法得到关于的线性回归方程为,且年龄的方差为,评分的方差为,求y与x的相关系数r,并据此判断对无人驾驶出租车使用体验的评分与年龄的相关性强弱(当时,认为相关性强,否则认为相关性弱).
附:.独立性检验中的,其中.
临界值表:
0.050
0.010
0.001
3.841
6.635
10.828
【答案】(1)列联表见详解;有的把握认为对无人驾驶出租车的评价与年龄有关
(2)对无人驾驶出租车使用体验的评分与年龄的相关很强
【分析】(1)根据题意完善列联表,求,并与临界值对比分析;
(2)根据题意求相关系数,进而分析理解.
【详解】(1)根据题意可得列联表如下:
好评
差评
合计
青年
20
30
50
中老年
40
10
50
合计
60
40
100
因为,
所以有的把握认为对无人驾驶出租车的评价与年龄有关.
(2)因为,所以,
因为,所以,
因为,所以,
所以相关系数,
因为,所以判断对无人驾驶出租车使用体验的评分与年龄的相关很强.
【题型16】某高校拟与某网络平台合作组织学生参加与AI知识有关的网络答题活动,为了解男女学生参与答题意愿的差异,男生、女生各取100人.设事件“学生愿意报名参加答题活动”,“学生为男生”,据统计
(1)根据已知条件,完成下列2×2列联表,并依据小概率值的独立性检验,能否推断该校学生报名参加答题活动的意愿与性别有关?
性别
男生
女生
合计
不愿报名参加答题活动
愿意报名参加答题活动
合计
200
(2)网络答题规则:假设甲每道题回答是否正确相互独立,且每次答对的概率均为若答题活动设置4道题,且答题规则如下:每次答一题,一旦答对,则结束答题;答错则继续答题,直到4道题答完.已知甲同学报名参加答题活动,用X表示在本次答题的题目数量,求X的分布列和期望.
参考公式与数据:其中.
0.10
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【答案】(1)表格见解析,有关联
(2)分布列见解析,
【分析】(1)根据已知条件求出列联表中的数据,再计算出的值判断即可;
(2)写出的所有可能取值,结合独立事件的概率特征求出对应的概率,从而可写出的分布列及期望.
【详解】(1)因为,所以愿意报名参加答题活动的人数为,
又因为,所以愿意报名参加答题活动的男生人数为,
则愿意报名参加答题活动的女生人数为,
则可得到列联表为:
性别
男生
女生
合计
不愿报名参加答题活动
40
80
120
愿意报名参加答题活动
60
20
80
合计
100
100
200
零假设:学生报名参加答题活动的意愿与性别无关,
则,
依据小概率值的独立性检验,我们推断不成立,
即认为学生报名参加答题活动与性别有关联,此推断犯错误的概率不大于0.001,
(2)的所有可能取值为,
,
,
所以的分布列为:
1
2
3
4
故.
原创精品资源学科网独家享有版权,侵权必究!2
学科网(北京)股份有限公司
$
相关资源
示范课
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。