内容正文:
第8章 成对数据的统计分析
一、知识点回顾
成对数据的统计的相关性
变量的相关关系
1.常见的两变量之间的关系有两类:一类是函数关系,另一类是相关关系.与函数关系不同,相关关系是一种非确定性关系.
2.如果从整体上看,当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势,就称这两个变量正相关;如果当一个变量的值增加时,另一个变量的相应值呈现减少的趋势,则称这两个变量负相关.
3.一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,就称这两个变量线性相关.
样本相关系数
相关系数 r=.
[注意]
1当r>0时,表明两个变量正相关;当r<0时,表明两个变量负相关;
2r的绝对值越接近于1,表明两个变量的线性相关性越强;r的绝对值越接近于0,表明两个变量之间几乎不存在线性相关关系;通常|r|大于0.75时,认为两个变量有很强的线性相关关系.
一元线性回归模型
1.经验回归直线
从散点图上看,如果这些点从整体上看大致分布在通过散点图中心的一条直线附近,称两个变量之间具有线性相关关系,这条直线叫做经验回归直线.
2.经验回归方程为=x+,
其中==,
=-.
3.通过求Q= (yi-bxi-a)2的最小值而得到经验回归直线的方法,即使得样本数据的点到回归直线的距离的平方和最小,这一方法叫做最小二乘法.
判断回归模型的拟合效果
由成对样本数据(xi,yi)(i=1,2,…,n)按照最小二乘法得到经验回归方程=x+,其中y叫做观测值,叫做预测值,残差e=y-.
相对于样本点(xi,yi)的随机误差i=yi-i=yi-(xi+).
1.残差分析法
(1)作残差图:作图时纵坐标为残差,横坐标可以选为样本编号,或xi数据,或yi数据,这样作出的图形称为残差图.
(2)残差分析:残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,这样的带状区域的宽
度越窄,说明模型拟合精度越高,经验回归方程的预报精度越高.
2.决定系数 (R2)法
.R2的值越趋近于1,模型的拟合效果越好.
列联表与独立性检验
分类变量与列联表
1.分类变量:变量的不同“值”表示个体所属的不同类别,像这样的变量称为分类变量.
2.列联表:列出的两个分类变量的频数表,称为列联表.假设有两个分类变量X和Y,X表示相互对立的两个事件{X=0}和{X=1},Y表示相互对立的两个事件{Y=0}和{Y=1},其中a,b,c,d是事件{X=x,Y=y}(x,y=0,1)的频数,n是样本容量,其样本频数列联表(称为2×2列联表)如表所示:
X
Y
合计
Y=0
Y=1
X=0
a
b
a+b
X=1
c
d
c+d
合计
a+c
b+d
n=a+b+c+d
独立性检验
1.小概率值α的临界值:对于任何小概率值α,可以找到相应的正实数xα,使得下面的关系成立P(χ2≥xα)=α.我们称xα为α的临界值,这个临界值可作为判断χ2大小的标准.概率值α越小,临界值xα越大.
2.χ2的计算公式:χ2=.
3.独立性检验:利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验.
4.基于小概率值α的检验规则:
当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α;当χ2<xα时,我们没有充分证据推断H0不成立,可以认为X和Y独立(其中xα为α的临界值).
5.应用独立性检验解决实际问题的主要环节:
(1)提出零假设H0:X和Y相互独立,并给出在问题中的解释;
(2)根据抽样数据整理出2×2列联表,计算χ2的值,并与临界值xα比较;
(3)根据检验规则得出推断结论;
(4)在X和Y不独立的情况下,根据需要,通过比较相应的频率,分析X和Y间的影响规律.
6.独立性检验中几个常用的小概率值和相应的临界值:
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
【独立性检验结论】
两个分类变量和是否有关系的判断标准:
统计学研究表明:
当时,认为与无关;当时,有的把握说与有关;
当时,有的把握说与有关;当时,有的把握说与有关.
二、题型汇总
考点01:相关关系与相关系数
考点02:线性回归方程(非线性)
考点03:分类变量的两种统计表示形式
考点04:分类变量关联性的判断
考点05:独立性检验
3、
4、 题型通关
考点1 相关关系与相关系数
例1-1.如图对两组数据,和,分别进行回归分析,得到散点图如图,并求得线性回归方程分别是和,并对变量,进行线性相关检验,得到相关系数,对变量,进行线性相关检验,得到相关系数,则下列判断正确的是( )
A. B. C. D.【答案】D
【详解】由散点图可知,与负相关,与正相关,则,,故A、B错误;
且图形中点比更加集中在一条直线附近,则,又,,得.C错误,D正确.
例1-2.已知变量与的回归直线方程为,变量与负相关,则( )
A.与负相关,与负相关 B.与正相关,与正相关
C.与负相关,与正相关 D.与正相关,与负相关【答案】D
【详解】根据回归方程可知变量与正相关,又变量与负相关,
由正相关、负相关的定义可知,与负相关.故选:D
例1-3.某校数学建模兴趣小组为研究本地区儿子身高与父亲身高之间的关系,抽样调查后得出与线性相关,且经验回归方程为.调查所得的部分样本数据如下:
父亲身高
164
166
170
173
173
174
180
儿子身高
165
168
176
170
172
176
178
则下列说法正确的是( )
A.儿子身高是关于父亲身高的函数
B.当父亲身高增加时,儿子身高增加
C.儿子身高为时,父亲身高一定为
D.父亲身高为时,儿子身高的均值为【答案】D
【详解】由题意知父亲身高与儿子身高具有线性相关关系,不是函数关系,故A不正确;
当父亲身高增加时,儿子身高约增加,故B不正确;
当儿子身高为时,代入可得,父亲身高可能为,故C不正确;
若某父亲身高为,则其儿子的身高估计为,故D正确.故选:D.
例1-4.已知变量,之间的一组相关数据如下表所示:
6
8
10
12
6
3
2
据此得到变量,之间的线性回归方程为,则下列说法不正确的是( )
A.变量,之间成负相关关系 B.可以预测,当时,
C. D.该回归直线必过点【答案】C
【详解】对于A中,由,可得变量之间呈现负相关关系,所以A正确;
对于B中,当,可得,所以B正确;
对于C中,由表格中的数据,可得,
则,解得,所以C不正确;
对于D中,由,可得,所以该回归直线必经过点,所以D正确.故选:C.
例1-5.已知变量x和y满足经验回归方程,且变量x和y之间的一组相关数据如表所示,则下列说法错误的是( )
6
8
10
12
7
4
3
A.变量x和y呈负相关 B.当时,
C. D.该经验回归直线必过点【答案】C
【详解】对A:由可得,故变量x和y呈负相关,故A正确;
对B:当时,,故B正确;
对C:由表可得,,
故,解得,故C错误;
对D:由,,故D正确.选:C.
考点02 线性回归方程(非线性)
例2-1.某零售行业为了解宣传对销售额的影响,在本市内随机抽取了5个大型零售卖场,得到其宣传费用x(单位:万元)和销售额y(单位:万元)的数据如下:
x(万元)
3
4
5
6
7
y(万元)
45
50
60
65
70
由统计数据知y与x满足线性回归方程,其中,当宣传费用时,销售额y的估计值为( )
A.89.5 B.90.5 C.92.5 D.94.5【答案】B
【详解】由表中数据可知,,所以,解得,
所以当宣传费用时,销售额y的估计值为.故选:B.
例2-2.下列说法中,正确命题的个数为( )
① 已知随机变量服从二项分布,若,则.
②对具有线性相关关系的变量,,其线性回归方程为,若样本点的中心为,则实数的值是.
③以模型去拟合一组数据时,为了求出回归方程,设,求得线性回归方程为,则、的值分别是和.
④若样本数据的方差为,则数据:的方差为16
A.0个 B.1个 C.2个 D.3个【答案】D
【详解】对于①:因为服从二项分布,所以,
所以,解得,故①正确;
对于②:因为线性回归直线必过样本中心点,所以,可得,故②正确;
对于③:由两边取对数可得,
令,求得线性回归方程为,所以,,则,,故③正确;
对于④:若样本数据的方差为,则数据的方差为,故④错误;
故正确的为①②③共个.故选:D
例2-3.下列说法正确的是( )
A.若数据,,…,的方差为1,则数据,,…,的标准差为4
B.已知一组数据2,3,5,7,8,9,9,11,则该组数据的第40百分位数为6
C.一组样本数据的频率分布直方图是单峰的且形状是对称的,则该组数据的平均数和中位数应该大体上差不多
D.经验回归直线恒过,且在回归直线上的样本点越多,拟合效果越好【答案】C
【详解】解:对于A项,若数据的方差为1,则数据的方差为,标准差为2,故A项错误;
对于B项,由于,则该组数据的第40百分位数是第4个数据,为7,故B项错误;
对于C项,由于频率分布直方图是单峰的且形状是对称的,故C项正确;
对于D项,应是偏差平方和越小,拟合效果越好,故D项错误;故选:C
例2-4.下列说法中正确的是( )
A.具有线性相关关系的变量,,其线性回归方程为,若样本的中心,则
B.数据3,4,2,8,1,5,8,6的中位数为5
C.将一组数据中的每一个数据加上同一个正数后,方差变大
D.若甲、乙两组数据的相关系数分别为和0.89,则甲组数据的线性相关性更强【答案】D
【详解】对于A,把代入,可得,解得,故A错误;
对于B,数据3,4,2,8,1,5,8,6,即1,2,3,4,5,6,8,8的中位数为,故B错误;
对于C,将一组数据中的每一个数据加上同一个正数后,方差不变,故C错误;
对于D,若甲、乙两组数据的相关系数分别为和0.89,,因为,则甲组数据的线性相关性更强,故D正确.故选:D.
例2-5.下列命题错误的是( )
A.两个随机变量的线性相关性越强,相关系数的绝对值越接近于1
B.设,若,,则
C.线性回归直线一定经过样本点的中心
D.一个袋子中有100个大小相同的球,其中有40个黄球、60个白球,从中不放回地随机摸出20个球作为样本,用随机变量X表示样本中黄球的个数,则X服从二项分布,且【答案】D
【详解】A:两个随机变量的线性相关性越强,相关系数的绝对值越接近于1,故A正确;
B:由,得,解得,故B正确;
C:线性回归直线一定经过样本点的中心,故C正确;
D:由于是不放回地随机摸出20个球作为样本,
所以由超几何分布的定义知服从超几何分布,得,故D错误;故选:D
例2-6.下列说法中正确的个数为( )个
①对立事件一定是互斥事件;②在经验回归直线方程中,当解释变量每增加一个单位时,预报变量减少0.1个单位;③两个随机变量的线性相关性越强,相关系数绝对值越接近于1;④在回归分析模型中,若相关指数越小,则残差平方和越大,模型的拟合效果越好.
A.1 B.2 C.3 D.4【答案】B
【详解】对于①,对立事件一定是互斥事件,但互斥事件未必是对立事件,故①正确;
对于②,根据回归直线方程中回归系数的含义可知:当解释变量每增加一个单位时,预报变量增加个单位,故②错误;
对于③,根据相关系数的计算公式可知:两个变量的线性相关性越强,相关系数的绝对值越接近,故③正确;
对于④,根据回归分析的基本思想可知:相关指数越小,则残差平方和越大,模型的拟合效果越差,④错误.
例2-7.下列说法不正确的是( ).
A.一组数据10,11,11,12,13,14,16,18,20,22的第60百分位数为14
B.若随机变量服从正态分布,且,则
C.若线性相关系数越接近1,则两个变量的线性相关程度越高
D.对具有线性相关关系的变量、,且回归方程为,若样本点的中心为,则实数的值是【答案】A
【详解】对A:因为,所以第百分位数为,A错误;
对B:若随机变量服从正态分布,且,
则,则,B正确;
对C:若线性相关系数越接近,则两个变量的线性相关性越强,C正确;
对于D,样本点的中心为,所以,,
因为满足线性回归方程,所以,所以,D正确.故选:A
考点03:分类变量的两种统计表示形式
例3-1.(多选)根据如图所示的等高堆积条形图,下列叙述正确的是( )
A.吸烟患肺病的频率约为0.2 B.吸烟不患肺病的频率约为0.8
C.不吸烟患肺病的频率小于0.05 D.吸烟与患肺病无关系 【答案】ABC
【解析】:从等高堆积条形图上可以明显地看出,吸烟患肺病的频率远远大于不吸烟患肺病的频率.ABC都正确.
例3-2.假设有两个分类变量X和Y,它们的值域分别为{x1,x2}和{y1,y2},其2×2列联表为
X
Y
合计
y1
y2
x1
a
b
a+b
x2
c
d
c+d
合计
a+c
b+d
a+b+c+d
对同一样本,以下数据能说明X与Y有关的可能性最大的一组为( )
A.a=5,b=4,c=3,d=2 B.a=5,b=3,c=4,d=2
C.a=2,b=3,c=4,d=5 D.a=3,b=2,c=4,d=5 【答案】D
【解析】:对于同一样本,|ad-bc|越小,说明x与y相关性越弱,而|ad-bc|越大,说明x与y相关性越强,
通过计算知,对于A、B、C都有|ad-bc|=|10-12|=2;对于选项D,有|ad-bc|=|15-8|=7,显然7>2.
分类变量的两种统计表示形式
(1)等高堆积条形图,根据等高堆积条形图的高度差判断两分类变量是否有关联及关联强弱;
(2)2×2列联表,直接利用2×2列联表中的数据进行计算分析,用定量的方式判断两分类变量是否有关联及关联的强弱.
考点04:分类变量关联性的判断
例4-1.某科研机构为了研究中年人秃发与心脏病是否有关,随机调查了一些中年人的情况,具体数据如表:
心脏病
无心脏病
秃发
20
300
不秃发
5
450
根据表中数据得到χ2≈15.968,因为χ2>10.828,则断定秃发与心脏病有关系.那么这种判断出错的可能性为( )
A.0.001 B.0.05
C.0.025 D.0.01
【解析】 因为χ2>10.828=x0.001,因此判断出错的可能性为0.001,故选A.【答案】A
例4-2.某市政府调查市民收入增减与旅游愿望的关系时,采用独立性检验法抽查了3 000人,计算得χ2=6.023,则市政府断言市民收入增减与旅游愿望有关系的可信程度是( )
A.90% B.95%
C.99% D.99.5% 【答案】B
【解析】:由临界值表,得6.023>3.841=x0.05,
所以可断言市民收入增减与旅游愿望有关系的可信程度为95%.
考点05独立性检验
例5-1.“民政送温暖,老人有饭吃”.近年来,各级政府,重视提高老年人的生活质量.在医疗、餐饮等多方面,为老人提供了方便.单从用餐方面,各社区,创建了“爱心食堂”、“爱心午餐”、“老人食堂”等等不同名称的食堂,解决了老人的吃饭问题.“爱心食堂A”为了更好地服务老人,于3月28日12时,食堂管理层人员对这一时刻用餐的118人,对本食堂推出的15种菜品按性价比“满意”和“不满意”作问卷调查,其中,有13人来食堂用餐不足5次,另有儿童5人,他们对菜品不全了解,不予问卷统计,在被问卷的人员中男性比女性多20人.用餐者对15种菜品的性价比认为“满意”的菜品数记为,当时,认为该用餐者对本食堂的菜品“满意”,否则,认为“不满意”.统计结果部分信息如下表:
满意
不满意
合计
参考公式和临界值表,其中,.
男
40
女
20
0.100
0.050
0.010
0.001
2.706
3.841
6.635
10.828
合计
(1)①完成上面列联表;
②能有多大(百分比)的把握认为用餐者对本食堂菜品的性价比是否满意与性别有关?
(2)用分层抽样在对菜品的性价比“满意”的人群中抽取6人,再从这6人中随机抽取3人,用表示抽取的3人中的男性人数,求的分布列和期望.
【详解】(1)①由题意,问卷调查人数为(人),其中,男性60人,女性40人,
得完整列联表如下表:
满意
不满意
合计
男
40
20
60
女
20
20
40
吕计
60
40
100
②,而.
所以有的把握认为用餐者对本食堂菜品的性价比是否满意与性别有关.
(2)由(1)知,对菜品的性价比“满意”的人群中有40名男性和20名女性,用分层抽样分别抽取男性4人和女性2人,易知的可能取值为,
,,,
所以的分布列为
.
例5-2.某学校举办了一次主题为“科技兴国,强国有我”的知识竞赛,并从所有参赛学生中随机抽取了男、女生各50人,统计他们的竞赛成绩(满分100分,每名参赛学生至少得60分),并将成绩分成4组:,,,(单位:分),得到如下的频率分布直方图.
(1)现将竞赛成绩不低于90分的学生称为“科技知识达人”,成绩低于90分的学生称为“非科技知识达人”.把随机抽取的参赛学生数据统计如下,将下列列联表补充完整,并判断是否有95%的把握认为能否获得“科技知识达人”称号与性别有关.
科技知识达人
非科技知识达人
合计
附:(其中).
男生
15
女生
0.10
0.05
0.025
0.010
0.005
0.001
2.706
3.841
5.024
6.635
7.879
10.828
合计
(2)将频率视为概率,从所有参赛学生中随机抽取3人进行访谈,记这3人中是“科技知识达人”的人数为,求的分布列与数学期望.
【详解】(1)列联表补充完整如下:
科技知识达人
非科技知识达人
合计
男生
15
35
50
女生
5
45
50
合计
20
80
100
零假设:能否获得“科技知识达人”称号与性别无关,
则,
所以依据小概率值的独立性检验,我们推断不成立,即有的把握认为能否获得“科技知识达人”称号与性别有关;
(2)从所有参赛学生中任取一人是“科技知识达人”的概率,
由题意可知:,的可能取值为0,1,2,3,
则,
,
,
,
所以的分布列为:
0
1
2
3
所以.
例5-3.某数学老师在其任教的甲、乙两个班级中各抽取30名学生进行测试,分数分布如表:
分数区间
甲班人数
乙班人数
[0,30)
3
6
[30,60)
6
6
[60,90)
9
12
[90,120)
6
3
[120,150]
6
3
(1)若成绩在120分以上(含120分)为优秀,求从乙班参加测试的成绩在90分以上(含90分)的学生中,随机任取2名学生,恰有1名为优秀的概率;
(2)根据以上数据完成下面的2×2列联表,则在犯错的概率不超过0.1的前提下,是否有足够的把握认为学生的数字成绩优秀与否和班级有关?
优秀
不优秀
总计
参考公式:,其中.
甲班
乙班
总计
【详解】(1)乙班参加测试的分以上的同学有人,其中成绩优秀的有3人,记为,另3人记为,
从这六名学生中抽取两名的样本空间,有15个样本点,
设事件表示恰有一位学生成绩优秀,则,有9个样本点,
所以所求概率为.
(2)由给定的分数分布表,得2×2列联表:
优秀
不优秀
总计
甲班
6
24
30
乙班
3
27
30
总计
9
51
60
,
在犯错概率小于的前提下,没有足够的把握说明学生的数学成绩是否优秀与班级有关系.
例5-4.2024年3月,某校语文教师对学生提出“3月读一本书”的要求,每位学生都选择且只能选择《红楼梦》和《三国演义》中的一本,现随机调查该校男、女生各100人,整理得到列联表如下.
《红楼梦》
《三国演义》
总计
参考公式,
其中.
男生
30
70
女生
60
40
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
总计
(1)依据小概率值的独立性检验,能否认为学生选择《红楼梦》还是《三国演义》与性别有关?
(2)已知学生选择哪本书是相互独立的,用频率代替概率,从该校选择《红楼梦》的学生中随机抽取3人,抽到的女生人数设为,求的分布列和数学期望.
【详解】(1)因为,
所以依据小概率值的独立性检验,可以认为学生选择《红楼梦》还是《三国演义》与性别有关.
(2)由题可知,的所有可能取值为0,1,2,3,
选择《红楼梦》的学生是女生的概率为,所以.
所以, ,
, ,
所以的分布列为
0
1
2
3
P
所以.
学科网(北京)股份有限公司
$$
第8章 成对数据的统计分析
一、知识点回顾
成对数据的统计的相关性
变量的相关关系
1.常见的两变量之间的关系有两类:一类是函数关系,另一类是相关关系.与函数关系不同,相关关系是一种非确定性关系.
2.如果从整体上看,当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势,就称这两个变量正相关;如果当一个变量的值增加时,另一个变量的相应值呈现减少的趋势,则称这两个变量负相关.
3.一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,就称这两个变量线性相关.
样本相关系数
相关系数 r=.
[注意]
1当r>0时,表明两个变量正相关;当r<0时,表明两个变量负相关;
2r的绝对值越接近于1,表明两个变量的线性相关性越强;r的绝对值越接近于0,表明两个变量之间几乎不存在线性相关关系;通常|r|大于0.75时,认为两个变量有很强的线性相关关系.
一元线性回归模型
1.经验回归直线
从散点图上看,如果这些点从整体上看大致分布在通过散点图中心的一条直线附近,称两个变量之间具有线性相关关系,这条直线叫做经验回归直线.
2.经验回归方程为=x+,
其中==,
=-.
3.通过求Q= (yi-bxi-a)2的最小值而得到经验回归直线的方法,即使得样本数据的点到回归直线的距离的平方和最小,这一方法叫做最小二乘法.
判断回归模型的拟合效果
由成对样本数据(xi,yi)(i=1,2,…,n)按照最小二乘法得到经验回归方程=x+,其中y叫做观测值,叫做预测值,残差e=y-.
相对于样本点(xi,yi)的随机误差i=yi-i=yi-(xi+).
1.残差分析法
(1)作残差图:作图时纵坐标为残差,横坐标可以选为样本编号,或xi数据,或yi数据,这样作出的图形称为残差图.
(2)残差分析:残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,这样的带状区域的宽
度越窄,说明模型拟合精度越高,经验回归方程的预报精度越高.
2.决定系数 (R2)法
.R2的值越趋近于1,模型的拟合效果越好.
列联表与独立性检验
分类变量与列联表
1.分类变量:变量的不同“值”表示个体所属的不同类别,像这样的变量称为分类变量.
2.列联表:列出的两个分类变量的频数表,称为列联表.假设有两个分类变量X和Y,X表示相互对立的两个事件{X=0}和{X=1},Y表示相互对立的两个事件{Y=0}和{Y=1},其中a,b,c,d是事件{X=x,Y=y}(x,y=0,1)的频数,n是样本容量,其样本频数列联表(称为2×2列联表)如表所示:
X
Y
合计
Y=0
Y=1
X=0
a
b
a+b
X=1
c
d
c+d
合计
a+c
b+d
n=a+b+c+d
独立性检验
1.小概率值α的临界值:对于任何小概率值α,可以找到相应的正实数xα,使得下面的关系成立P(χ2≥xα)=α.我们称xα为α的临界值,这个临界值可作为判断χ2大小的标准.概率值α越小,临界值xα越大.
2.χ2的计算公式:χ2=.
3.独立性检验:利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验.
4.基于小概率值α的检验规则:
当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α;当χ2<xα时,我们没有充分证据推断H0不成立,可以认为X和Y独立(其中xα为α的临界值).
5.应用独立性检验解决实际问题的主要环节:
(1)提出零假设H0:X和Y相互独立,并给出在问题中的解释;
(2)根据抽样数据整理出2×2列联表,计算χ2的值,并与临界值xα比较;
(3)根据检验规则得出推断结论;
(4)在X和Y不独立的情况下,根据需要,通过比较相应的频率,分析X和Y间的影响规律.
6.独立性检验中几个常用的小概率值和相应的临界值:
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
【独立性检验结论】
两个分类变量和是否有关系的判断标准:
统计学研究表明:
当时,认为与无关;当时,有的把握说与有关;
当时,有的把握说与有关;当时,有的把握说与有关.
二、题型汇总
考点01:相关关系与相关系数
考点02:线性回归方程(非线性)
考点03:分类变量的两种统计表示形式
考点04:分类变量关联性的判断
考点05:独立性检验
3、
4、 题型通关
考点1 相关关系与相关系数
例1-1.如图对两组数据,和,分别进行回归分析,得到散点图如图,并求得线性回归方程分别是和,并对变量,进行线性相关检验,得到相关系数,对变量,进行线性相关检验,得到相关系数,则下列判断正确的是( )
A. B. C. D.
例1-2.已知变量与的回归直线方程为,变量与负相关,则( )
A.与负相关,与负相关 B.与正相关,与正相关
C.与负相关,与正相关 D.与正相关,与负相关
例1-3.某校数学建模兴趣小组为研究本地区儿子身高与父亲身高之间的关系,抽样调查后得出与线性相关,且经验回归方程为.调查所得的部分样本数据如下:
父亲身高
164
166
170
173
173
174
180
儿子身高
165
168
176
170
172
176
178
则下列说法正确的是( )
A.儿子身高是关于父亲身高的函数
B.当父亲身高增加时,儿子身高增加
C.儿子身高为时,父亲身高一定为
D.父亲身高为时,儿子身高的均值为
例1-4.已知变量,之间的一组相关数据如下表所示:
6
8
10
12
6
3
2
据此得到变量,之间的线性回归方程为,则下列说法不正确的是( )
A.变量,之间成负相关关系
B.可以预测,当时,
C.
D.该回归直线必过点
例1-5.已知变量x和y满足经验回归方程,且变量x和y之间的一组相关数据如表所示,则下列说法错误的是( )
6
8
10
12
7
4
3
A. 变量x和y呈负相关
B.当时,
C.
D.该经验回归直线必过点
考点02 线性回归方程(非线性)
例2-1.某零售行业为了解宣传对销售额的影响,在本市内随机抽取了5个大型零售卖场,得到其宣传费用x(单位:万元)和销售额y(单位:万元)的数据如下:
x(万元)
3
4
5
6
7
y(万元)
45
50
60
65
70
由统计数据知y与x满足线性回归方程,其中,当宣传费用时,销售额y的估计值为( )
A.89.5 B.90.5 C.92.5 D.94.5
例2-2.下列说法中,正确命题的个数为( )
① 已知随机变量服从二项分布,若,则.
②对具有线性相关关系的变量,,其线性回归方程为,若样本点的中心为,则实数的值是.
③以模型去拟合一组数据时,为了求出回归方程,设,求得线性回归方程为,则、的值分别是和.
④若样本数据的方差为,则数据:的方差为16
A.0个 B.1个 C.2个 D.3个
例2-3.下列说法正确的是( )
A.若数据,,…,的方差为1,则数据,,…,的标准差为4
B.已知一组数据2,3,5,7,8,9,9,11,则该组数据的第40百分位数为6
C.一组样本数据的频率分布直方图是单峰的且形状是对称的,则该组数据的平均数和中位数应该大体上差不多
D.经验回归直线恒过,且在回归直线上的样本点越多,拟合效果越好
例2-4.下列说法中正确的是( )
A.具有线性相关关系的变量,,其线性回归方程为,若样本的中心,则
B.数据3,4,2,8,1,5,8,6的中位数为5
C.将一组数据中的每一个数据加上同一个正数后,方差变大
D.若甲、乙两组数据的相关系数分别为和0.89,则甲组数据的线性相关性更强
例2-5.下列命题错误的是( )
A.两个随机变量的线性相关性越强,相关系数的绝对值越接近于1
B.设,若,,则
C.线性回归直线一定经过样本点的中心
D.一个袋子中有100个大小相同的球,其中有40个黄球、60个白球,从中不放回地随机摸出20个球作为样本,用随机变量X表示样本中黄球的个数,则X服从二项分布,且
例2-6.下列说法中正确的个数为( )个
①对立事件一定是互斥事件;
②在经验回归直线方程中,当解释变量每增加一个单位时,预报变量减少0.1个单位;
③两个随机变量的线性相关性越强,相关系数绝对值越接近于1;
④在回归分析模型中,若相关指数越小,则残差平方和越大,模型的拟合效果越好.
A.1 B.2 C.3 D.4
例2-7.下列说法不正确的是( ).
A.一组数据10,11,11,12,13,14,16,18,20,22的第60百分位数为14
B.若随机变量服从正态分布,且,则
C.若线性相关系数越接近1,则两个变量的线性相关程度越高
D.对具有线性相关关系的变量、,且回归方程为,若样本点的中心为,则实数的值是
考点03:分类变量的两种统计表示形式
例3-1.(多选)根据如图所示的等高堆积条形图,下列叙述正确的是( )
A. 吸烟患肺病的频率约为0.2
B.吸烟不患肺病的频率约为0.8
C.不吸烟患肺病的频率小于0.05
D.吸烟与患肺病无关系
例3-2.假设有两个分类变量X和Y,它们的值域分别为{x1,x2}和{y1,y2},其2×2列联表为
X
Y
合计
y1
y2
x1
a
b
a+b
x2
c
d
c+d
合计
a+c
b+d
a+b+c+d
对同一样本,以下数据能说明X与Y有关的可能性最大的一组为( )
A. a=5,b=4,c=3,d=2
B.a=5,b=3,c=4,d=2
C.a=2,b=3,c=4,d=5
D.a=3,b=2,c=4,d=5
分类变量的两种统计表示形式
(1)等高堆积条形图,根据等高堆积条形图的高度差判断两分类变量是否有关联及关联强弱;
(2)2×2列联表,直接利用2×2列联表中的数据进行计算分析,用定量的方式判断两分类变量是否有关联及关联的强弱.
考点04:分类变量关联性的判断
例4-1.某科研机构为了研究中年人秃发与心脏病是否有关,随机调查了一些中年人的情况,具体数据如表:
心脏病
无心脏病
秃发
20
300
不秃发
5
450
根据表中数据得到χ2≈15.968,因为χ2>10.828,则断定秃发与心脏病有关系.那么这种判断出错的可能性为( )
A.0.001 B.0.05
C.0.025 D.0.01
例4-2.某市政府调查市民收入增减与旅游愿望的关系时,采用独立性检验法抽查了3 000人,计算得χ2=6.023,则市政府断言市民收入增减与旅游愿望有关系的可信程度是( )
A.90% B.95%
C.99% D.99.5%
考点05独立性检验
例5-1.“民政送温暖,老人有饭吃”.近年来,各级政府,重视提高老年人的生活质量.在医疗、餐饮等多方面,为老人提供了方便.单从用餐方面,各社区,创建了“爱心食堂”、“爱心午餐”、“老人食堂”等等不同名称的食堂,解决了老人的吃饭问题.“爱心食堂A”为了更好地服务老人,于3月28日12时,食堂管理层人员对这一时刻用餐的118人,对本食堂推出的15种菜品按性价比“满意”和“不满意”作问卷调查,其中,有13人来食堂用餐不足5次,另有儿童5人,他们对菜品不全了解,不予问卷统计,在被问卷的人员中男性比女性多20人.用餐者对15种菜品的性价比认为“满意”的菜品数记为,当时,认为该用餐者对本食堂的菜品“满意”,否则,认为“不满意”.统计结果部分信息如下表:
满意
不满意
合计
参考公式和临界值表,其中,.
男
40
女
20
0.100
0.050
0.010
0.001
2.706
3.841
6.635
10.828
合计
(1)①完成上面列联表;
②能有多大(百分比)的把握认为用餐者对本食堂菜品的性价比是否满意与性别有关?
(2)用分层抽样在对菜品的性价比“满意”的人群中抽取6人,再从这6人中随机抽取3人,用表示抽取的3人中的男性人数,求的分布列和期望.
例5-2.某学校举办了一次主题为“科技兴国,强国有我”的知识竞赛,并从所有参赛学生中随机抽取了男、女生各50人,统计他们的竞赛成绩(满分100分,每名参赛学生至少得60分),并将成绩分成4组:,,,(单位:分),得到如下的频率分布直方图.
(1)现将竞赛成绩不低于90分的学生称为“科技知识达人”,成绩低于90分的学生称为“非科技知识达人”.把随机抽取的参赛学生数据统计如下,将下列列联表补充完整,并判断是否有95%的把握认为能否获得“科技知识达人”称号与性别有关.
科技知识达人
非科技知识达人
合计
附:(其中).
男生
15
女生
0.10
0.05
0.025
0.010
0.005
0.001
2.706
3.841
5.024
6.635
7.879
10.828
合计
(2)将频率视为概率,从所有参赛学生中随机抽取3人进行访谈,记这3人中是“科技知识达人”的人数为,求的分布列与数学期望.
例5-3.某数学老师在其任教的甲、乙两个班级中各抽取30名学生进行测试,分数分布如表:
分数区间
甲班人数
乙班人数
[0,30)
3
6
[30,60)
6
6
[60,90)
9
12
[90,120)
6
3
[120,150]
6
3
(1)若成绩在120分以上(含120分)为优秀,求从乙班参加测试的成绩在90分以上(含90分)的学生中,随机任取2名学生,恰有1名为优秀的概率;
(2)根据以上数据完成下面的2×2列联表,则在犯错的概率不超过0.1的前提下,是否有足够的把握认为学生的数字成绩优秀与否和班级有关?
优秀
不优秀
总计
参考公式:,其中.
甲班
乙班
总计
例5-4.2024年3月,某校语文教师对学生提出“3月读一本书”的要求,每位学生都选择且只能选择《红楼梦》和《三国演义》中的一本,现随机调查该校男、女生各100人,整理得到列联表如下.
《红楼梦》
《三国演义》
总计
参考公式,
其中.
男生
30
70
女生
60
40
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
总计
(1)依据小概率值的独立性检验,能否认为学生选择《红楼梦》还是《三国演义》与性别有关?
(2)已知学生选择哪本书是相互独立的,用频率代替概率,从该校选择《红楼梦》的学生中随机抽取3人,抽到的女生人数设为,求的分布列和数学期望.
学科网(北京)股份有限公司
$$