内容正文:
第八章 成对数据的统计分析题型汇总
题型预览
题型一 相关系数的意义及辨析
题型二 相关系数的计算
题型三 求线性回归直线方程
题型四 样本中心点的相关问题
题型五 非线性回归的问题
题型六 残差的计算
题型七 独立性检验的概念及辨析
题型八 卡方的计算
知识清单
变量间的相关关系
相关关系的定义:两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系.两个变量之间的关系分为函数关系和相关关系.
【注意】相关关系与函数关系的异同点
(1)相同点:均是指两个变量的关系
(2)不同点:函数关系是一种确定的关系,而相关关系是一种非确定关系
散点图及其应用
(1)散点图:为直观地描述成对样本数据中两个变量间的关系,用横轴表示其中的一个变量,纵轴表示另一个变量,则成对样本数据都可以用直角坐标系中的点表示出来,由这些点组成的统计图叫做散点图.
(2)散点图的作用
如果散点图中变量的对应点分布在某条曲线的附近,我们就可以得出结论:这两个变量具有相关性,如图(1)(2).如果变量的对应点分布没有规律,我们就可以得出结论:这两个变量不具有相关性,如图(3).
(3)正相关与负相关
从整体上看,当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势,我们就称这两个变量正相关;当一个变量的值增加时,另一个变量的相应值呈现减小的趋势,则称这两个变量负相关.
(4)线性相关与曲线相关
一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们就称这两个变量线性相关.
一般地,如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量非线性相关或曲线相关.
样本相关系数
(1)一般地,如果变量x和y正相关,那么关于均值平移后的大多数散点将分布在第一象限、第三象限,对应的成对数据同号的居多;如果变量x和y负相关,那么关于均值平移后的大多数散点将分布在第二象限、第四象限,对应的成对数据异号的居多.
(2)样本相关系数r=.
(3)样本相关系数r的取值范围为[-1,1].
当|r|越接近1时,成对样本数据的线性相关程度越强;
当|r|越接近0时,成对样本数据的线性相关程度越弱.
【注意】 样本相关系数r是一个描述成对样本数据的数字特征,它的正负性可以反映成对样本数据的变化特征:
当r>0时,称成对样本数据正相关;
当r<0时,称成对样本数据负相关;
当|r|=1时,表明成对样本数据都在一条直线上,即两个变量之间满足一种线性关系.
当r=0时,只表明成对样本数据间没有线性相关关系,但不排除它们之间有其他相关关系.
一元线性回归模型
为Y关于x的一元线性回归模型.其中,Y称为因变量或响应变量,x称为自变量或解释变量;a和b为模型的未知参数,a称为截距参数,b称为斜率参数;e是Y与bx+a之间的随机误差.
最小二乘法和经验回归方程
(1)有关概念
=x+称为Y关于x的经验回归方程,也称经验回归函数或经验回归公式,其图形称为经验回归直线,求经验回归方程的方法叫做最小二乘法,求得的,叫做b,a的最小二乘估计.
(2)计算公式
【注意】(1)经验回归直线过点()
(2)经验回归方程=x+中的表示x增加1个单位时,y的平均变化量为,而表示y不随x的变化而变化的部分
残差及残差分析
(1)对于响应变量Y,通过观测得到的数据称为观测值.通过经验回归方程得到的称为预测值,观测值减去预测值所得的差称为残差.
(2)作图时纵坐标为残差,横坐标可以选为样本编号,或解释变量的观测值等,这样作出的图形称为残差图.在残差图中,残差比较均匀地落在水平的带状区域中,说明选用的模型比较合适,这样的带状区域的宽度越窄,说明模型拟合精度越高.
(3)残差分析:残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果,以及判断原始数据中是否存在可疑数据等,这方面工作称为残差分析.
残差平方和与决定系数R2
(1)残差图法:在残差图中,如果残差比较均匀地集中在以横轴为对称轴的水平带状区域内,则说明经验回归方程较好地刻画了两个变量的关系.
(3)决定系数R2法:可以用R2=1-来比较两个模型的拟合效果,R2越小,模型拟合效果越差,R2越大,模型拟合效果越好.
【注意】决定系数R2的取值范围是0≤R2≤1
刻画回归效果的三种方法
(1)残差图法:残差比较均匀地落在水平带状区域内,则说明选用的模型比较合适.
(3)决定系数R2法:R2= 越接近1,表明模型的拟合效果越好.
非线性回归分析
(1)非线性回归分析的思想
研究两个变量的关系时,依据样本点画出散点图,从整体上看,如果样本点没有分布在某个带状区域内,就称这两个变量之间不具有线性相关关系,此时不能直接利用经验回归方程来建立两个变量之间的关系.
(2)非线性经验回归方程
当回归方程不是形如=x+(,∈R)时,称之为非线性经验回归方程.当两个变量不呈线性相关关系时,依据样本点的分布选择合适的曲线方程来拟合数据,可通过变量代换,利用线性回归模型建立两个变量间的非线性经验回归方程.
非线性回归问题的处理方法
(1)指数函数型y=eb x+a
①函数y=eb x+a的图象,如图所示.
②处理方法:两边取对数得ln y=ln ebx+a,即ln y=bx+a.令z=ln y,把原始数据(x,y)转化为(x,z),再根据线性回归模型的方法求出a,b.
(2)对数函数型y=b ln x+a
①函数y=b ln x+a的图象,如图所示.
②处理方法:设x′=ln x,原方程可化为y=bx′+a,
再根据线性回归模型的方法求出a,b.
(3)y=bx2+a型
处理方法:设x′=x2,原方程可化为y=bx′+a,再根据线性回归模型的方法求出a,b.
数值变量与分类变量
数值变量:数值变量的取值为实数,其大小和运算都有实际含义.
分类变量:这里所说的变量和值不一定是具体的数值,例如,性别变量,其取值为男和女两种.我们经常会使用一种特殊的随机变量,以区别不同的现象或性质,这类随机变量称为分类变量,分类变量的取值可以用实数表示.
【注意】分类变量的取值可以用实数来表示,例如男性,女性可以用1,0表示,学生的班级可以用1,2,3来表示.这些数值只作编号使用,并没有大小和运算意义.分类变量是相对于数值变量来说的
列联表
定义一对分类变量X和Y,我们整理数据如表所示:
X
Y
合计
Y=0
Y=1
X=0
a
b
a+b
X=1
c
d
c+d
合计
a+c
b+d
n=a+b+c+d
上表是关于分类变量X和Y的抽样数据的2×2列联表,最后一行的前两个数分别是事件{Y=0}和{Y=1}中样本点的个数;最后一列的前两个数分别是事件{X=0}和{X=1}中样本点的个数;中间的四个数a,b,c,d是事件{X=x,Y=y}(x,y=0,1)中样本点的个数;右下角格中的数n是样本空间中样本点的总数.
独立性检验的理解
(1)零假设:设X和Y为定义在Ω上,取值于{0,1}的成对分类变量.由于{X=0}和{X=1},{Y=0}和{Y=1}都是互为对立事件,故要判断事件{X=1}和{Y=1}之间是否有关联,需要判断假定关系H0:P(Y=1|X=0)=P(Y=1|X=1)是否成立.
(2)独立性检验的公式
χ2=,其中n=a+b+c+d,用随机变量χ2取值的大小作为判断零假设H0是否成立的依据,当它比较大时推断H0不成立,否则认为H0成立.
(3)临界值:对任何小概率值α,可以找到相应的正实数xα,使P(χ2≥xα)=α.称xα为α的临界值.临界值可作为判断χ2大小的标准.概率值α越小,临界值xα越大.
(4)基于小概率值α的检验规则:当χ2≥xα时,推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α;
当χ2<xα时,没有充分证据推断H0不成立,可以认为X和Y独立.利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验.
(5)χ2独立性检验中几个常用的小概率值和相应的临界值.
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
【注意】χ2越小,独立性越强,相关性越弱;χ2越大,独立性越弱,相关性越强
题型突破
题型一 相关系数的意义及辨析
1.对四组数据进行统计,获得如图所示的散点图,关于其样本相关系数的比较,正确的是( )
A. B.
C. D.
2.某研究小组为了探究变量x与y之间的线性相关关系,收集了5组数据,(),并绘制成如图所示的散点图(点A,B,C,D,E).经计算,这5组数据的样本相关系数为r.若去掉点后,剩余4组数据的样本相关系数为,则下列结论正确的是( )
A. B. C. D.
3.通过随机抽样绘制得到如图所示的某种商品每千克价格(单位:百元)与该商品消费者年需求量(单位:千克)的散点图.下列说法正确的是( ).
A.若去掉图中右下方的点后,“每千克价格”与“年需求量”这两个变量的线性相关系数变大
B.若去掉图中右下方的点后,“每千克价格”与“年需求量”这两个变量的线性相关系数变小
C.将“每千克价格”的单位由百元变为元,“每千克价格”与“年需求量”这两个变量的线性相关系数变大
D.将“每千克价格”的单位由百元变为元,“每千克价格”与“年需求量”这两个变量的线性相关系数变小
4.甲、乙、丙、丁各自研究两个随机变量的数据,若甲、乙、丙、丁计算得到各自研究的两个随机变量的样本相关系数分别为,,,,则这四人中,研究的两个随机变量的线性相关程度最高的是( )
A.甲 B.乙 C.丙 D.丁
题型二 相关系数的计算
5.某厂的生产原料耗费(单位:百万元)与销售额(单位:百万元)之间有如下的对应关系:
与之间是否具有线性相关关系?若有,判断相关性的强弱.
6.为分析肥胖程度对总胆固醇与空腹血糖的影响,在肥胖人群中随机抽出8人,他们的肥胖指数BMI值、总胆固醇TC指标值(单位:mmol/L),空腹血糖GLU指标值(单位:mmol/L)如表所示:
人员编号
1
2
3
4
5
6
7
8
BMI值x
25
27
30
32
33
35
40
42
TC指标值y
5.3
5.4
5.5
5.6
5.7
6.5
6.9
7.1
GLU指标值z
6.7
7.2
7.3
8.0
8.1
8.6
9.0
9.1
用变量y与x,z与x的相关系数,分别说明TC指标值与BMI值、GLU指标值与BMI值的相关程度.
参考公式:
相关系数,
参考数据:,,,,,,,.
7.随着智能手机的普及,使用手机上网成为人们日常生活的一部分,很多消费者对手机流量的需求越来越大,某通信公司为了更好地满足消费者对流量的需求,准备推出一款流量包.该通信公司选了5个城市(总人数、经济发展情况、消费能力等方面比较接近)采用不同的定价方案作为试点,经过一个月的统计,发现该流量包的定价x(单位:元/月)和购买人数y(单位:万人)的关系如下表:
x
30
35
40
45
50
y
18
14
10
8
5
计算该流量包的定价x与购买人数y的相关系数________.(结果保留3位小数)
8.科研人员在对人体脂肪含量和年龄之间关系的研究中,获得了一些年龄和脂肪含量的样本数据,如表:
x(年龄/岁)
26
27
39
41
49
53
56
58
60
61
y(脂肪含量/%)
14.5
17.8
21.2
25.9
26.3
29.6
31.4
33.5
35.2
34.6
根据上表的数据得到如下的散点图.
根据上表中的样本数据及其散点图,计算样本相关系数(精确到),并刻画它们的相关程度.
(参考数据:,,,)
题型三 求线性回归直线方程
9.为了得到某种新产品表面的腐蚀刻线,技术员通过实验检测,发现该产品的腐蚀深度(单位:)与腐蚀时间(单位:)有关,并收集数据如下表:
腐蚀时间t/s
5
10
15
20
30
40
腐蚀深度 y/μm
5
8
10
13
17
19
(1)根据表中样本数据,计算样本相关系数,(系数精确到)并推断它们的线性相关程度;
(2)建立关于的线性回归方程(系数精确到);若腐蚀时间为,请估计腐蚀深度.参考数据:
参考公式:相关系数
线性回归方程的斜率 截距
10.某人工智能公司从某年起5年的利润情况如下表所示.
第年
1
2
3
4
5
利润亿元
3.3
3.6
4.4
4.8
5.2
(1)求出关于的回归直线方程;
(2)根据回归直线方程,预测该人工智能公司第6年的利润.
参考公式:.
参考数据:.
11.一个车间为了规定工时,需要确定加工零件所花费的时间,为此进行了5次试验,测得的数据如下:
零件数个
10
20
30
40
50
加工时间分钟
62
68
75
81
89
如果与线性相关,求回归直线方程;
附:,.
12.为了更好地适应市场需求,某企业根据市场调研得到研发投入(亿元)与产品收益(亿元)的数据统计如下:
1
2
3
4
5
6
7
2
3
5
7
8
8
9
参考公式:,
则下列选项不正确的是( )
A.
B.由散点图知变量和正相关
C.相关系数的绝对值越接近0,表示的线性相关程度越弱
D.用最小二乘法求得关于的线性回归直线方程为
13.新型抗生素是近年来针对耐药菌感染研发的抗菌药物.通过创新机制或结构改良,对抗传统抗生素难以治疗的超级细菌.实验人员用感染肺炎的小白鼠对一种新型抗生素进行实验,并对使用该种抗生素后,小白鼠血液中的肺炎链球菌值(单位:个/)进行检验,并统计得到了下表:
第15题表
第天
1
2
3
4
5
肺炎链球菌值(个/)
66
57
50
41
36
并计算得:
(1)计算变量和变量的样本相关系数,并说明两变量线性的相关程度(结果保留两位小数);
(2)若小白鼠血液中的肺炎链球菌值在区间内,则说明肺炎已治愈,用最小二乘法求关于的经验回归方程,并预测该小白鼠至少需要服药多少天才能痊愈.
参考数据及公式:样本数据的相关系数,其回归直线的斜率和截距的最小二乘估计值分别为:
题型四 样本中心点的相关问题
14.下表提供了某厂进行技术改造后生产产品过程中记录的产量(单位:t)与相应的生产能耗(单位:t标准煤)的几组数据:
4
5
6
7
标准煤
3.2
3.8
5.3
根据数据可得到的回归方程为,则( )
A.4.6 B.4.55 C.4.5 D.4.35
15.某产品的研发投入费用(单位:万元)与销售量(单位:万件)之间的对应数据如下表所示:
/万元
2.2
2.6
4.3
5.0
5.9
/万件
3.8
5.4
7.0
10.35
12.2
根据表中的数据,可得回归直线方程,则______.
16.(多选)对于变量,,经过随机抽样获得成对数据,且40,利用最小二乘法得到关于的线性回归方程为,且与的相关系数,则下列结论错误的是( )
A.越大,与的线性相关性越弱
B.若,则
C.若,则
D.若样本点都在回归直线上,则
17.已知两个线性相关变量与的统计数据如下表:其经验回归方程为,则( )
3
4
5
6
7
2.4
4
4.6
5.2
A.2.8 B.3 C.3.2 D.3.4
18.(多选)下列说法正确的是( )
A.若随机变量X服从正态分布,且,则
B.一组数据10,11,11,12,13,14,16,18,20,22的第60百分位数为15
C.对具有线性相关关系的变量x,y,利用最小二乘法得到的经验回归方程为,若样本点的中心为,则实数m的值是
D.若决定系数越小,则两个变量的相关性越强
题型五 非线性回归的问题
19.椰树集团为确定下一年度投入椰树椰汁的宣传费,需了解年宣传费(单位:千元)对年销售量(单位:)和年利润(单位:千元)的影响,对近8年的年宣传费和年销售量数据作了初步处理,得到下面的散点图及一些统计量的值.
46.6
563
6.8
298.8
1.6
1469
108.8
表中
(1)根据散点图判断,与哪一个适宜作为年销售量关于年宣传费的回归方程类型?根据判断结果及表中数据,建立关于的回归方程;
(2)已知椰树椰汁的年利润与的关系为.根据(1)的结果求年宣传费时,年销售量及年利润的预报值是多少?
附:对于一组数据,其回归线的斜率和截距的最小二乘估计分别为:
20.数据显示,某企业近年加大了科技研发资金的投入,其科技投入(百万元)与收益(百万元)的数据统计如下:
科技投入
1
2
3
4
5
6
7
收益
19
20
22
31
40
50
70
根据数据特点,甲认为样本点分布在指数型曲线的周围,据此他对数据进行了一些初步处理.如下表:
5
140
1239
149
2134
130
其中,.
(1)请根据表中数据,建立关于的回归方程(系数精确到0.1);
(2)①乙认为样本点分布在直线的周围,并计算得线性回归方程为,以及该回归模型的决定系数,试比较甲、乙两人所建立的模型,谁的拟合效果更好?
②由①所得的结论,计算该企业欲使收益达到1亿元,科技投入的费用至少要多少百万元?(精确到0.1)
附:对于一组数据,,……,,其线性回归直线的斜率和截距的最小二乘法估计公式分别为,,决定系数:.参考数据:.
21.红铃虫是棉花的主要害虫之一,能对农作物造成严重伤害.每只红铃虫的平均产卵数y(个)和平均温度x(℃)有关,现收集了7组数据,得到下面的散点图及一些统计量的值.
(1)根据散点图判断,与(其中e为自然对数的底数)哪一个更适合作为平均产卵数y(个)关于平均温度(℃)的回归方程类型?(给出判断即可,不必说明理由)并由判断结果及表中数据,求出关于的回归方程;
附:回归方程中,.
参考数据
5215
2347.3
33.6
27
81.3
3.6
(2)现在有10根棉花纤维,其中有6根为长纤维,4根为短纤维,从中随机抽取3根棉花纤维,设抽到的长纤维棉花的根数为X,求X的分布列.
22.已知变量和之间的关系可以用模型来拟合.设,若根据样本数据计算可得,且与的线性回归方程为,则_______.(参考数据:)
23.某研发小组为了解年研发资金投入量(单位:亿元)对年销售额(单位:亿元)的影响,结合近10年的年研发资金投入量和年销售额的数据(),建立了两个函数模型:①,②,其中,,,均为常数,为自然对数的底数.设,,经过计算得如下数据.
20
66
770
200
14
460
4.20
3125000
0.308
21500
(1)设和的相关系数为,和的相关系数为,请从相关系数的角度,选择一个拟合程度更好的模型.
(2)根据(1)中选择的模型及表中数据,建立关于的线性回归方程(系数精确到0.01),根据线性回归方程,若当年的销售额大致为亿元,则估计当年的研发资金投入量为多少亿元.
参考公式:相关系数,
线性回归直线中斜率和截距的最小二乘法估计参数分别为,.
题型六 残差的计算
24.根据生物实验中的一组数据作出如图所示的散点图,并对这组数据进行回归分析后发现遗漏了点,增加点后再次进行回归分析,得到的结果和原来相比( )
A.决定系数变小 B.残差平方和变小
C.相关系数变大 D.不变
25.某景区在五一劳动节期间开展“致敬最美劳动者”主题游园活动,天的入园游客量统计数据如下:
活动开展第天
入园游客量(百人)
(1)由数据看出,可用线性回归模型拟合与的关系,请计算相关系数(保留小数点后两位),并推断相关程度的强弱;
(2)求经验回归方程以及表中第个观测的残差;(观测值减去预测值称为残差)
(3)该景区在活动期间设置个打卡通道,记为通道①、通道②、通道③,游客入园时选择通道①、②、③的概率依次为、、;游客离园时,从原先入园通道离园的概率为,从另两个通道离园的概率均为,求游客从通道①离园的概率.
附:参考公式:相关系数;回归直线方程,其中,;
参考数据:,,,.
26.(多选)已知某AI软件公司为迎合市场的需求开发了一款新型智能AI写作软件,现将该软件上市后的月份以及每个月获得的利润(单位:万元)之间的关系统计如下表所示,并根据表中数据,得到经验回归方程,则( )
月份
1
2
3
4
5
利润
5
8
10
12
15
A. B.可以估计每增加1个月份,月利润提高2.8万元
C.可以估计10月份的利润为26.8万元 D.5月份利润的残差为0.4万元
27.现代物流成为继劳动力、自然资源外影响企业生产成本及利润的重要因素.某企业去年前八个月的物流成本(单位:万元)和企业利润的数据(单位:万元)如下表所示:
月份
1
2
3
4
5
6
7
8
物流成本
83
83.5
80
86.5
89
84.5
79
86.5
利润
114
116
106
122
132
114
132
残差
0.2
0.6
1.8
-3
-1
-4.6
根据最小二乘法公式求得经验回归方程为.
(1)求的值,并利用已知的经验回归方程求出8月份对应的残差值;
(2)请先求出线性回归模型的决定系数(精确到0.0001),若根据非线性模型求得解释变量(物流成本)对于响应变量(利润)的决定系数,请说明以上两种模型哪种模型拟合效果更好.
参考公式及数据:,,.
28.(多选)下列说法正确的是( )
A.样本数据的第70百分位数为23
B.若一组样本数据的方差,则
C.在做回归分析时,可以用决定系数刻画模型的回归效果,若越大,则说明模型拟合的效果越好
D.残差图中,残差点所在的水平带状区域越窄,则回归方程的预报精确度越高
29.(多选)下列说法中正确的是( )
A.某学校高二年级数学课外活动小组中有男生5人,女生3人,从中选2人,1人做正组长,1人做副组长,共有64种不同的选法
B.线性回归分析中可以用决定系数来刻画回归的效果,若的值越小,则模型的拟合效果越好
C.对具有线性相关关系的变量,其线性回归方程为,若样本点的中心为,则实数的值是-4
D.以模型去拟合一组数据时,为了求出经验回归方程,设,求得线性回归方程为,则的值分别是和2
题型七 独立性检验的概念及辨析
30.为比较甲、乙两所学校学生的数学水平,采用简单随机抽样的方法抽取100名学生.通过测验得到如下的列联表:
单位:人
学校
数学成绩
合计
不优秀
优秀
甲
40
10
50
乙
30
20
50
合计
70
30
100
附:,其中.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
下列结论正确的是( )
A.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率无差异
B.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率有差异
C.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率有差异
D.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率有差异
31.读万卷书,行万里路.随着我国教育模式由“应试教育”向“素质教育”转变,研学旅行作为一种传统而现代的素质教育手段被广泛关注.某校对“是否喜欢参加暑期研学旅行与学生性别的关系”进行了一次调查,其中被调查的男、女生人数相同,男生中喜欢参加暑期研学旅行的人数占男生人数的,女生中喜欢参加暑期研学旅行的人数占女生人数的.若有95%的把握认为是否喜欢参加暑期研学旅行与学生性别有关,则被调查的学生中,男生的人数不可能为( )
A.25 B.45 C.60 D.75
是否喜欢参加暑期研学旅行
性别
总计
男生
女生
喜欢
不喜欢
总计
32.某公司男、女职工人数相等,该公司为了了解职工是否接受去外地长时间出差,在男、女职工中各随机抽取了100人进行调查,数据显示男职工和女职工接受去外地长时间出差的人数分别为40和20.下列结论正确的是( )
附表:
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
附:,其中.
A.依据小概率值的独立性检验,不能认为是否接受去外地长时间出差与性别有关
B.依据小概率值的独立性检验,可以认为是否接受去外地长时间出差与性别有关
C.有的把握认为是否接受去外地长时间出差与性别有关
D.是否接受去外地长时间出差与性别无关
33.下列说法中,正确的有__________(填序号).
①回归直线恒过点,且至少过一个样本点;
②根据列联表中的数据计算得出,而,则有99%的把握认为两个分类变量有关系,即有1%的可能性使得“两个分类变量有关系”的推断出现错误;
③是用来判断两个分类变量是否相关的随机变量,当的值很小时可以推断两类变量不相关;
④某项测量结果服从正态分布,则,则.
题型八 卡方的计算
34.羽毛球运动在我国是非常受大众喜爱的一项运动,但自2023年以来,由于多种原因,羽毛球价格经历多轮上涨,部分高端型号涨幅甚至超过同期黄金涨幅,越来越多的球友直呼快打不起球了.我国某著名体育厂商抓住这个历史机遇推出了人造羽毛球,名为碳音球,这款羽毛球采用碳纤维复合材料替代天然羽毛,其飞行轨迹与击球手感接近天然羽毛球,但价格却只有天然羽毛球的60%到70%,该羽毛球一经上市便引起热烈反响,但舆论对其评价褒贬不一.某市场调查机构调查了男性和女性各100名羽毛球爱好者对碳音球和天然羽毛球的偏好程度,现统计得出样本中偏好碳音球的人数占样本总数的45%,其中偏好碳音球的女性羽毛球爱好者有50人.
偏好碳音球
偏好天然羽毛球
合计
男性
女性
50
合计
200
(1)请根据已知条件将上述列联表补充完整,并分析是否有90%的把握认为两种羽毛球的偏好与性别有关?
(2)现从男性羽毛球爱好者中按对碳音球和天然羽毛球的偏好采用分层抽样的方法抽取10人,然后从这10人中随机抽取3人参加有奖问答,记3人中偏好碳音球的人数为,求的分布列和数学期望.
(3)若某羽毛球俱乐部的男女比例为3:2.将样本的频率视为概率,现从该俱乐部中随机抽取一人,已知此人偏好碳音球,求其为男性的概率.
附:
0.100
0.050
0.010
2.706
3.841
6.635
35.智能驾驶辅助系统是指利用车载传感器、控制器等装置、实现环境感知、规划决策与运动控制,辅助驾驶员完成部分驾驶操作,提升行车安全性与舒适性的系统,驾驶员仍需全程监管车辆并随时接管驾驶:驾龄是指初次领取机动车驾驶证至今的时间长度、为研究智能驾驶辅助系统使用情况与驾龄的关系,随机调查了200名私家车车主,得到如下列联表:
经常使用智能驾驶辅助系统
不经常使用智能驾驶辅助系统
合计
驾龄≤5年
58
42
100
驾龄>5年
36
64
100
合计
94
106
200
(1)从这200名车主中随机抽取1人,已知该车主驾龄不超过5年,求该车主经常使用智能驾驶辅助系统的概率;
(2)根据小概率值的独立性检验,分析智能驾驶辅助系统使用情况是否与驾龄有关.
附:
0.050
0.010
0.001
3.841
6.635
10.828
36.某团队为探究大语言模型参数量与模型性能之间的关系,训练了6个不同参数量的模型,并在同一验证集上评估性能得分,得到如下统计数据:
参数量x(亿)
2
4
6
8
10
12
性能得分y(分)
1.8
2.8
3.4
3.6
3.8
4.0
(1)求y关于x的线性回归方程(系数用分数表示),并预测参数量为14亿时,模型的性能得分;
(2)该团队比较了100次实验的实际性能与预测性能,得到“高效”(实际得分≥预测得分)和“低效”(实际得分<预测得分)两种效率组别.同时,他们记录了每次实验所用的训练数据质量等级(优质/普通),得到如下列联表:
训练数据质量等级
训练效率
总计
高效
低效
优质
42
18
60
普通
18
22
40
总计
60
40
100
请依据小概率值的独立性检验,分析训练效率是否与训练数据质量有关.
附:,,,.
.
0.05
0.01
0.001
3.841
6.635
10.828
37.人工智能技术(简称AI技术)已成为引领世界新一轮科技革命和产业改革的战略性技术,并迅速在各行各业中得到应用和推广,教育行业也不例外.某市教体局为调查本市中学教师使用AI技术辅助教学的情况,随机抽取了该市120名中学教师,统计了他们一周内使用AI技术帮助制作课件的情况,并将一周内使用AI技术帮助制作课件的节次不少于4次的认定为喜欢使用AI技术,否则认定为不喜欢使用AI技术,经统计得到如下2×2列联表.
年龄
是否喜欢使用AI技术
合计
是
否
不超过45岁
46
超过45岁
28
合计
78
(1)补全上述2×2列联表.
(2)依据小概率值的独立性检验,能否认为该市中学教师是否喜欢使用AI技术与年龄有关;
(3)将频率视为概率,现从所抽取的120名中学教师中随机抽取一人,在抽中喜欢使用AI技术的教师的条件下,求此人年龄超过45岁的概率.
附:,其中.
0.1
0.01
0.001
2.706
6.635
10.828
38.《我爱古诗词》是某卫视推出的大型传统文化竞技类节目,旨在弘扬中华诗词文化、考验选手诗词储备与临场应变能力.某机构为了解大学生喜欢《我爱古诗词》是否与性别有关,对某校名大学生进行问卷调查,得到如下列联表:
喜欢
不喜欢
合计
男生
女生
合计
(1)判断在犯错误的概率不超过的前提下能否认为喜欢《我爱古诗词》与性别有关,并说明理由;
(2)已知在参与问卷调查的大学生中有名是大一学生,其中名喜欢《我爱古诗词》.现从这名大一学生中随机抽取人,设抽到喜欢《我爱古诗词》的人数为,求的分布列与数学期望.
附:,(结果精确到).
强化训练
1.下列说法正确的是( )
A.一组数据2,3,8,3,10,18,7,4的第50百分位数为4
B.在残差图中,残差点所在的水平带状区域越宽,回归方程的预报精确度越高
C.设且,则
D.根据分类变量X与Y的成对样本数据,计算得到,根据小概率值的独立性检验,可判断X与Y有关联,此推断犯错误的概率不大于0.05
2.已知变量具有线性相关关系,根据一组观测数据利用最小二乘法建立了经验回归方程,若,则( )
A.10 B.5 C.0.5 D.0.1
3.独立性检验中,若小于临界值,则下列结论正确的是( )
A.两个变量一定相互独立 B.两个变量一定不独立
C.没有充分证据表明两个变量有关 D.两个变量有关联的可能性为
4.下列说法中,正确的是( )
A.将一组数据中的每一个数据加上同一个正数后,方差变大
B.在回归分析中,为0.98的模型比为0.99的模型拟合的效果更好
C.残差图中,残差点所在的水平带状区域越窄,则回归方程的预报精确度越低
D.根据分类变量与的成对样本数据,计算得到,根据小概率值的独立性检验,可判断与有关联,此推断犯错误的概率不超过0.05
5.已知,,,四组成对样本数据对应的线性相关系数分别为-0.95,-0.82,0.86,0.93,则线性相关程度最弱的是( )
A.组 B.组 C.组 D.组
6.已知某种商品的广告费支出(单位:万元)与销售额(单位:万元)之间有如下对应数据:
4
6
7
8
根据上表可得经验回归方程,据此估计,当投入万元广告费时,销售额为( )
A.万元 B.万元 C.万元 D.万元
7.从非洲蔓延到东南亚的蝗虫灾害严重威胁了国际农业生产,影响了人民生活.世界性与区域性温度的异常、旱涝频繁发生给蝗灾发生创造了机会.已知蝗虫的产卵量y与温度x的关系可以用模型(其中e为自然对数的底数)拟合,设,其变换后得到一组数据:
x
20
23
25
27
30
z
2
2.4
3
3
4.6
由上表可得经验回归方程,则当x=35时,蝗虫的产卵量y的估计值为( )
A. B. C.8 D.
8.(多选)下列选项正确的是( )
A.若回归方程为,则当变量增加1个单位时,增加3个单位
B.设具有相关关系的两个变量x、y的相关系数为r,越接近于1,说明两个变量之间的线性相关性越强
C.利用进行独立性检验时,的值越大,说明有更大的把握认为两个分类变量相关性越弱
D.根据一组样本数据的散点图判断出两个变量线性相关,由最小二乘法求得其回归方程为,若其中一个散点坐标为,则
9.(多选)某奶茶店统计了六天每天天气平均气温t(℃)和每天凉茶的销售数量n(单位:杯),得到以下数据:
t(℃)
3
0
5
7
9
12
n(单位:杯)
23
17
27
29
36
42
若t与n线性相关,且回归直线方程为,则( )
A.t和n正相关 B.点在回归直线上
C. D.
10.(多选)下列结论错误的是( )
A.由样本数据得到的回归直线必过点
B.若两个随机变量的线性相关性越强,则样本相关系数就越接近于1
C.从独立性检验可知,有99%的把握认为吸烟与患肺癌有关时,我们说某人吸烟,那么他有99%的可能患有肺癌
D.若散点图中所有点都在直线上,则样本相关系数
11.(多选)已知相关系数,关于的线性回归方程中斜率和截距的最小二乘估计公式分别为,,已知变量与变量的部分数据,建立由最小二乘法得到的两个回归模型:以为自变量,为因变量,得出的线性回归方程为;以为自变量,为因变量,得出的线性回归方程为,若两个模型的计算均无误,则下列判断正确的是( )
A.若已知变量的方差,则可得知变量的标准差
B.若已知变量的方差,则不可得知变量的标准差
C.若不给定其他信息,则也可得知变量与变量各自的平均值
D.若不给定其他信息,则也可得知变量与变量的相关系数
12.(多选)下列结论正确的是( )
A.随机变量X 服从二项分布,Y = 2X +1 ,则D(Y) = 3
B.相关系数 r 的值越小,两个变量之间的线性相关性越弱
C.在线性回归分析中,若 值越小则模型的拟合效果越好
D.随机变量X 服从正态分布 ,且P(2 < X < 5 ) = a ,则
13.某公司为了解用电量y(单位:千瓦时)与气温x(单位:摄氏度)之间的关系,随机统计了4天的用电量与当天气温,绘制了如下表格,由表中数据可得回归方程,则实数_____.
x
10
13
18
y
62
38
34
m
14.某学校开展研究性学习活动,一组同学获得了下面的一组试验数据:
x
1.99
3
4
5.1
8
y
0.99
1.58
2.01
2.35
3.00
现有如下5个模拟函数:①;②;③;④;⑤,请从中选择一个模拟函数,使它能近似地反映这些数据的规律,应选________(填序号).
15.为研究学习时间与成绩的关系,记录5名学生的数学学习时间(小时)与模拟考成绩(分,满分 150) 如下:
2
4
6
8
10
w
58
72
80
90
100
设模拟考成绩与学习时间的回归模型为:,其中 .为计算简洁,现对数据进行中心化处理: 令,则回归模型化为. 记残差平方和.
(1)根据最小二乘原理,要使最小(假设),推导的估计量的表达式(写出关键步骤).
(2)利用所给数据,求关于的经验回归方程,并还原为关于的方程. 预测时的成绩.
16.某影视数据平台对最近上映的电影《飞驰人生3》进行票房调研,记录了其上映后的累计票房情况.累计票房(单位:千万元)与上映天数(单位:天)的数据如下表所示:
上映天数
4
7
9
10
15
累计票房
20
40
60
80
100
(1)利用表中的数据,计算相关系数(结果精确到0.01),并推断两个变量的线性相关程度;
(2)求关于的经验回归方程,并预测上映40天时的累计票房(结果精确到0.01).
参考公式:经验回归方程,其中,,相关系数.参考数据:,,,.
17.飞机与高铁是人们远距离出行的两种方式,交通大学某班学生为了调查人们选择的远距离出行方式是否与年龄相关,随机抽取该市1000名市民进行调查,得到如下列联表:
低于40岁
不低于40岁
总计
选择飞机出行
100
选择高铁出行
300
总计
500
1000
(1)补全表中数据,依据小概率值的独立性检验,是否能够认为市民选择的远距离出行方式与年龄有关联?
(2)调查小组统计高铁站某处今天的客流量,从7:00开始,每小时作为一个时间段(为第1个时间段,为第2个时间段,……),得到如下数据:
时间段
1
2
3
4
5
客流量(千人)
1
1.5
2.5
3
3.5
若与线性相关,建立每个时间段客流量与时间段的经验回归方程,并预测的客流量.
附:,其中.
0.010
0.001
6.635
10.828
对于一组数据,,…,,其经验回归方程的斜率,.
18.某学校对学生是否喜欢跑步锻炼进行调查,随机抽取男女学生共n人进行问卷调查,统计得到如下列联表:
喜欢
不喜欢
合计
男生
100
20
女生
20
合计
n
若采用比例分配的分层随机抽样从这n人中抽取5人,则有男生3人,女生2人.
(1)求以及这人中喜欢跑步锻炼的概率;
(2)根据小概率值的独立性检验,能否认为学生喜欢跑步锻炼与其性别有关?
(3)用样本估计总体,将频率视为概率,从该校全体学生中随机抽取2人,记其中喜欢跑步锻炼的人数为X,求X的数学期望.
附:,
0.050
0.010
0.001
3.841
6.635
10.828
19.某社区消费者协会为了解本社区居民网购消费情况,随机抽取了100位居民作为样本,就最近一年来网购消费金额(单位:千元),网购次数和支付方式等进行了问卷调查.经统计这100位居民的网购消费金额均在区间内,按,,,,,分成6组,其频率分布直方图如图所示.
(1)估计该社区居民最近一年来网购消费金额的中位数;
(2)将网购消费金额不少于20千元的人称为网购迷,补全下面的2×2列联表,并判断有多大把握认为“是否为网购迷与性别有关系”;
网购人群类别
性别
合计
男
女
网购迷
20
非网购迷
45
合计
100
(3)调查显示,甲、乙两人每次网购采用的支付方式相互独立,两人网购时间与次数也互不影响.统计最近一年来两人网购的总次数与支付方式,所得数据如下表所示:
类别
网购总次数
支付宝支付次数
银行卡支付次数
微信支付次数
甲
80
40
16
24
乙
90
60
18
12
将频率视为概率,若甲、乙两人在下周内各自网购2次,记两人采用支付宝支付的次数之和为,求的数学期望.
附:.
0.1
0.05
0.025
0.010
0.005
0.001
2.706
3.841
5.024
6.635
7.879
10.828
1 / 1
学科网(北京)股份有限公司
$
第八章 成对数据的统计分析题型汇总
题型预览
题型一 相关系数的意义及辨析
题型二 相关系数的计算
题型三 求线性回归直线方程
题型四 样本中心点的相关问题
题型五 非线性回归的问题
题型六 残差的计算
题型七 独立性检验的概念及辨析
题型八 卡方的计算
知识清单
变量间的相关关系
相关关系的定义:两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系.两个变量之间的关系分为函数关系和相关关系.
【注意】相关关系与函数关系的异同点
(1)相同点:均是指两个变量的关系
(2)不同点:函数关系是一种确定的关系,而相关关系是一种非确定关系
散点图及其应用
(1)散点图:为直观地描述成对样本数据中两个变量间的关系,用横轴表示其中的一个变量,纵轴表示另一个变量,则成对样本数据都可以用直角坐标系中的点表示出来,由这些点组成的统计图叫做散点图.
(2)散点图的作用
如果散点图中变量的对应点分布在某条曲线的附近,我们就可以得出结论:这两个变量具有相关性,如图(1)(2).如果变量的对应点分布没有规律,我们就可以得出结论:这两个变量不具有相关性,如图(3).
(3)正相关与负相关
从整体上看,当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势,我们就称这两个变量正相关;当一个变量的值增加时,另一个变量的相应值呈现减小的趋势,则称这两个变量负相关.
(4)线性相关与曲线相关
一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们就称这两个变量线性相关.
一般地,如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量非线性相关或曲线相关.
样本相关系数
(1)一般地,如果变量x和y正相关,那么关于均值平移后的大多数散点将分布在第一象限、第三象限,对应的成对数据同号的居多;如果变量x和y负相关,那么关于均值平移后的大多数散点将分布在第二象限、第四象限,对应的成对数据异号的居多.
(2)样本相关系数r=.
(3)样本相关系数r的取值范围为[-1,1].
当|r|越接近1时,成对样本数据的线性相关程度越强;
当|r|越接近0时,成对样本数据的线性相关程度越弱.
【注意】 样本相关系数r是一个描述成对样本数据的数字特征,它的正负性可以反映成对样本数据的变化特征:
当r>0时,称成对样本数据正相关;
当r<0时,称成对样本数据负相关;
当|r|=1时,表明成对样本数据都在一条直线上,即两个变量之间满足一种线性关系.
当r=0时,只表明成对样本数据间没有线性相关关系,但不排除它们之间有其他相关关系.
一元线性回归模型
为Y关于x的一元线性回归模型.其中,Y称为因变量或响应变量,x称为自变量或解释变量;a和b为模型的未知参数,a称为截距参数,b称为斜率参数;e是Y与bx+a之间的随机误差.
最小二乘法和经验回归方程
(1)有关概念
=x+称为Y关于x的经验回归方程,也称经验回归函数或经验回归公式,其图形称为经验回归直线,求经验回归方程的方法叫做最小二乘法,求得的,叫做b,a的最小二乘估计.
(2)计算公式
【注意】(1)经验回归直线过点()
(2)经验回归方程=x+中的表示x增加1个单位时,y的平均变化量为,而表示y不随x的变化而变化的部分
残差及残差分析
(1)对于响应变量Y,通过观测得到的数据称为观测值.通过经验回归方程得到的称为预测值,观测值减去预测值所得的差称为残差.
(2)作图时纵坐标为残差,横坐标可以选为样本编号,或解释变量的观测值等,这样作出的图形称为残差图.在残差图中,残差比较均匀地落在水平的带状区域中,说明选用的模型比较合适,这样的带状区域的宽度越窄,说明模型拟合精度越高.
(3)残差分析:残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果,以及判断原始数据中是否存在可疑数据等,这方面工作称为残差分析.
残差平方和与决定系数R2
(1)残差图法:在残差图中,如果残差比较均匀地集中在以横轴为对称轴的水平带状区域内,则说明经验回归方程较好地刻画了两个变量的关系.
(3)决定系数R2法:可以用R2=1-来比较两个模型的拟合效果,R2越小,模型拟合效果越差,R2越大,模型拟合效果越好.
【注意】决定系数R2的取值范围是0≤R2≤1
刻画回归效果的三种方法
(1)残差图法:残差比较均匀地落在水平带状区域内,则说明选用的模型比较合适.
(3)决定系数R2法:R2= 越接近1,表明模型的拟合效果越好.
非线性回归分析
(1)非线性回归分析的思想
研究两个变量的关系时,依据样本点画出散点图,从整体上看,如果样本点没有分布在某个带状区域内,就称这两个变量之间不具有线性相关关系,此时不能直接利用经验回归方程来建立两个变量之间的关系.
(2)非线性经验回归方程
当回归方程不是形如=x+(,∈R)时,称之为非线性经验回归方程.当两个变量不呈线性相关关系时,依据样本点的分布选择合适的曲线方程来拟合数据,可通过变量代换,利用线性回归模型建立两个变量间的非线性经验回归方程.
非线性回归问题的处理方法
(1)指数函数型y=eb x+a
①函数y=eb x+a的图象,如图所示.
②处理方法:两边取对数得ln y=ln ebx+a,即ln y=bx+a.令z=ln y,把原始数据(x,y)转化为(x,z),再根据线性回归模型的方法求出a,b.
(2)对数函数型y=b ln x+a
①函数y=b ln x+a的图象,如图所示.
②处理方法:设x′=ln x,原方程可化为y=bx′+a,
再根据线性回归模型的方法求出a,b.
(3)y=bx2+a型
处理方法:设x′=x2,原方程可化为y=bx′+a,再根据线性回归模型的方法求出a,b.
数值变量与分类变量
数值变量:数值变量的取值为实数,其大小和运算都有实际含义.
分类变量:这里所说的变量和值不一定是具体的数值,例如,性别变量,其取值为男和女两种.我们经常会使用一种特殊的随机变量,以区别不同的现象或性质,这类随机变量称为分类变量,分类变量的取值可以用实数表示.
【注意】分类变量的取值可以用实数来表示,例如男性,女性可以用1,0表示,学生的班级可以用1,2,3来表示.这些数值只作编号使用,并没有大小和运算意义.分类变量是相对于数值变量来说的
列联表
定义一对分类变量X和Y,我们整理数据如表所示:
X
Y
合计
Y=0
Y=1
X=0
a
b
a+b
X=1
c
d
c+d
合计
a+c
b+d
n=a+b+c+d
上表是关于分类变量X和Y的抽样数据的2×2列联表,最后一行的前两个数分别是事件{Y=0}和{Y=1}中样本点的个数;最后一列的前两个数分别是事件{X=0}和{X=1}中样本点的个数;中间的四个数a,b,c,d是事件{X=x,Y=y}(x,y=0,1)中样本点的个数;右下角格中的数n是样本空间中样本点的总数.
独立性检验的理解
(1)零假设:设X和Y为定义在Ω上,取值于{0,1}的成对分类变量.由于{X=0}和{X=1},{Y=0}和{Y=1}都是互为对立事件,故要判断事件{X=1}和{Y=1}之间是否有关联,需要判断假定关系H0:P(Y=1|X=0)=P(Y=1|X=1)是否成立.
(2)独立性检验的公式
χ2=,其中n=a+b+c+d,用随机变量χ2取值的大小作为判断零假设H0是否成立的依据,当它比较大时推断H0不成立,否则认为H0成立.
(3)临界值:对任何小概率值α,可以找到相应的正实数xα,使P(χ2≥xα)=α.称xα为α的临界值.临界值可作为判断χ2大小的标准.概率值α越小,临界值xα越大.
(4)基于小概率值α的检验规则:当χ2≥xα时,推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α;
当χ2<xα时,没有充分证据推断H0不成立,可以认为X和Y独立.利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验.
(5)χ2独立性检验中几个常用的小概率值和相应的临界值.
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
【注意】χ2越小,独立性越强,相关性越弱;χ2越大,独立性越弱,相关性越强
题型突破
题型一 相关系数的意义及辨析
1.对四组数据进行统计,获得如图所示的散点图,关于其样本相关系数的比较,正确的是( )
A. B.
C. D.
【答案】D
【分析】由散点图的特征,结合相关系数的定义即可得到答案.
【详解】由散点图的趋势可知,,,,
又图一的散点图比图三的散点图更为集中,则,所以,
又图二的散点图比图四的散点图更为集中,则,所以,
所以.
故选:D.
2.某研究小组为了探究变量x与y之间的线性相关关系,收集了5组数据,(),并绘制成如图所示的散点图(点A,B,C,D,E).经计算,这5组数据的样本相关系数为r.若去掉点后,剩余4组数据的样本相关系数为,则下列结论正确的是( )
A. B. C. D.
【答案】A
【分析】从图中可以看出点较其他点,偏离直线远,所以去掉点后,回归效果更好,结合相关系数的性质判断.
【详解】从散点图中可知,样本数据的两变量是正相关,
由于点较其他点偏离程度大,删除点后,回归效果更好,
从而相关系数的绝对值更接近于1,所以
3.通过随机抽样绘制得到如图所示的某种商品每千克价格(单位:百元)与该商品消费者年需求量(单位:千克)的散点图.下列说法正确的是( ).
A.若去掉图中右下方的点后,“每千克价格”与“年需求量”这两个变量的线性相关系数变大
B.若去掉图中右下方的点后,“每千克价格”与“年需求量”这两个变量的线性相关系数变小
C.将“每千克价格”的单位由百元变为元,“每千克价格”与“年需求量”这两个变量的线性相关系数变大
D.将“每千克价格”的单位由百元变为元,“每千克价格”与“年需求量”这两个变量的线性相关系数变小
【答案】B
【详解】改变变量的单位,线性相关系数不变,C、D错;
去除A点后,线性相关程度变高,
因为是负相关,所以线性相关系数变小,故A错误、B正确.
4.甲、乙、丙、丁各自研究两个随机变量的数据,若甲、乙、丙、丁计算得到各自研究的两个随机变量的样本相关系数分别为,,,,则这四人中,研究的两个随机变量的线性相关程度最高的是( )
A.甲 B.乙 C.丙 D.丁
【答案】B
【详解】因为,
所以这四人中,乙研究的两个随机变量的线性相关程度最高.
题型二 相关系数的计算
5.某厂的生产原料耗费(单位:百万元)与销售额(单位:百万元)之间有如下的对应关系:
与之间是否具有线性相关关系?若有,判断相关性的强弱.
【答案】与之间具有很强的正相关关系.
【分析】作出散点图,可作出判断,再计算出相关系数的值,即可得出结论.
【详解】画出散点图如图所示,由图可知、有线性相关关系.
由题中表格数据可得,,
,,
,
所以.
故与之间具有很强的正相关关系.
6.为分析肥胖程度对总胆固醇与空腹血糖的影响,在肥胖人群中随机抽出8人,他们的肥胖指数BMI值、总胆固醇TC指标值(单位:mmol/L),空腹血糖GLU指标值(单位:mmol/L)如表所示:
人员编号
1
2
3
4
5
6
7
8
BMI值x
25
27
30
32
33
35
40
42
TC指标值y
5.3
5.4
5.5
5.6
5.7
6.5
6.9
7.1
GLU指标值z
6.7
7.2
7.3
8.0
8.1
8.6
9.0
9.1
用变量y与x,z与x的相关系数,分别说明TC指标值与BMI值、GLU指标值与BMI值的相关程度.
参考公式:
相关系数,
参考数据:,,,,,,,.
【答案】答案见解析
【分析】根据相关系数的计算结果来判断变量之间的相关性.
【详解】由题意,变量与的相关系数,
变量与的相关系数是,
可以看出TC指标值与BMI值,GLU指标值与BMI值都是高度正相关.
7.随着智能手机的普及,使用手机上网成为人们日常生活的一部分,很多消费者对手机流量的需求越来越大,某通信公司为了更好地满足消费者对流量的需求,准备推出一款流量包.该通信公司选了5个城市(总人数、经济发展情况、消费能力等方面比较接近)采用不同的定价方案作为试点,经过一个月的统计,发现该流量包的定价x(单位:元/月)和购买人数y(单位:万人)的关系如下表:
x
30
35
40
45
50
y
18
14
10
8
5
计算该流量包的定价x与购买人数y的相关系数________.(结果保留3位小数)
【答案】
【分析】根据相关系数的公式计算结果;
【详解】根据表格中的数据,
可得,.
可列表如下:
i
1
2
3
4
5
-10
-5
0
5
10
7
3
-1
-3
-6
-70
-15
0
-15
-60
则,
,
因此相关系数
.
故答案为:.
8.科研人员在对人体脂肪含量和年龄之间关系的研究中,获得了一些年龄和脂肪含量的样本数据,如表:
x(年龄/岁)
26
27
39
41
49
53
56
58
60
61
y(脂肪含量/%)
14.5
17.8
21.2
25.9
26.3
29.6
31.4
33.5
35.2
34.6
根据上表的数据得到如下的散点图.
根据上表中的样本数据及其散点图,计算样本相关系数(精确到),并刻画它们的相关程度.
(参考数据:,,,)
【答案】0.98,可以推断人体脂肪含量和年龄的相关程度很强.
【分析】根据表中数据求出,然后由相关系数公式计算,根据计算结果可下结论.
【详解】根据题表中的样本数据及其散点图知,
;
.
所以.
由此,可以推断人体脂肪含量和年龄的相关程度很强.
题型三 求线性回归直线方程
9.为了得到某种新产品表面的腐蚀刻线,技术员通过实验检测,发现该产品的腐蚀深度(单位:)与腐蚀时间(单位:)有关,并收集数据如下表:
腐蚀时间t/s
5
10
15
20
30
40
腐蚀深度 y/μm
5
8
10
13
17
19
(1)根据表中样本数据,计算样本相关系数,(系数精确到)并推断它们的线性相关程度;
(2)建立关于的线性回归方程(系数精确到);若腐蚀时间为,请估计腐蚀深度.参考数据:
参考公式:相关系数
线性回归方程的斜率 截距
【答案】(1),高度线性正相关;
(2),
【分析】(1)根据相关系数公式求出,即可解题;
(2)数据代入公式即可求出回归方程,进而可得腐蚀时间为的腐蚀深度.
【详解】(1)由题可知, ,
,
,
,
,非常接近1,说明腐蚀深度与腐蚀时间呈高度线性正相关;
(2),
,
因此线性回归方程为: ,
当腐蚀时间时,代入得: .
10.某人工智能公司从某年起5年的利润情况如下表所示.
第年
1
2
3
4
5
利润亿元
3.3
3.6
4.4
4.8
5.2
(1)求出关于的回归直线方程;
(2)根据回归直线方程,预测该人工智能公司第6年的利润.
参考公式:.
参考数据:.
【答案】(1)
(2)5.76亿元
【分析】(1)根据给定数表,利用最小二乘法求出回归直线方程.
(2)由(1)的结论预测利润.
【详解】(1)依题意,,,
则,,
所以关于的回归方程为.
(2)由(1)知,当时,
所以该人工智能公司第6年的利润约为5.76亿元.
11.一个车间为了规定工时,需要确定加工零件所花费的时间,为此进行了5次试验,测得的数据如下:
零件数个
10
20
30
40
50
加工时间分钟
62
68
75
81
89
如果与线性相关,求回归直线方程;
附:,.
【答案】
【详解】根据题中公式,结合表中数据进行运算求解即可;
由题中数据得,,
,
,
,.
因为,,
故所求的回归直线方程为.
12.为了更好地适应市场需求,某企业根据市场调研得到研发投入(亿元)与产品收益(亿元)的数据统计如下:
1
2
3
4
5
6
7
2
3
5
7
8
8
9
参考公式:,
则下列选项不正确的是( )
A.
B.由散点图知变量和正相关
C.相关系数的绝对值越接近0,表示的线性相关程度越弱
D.用最小二乘法求得关于的线性回归直线方程为
【答案】D
【分析】对于A,根据条件,直接求出,即可求解;对于B,根据条件,画出散点图,即可求解;对于C,根据相关系数的定义判断即可;对于D,利用线性回归直线方程过样本中心,代入计算,即可求解.
【详解】对于选项A,由题知,
,故选项A正确;
对于选项B,由图表可得散点图如下,由散点图知变量和正相关,所以选项B正确;
对于选项C,相关系数的绝对值越接近0,表示的线性相关程度越弱,故选项C正确;
对于选项D,因为样本中心点为,又,
所以不是关于的线性回归直线方程,故选项D不正确.
故选:D
13.新型抗生素是近年来针对耐药菌感染研发的抗菌药物.通过创新机制或结构改良,对抗传统抗生素难以治疗的超级细菌.实验人员用感染肺炎的小白鼠对一种新型抗生素进行实验,并对使用该种抗生素后,小白鼠血液中的肺炎链球菌值(单位:个/)进行检验,并统计得到了下表:
第15题表
第天
1
2
3
4
5
肺炎链球菌值(个/)
66
57
50
41
36
并计算得:
(1)计算变量和变量的样本相关系数,并说明两变量线性的相关程度(结果保留两位小数);
(2)若小白鼠血液中的肺炎链球菌值在区间内,则说明肺炎已治愈,用最小二乘法求关于的经验回归方程,并预测该小白鼠至少需要服药多少天才能痊愈.
参考数据及公式:样本数据的相关系数,其回归直线的斜率和截距的最小二乘估计值分别为:
【答案】(1),两变量线性的相关程度很强
(2),8天
【分析】(1)利用样本相关系数公式直接求解,然后根据相关系数的性质判断即可.
(2)利用最小二乘法求得回归直线方程,令,解不等式即可得解.
【详解】(1)因为,
所以,
又
所以,
因为非常接近1,所以两变量线性的相关程度很强.
(2)由题,,
,,
所以,
,
所以关于的经验回归方程为,
令,解得,
所以该小白鼠至少需要服药8天才能痊愈.
题型四 样本中心点的相关问题
14.下表提供了某厂进行技术改造后生产产品过程中记录的产量(单位:t)与相应的生产能耗(单位:t标准煤)的几组数据:
4
5
6
7
标准煤
3.2
3.8
5.3
根据数据可得到的回归方程为,则( )
A.4.6 B.4.55 C.4.5 D.4.35
【答案】C
【分析】求出,根据回归直线必过样本中心点,代入求解即可.
【详解】依题意,,,
因为回归直线必过样本中心点,
所以,解得.
15.某产品的研发投入费用(单位:万元)与销售量(单位:万件)之间的对应数据如下表所示:
/万元
2.2
2.6
4.3
5.0
5.9
/万件
3.8
5.4
7.0
10.35
12.2
根据表中的数据,可得回归直线方程,则______.
【答案】
【详解】由题意可得,
,
因为回归直线方程经过点,
所以.
16.(多选)对于变量,,经过随机抽样获得成对数据,且40,利用最小二乘法得到关于的线性回归方程为,且与的相关系数,则下列结论错误的是( )
A.越大,与的线性相关性越弱
B.若,则
C.若,则
D.若样本点都在回归直线上,则
【答案】ABC
【详解】由于可得,则,
对于,由于,故的值越大,与的线性相关性越强,故A错误;
对于C,当时,把代入得,则,故C错误;
对于D,若样本点,)都在回归直线上,且,则,D正确;
对于B,当时,无法确定的值,B错误.
17.已知两个线性相关变量与的统计数据如下表:其经验回归方程为,则( )
3
4
5
6
7
2.4
4
4.6
5.2
A.2.8 B.3 C.3.2 D.3.4
【答案】A
【详解】由表格知,,经验回归方程经过点,
所以,解得.
18.(多选)下列说法正确的是( )
A.若随机变量X服从正态分布,且,则
B.一组数据10,11,11,12,13,14,16,18,20,22的第60百分位数为15
C.对具有线性相关关系的变量x,y,利用最小二乘法得到的经验回归方程为,若样本点的中心为,则实数m的值是
D.若决定系数越小,则两个变量的相关性越强
【答案】ABC
【分析】根据正态分布概率性质计算判断A,由百分位数定义计算判断B,把中心点代入回归方程求解后判断C,利用相关系数与决定系数的概念判断D,从而得解.
【详解】选项A,因为随机变量X服从正态分布,所以,
又,所以,故A正确;
选项B,这组数据总共有10个数,由于,
因此第60百分位数为,故B正确;
选项C,因为经验回归方程为,样本中心为,
所以,解得,故C正确.
选项D,因为,
当越小时,越小,此时两个变量的相关性越小,故D错误.
故选:ABC.
题型五 非线性回归的问题
19.椰树集团为确定下一年度投入椰树椰汁的宣传费,需了解年宣传费(单位:千元)对年销售量(单位:)和年利润(单位:千元)的影响,对近8年的年宣传费和年销售量数据作了初步处理,得到下面的散点图及一些统计量的值.
46.6
563
6.8
298.8
1.6
1469
108.8
表中
(1)根据散点图判断,与哪一个适宜作为年销售量关于年宣传费的回归方程类型?根据判断结果及表中数据,建立关于的回归方程;
(2)已知椰树椰汁的年利润与的关系为.根据(1)的结果求年宣传费时,年销售量及年利润的预报值是多少?
附:对于一组数据,其回归线的斜率和截距的最小二乘估计分别为:
【答案】(1)
(2)644.6;258.3
【分析】(1)根据散点图分析得出回归方程类型,结合非线性回归模型转化线性回归方程分析求解即可;
(2)根据(1)中的方程代入相关变量计算分析即可.
【详解】(1)由散点图可以判断,适宜作为年销售量关于年宣传费的回归方程类型,
令,先建立关于的线性回归方程,
由于 ,
则,
所以关于的线性回归方程为,
因此关于的回归方程为.
(2)当时,年销售量的预报值,
年利润的预报值.
20.数据显示,某企业近年加大了科技研发资金的投入,其科技投入(百万元)与收益(百万元)的数据统计如下:
科技投入
1
2
3
4
5
6
7
收益
19
20
22
31
40
50
70
根据数据特点,甲认为样本点分布在指数型曲线的周围,据此他对数据进行了一些初步处理.如下表:
5
140
1239
149
2134
130
其中,.
(1)请根据表中数据,建立关于的回归方程(系数精确到0.1);
(2)①乙认为样本点分布在直线的周围,并计算得线性回归方程为,以及该回归模型的决定系数,试比较甲、乙两人所建立的模型,谁的拟合效果更好?
②由①所得的结论,计算该企业欲使收益达到1亿元,科技投入的费用至少要多少百万元?(精确到0.1)
附:对于一组数据,,……,,其线性回归直线的斜率和截距的最小二乘法估计公式分别为,,决定系数:.参考数据:.
【答案】(1)
(2)① ;甲建立的回归模型拟合效果更好;② 科技投入的费用至少要9.3百万元.
【分析】(1)两边取对数得,令,利用最小二乘法可求得,由此可得回归方程;
(2)①根据公式计算可得相关指数,由此可得结论;
②由,解不等式可求得x范围,由此可得结果.
【详解】(1)将两边取对数得:,令,则,
∵,∴根据最小二乘估计可知:,
∴,
∴回归方程为,即.
(2)①甲建立的回归模型的.
∴甲建立的回归模型拟合效果更好.
②由①知,甲建立的回归模型拟合效果更好.
设,解得:,解得:.
∴科技投入的费用至少要9.3百万元,下一年的收益才能达到1亿.
21.红铃虫是棉花的主要害虫之一,能对农作物造成严重伤害.每只红铃虫的平均产卵数y(个)和平均温度x(℃)有关,现收集了7组数据,得到下面的散点图及一些统计量的值.
(1)根据散点图判断,与(其中e为自然对数的底数)哪一个更适合作为平均产卵数y(个)关于平均温度(℃)的回归方程类型?(给出判断即可,不必说明理由)并由判断结果及表中数据,求出关于的回归方程;
附:回归方程中,.
参考数据
5215
2347.3
33.6
27
81.3
3.6
(2)现在有10根棉花纤维,其中有6根为长纤维,4根为短纤维,从中随机抽取3根棉花纤维,设抽到的长纤维棉花的根数为X,求X的分布列.
【答案】(1)更适宜,;
(2)分布列见解析.
【分析】(1)根据散点图的形状,判断回归方程类型;将两边同时取自然对数,转化为线性回归方程,即可得到答案.
(2)求出X的可能值及各个值对应的概率,列出分布列即可.
【详解】(1)根据散点图的形状,判断更适宜作为平均产卵数y关于平均温度x的回归方程类型,
将两边同时取自然对数,得,
依题意,,,
因此,则,
于是z关于x的线性回归方程为,
所以y关于x的回归方程为.
(2)依题意,X的可能值为,
,
,
所以X的分布列为:
0
1
2
3
22.已知变量和之间的关系可以用模型来拟合.设,若根据样本数据计算可得,且与的线性回归方程为,则_______.(参考数据:)
【答案】0.3
【分析】利用非线性回归通过拟合函数计算即可.
【详解】由题意知,解得,
所以,
由,得,所以,
则.
故答案为:0.3
23.某研发小组为了解年研发资金投入量(单位:亿元)对年销售额(单位:亿元)的影响,结合近10年的年研发资金投入量和年销售额的数据(),建立了两个函数模型:①,②,其中,,,均为常数,为自然对数的底数.设,,经过计算得如下数据.
20
66
770
200
14
460
4.20
3125000
0.308
21500
(1)设和的相关系数为,和的相关系数为,请从相关系数的角度,选择一个拟合程度更好的模型.
(2)根据(1)中选择的模型及表中数据,建立关于的线性回归方程(系数精确到0.01),根据线性回归方程,若当年的销售额大致为亿元,则估计当年的研发资金投入量为多少亿元.
参考公式:相关系数,
线性回归直线中斜率和截距的最小二乘法估计参数分别为,.
【答案】(1)模型的拟合程度更好
(2),8亿元
【分析】(1)根据题干所给数据求出相关系数为、即可判断;
(2)由(1)可得两边取对数可得,即,再由所给数据求出、,即可得到回归方程,再代入求出即可.
【详解】(1)由题意可知,
因为,所以从相关系数的角度,模型的拟合程度更好.
(2)因为,所以,即.
由题中数据可得,
则,从而关于的线性回归方程为,
故,即.
将年销售额亿元,代入,得,解得,
故估计当年的研发资金投入量为亿元.
题型六 残差的计算
24.根据生物实验中的一组数据作出如图所示的散点图,并对这组数据进行回归分析后发现遗漏了点,增加点后再次进行回归分析,得到的结果和原来相比( )
A.决定系数变小 B.残差平方和变小
C.相关系数变大 D.不变
【答案】A
【详解】增加点,从散点图中可以看出拟合效果变差;
决定系数越接近1,拟合效果越好,所以拟合效果变差后决定系数变小,故A正确;
残差平方和越小,拟合效果越好,所以残差平方和变大,故B错误;
越接近1,相关程度越强,拟合效果越好,由于两个变量成正相关,所以相关系数变小,故C错误;
增加点前的的平均数为,增加点后的的平均数为,
所以变大,故D错误.
25.某景区在五一劳动节期间开展“致敬最美劳动者”主题游园活动,天的入园游客量统计数据如下:
活动开展第天
入园游客量(百人)
(1)由数据看出,可用线性回归模型拟合与的关系,请计算相关系数(保留小数点后两位),并推断相关程度的强弱;
(2)求经验回归方程以及表中第个观测的残差;(观测值减去预测值称为残差)
(3)该景区在活动期间设置个打卡通道,记为通道①、通道②、通道③,游客入园时选择通道①、②、③的概率依次为、、;游客离园时,从原先入园通道离园的概率为,从另两个通道离园的概率均为,求游客从通道①离园的概率.
附:参考公式:相关系数;回归直线方程,其中,;
参考数据:,,,.
【答案】(1),相关程度很强
(2),残差为百人
(3)
【分析】(1)求出、的值,利用公式求出相关系数的值,即可得出结论;
(2)利用最小二乘法公式求出、的值,可得出回归直线方程,将代入回归直线方程,结合残差的概念求解即可;
(3)记从通道入园的事件为,从通道离园的事件为,结合全概率公式求解即可.
【详解】(1)由表格中的数据可得,,
则,
由相关系数,可以推断入园游客量与活动开展第天相关程度很强.
(2),,
故经验回归方程为.
对于表中第个观测,入园游客量为(百人),
预测值为(百人),残差为(百人)
(3)记从通道入园的事件为,从通道离园的事件为,
由题意可得,,,,
.
26.(多选)已知某AI软件公司为迎合市场的需求开发了一款新型智能AI写作软件,现将该软件上市后的月份以及每个月获得的利润(单位:万元)之间的关系统计如下表所示,并根据表中数据,得到经验回归方程,则( )
月份
1
2
3
4
5
利润
5
8
10
12
15
A. B.可以估计每增加1个月份,月利润提高2.8万元
C.可以估计10月份的利润为26.8万元 D.5月份利润的残差为0.4万元
【答案】AC
【分析】由回归方程过样本中心点即可求解判断A;由回归方程和残差定义即可逐项分析求解判断BCD.
【详解】依题意,,
将代入中,解得,故A正确;
可以估计每增加1个月份,月利润提高2.4万元,故B错误;
将代入中,得到,故C正确;
将代入中,得到,则所求残差为,故D错误.
故选:AC.
27.现代物流成为继劳动力、自然资源外影响企业生产成本及利润的重要因素.某企业去年前八个月的物流成本(单位:万元)和企业利润的数据(单位:万元)如下表所示:
月份
1
2
3
4
5
6
7
8
物流成本
83
83.5
80
86.5
89
84.5
79
86.5
利润
114
116
106
122
132
114
132
残差
0.2
0.6
1.8
-3
-1
-4.6
根据最小二乘法公式求得经验回归方程为.
(1)求的值,并利用已知的经验回归方程求出8月份对应的残差值;
(2)请先求出线性回归模型的决定系数(精确到0.0001),若根据非线性模型求得解释变量(物流成本)对于响应变量(利润)的决定系数,请说明以上两种模型哪种模型拟合效果更好.
参考公式及数据:,,.
【答案】(1),;
(2),拟合程度更好.
【分析】(1)根据经验回归方程过样本中心点,先由经验回归方程和的平均数,求出的平均数,再根据平均数的定义求出;然后根据残差定义计算8月份的残差.
(2)先求出残差平方和,再代入公式计算,最后与非线性回归模型的比较大小,即可判断.
【详解】(1)因为,,,
则,解得;
8月份对应的残差值.
(2)因为,
所以,
所以,
所以线性回归模型拟合程度更好.
28.(多选)下列说法正确的是( )
A.样本数据的第70百分位数为23
B.若一组样本数据的方差,则
C.在做回归分析时,可以用决定系数刻画模型的回归效果,若越大,则说明模型拟合的效果越好
D.残差图中,残差点所在的水平带状区域越窄,则回归方程的预报精确度越高
【答案】BCD
【详解】对于A,将样本数据按从小到大排列为.
,故第70百分位数为第7位和第8位数值平均数,为,A错误.
对于B,,,,B正确.
对于C,决定系数越接近1,说明模型对数据的拟合效果越好,
相反若越小,则说明模型拟合的效果越差,故C正确.
对于D,残差图中,残差点所在的水平带状区域越窄,说明残差波动越小,
即对数据的预测误差越小,故D正确.
29.(多选)下列说法中正确的是( )
A.某学校高二年级数学课外活动小组中有男生5人,女生3人,从中选2人,1人做正组长,1人做副组长,共有64种不同的选法
B.线性回归分析中可以用决定系数来刻画回归的效果,若的值越小,则模型的拟合效果越好
C.对具有线性相关关系的变量,其线性回归方程为,若样本点的中心为,则实数的值是-4
D.以模型去拟合一组数据时,为了求出经验回归方程,设,求得线性回归方程为,则的值分别是和2
【答案】CD
【分析】根据排列即可求解A,根据决定系数的定义即可求解B,将样本中心代入即可求解C,取对数即可求解D.
【详解】对A:可以看作从8个人中取2个人的排列,故有种不同的选法,A错误;
对B:线性回归分析中可以用决定系数来刻画回归的效果,若的值越大,则模型的拟合效果越好,B错误;
对C:由题知,解得,C正确,
对D:以模型去拟合一组数据时,为了求出经验回归方程,设,
则,由题线性回归方程为,则,故的值分别是和2,D正确.
题型七 独立性检验的概念及辨析
30.为比较甲、乙两所学校学生的数学水平,采用简单随机抽样的方法抽取100名学生.通过测验得到如下的列联表:
单位:人
学校
数学成绩
合计
不优秀
优秀
甲
40
10
50
乙
30
20
50
合计
70
30
100
附:,其中.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
下列结论正确的是( )
A.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率无差异
B.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率有差异
C.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率有差异
D.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率有差异
【答案】B
【分析】根据独立性检验的基本思想,结合已知计算得,逐项进行分析即可求解.
【详解】零假设为:两校学生的数学成绩优秀率无差异,
A,若,因为,故有充分的证据推断不成立,
即两校学生的数学成绩优秀率有差异,故A错误;
B,若,因为,故有充分的证据推断不成立,
即两校学生的数学成绩优秀率有差异,故B正确;
C,若,因为,故没有充分的证据推断不成立,
即两校学生的数学成绩优秀率无差异,故C错误;
D,若,因为,故没有充分的证据推断不成立,
即两校学生的数学成绩优秀率无差异,故D错误.
故选:B
31.读万卷书,行万里路.随着我国教育模式由“应试教育”向“素质教育”转变,研学旅行作为一种传统而现代的素质教育手段被广泛关注.某校对“是否喜欢参加暑期研学旅行与学生性别的关系”进行了一次调查,其中被调查的男、女生人数相同,男生中喜欢参加暑期研学旅行的人数占男生人数的,女生中喜欢参加暑期研学旅行的人数占女生人数的.若有95%的把握认为是否喜欢参加暑期研学旅行与学生性别有关,则被调查的学生中,男生的人数不可能为( )
A.25 B.45 C.60 D.75
【答案】A
【分析】根据条件设男生人数为,再根据条件列出列联表,计算,解不等式.
【详解】依题意,设男生的人数为,可列出2×2列联表如下所示:
是否喜欢参加暑期研学旅行
性别
总计
男生
女生
喜欢
不喜欢
总计
则=.
由题意知,即,得,所以.
又,所以结合选项知B,C,D项都可以.
32.某公司男、女职工人数相等,该公司为了了解职工是否接受去外地长时间出差,在男、女职工中各随机抽取了100人进行调查,数据显示男职工和女职工接受去外地长时间出差的人数分别为40和20.下列结论正确的是( )
附表:
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
附:,其中.
A.依据小概率值的独立性检验,不能认为是否接受去外地长时间出差与性别有关
B.依据小概率值的独立性检验,可以认为是否接受去外地长时间出差与性别有关
C.有的把握认为是否接受去外地长时间出差与性别有关
D.是否接受去外地长时间出差与性别无关
【答案】B
【分析】求得卡方值,比对临界值,逐个判断即可.
【详解】由题意,列出列联表:
接受
不接受
合计
男
40
60
100
女
20
80
100
合计
60
140
200
零假设为:是否接受去外地长时间出差与性别相互独立,即是否接受去外地长时间出差与性别无关,
所以,
根据小概率值的独立性检验,我们推断不成立,
即认为是否接受去外地长时间出差与性别有关,此推断犯错误的概率不大于0.005.
故选:B.
33.下列说法中,正确的有__________(填序号).
①回归直线恒过点,且至少过一个样本点;
②根据列联表中的数据计算得出,而,则有99%的把握认为两个分类变量有关系,即有1%的可能性使得“两个分类变量有关系”的推断出现错误;
③是用来判断两个分类变量是否相关的随机变量,当的值很小时可以推断两类变量不相关;
④某项测量结果服从正态分布,则,则.
【答案】②④
【分析】根据回归直线的特征即可判断①,理解独立性检验的基本思想即可判断②,正确把握卡方值的含义即可判断③,利用正态曲线的对称性可判断④.
【详解】对于①,回归直线恒过点,但不一定过样本点,故①错误;
对于②,因独立性检验是选取一个零假设条件下的小概率事件,故②正确;
对于③,当的值很小时推断两类变量相关的把握小,但不能说无关,故③错误;
对于④,因为服从正态分布,且,所以与关于直线对称,
由可得,,则,故④正确.
故答案为:②④.
【点睛】关键点点睛:本题主要考查回归分析,独立性检验,正态分布等知识点,属于基础题.
解决此类题的关键即是正确理解和把握以上概念和本质特征,如回归直线的图象体征,独立性检验中“零假设”的含义,正态分布曲线的对称性特征.
题型八 卡方的计算
34.羽毛球运动在我国是非常受大众喜爱的一项运动,但自2023年以来,由于多种原因,羽毛球价格经历多轮上涨,部分高端型号涨幅甚至超过同期黄金涨幅,越来越多的球友直呼快打不起球了.我国某著名体育厂商抓住这个历史机遇推出了人造羽毛球,名为碳音球,这款羽毛球采用碳纤维复合材料替代天然羽毛,其飞行轨迹与击球手感接近天然羽毛球,但价格却只有天然羽毛球的60%到70%,该羽毛球一经上市便引起热烈反响,但舆论对其评价褒贬不一.某市场调查机构调查了男性和女性各100名羽毛球爱好者对碳音球和天然羽毛球的偏好程度,现统计得出样本中偏好碳音球的人数占样本总数的45%,其中偏好碳音球的女性羽毛球爱好者有50人.
偏好碳音球
偏好天然羽毛球
合计
男性
女性
50
合计
200
(1)请根据已知条件将上述列联表补充完整,并分析是否有90%的把握认为两种羽毛球的偏好与性别有关?
(2)现从男性羽毛球爱好者中按对碳音球和天然羽毛球的偏好采用分层抽样的方法抽取10人,然后从这10人中随机抽取3人参加有奖问答,记3人中偏好碳音球的人数为,求的分布列和数学期望.
(3)若某羽毛球俱乐部的男女比例为3:2.将样本的频率视为概率,现从该俱乐部中随机抽取一人,已知此人偏好碳音球,求其为男性的概率.
附:
0.100
0.050
0.010
2.706
3.841
6.635
【答案】(1)表格见解析,没有的把握认为两种羽毛球的偏好与性别有关
(2)
0
1
2
3
(3)
【分析】(1)完善列联表,计算出卡方,即可判断;
(2)利用超几何分布的概率公式求出分布列,从而求出数学期望;
(3)根据全概率公式及条件概率公式计算可得.
【详解】(1)依题意可得列联表如下:
偏好碳音球
偏好天然羽毛球
合计
男性
40
60
100
女性
50
50
100
合计
90
110
200
,
没有的把握认为两种羽毛球的偏好与性别有关.
(2)依题意男性羽毛球爱好者偏好碳音球的抽取人,
偏好天然羽毛球的抽取人,
则的可能取值为,,,,
则,,
,,
则的分布列为,
0
1
2
3
所以的数学期望为: ;
(3)记事件A为:抽取的人偏好碳音球:事件B为:抽取的人性别为男性,
则,
由全概率公式得,
则,即此人为男性的概率为.
35.智能驾驶辅助系统是指利用车载传感器、控制器等装置、实现环境感知、规划决策与运动控制,辅助驾驶员完成部分驾驶操作,提升行车安全性与舒适性的系统,驾驶员仍需全程监管车辆并随时接管驾驶:驾龄是指初次领取机动车驾驶证至今的时间长度、为研究智能驾驶辅助系统使用情况与驾龄的关系,随机调查了200名私家车车主,得到如下列联表:
经常使用智能驾驶辅助系统
不经常使用智能驾驶辅助系统
合计
驾龄≤5年
58
42
100
驾龄>5年
36
64
100
合计
94
106
200
(1)从这200名车主中随机抽取1人,已知该车主驾龄不超过5年,求该车主经常使用智能驾驶辅助系统的概率;
(2)根据小概率值的独立性检验,分析智能驾驶辅助系统使用情况是否与驾龄有关.
附:
0.050
0.010
0.001
3.841
6.635
10.828
【答案】(1)0.58
(2)有关
【详解】(1)设事件A为“车主驾龄不超过5年”,事件B为“车主经常使用智能驾驶辅助系统”.
由题意可知:,,根据条件概率公式得:,
所以该车主经常使用智能驾驶辅助系统的概率为0.58.
(2)提出假设:智能驾驶辅助系统使用情况与驾龄无关,
根据表中数据可得:,
根据小概率值的独立性检验,推断不成立,即认为智能驾驶辅助系统使用情况与驾龄有关,该推断犯错误的概率不超过0.010.
36.某团队为探究大语言模型参数量与模型性能之间的关系,训练了6个不同参数量的模型,并在同一验证集上评估性能得分,得到如下统计数据:
参数量x(亿)
2
4
6
8
10
12
性能得分y(分)
1.8
2.8
3.4
3.6
3.8
4.0
(1)求y关于x的线性回归方程(系数用分数表示),并预测参数量为14亿时,模型的性能得分;
(2)该团队比较了100次实验的实际性能与预测性能,得到“高效”(实际得分≥预测得分)和“低效”(实际得分<预测得分)两种效率组别.同时,他们记录了每次实验所用的训练数据质量等级(优质/普通),得到如下列联表:
训练数据质量等级
训练效率
总计
高效
低效
优质
42
18
60
普通
18
22
40
总计
60
40
100
请依据小概率值的独立性检验,分析训练效率是否与训练数据质量有关.
附:,,,.
.
0.05
0.01
0.001
3.841
6.635
10.828
【答案】(1)线性回归方程为,预测性能得分约为分
(2)依据的独立性检验,训练效率与训练数据质量有关
【分析】(1)先根据数据算样本均值,再用公式求回归系数和得线性回归方程,最后代入值预测.
(2)提出零假设,根据列联表数据算卡方值,与临界值比较后判断是否拒绝零假设.
【详解】(1)由题意可得,n=6,,,
又因为,,所以根据公式计算回归系数可得:
,
,
所以,关于的线性回归方程为: ,
当参数量亿时,代入可得: ,
即预测参数量为14亿时,模型性能得分约为分(或分).
(2)零假设:训练效率与训练数据质量无关,根据列联表可得:
,,,,,
所以卡方统计量为,
因为对应的临界值为,,所以拒绝,
依据的独立性检验,认为训练效率与训练数据质量有关.
37.人工智能技术(简称AI技术)已成为引领世界新一轮科技革命和产业改革的战略性技术,并迅速在各行各业中得到应用和推广,教育行业也不例外.某市教体局为调查本市中学教师使用AI技术辅助教学的情况,随机抽取了该市120名中学教师,统计了他们一周内使用AI技术帮助制作课件的情况,并将一周内使用AI技术帮助制作课件的节次不少于4次的认定为喜欢使用AI技术,否则认定为不喜欢使用AI技术,经统计得到如下2×2列联表.
年龄
是否喜欢使用AI技术
合计
是
否
不超过45岁
46
超过45岁
28
合计
78
(1)补全上述2×2列联表.
(2)依据小概率值的独立性检验,能否认为该市中学教师是否喜欢使用AI技术与年龄有关;
(3)将频率视为概率,现从所抽取的120名中学教师中随机抽取一人,在抽中喜欢使用AI技术的教师的条件下,求此人年龄超过45岁的概率.
附:,其中.
0.1
0.01
0.001
2.706
6.635
10.828
【答案】(1)
年龄
是否喜欢使用AI技术
合计
是
否
不超过45岁
46
14
60
超过45岁
32
28
60
合计
78
42
120
(2)能认为有关
(3)
【分析】(1)先根据总人数、“是”的合计数求出“否”的合计数,再结合已知的行列数据,依次算出其余空缺数值;
(2)先确定列联表中的、、、对应数值,代入给定的公式计算统计量,再将结果与对应的临界值比较,根据比较结果作出判断;
(3)先确定喜欢使用AI技术的总人数以及其中年龄超过45岁的人数,再利用条件概率公式计算.
【详解】(1)
年龄
是否喜欢使用AI技术
合计
是
否
不超过45岁
46
14
60
超过45岁
32
28
60
合计
78
42
120
超过45岁喜欢使用AI的人数:,
不超过45岁不喜欢使用AI的人数:,(总人数120,超过45岁合计,故不超过45岁合计),
不喜欢使用AI的总人数:,符合总人数;
(2)零假设:该市中学教师是否喜欢使用AI技术与年龄无关。
根据卡方公式计算:
设,
,
已知小概率值对应的临界值,由于,因此拒绝,
依据的独立性检验,能认为该市中学教师是否喜欢使用AI技术与年龄有关;
(3)设事件:抽中喜欢使用AI技术的教师,
事件:抽中教师年龄超过45岁,要求,
根据条件概率公式:,
其中(喜欢且年龄超过45岁的人数),(喜欢的总人数),
因此:.
38.《我爱古诗词》是某卫视推出的大型传统文化竞技类节目,旨在弘扬中华诗词文化、考验选手诗词储备与临场应变能力.某机构为了解大学生喜欢《我爱古诗词》是否与性别有关,对某校名大学生进行问卷调查,得到如下列联表:
喜欢
不喜欢
合计
男生
女生
合计
(1)判断在犯错误的概率不超过的前提下能否认为喜欢《我爱古诗词》与性别有关,并说明理由;
(2)已知在参与问卷调查的大学生中有名是大一学生,其中名喜欢《我爱古诗词》.现从这名大一学生中随机抽取人,设抽到喜欢《我爱古诗词》的人数为,求的分布列与数学期望.
附:,(结果精确到).
【答案】(1)在犯错误的概率不超过的前提下,能认为喜欢《我爱古诗词》与性别有关,理由见解析.
(2)的分布列为
.
【分析】(1)提出零假设,利用卡方公式计算的值,再与临界值比较后即得结论;
(2)先确定的可能取值为,再结合超几何分布概率公式分别计算概率,列出分布列并用期望公式计算即可.
【详解】(1)零假设:喜欢《我爱古诗词》与性别无关
由题意可得,
所以零假设不成立,
所以在犯错误的概率不超过的前提下,能认为喜欢《我爱古诗词》与性别有关.
(2)由题意可得,的可能取值为,
,,,
所以的分布列为
.
强化训练
1.下列说法正确的是( )
A.一组数据2,3,8,3,10,18,7,4的第50百分位数为4
B.在残差图中,残差点所在的水平带状区域越宽,回归方程的预报精确度越高
C.设且,则
D.根据分类变量X与Y的成对样本数据,计算得到,根据小概率值的独立性检验,可判断X与Y有关联,此推断犯错误的概率不大于0.05
【答案】D
【分析】利用百分位数的定义求解选项A即可,利用残差图与回归方程的关系求解选项B即可,利用正态分布的定义求解选项C即可,利用独立性检验的定义求解选项D即可.
【详解】将这一组数据2,3,8,3,10,18,7,4按照从小到大排序得:2,3,3,4,7,8,10,18.
因则50百分位数为第4位和第5位的平均数,即,故A错误.
在残差图中,残差点所在的水平带状区域越窄,回归方程的预报精确度越高,故B错误.
因,则故C错误.
因故判断X与Y有关联,此推断犯错误的概率不大于0.05,故D正确.
2.已知变量具有线性相关关系,根据一组观测数据利用最小二乘法建立了经验回归方程,若,则( )
A.10 B.5 C.0.5 D.0.1
【答案】D
【详解】因为经验回归直线一定经过点,所以,解得.
3.独立性检验中,若小于临界值,则下列结论正确的是( )
A.两个变量一定相互独立 B.两个变量一定不独立
C.没有充分证据表明两个变量有关 D.两个变量有关联的可能性为
【答案】C
【分析】根据独立性检验的基本逻辑即可求解.
【详解】对于A,小于临界值,并不意味着“一定相互独立”,只是无足够证据反对独立,故A错误;
对于B,小于临界值,并不意味着“一定不独立”,只是无足够证据反对独立,故B错误;
对于C,这是独立性检验的基本逻辑:当时,无充分证据支持变量相关,即不能认为有关联,故C正确;
对于D,对应的把握认为两个变量有关联,而实际上,故D错误.
4.下列说法中,正确的是( )
A.将一组数据中的每一个数据加上同一个正数后,方差变大
B.在回归分析中,为0.98的模型比为0.99的模型拟合的效果更好
C.残差图中,残差点所在的水平带状区域越窄,则回归方程的预报精确度越低
D.根据分类变量与的成对样本数据,计算得到,根据小概率值的独立性检验,可判断与有关联,此推断犯错误的概率不超过0.05
【答案】D
【详解】将一组数据中的每一个数据加上同一个正数后,数据相对平均值的波动情况无变化,方差不变,故A错误;
由越接近1,模型拟合效果越好,知B错误;
若残差点所在的水平带状区域越窄,说明残差的波动越小,回归方程对数据的拟合精度越高,进而回归方程的预报精确度也越高(而非越低),故C错误;
因为,所以判断与有关联,此推断犯错误的概率不超过0.05,故D正确.
5.已知,,,四组成对样本数据对应的线性相关系数分别为-0.95,-0.82,0.86,0.93,则线性相关程度最弱的是( )
A.组 B.组 C.组 D.组
【答案】B
【分析】由线性相关系数的性质判断即可得.
【详解】因为,所以线性相关程度最弱的是组.
6.已知某种商品的广告费支出(单位:万元)与销售额(单位:万元)之间有如下对应数据:
4
6
7
8
根据上表可得经验回归方程,据此估计,当投入万元广告费时,销售额为( )
A.万元 B.万元 C.万元 D.万元
【答案】D
【详解】由上表可知:,,
样本点的中心为,
代入经验回归方程,得,
经验回归方程为,
将代入可得,
当投入万元广告费时,销售额为万元.
7.从非洲蔓延到东南亚的蝗虫灾害严重威胁了国际农业生产,影响了人民生活.世界性与区域性温度的异常、旱涝频繁发生给蝗灾发生创造了机会.已知蝗虫的产卵量y与温度x的关系可以用模型(其中e为自然对数的底数)拟合,设,其变换后得到一组数据:
x
20
23
25
27
30
z
2
2.4
3
3
4.6
由上表可得经验回归方程,则当x=35时,蝗虫的产卵量y的估计值为( )
A. B. C.8 D.
【答案】A
【分析】根据线性回归方程的性质求出,由此可求.
【详解】由表格数据知:,,
因为数对满足,得,
∴,即,∴,∴x=35时,.
故当x=35时,蝗虫的产卵量y的估计值为.
故选:A.
8.(多选)下列选项正确的是( )
A.若回归方程为,则当变量增加1个单位时,增加3个单位
B.设具有相关关系的两个变量x、y的相关系数为r,越接近于1,说明两个变量之间的线性相关性越强
C.利用进行独立性检验时,的值越大,说明有更大的把握认为两个分类变量相关性越弱
D.根据一组样本数据的散点图判断出两个变量线性相关,由最小二乘法求得其回归方程为,若其中一个散点坐标为,则
【答案】AB
【详解】对于选项A:因为回归方程为,
所以当变量增加1个单位时,增加3个单位,故A正确;
对于选项B:越接近于1,说明两个变量之间的线性相关性越强,故B正确;
对于选项C:的值越大,说明有更大的把握认为两个分类变量相关,故C错误;
对于选项D:回归直线不一定经过样本点,无法求参数的值,故D错误.
9.(多选)某奶茶店统计了六天每天天气平均气温t(℃)和每天凉茶的销售数量n(单位:杯),得到以下数据:
t(℃)
3
0
5
7
9
12
n(单位:杯)
23
17
27
29
36
42
若t与n线性相关,且回归直线方程为,则( )
A.t和n正相关 B.点在回归直线上
C. D.
【答案】ABD
【分析】根据表格中的数据,求得样本中心,结合选项,逐项分析、计算,即可求解.
【详解】根据表格中的数据,可得,
即数据的样本中心为,
对于A,由表格中的数据得,当气温从0到12时,从17增加到42,
所以随着气温的升高,凉茶的销售数量总体呈上升趋势,所以t和n正相关,故A正确;
对于B,根据回归直线过样本中心,所以点在回归直线上,所以B正确;
对于C,由气温t和销售数量总体上正相关,所以,所以C不正确;
对于D,由表格中的数据得:
第一组:;第二组:;
第三组:;第四组:;
第五组:;第六组:;
所以,所以D正确.
10.(多选)下列结论错误的是( )
A.由样本数据得到的回归直线必过点
B.若两个随机变量的线性相关性越强,则样本相关系数就越接近于1
C.从独立性检验可知,有99%的把握认为吸烟与患肺癌有关时,我们说某人吸烟,那么他有99%的可能患有肺癌
D.若散点图中所有点都在直线上,则样本相关系数
【答案】BCD
【分析】由回归直线方程、相关系数、独立性检验相关概念逐项判断即可.
【详解】对于A,回归直线方程概念可知,回归直线必过样本中心点,故A正确;
对于B,若两个随机变量的线性相关性越强,则样本相关系数的绝对值就越接近于1,故B错误;
对于C,由独立性检验的基本思想可知该判断不正确,故C错误;
对于D,散点图中所有点都在直线上,则样本相关系数,故D错误.
11.(多选)已知相关系数,关于的线性回归方程中斜率和截距的最小二乘估计公式分别为,,已知变量与变量的部分数据,建立由最小二乘法得到的两个回归模型:以为自变量,为因变量,得出的线性回归方程为;以为自变量,为因变量,得出的线性回归方程为,若两个模型的计算均无误,则下列判断正确的是( )
A.若已知变量的方差,则可得知变量的标准差
B.若已知变量的方差,则不可得知变量的标准差
C.若不给定其他信息,则也可得知变量与变量各自的平均值
D.若不给定其他信息,则也可得知变量与变量的相关系数
【答案】ACD
【分析】根据方差,标准差,相关系数和的定义和表达式,得到及其他关系式,结合数据,代入求值,得到答案
【详解】对于D,以为自变量,为因变量,得出的线性回归方程为,
故,
以为自变量,为因变量,得出的线性回归方程为,
故,
故,
且回归系数为负数,故相关系数,D正确.
对于A,设变量与变量的标准差分别为,,
则,,,
所以
即,
代入已知数据得,即,
若已知变量的方差,即可求得,进而代入上式求得,A正确.
对于B,若已知变量的方差,即可求得,进而代入求得,B错误.
对于C,线性回归直线经过样本中心点,
代入两个回归方程得与,联立解得,,
故不给定其他信息也可得知变量与变量各自的平均值,C正确.
12.(多选)下列结论正确的是( )
A.随机变量X 服从二项分布,Y = 2X +1 ,则D(Y) = 3
B.相关系数 r 的值越小,两个变量之间的线性相关性越弱
C.在线性回归分析中,若 值越小则模型的拟合效果越好
D.随机变量X 服从正态分布 ,且P(2 < X < 5 ) = a ,则
【答案】AD
【详解】对于A,,A正确;
对于B,相关系数 的值越小,两个变量之间的线性相关性越弱,B错误;
对于C,在线性回归分析中,若 值越大则模型的拟合效果越好,C错误;
对于D,正态曲线关于直线对称,所以,
又,所以,D正确.
13.某公司为了解用电量y(单位:千瓦时)与气温x(单位:摄氏度)之间的关系,随机统计了4天的用电量与当天气温,绘制了如下表格,由表中数据可得回归方程,则实数_____.
x
10
13
18
y
62
38
34
m
【答案】24
【分析】求出样本中心点的坐标,将样本中心点的坐标代入回归直线方程,可得出实数的值.
【详解】由题意,,
,
所以样本中心点为,
将样本中心点的坐标代入回归直线方程可得,解得.
故答案为:24.
14.某学校开展研究性学习活动,一组同学获得了下面的一组试验数据:
x
1.99
3
4
5.1
8
y
0.99
1.58
2.01
2.35
3.00
现有如下5个模拟函数:①;②;③;④;⑤,请从中选择一个模拟函数,使它能近似地反映这些数据的规律,应选________(填序号).
【答案】④
【分析】根据表中提供的数据,可通过描点,连线,画出图象,看哪个函数的图象能接近所画图象,这个函数便可反应这些数据的规律.
【详解】根据表中数据,画出图象如下:
通过图象可看出,能比较近似的反映这些数据的规律.
故答案为:④.
15.为研究学习时间与成绩的关系,记录5名学生的数学学习时间(小时)与模拟考成绩(分,满分 150) 如下:
2
4
6
8
10
w
58
72
80
90
100
设模拟考成绩与学习时间的回归模型为:,其中 .为计算简洁,现对数据进行中心化处理: 令,则回归模型化为. 记残差平方和.
(1)根据最小二乘原理,要使最小(假设),推导的估计量的表达式(写出关键步骤).
(2)利用所给数据,求关于的经验回归方程,并还原为关于的方程. 预测时的成绩.
【答案】(1)
(2)关于的经验回归方程为,关于的方程为,预测时的成绩为
【分析】(1)展开式为的二次函数,利用二次函数的最值的求法即可求解;
(2)利用(1)的结论可求关于的经验回归方程,进而可求关于的方程,代入可求预测值.
【详解】(1)因为
上式是关于的二次函数,因此要使取得最小值,
当且仅当的取值为时,取得最小值;
(2)因为,
所以可得
0
2
4
0
10
20
所以,
,
所以,所以关于的经验回归方程为,
所以关于的方程为,所以,
所以时,.
16.某影视数据平台对最近上映的电影《飞驰人生3》进行票房调研,记录了其上映后的累计票房情况.累计票房(单位:千万元)与上映天数(单位:天)的数据如下表所示:
上映天数
4
7
9
10
15
累计票房
20
40
60
80
100
(1)利用表中的数据,计算相关系数(结果精确到0.01),并推断两个变量的线性相关程度;
(2)求关于的经验回归方程,并预测上映40天时的累计票房(结果精确到0.01).
参考公式:经验回归方程,其中,,相关系数.参考数据:,,,.
【答案】(1),两个变量具有很强的线性相关程度
(2),预测上映40天时的累计票房为千万元
【分析】(1)先计算,代入相关系数公式计算即可;
(2)先计算和,进而得经验回归方程,令,代入回归方程即可求解.
【详解】(1)由题意得,,,
,,,
则
,
所以两个变量具有很强的线性相关程度.
(2)由题意得,,
,
所以经验回归方程为,
令,得(千万元),
所以预测上映40天时的累计票房为千万元.
17.飞机与高铁是人们远距离出行的两种方式,交通大学某班学生为了调查人们选择的远距离出行方式是否与年龄相关,随机抽取该市1000名市民进行调查,得到如下列联表:
低于40岁
不低于40岁
总计
选择飞机出行
100
选择高铁出行
300
总计
500
1000
(1)补全表中数据,依据小概率值的独立性检验,是否能够认为市民选择的远距离出行方式与年龄有关联?
(2)调查小组统计高铁站某处今天的客流量,从7:00开始,每小时作为一个时间段(为第1个时间段,为第2个时间段,……),得到如下数据:
时间段
1
2
3
4
5
客流量(千人)
1
1.5
2.5
3
3.5
若与线性相关,建立每个时间段客流量与时间段的经验回归方程,并预测的客流量.
附:,其中.
0.010
0.001
6.635
10.828
对于一组数据,,…,,其经验回归方程的斜率,.
【答案】(1)表格见解析,与年龄有关联
(2),客流量约为4.25千人
【分析】(1)根据数据完成表格,求出的值即可判断;
(2)根据数据求出回归方程,再代入,即可得答案.
【详解】(1)列联表如下:
低于40岁
不低于40岁
总计
选择飞机出行
100
200
300
选择高铁出行
400
300
700
总计
500
500
1000
零假设为:市民选择的远距离出行方式与年龄没有关联.
由列联表中的数据,
得.
依据小概率值的独立性检验,我们推断不成立,
所以能够认为市民选择的远距离出行方式与年龄有关联.
(2),,
所以,
,
所以每个时间段客流量与时间段的经验回归方程为.
当时,,
所以预测12:00~13:00的客流量约为4.25千人.
18.某学校对学生是否喜欢跑步锻炼进行调查,随机抽取男女学生共n人进行问卷调查,统计得到如下列联表:
喜欢
不喜欢
合计
男生
100
20
女生
20
合计
n
若采用比例分配的分层随机抽样从这n人中抽取5人,则有男生3人,女生2人.
(1)求以及这人中喜欢跑步锻炼的概率;
(2)根据小概率值的独立性检验,能否认为学生喜欢跑步锻炼与其性别有关?
(3)用样本估计总体,将频率视为概率,从该校全体学生中随机抽取2人,记其中喜欢跑步锻炼的人数为X,求X的数学期望.
附:,
0.050
0.010
0.001
3.841
6.635
10.828
【答案】(1),
(2)不能认为学生喜欢跑步锻炼与其性别有关
(3)
【分析】(1)由条件求男生人数,再结合分层抽样性质求出,由此求出女生人数及女生中喜欢跑步锻炼的人数,结合古典概型概率公式求结论;
(2)完善列联表,提出零假设,计算,比较与临界值的大小即可判断结论;
(3)结合二项分布的定义判断,再根据二项分布期望公式求结论.
【详解】(1)由已知男生人数为,
又采用比例分配的分层随机抽样从这人中抽取人,则有男生人,女生人,
所以,解得,
所以女生人数为,女生中喜欢跑步锻炼的人数为,
所以这人中喜欢跑步锻炼的总人数为,
所以这人中喜欢跑步锻炼的概率,
(2)由(1)可得列联表为:
喜欢
不喜欢
合计
男生
女生
合计
零假设为:假设是否喜欢跑步锻炼与性别无关,
则,
依据小概率值的独立性检验,没有充分证据推断不成立,
因此可以认为成立,即不能认为是否喜欢跑步锻炼与性别有关.
(3)的可能取值为0,1,2,,
,
.
的分布列为
0
1
.
19.某社区消费者协会为了解本社区居民网购消费情况,随机抽取了100位居民作为样本,就最近一年来网购消费金额(单位:千元),网购次数和支付方式等进行了问卷调查.经统计这100位居民的网购消费金额均在区间内,按,,,,,分成6组,其频率分布直方图如图所示.
(1)估计该社区居民最近一年来网购消费金额的中位数;
(2)将网购消费金额不少于20千元的人称为网购迷,补全下面的2×2列联表,并判断有多大把握认为“是否为网购迷与性别有关系”;
网购人群类别
性别
合计
男
女
网购迷
20
非网购迷
45
合计
100
(3)调查显示,甲、乙两人每次网购采用的支付方式相互独立,两人网购时间与次数也互不影响.统计最近一年来两人网购的总次数与支付方式,所得数据如下表所示:
类别
网购总次数
支付宝支付次数
银行卡支付次数
微信支付次数
甲
80
40
16
24
乙
90
60
18
12
将频率视为概率,若甲、乙两人在下周内各自网购2次,记两人采用支付宝支付的次数之和为,求的数学期望.
附:.
0.1
0.05
0.025
0.010
0.005
0.001
2.706
3.841
5.024
6.635
7.879
10.828
【答案】(1)17.5
(2)表格见解析,有97.5%的把握认为“是否为网购迷与性别有关系”.
(3)
【分析】(1)根据频率分布直方图中位数的求解方法计算即可;
(2)先补全列联表,再计算值,并结合独立性检验思想求解即可;
(3)先根据频率估计概率得甲使用支付宝的概率为,乙使用支付宝的概率为,再求对应取值的概率,列分布列,求期望即可.
【详解】(1)解:依题意,因为,
而,
所以中位数位于内,所以中位数为.
(2)解:依题意,消费金额不少于20千元的频率为,
所以网购迷人数为,非网购迷的人数为.
所以补全列联表如下.
网购人群类别
性别
合计
男
女
网购迷
15
20
35
非网购迷
45
20
65
合计
60
40
100
所以.
因为,所以有97.5%的把握认为“是否为网购迷与性别有关系”.
(3)(3)根据统计数据,甲使用支付宝的概率为,乙使用支付宝的概率为,
甲、乙两人在下周内各自网购2次,两人采用支付宝支付的次数之和的所有可能的取值为0,1,2,3,4.
,
.
,
,
.
所以随机变量的分布列为
0
1
2
3
4
所以的数学期望
.
1 / 1
学科网(北京)股份有限公司
$