内容正文:
第4章 统计
清单01、变量的相关关系
1.定义
两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系.
2.正相关、负相关
如果从整体上看,当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势,我们就称这两个变量正相关;如果当一个变量的值增加时,另一个变量的相应值呈现减少的趋势,则称这两个变量负相关.
3.线性相关和非线性相关
(1)一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们就称这两个变量线性相关.
(2)一般地,如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量非线性相关或曲线相关.
4.样本相关系数
计算公式
r=
r为变量x和变量y的样本相关系数
样本相
关系数r
的特征
①r∈[-1,1].
②当r>0时,称成对样本数据正相关;当r<0时,称成对样本数据负相关.
③当|r|越接近1时,成对样本数据的线性相关程度越强;当|r|越接近0时,成对样本数据的线性相关程度越弱
5.经验回归方程与最小二乘法
设满足一元线性回归模型的两个变量的n对样本数据为(x1,y1),(x2,y2),…,(xn,yn).
当a,b的取值为=,=-时,Q= (yi-bxi-a)2达到最小.将=x+称为Y关于x的经验回归方程,也称经验回归函数或经验回归公式,其图形称为经验回归直线.这种求经验回归方程的方法叫做最小二乘法,求得的,叫做b,a的最小二乘估计.
6.刻画回归效果的方式
(1)残差图法,作图时纵坐标为残差,横坐标可以选为样本编号,或身高数据,或体重估计值等,这样作出的图形称为残差图.在残差图中,残差点比较均匀地落在以横轴为对称轴的水平的带状区域中,说明选用的模型比较合适,这样的带状区域的宽度越窄,说明模型拟合精度越高.
(2)残差平方和法,残差平方和为 (yi-i)2,残差平方和越小,模型拟合效果越好.
(3)利用决定系数R2刻画拟合效果
R2=1-.R2越大,表示残差平方和越小,即模型的拟合效果越好;R2越小,表示残差平方和越大,即模型的拟合效果越差.
清单02、独立性检验
1.χ2的计算公式:记n=a+b+c+d,则χ2=.
2.利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验.
3.应用独立性检验解决实际问题包括以下几个环节:
(1)提出零假设H0:X和Y相互独立,并给出在问题中的解释.
(2)根据抽样数据整理出2×2列联表,计算χ2的值,并与临界值xα比较.
(3)根据检验规则得出推断结论.
(4)在X和Y不独立的情况下,根据需要,通过比较相应的频率,分析X和Y间的影响规律.
【常用结论】
1.经验回归直线过样本点的中心(,).
2.根据经验回归方程计算的值,仅是一个预测值,不是真实发生的值.
3.根据χ2的值可以判断两个分类变量有关的可信程度,若χ2越大,则两分类变量有关的把握越大.
易错点1 相关系数的计算与应用
例1..以下散点图经过标准化后,相关系数最大的是( )
A. B.
C. D.
例2.(多选)下列关于相关系数的说法正确的是( )
A.相关系数越大两个变量间相关性越强
B.相关系数的取值范围为
C.相关系数时两个变量正相关,时两个变量负相关
D.相关系数时,样本点在同一直线上
例3.(多选)通过随机抽样,得到变量和变量的7对数据,并绘制成散点图如图所示,已知变量和变量线性相关,且回归直线是图中直线,则下列说法正确的是( )
A.直线的斜率是负数
B.变量与变量正相关
C.相关系数
D.若去掉图中点后,剩余数据的相关系数变大
例4.已知,,,,则相关系数______.(相关系数)
易错点2 线性回归分析
例1.(多选)某种细胞在培养正常的情况下,时刻(单位:分)与细胞数(单位:个)的部分数据如下表所示:
1
2
3
4
5
52
95
185
227
若与线性相关,由上表数据求得经验回归方程为,则下列说法正确的是( )
A.与正相关 B.
C.细胞数逐分增加,平均每分钟增加10个左右 D.预计10分钟后细胞数约为450个
例2.2025年11 月,搭载“祖冲之三号”同款芯片的超导量子计算机“天衍-287”完成搭建,该量子计算系统具备“量子计算优越性”能力.下表记录了8个团队在特定年度的研发资金投入x(单位:亿元)与芯片性能提升评估指数y,且
研发资金投入x/亿元
2
10
性能提升评估指数y
2
12
已知y与x具有较强的线性关系,通过最小二乘估计得到的经验回归方程为如果去掉样本点后,得到的新样本的经验回归方程为则( )
A.0.1 B.0.3 C.0.5 D.0.7
例3.(多选)两个具有相关关系的变量,的一组数据为,,,,其经验回归方程为,记,,相关系数为;若将数据调整为,,,,其经验回归方程为,记,相关系数为,则( )
附:,
A. B.
C. D.
例4.某景点自从取消门票实行免费开放后,迅速成为网红打卡点,不仅带动了淡季的旅游,而且优化了旅游产业的结构.下表是该景点免费开放后前五个月的打卡人数y(万人)与第个月的数据:
1
2
3
4
5
1.3
1.7
2.2
2.8
3.5
已知与线性相关.
(1)求关于的线性回归方程;
(2)预测第7个月的打卡人数.
参考数据:.
参考公式:线性回归方程中斜率、截距的最小二乘法估计公式为.
易错点4 非线性回归分析
例1. 用模型去拟合与的关系,令,得到关于的回归直线方程为,则( )
A.1 B.2 C.3 D.4
例2. 在研究两个变量的相关关系时,观察散点图发现样本点集中于某一条指数曲线的周围.令,求得经验回归方程为,则该模型的回归方程为________.
例3.某科技创新型企业自创建以来,不断加大研发投入,走科技创新之路,年利润得到较快增长,2021~2025连续五年的年利润y(单位:亿元)与年份序号x(,2,3,4,5,其中2021年记为1,2022年记为2,以此类推)满足某一元非线性回归方程,统计数据如下:
374
230
6.3
144
1.6
4
注:,.
(1)设和y的相关系数为,x和v的相关系数为,请从相关系数的角度,确定和(其中a,b,m,n均为常数,e为自然对数的底数)哪一个拟合程度更好;
(2)根据(1)的结论及表中数据,建立y关于x的回归方程.
附:①相关系数,回归直线中斜率和截距的最小二乘估计公式分别为, .
②参考数据:.
易错点5残差与相关指数的应用
例1. (多选)小张同学收集了某商品销售收入y(单位:万元)与相应的广告支出x(单位:万元)共10组数据,绘制出散点图,如下图所示,并利用线性回归模型进行拟合.她将图中10个点中的A点去掉后再重新进行线性回归分析,则下列说法正确的是( ).
A.决定系数变大
B.残差平方和变大
C.相关系数r的值变大
D.去掉A点后,若所有散点都在一条直线上,则决定系数
例2. (多选)为研究某种树的树高和胸径的关系,甲学习小组随机测量了100棵该品种树的胸径x(单位:cm)和树高y(单位:m)的数据,已知其中一组数据为点,且,求得线性经验回归方程为,其决定系数,并绘制了如下残差图.该小组研究发现,残差比较均匀地分布在以取值为0的横轴为对称轴的水平带状区域内,则下列结论正确的是( )
A.乙学习小组对这组数据进行分析,得到非线性经验回归方程,其决定系数为,则甲小组选取的模型拟合效果更好
B.数据点P对应的残差为0.9
C.该样本中树的平均树高为22.29m
D.删除数据点P后,重新求得的回归直线的斜率变小
【答案】AC
例3.已知变量和的成对样本数据的经验回归方程为,且,当增加1个样本数据后,重新得到的经验回归方程的斜率为,则在新的经验回归方程的估计下,样本数据所对应的残差为( )
A. B. C.1 D.2
易错点6 独立性检验的概念和辨析
例1. 根据分类变量与的观测数据,计算得到,依据小概率值()的独立性检验,则( )
A.变量与不独立
B.变量与独立
C.变量与不独立,这个结论犯错误的概率不超过0.1
D.变量与独立,这个结论犯错误的概率不超过0.1
例2. 在性别与吃零食这两个分类变量的计算中,下列说法正确的是( )
①若的观测值为,我们有的把握认为吃零食与性别有关系,那么在100个吃零食的人中必有99人是女性;
②从独立性检验可知有的把握认为吃零食与性别有关系时,我们说某人吃零食,那么此人是女性的可能性为;
③若从统计量中求出有的把握认为吃零食与性别有关系,是指有的可能性使得出的判断出现错误.
A.①② B.①③ C.②③ D.③
例3. 某单位对员工是否愿意被外派与年龄的关系进行了一次调查,根据独立性检验原理,处理所得数据之后发现,得到“是否愿意被外派与年龄有关”这个结论犯错误的概率大于0.001,而不大于0.01,则的值可能为( )
附表:
0.05
0.01
0.001
3.841
6.635
10.828
A.3.206 B.6.561 C.7.879 D.11.028
易错点7独立性检验的应用
例1. 根据下面的列联表判断患肝病与嗜酒有关系的把握有( )
肝病
酒性
合计
嗜酒
不嗜酒
患肝病
7775
42
7817
未患肝病
2099
49
2148
合计
9874
91
9965
A. B. C. D.
例2. 某航天材料实验室要对比两种新型高温合金材料的性能稳定性,现有合金部件样本900件,合金部件样本500件,采用分层抽样抽取140件做耐热疲劳测试,以部件能承受1000次热循环不失效为合格标准,得到以下部分列联表:
单位:件
材料配方类型
耐热疲劳性能
合计
测试合格
测试不合格
配方材料试样
75
配方材料试样
20
合计
140
(1)请完成上述列联表;
(2)依据的独立性检验,能否认为不同的材料配方与耐热疲劳性能有关联?
附:,其中.
附表:
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
例3. 为了了解心肺疾病是否与年龄相关,现随机抽取了40名市民,得到数据如下表:
年龄
心肺疾病
合计
患心肺疾病
不患心肺疾病
大于40岁
16
小于等于40岁
12
合计
40
已知在40人中随机抽取1人,抽到不患心肺疾病的市民的概率为.
(1)请将列联表补充完整;
(2)已知在大于40岁且患心肺疾病的市民中,有4名重症患者,专家建议以重症患者住院治疗,现从这16名患者中选出2人,记需住院治疗的人数为,求的分布列和数学期望;
(3)能否在犯错误的概率不超过0.01的前提下认为患心肺疾病与年龄有关?
一、单项选择题
1.调查某种群花萼长度和花瓣长度,所得数据如图所示,其中样本相关系数r=0.824 5,下列说法正确的是( )
A.花瓣长度和花萼长度没有相关性
B.花瓣长度和花萼长度呈现负相关
C.花瓣长度和花萼长度呈现正相关
D.若从样本中抽取一部分,则这部分的样本相关系数一定是0.824 5
2.为调查某地区中学生每天睡眠时间,采用样本量比例分配的分层随机抽样,现抽取初中生800人,其每天睡眠时间均值为9 h,方差为1,抽取高中生1 200人,其每天睡眠时间均值为8 h,方差为0.5,则估计该地区中学生每天睡眠时间的方差为( )
A.0.96 B.0.94 C.0.79 D.0.75
3.某射击运动员连续射击5次,命中的环数(环数为整数)形成的一组数据中,中位数为8,唯一的众数为9,极差为3,则该组数据的平均数为( )
A.7.6 B.7.8 C.8 D.8.2
4.为宣传我国第三艘航空母舰“中国人民解放军海军福建舰”正式服役,增强学生的国防意识,某校组织1 000名学生参加了“逐梦深蓝,山河荣耀”国防知识竞赛,从中随机抽取20名学生的考试成绩(单位:分),成绩的频率分布直方图如图所示,则下列说法正确的是( )
A.频率分布直方图中a的值为0.004
B.估计这20名学生考试成绩的第60百分位数为75
C.估计这20名学生数学考试成绩的众数为80
D.估计总体中成绩落在[60,70)内的学生人数为150
5.云计算是信息技术发展的集中体现,近年来,我国云计算市场规模持续增长.已知某科技公司2018至2022年云计算市场规模数据,且市场规模y(千万元)与年份代码x的关系可以用模型y=(其中e为自然对数的底数)拟合,设z=ln y,得到数据统计表如下:
年份
2018年
2019年
2020年
2021年
2022年
年份代码x
1
2
3
4
5
云计算市场规模
y/千万元
7.4
11
20
36.6
66.7
z=ln y
2
2.4
3
3.6
4
由上表可得经验回归方程=0.52x+,则2025年该科技公司云计算市场规模y的估计值为( )
A.e5.08 B.e5.6 C.e6.12 D.e6.5
二、多项选择题
6.某服装生产商为了解青少年的身高和体重的关系,在15岁的男生中随机抽测了10人的身高和体重,数据如下表所示:
编号
1
2
3
4
5
6
7
8
9
10
身高
/cm
165
168
170
172
173
174
175
177
179
182
体重
/kg
55
89
61
65
67
70
75
75
78
80
由表中数据制作成如下所示的散点图:
由最小二乘法计算得到经验回归直线l1的方程为=1x+1,样本相关系数为r1,决定系数为;经过残差分析确定(168,89)为离群点(对应残差过大),把它去掉后,再用剩下的9组数据计算得到经验回归直线l2的方程为=2x+2,样本相关系数为r2,决定系数为.则以下结论中正确的有( )
A.1>2 B.1>2
C.r1<r2 D.
7.某短视频平台以讲故事,赞家乡,聊美食,展才艺等形式展示了丰富多彩的新时代农村生活,吸引了众多粉丝,该平台通过直播带货把家乡的农产品推销到全国各地,从而推进了“新时代乡村振兴”.从平台的所有主播中,随机选取300人进行调查,其中青年人、中年人、其他人群三个年龄段的比例饼状图如图1所示,各年龄段主播的性别百分比等高堆积条形图如图2所示,则下列说法正确的有( )
A.该平台女性主播占比的估计值为0.4
B.从所调查的主播中,随机抽取一位参加短视频剪辑培训,则被抽到的主播是中年男性的概率为0.7
C.按年龄段把所调查的主播分为三层,用分层随机抽样法抽取20名主播担当平台监管,若样本量按比例分配,则中年主播应抽取6名
D.从所调查的主播中,随机选取一位作为幸运主播,已知该幸运主播是青年人的条件下,又是女性的概率为0.6
三、填空题
8.近年来,我国肥胖人群的规模急速增长,肥胖人群有很大的心血管安全隐患.目前,国际上常用身体质量指数(BMI)来衡量人体胖瘦程度以及是否健康,其计算公式是BMI=.我国成人的BMI数值标准为:BMI<18.5为偏瘦,18.5≤BMI<24为正常,24≤BMI<28为偏胖,BMI≥28为肥胖.为了解某公司员工的身体肥胖情况,研究人员从公司员工体检数据中,利用分层随机抽样得到15名员工的BMI数据如下:23.5,21.6,30.6,22.1,23.7,20.6,25.5,23.9,20.8,21.5,21.8,18.2,25.2,21.5,19.1.则该组数据的第70百分位数为________.
9.某工厂为研究某种产品产量x(单位:t)与所需某种原材料y(单位:t)的相关性,在生产过程中收集4组对应数据(x,y)如下表所示:
x
3
4
5
6
y
2.5
3
4
m
根据表中数据,得出y关于x的经验回归方程为=0.7x+.据此计算出在样本点(4,3)处的残差为-0.15,则的值为________,表中m的值为________.
四、解答题
10.某乡政府为提高当地农民收入,指导农民种植药材,并在种植药材的土地附近种草放牧,发展畜牧业.牛粪、羊粪等有机肥可以促进药材的生长,发展生态循环农业.如图所示为某农户近7年种植药材的平均收入y(单位:千元)与年份代码x的折线图,
其中wi=.
(1)根据折线图判断y=a+bx与y=c+dx2哪一个适宜作为平均收入y关于年份代码x的回归方程类型?并说明理由.
(2)根据(1)的判断结果及数据,建立y关于x的经验回归方程,并预测2025年该农户种植药材的平均收入.(结果精确到0.01)
(3)结合当地的环境和气候及对种植户的调查统计分析表明:若继续种植现有的药材,农户的收入将接近“瓶颈”.要想继续提高农户的收入,则需要制订新的种植方案.在原有的土地上继续种植原有药材,质量得不到保障,且影响农户经济收入.请先分析原因,并给出建议.
附:相关系数r=,回归直线=x+的斜率和截距的最小二乘估计分别为=,=-≈2.65.
11.某学校号召学生参加“每天锻炼1小时”活动,为了了解学生参与活动的情况,随机调查了100名学生一个月(30天)完成锻炼活动的天数,制成如下频数分布表:
天数
[0,5]
(5,10]
(10,15]
(15,20]
(20,25]
(25,30]
人数
4
15
33
31
11
6
附:P(μ-σ≤X≤μ+σ)≈0.682 7;P(μ-2σ≤X≤μ+2σ)≈0.954 5;
P(μ-3σ≤X≤μ+3σ)≈0.997 3;
χ2=(n=a+b+c+d).
α
0.050
0.010
0.001
xα
3.841
6.635
10.828
(1)由频数分布表可以认为,学生参加体育锻炼天数X近似服从正态分布N(μ,σ2),其中μ近似为样本的平均数(每组数据取区间的中间值),且σ=6.1,若全校有3 000名学生,求一个月参加“每天锻炼1小时”活动超过21天的人数(精确到1).
(2)调查数据表明,一个月参加“每天锻炼1小时”活动的天数在(15,30]的学生中有30名男生,天数在[0,15]的学生中有20名男生,学校对当月参加“每天锻炼1小时”活动超过15天的学生授予“运动达人”称号.请填写下面列联表:
性别
活动天数
合计
[0,15]
(15,30]
男生
女生
合计
并依据小概率值α=0.05的独立性检验,能否认为学生性别与获得“运动达人”称号有关联?如果结论是有关联,请解释它们之间如何相互影响.
14 / 16
学科网(北京)股份有限公司
学科网(北京)股份有限公司
$
第4章 统计
清单01、变量的相关关系
1.定义
两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系.
2.正相关、负相关
如果从整体上看,当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势,我们就称这两个变量正相关;如果当一个变量的值增加时,另一个变量的相应值呈现减少的趋势,则称这两个变量负相关.
3.线性相关和非线性相关
(1)一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们就称这两个变量线性相关.
(2)一般地,如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量非线性相关或曲线相关.
4.样本相关系数
计算公式
r=
r为变量x和变量y的样本相关系数
样本相
关系数r
的特征
①r∈[-1,1].
②当r>0时,称成对样本数据正相关;当r<0时,称成对样本数据负相关.
③当|r|越接近1时,成对样本数据的线性相关程度越强;当|r|越接近0时,成对样本数据的线性相关程度越弱
5.经验回归方程与最小二乘法
设满足一元线性回归模型的两个变量的n对样本数据为(x1,y1),(x2,y2),…,(xn,yn).
当a,b的取值为=,=-时,Q= (yi-bxi-a)2达到最小.将=x+称为Y关于x的经验回归方程,也称经验回归函数或经验回归公式,其图形称为经验回归直线.这种求经验回归方程的方法叫做最小二乘法,求得的,叫做b,a的最小二乘估计.
6.刻画回归效果的方式
(1)残差图法,作图时纵坐标为残差,横坐标可以选为样本编号,或身高数据,或体重估计值等,这样作出的图形称为残差图.在残差图中,残差点比较均匀地落在以横轴为对称轴的水平的带状区域中,说明选用的模型比较合适,这样的带状区域的宽度越窄,说明模型拟合精度越高.
(2)残差平方和法,残差平方和为 (yi-i)2,残差平方和越小,模型拟合效果越好.
(3)利用决定系数R2刻画拟合效果
R2=1-.R2越大,表示残差平方和越小,即模型的拟合效果越好;R2越小,表示残差平方和越大,即模型的拟合效果越差.
清单02、独立性检验
1.χ2的计算公式:记n=a+b+c+d,则χ2=.
2.利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验.
3.应用独立性检验解决实际问题包括以下几个环节:
(1)提出零假设H0:X和Y相互独立,并给出在问题中的解释.
(2)根据抽样数据整理出2×2列联表,计算χ2的值,并与临界值xα比较.
(3)根据检验规则得出推断结论.
(4)在X和Y不独立的情况下,根据需要,通过比较相应的频率,分析X和Y间的影响规律.
【常用结论】
1.经验回归直线过样本点的中心(,).
2.根据经验回归方程计算的值,仅是一个预测值,不是真实发生的值.
3.根据χ2的值可以判断两个分类变量有关的可信程度,若χ2越大,则两分类变量有关的把握越大.
易错点1 相关系数的计算与应用
例1..以下散点图经过标准化后,相关系数最大的是( )
A. B.
C. D.
【答案】A
【详解】对于,散点呈上升趋势,线性相关系数为正数,这些点紧密的聚集在一条直线的附近,线性相关性强;
对于,散点分布呈曲线趋势,线性相关程度比弱;
对于,散点呈下降趋势,线性相关系数为负数;
对于,散点分布比较分散,线性相关程度比弱;
所以相关系数最大的是.
故选:.
例2.(多选)下列关于相关系数的说法正确的是( )
A.相关系数越大两个变量间相关性越强
B.相关系数的取值范围为
C.相关系数时两个变量正相关,时两个变量负相关
D.相关系数时,样本点在同一直线上
【答案】BCD
【详解】对于相关系数,有以下结论:①当时,表明两个变量正相关;当时,表明两个变量负相关.
②的绝对值越接近于,表明两个变量的线性相关性越强;的绝对值越接近于,表明两个变量之间几乎不存在线性相关关系.
对于A,当时此结论不成立,所以A不正确.
对于B,由相关系数的性质可得,所以B正确.
对于C,由相关系数的性质可得正确.
对于D,由相关系数的性质可得正确.
故选:BCD.
例3.(多选)通过随机抽样,得到变量和变量的7对数据,并绘制成散点图如图所示,已知变量和变量线性相关,且回归直线是图中直线,则下列说法正确的是( )
A.直线的斜率是负数
B.变量与变量正相关
C.相关系数
D.若去掉图中点后,剩余数据的相关系数变大
【答案】AC
【详解】对于A、B、C:由图可知直线的斜率是负数,所以变量与变量负相关,相关系数,故A、C正确,B错误;
对于D:若去掉图中点后,剩余的数据会更集中,相关程度会更高,相关系数的绝对值变大,又,所以相关系数变小,故D错误.
故选:AC.
例4.已知,,,,则相关系数______.(相关系数)
【答案】
【详解】由题设,有.
故答案为:.
易错点2 线性回归分析
例1.(多选)某种细胞在培养正常的情况下,时刻(单位:分)与细胞数(单位:个)的部分数据如下表所示:
1
2
3
4
5
52
95
185
227
若与线性相关,由上表数据求得经验回归方程为,则下列说法正确的是( )
A.与正相关 B.
C.细胞数逐分增加,平均每分钟增加10个左右 D.预计10分钟后细胞数约为450个
【答案】ABD
【详解】由回归方程中的系数大于0,可知与正相关,故A项正确;
由表中数据可知,又因为回归方程为,
把代入回归方程中,解得,所以,解得,故B项正确;
由经验回归方程知细胞数逐分增加,平均每分钟增加44个左右,故C项错误;
将代入回归方程中,得,故D项正确.
故选:ABD.
例2.2025年11 月,搭载“祖冲之三号”同款芯片的超导量子计算机“天衍-287”完成搭建,该量子计算系统具备“量子计算优越性”能力.下表记录了8个团队在特定年度的研发资金投入x(单位:亿元)与芯片性能提升评估指数y,且
研发资金投入x/亿元
2
10
性能提升评估指数y
2
12
已知y与x具有较强的线性关系,通过最小二乘估计得到的经验回归方程为如果去掉样本点后,得到的新样本的经验回归方程为则( )
A.0.1 B.0.3 C.0.5 D.0.7
【答案】B
【详解】由及,得,
则在新样本中,,
所以.
故选:B
例3.(多选)两个具有相关关系的变量,的一组数据为,,,,其经验回归方程为,记,,相关系数为;若将数据调整为,,,,其经验回归方程为,记,相关系数为,则( )
附:,
A. B.
C. D.
【答案】BD
【详解】对于A,,A错误;
对于B,,B正确;
对于C,,则,C错误;
对于D,,D正确.
故选:BD
例4.某景点自从取消门票实行免费开放后,迅速成为网红打卡点,不仅带动了淡季的旅游,而且优化了旅游产业的结构.下表是该景点免费开放后前五个月的打卡人数y(万人)与第个月的数据:
1
2
3
4
5
1.3
1.7
2.2
2.8
3.5
已知与线性相关.
(1)求关于的线性回归方程;
(2)预测第7个月的打卡人数.
参考数据:.
参考公式:线性回归方程中斜率、截距的最小二乘法估计公式为.
【答案】(1)
(2)4.5万人
【详解】(1)解:由统计表格中的数据,可得,,
且,
则,
可得,
所以关于的线性回归方程为.
(2)解:由(1)知:线性回归方程为,
当时,可得.
由此预测第7个月的打卡人数为4.5万人.
易错点4 非线性回归分析
例1. 用模型去拟合与的关系,令,得到关于的回归直线方程为,则( )
A.1 B.2 C.3 D.4
【答案】A
【详解】由模型可得,所以;
令,所以,可得;
又因为回归直线方程为,因此,可得.
故选:A
例2. 在研究两个变量的相关关系时,观察散点图发现样本点集中于某一条指数曲线的周围.令,求得经验回归方程为,则该模型的回归方程为________.
【答案】
【详解】因为,
所以.
故答案为:.
例3.某科技创新型企业自创建以来,不断加大研发投入,走科技创新之路,年利润得到较快增长,2021~2025连续五年的年利润y(单位:亿元)与年份序号x(,2,3,4,5,其中2021年记为1,2022年记为2,以此类推)满足某一元非线性回归方程,统计数据如下:
374
230
6.3
144
1.6
4
注:,.
(1)设和y的相关系数为,x和v的相关系数为,请从相关系数的角度,确定和(其中a,b,m,n均为常数,e为自然对数的底数)哪一个拟合程度更好;
(2)根据(1)的结论及表中数据,建立y关于x的回归方程.
附:①相关系数,回归直线中斜率和截距的最小二乘估计公式分别为, .
②参考数据:.
【答案】(1)模型的拟合程度更好
(2).
【详解】(1)令,则可化为,
,
令,则可化为,即,
因为,
所以,
则,因此从相关系数的角度来看,模型的拟合程度更好.
(2)由(1)知,用模型比较合适,
令,则可化为,即,
所以,
因为,,所以,
则关于的回归直线方程为,所以.
易错点5残差与相关指数的应用
例1. (多选)小张同学收集了某商品销售收入y(单位:万元)与相应的广告支出x(单位:万元)共10组数据,绘制出散点图,如下图所示,并利用线性回归模型进行拟合.她将图中10个点中的A点去掉后再重新进行线性回归分析,则下列说法正确的是( ).
A.决定系数变大
B.残差平方和变大
C.相关系数r的值变大
D.去掉A点后,若所有散点都在一条直线上,则决定系数
【答案】ACD
【详解】由散点图可知,点较其他点偏离直线更远,
去掉点后,回归效果更好,残差平方和变小,决定系数变大;
自变量与因变量的相关性变强,又与正相关,所以相关系数的值变大;
当所有散点都在一条直线上时,残差平方和为,决定系数,
故ACD正确,B错误.
故选:ACD.
例2. (多选)为研究某种树的树高和胸径的关系,甲学习小组随机测量了100棵该品种树的胸径x(单位:cm)和树高y(单位:m)的数据,已知其中一组数据为点,且,求得线性经验回归方程为,其决定系数,并绘制了如下残差图.该小组研究发现,残差比较均匀地分布在以取值为0的横轴为对称轴的水平带状区域内,则下列结论正确的是( )
A.乙学习小组对这组数据进行分析,得到非线性经验回归方程,其决定系数为,则甲小组选取的模型拟合效果更好
B.数据点P对应的残差为0.9
C.该样本中树的平均树高为22.29m
D.删除数据点P后,重新求得的回归直线的斜率变小
【答案】AC
【详解】对于A:决定系数越大,模型的拟合效果越好,,选项A正确;
对于B:计算数据对应的残差,当时,,
所以残差为,选项B错误;
对于C:已知,则样本中心点的横坐标:,
将代入回归方程,可得y=0.25×29.16+15=7.29+15=22.29,
所以样本中树的平均树高为,选项C正确;
对于D:删除数据后,
因为38.4大于样本中心点的横坐标29.16,且23.7小于通过回归方程计算出的38.4对应的预测值24.6,
所以删除该点后,剩下的数据整体上可能使得树高与胸径的正相关变强,
即重新求得的回归直线的斜率变大,选项D错误.
故选:AC.
例3.已知变量和的成对样本数据的经验回归方程为,且,当增加1个样本数据后,重新得到的经验回归方程的斜率为,则在新的经验回归方程的估计下,样本数据所对应的残差为( )
A. B. C.1 D.2
【答案】B
【详解】由,可得增加1个样本数据后的平均数为,
因为,所以,
则增加1个样本数据后的平均数为,
所以,解得,
所以新的经验回归方程为,
则当时,,
样本点的残差为.
故选:B.
易错点6 独立性检验的概念和辨析
例1. 根据分类变量与的观测数据,计算得到,依据小概率值()的独立性检验,则( )
A.变量与不独立
B.变量与独立
C.变量与不独立,这个结论犯错误的概率不超过0.1
D.变量与独立,这个结论犯错误的概率不超过0.1
【答案】B
【详解】因为,所以在显著性水平下,
没有充分证据拒绝原假设,因此我们认为变量与是独立的,
故选:B
例2. 在性别与吃零食这两个分类变量的计算中,下列说法正确的是( )
①若的观测值为,我们有的把握认为吃零食与性别有关系,那么在100个吃零食的人中必有99人是女性;
②从独立性检验可知有的把握认为吃零食与性别有关系时,我们说某人吃零食,那么此人是女性的可能性为;
③若从统计量中求出有的把握认为吃零食与性别有关系,是指有的可能性使得出的判断出现错误.
A.①② B.①③ C.②③ D.③
【答案】D
【详解】①若的观测值为,我们有的把握认为吃零食与性别有关系,那么在100个吃零食的人中必有99人是女性,故①不正确;
②独立性检验是用来考察两个分类变量是否具有关联性,并且能较精确地给出这种判断的可靠程度,
而不是给出事件的概率,故②不正确;
③若从统计量中求出有的把握认为吃零食与性别有关系,是指有的可能性使得出的判断出现错误,③正确。
故选:D
例3. 某单位对员工是否愿意被外派与年龄的关系进行了一次调查,根据独立性检验原理,处理所得数据之后发现,得到“是否愿意被外派与年龄有关”这个结论犯错误的概率大于0.001,而不大于0.01,则的值可能为( )
附表:
0.05
0.01
0.001
3.841
6.635
10.828
A.3.206 B.6.561 C.7.879 D.11.028
【答案】C
【详解】由题意得的值应位于与之间,故C正确,ABD错误.
故选:C
易错点7独立性检验的应用
例1. 根据下面的列联表判断患肝病与嗜酒有关系的把握有( )
肝病
酒性
合计
嗜酒
不嗜酒
患肝病
7775
42
7817
未患肝病
2099
49
2148
合计
9874
91
9965
A. B. C. D.
【答案】D
【详解】由列联表中的数据,计算得,
故有的把握认为患肝病与嗜酒有关系.
故选:D.
例2. 某航天材料实验室要对比两种新型高温合金材料的性能稳定性,现有合金部件样本900件,合金部件样本500件,采用分层抽样抽取140件做耐热疲劳测试,以部件能承受1000次热循环不失效为合格标准,得到以下部分列联表:
单位:件
材料配方类型
耐热疲劳性能
合计
测试合格
测试不合格
配方材料试样
75
配方材料试样
20
合计
140
(1)请完成上述列联表;
(2)依据的独立性检验,能否认为不同的材料配方与耐热疲劳性能有关联?
附:,其中.
附表:
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【答案】(1)列联表见解析
(2)有关联
【详解】(1)由已知合金部件应抽取件,合金部件应抽取件,
由此可得列联表如下:
材料配方类型
耐热疲劳性能
合计
测试合格
测试不合格
配方材料试样
75
15
90
配方材料试样
30
20
50
合计
105
35
140
(2)零假设为:材料配方与耐热疲劳性能无关联,
根据列联表数据,经计算得,
根据小概率值的独立性检验,我们推断不成立,
即认为材料配方与耐热疲劳性能有关联,此推断犯错误的概率不大于.
例3. 为了了解心肺疾病是否与年龄相关,现随机抽取了40名市民,得到数据如下表:
年龄
心肺疾病
合计
患心肺疾病
不患心肺疾病
大于40岁
16
小于等于40岁
12
合计
40
已知在40人中随机抽取1人,抽到不患心肺疾病的市民的概率为.
(1)请将列联表补充完整;
(2)已知在大于40岁且患心肺疾病的市民中,有4名重症患者,专家建议以重症患者住院治疗,现从这16名患者中选出2人,记需住院治疗的人数为,求的分布列和数学期望;
(3)能否在犯错误的概率不超过0.01的前提下认为患心肺疾病与年龄有关?
【答案】(1)答案见解析
(2)分布列见解析,
(3)能在犯错误的概率不超过0.01的前提下认为患心肺疾病与年龄有关.
【详解】(1)解:由题意知,在40人中随机抽取1人,抽到不患心肺疾病的市民的概率为,
所以抽到不患心肺疾病的市民的人数为人,
将列联表补充完整,如下表所示:
年龄
心肺疾病
合计
患心肺疾病
不患心肺疾病
大于40岁
16
4
20
小于等于40岁
8
12
20
合计
24
16
40
(2)解:由题意知,需住院治疗的人数为可能取值为,
可得,,,
所以随机变量的分布列为
0
1
2
所以随机变量的数学期望.
(3)解:零假设为:是否患心肺疾病与年龄无关,
由(1)中的列联表,可得,
所以能在犯错误的概率不超过0.01的前提下认为患心肺疾病与年龄有关.
一、单项选择题
1.调查某种群花萼长度和花瓣长度,所得数据如图所示,其中样本相关系数r=0.824 5,下列说法正确的是( )
A.花瓣长度和花萼长度没有相关性
B.花瓣长度和花萼长度呈现负相关
C.花瓣长度和花萼长度呈现正相关
D.若从样本中抽取一部分,则这部分的样本相关系数一定是0.824 5
C [∵相关系数r=0.824 5>0.75,且散点图呈左下角到右上角的带状分布,
∴花瓣长度和花萼长度呈正相关.
若从样本中抽取一部分,则这部分的相关系数不一定是0.824 5.故选C.]
2.为调查某地区中学生每天睡眠时间,采用样本量比例分配的分层随机抽样,现抽取初中生800人,其每天睡眠时间均值为9 h,方差为1,抽取高中生1 200人,其每天睡眠时间均值为8 h,方差为0.5,则估计该地区中学生每天睡眠时间的方差为( )
A.0.96 B.0.94 C.0.79 D.0.75
B [该地区中学生每天睡眠时间的平均数为:
×9+×8=8.4(h),
该地区中学生每天睡眠时间的方差为:
×[1+(9-8.4)2]+×[0.5+(8-8.4)2]=0.94.故选B.]
3.某射击运动员连续射击5次,命中的环数(环数为整数)形成的一组数据中,中位数为8,唯一的众数为9,极差为3,则该组数据的平均数为( )
A.7.6 B.7.8 C.8 D.8.2
B [依题意这组数据一共有5个数,中位数为8,则从小到大排列8的前面有2个数,后面也有2个数,又唯一的众数为9,则有两个9,其余数字均只出现一次,则最大数字为9,又极差为3,所以最小数字为6,所以这组数据为6,7,8,9,9,所以平均数为=7.8.故选B.]
4.为宣传我国第三艘航空母舰“中国人民解放军海军福建舰”正式服役,增强学生的国防意识,某校组织1 000名学生参加了“逐梦深蓝,山河荣耀”国防知识竞赛,从中随机抽取20名学生的考试成绩(单位:分),成绩的频率分布直方图如图所示,则下列说法正确的是( )
A.频率分布直方图中a的值为0.004
B.估计这20名学生考试成绩的第60百分位数为75
C.估计这20名学生数学考试成绩的众数为80
D.估计总体中成绩落在[60,70)内的学生人数为150
D [由频率分布直方图可得:
10×=1,解得a=0.005,故A错误;
前三个矩形的面积为×10=0.6,即第60百分位数为80,故B错误;
估计这20人的众数为=75,故C错误;
总体中成绩落在[60,70)内的学生人数为:3a×10×1 000=150,故D正确.故选D.]
5.云计算是信息技术发展的集中体现,近年来,我国云计算市场规模持续增长.已知某科技公司2018至2022年云计算市场规模数据,且市场规模y(千万元)与年份代码x的关系可以用模型y=(其中e为自然对数的底数)拟合,设z=ln y,得到数据统计表如下:
年份
2018年
2019年
2020年
2021年
2022年
年份代码x
1
2
3
4
5
云计算市场规模
y/千万元
7.4
11
20
36.6
66.7
z=ln y
2
2.4
3
3.6
4
由上表可得经验回归方程=0.52x+,则2025年该科技公司云计算市场规模y的估计值为( )
A.e5.08 B.e5.6 C.e6.12 D.e6.5
B [因为=3,=3,
所以=-0.52=3-3×0.52=1.44,
即经验回归方程=0.52x+1.44,
当x=8时,=0.52×8+1.44=5.6,
所以y=ez=e5.6,即2025年该科技公司云计算市场规模y的估计值为e5.6.故选B.]
二、多项选择题
6.某服装生产商为了解青少年的身高和体重的关系,在15岁的男生中随机抽测了10人的身高和体重,数据如下表所示:
编号
1
2
3
4
5
6
7
8
9
10
身高
/cm
165
168
170
172
173
174
175
177
179
182
体重
/kg
55
89
61
65
67
70
75
75
78
80
由表中数据制作成如下所示的散点图:
由最小二乘法计算得到经验回归直线l1的方程为=1x+1,样本相关系数为r1,决定系数为;经过残差分析确定(168,89)为离群点(对应残差过大),把它去掉后,再用剩下的9组数据计算得到经验回归直线l2的方程为=2x+2,样本相关系数为r2,决定系数为.则以下结论中正确的有( )
A.1>2 B.1>2
C.r1<r2 D.
AC [身高的平均数为=173.5,
因为离群点(168,89)的横坐标168小于平均值173.5,纵坐标89相对过大,所以去掉离群点后经验回归直线的截距变小而斜率变大,所以1>2,1<2,所以A正确,B错误;去掉离群点后成对样本数据的线性相关程度更强,拟合效果会更好,所以,所以C正确,D错误.故选AC.]
7.某短视频平台以讲故事,赞家乡,聊美食,展才艺等形式展示了丰富多彩的新时代农村生活,吸引了众多粉丝,该平台通过直播带货把家乡的农产品推销到全国各地,从而推进了“新时代乡村振兴”.从平台的所有主播中,随机选取300人进行调查,其中青年人、中年人、其他人群三个年龄段的比例饼状图如图1所示,各年龄段主播的性别百分比等高堆积条形图如图2所示,则下列说法正确的有( )
A.该平台女性主播占比的估计值为0.4
B.从所调查的主播中,随机抽取一位参加短视频剪辑培训,则被抽到的主播是中年男性的概率为0.7
C.按年龄段把所调查的主播分为三层,用分层随机抽样法抽取20名主播担当平台监管,若样本量按比例分配,则中年主播应抽取6名
D.从所调查的主播中,随机选取一位作为幸运主播,已知该幸运主播是青年人的条件下,又是女性的概率为0.6
AC [A选项,由图1可以看出选取300人中其他人群人数为300×10%=30,
青年人人数为300×60%=180,中年人人数为300×30%=90,
由图2可以看出青年人中女性人数为180×40%=72,中年人中女性人数为90×30%=27,
其他人群中女性人数为30×70%=21,
故该平台女性主播占比的估计值为=0.4,A正确;
B选项,中年人中男性人数为90×70%=63,
故从所调查的主播中,随机抽取一位参加短视频剪辑培训,则被抽到的主播是中年男性的概率为=0.21,B错误;
C选项,三个年龄段青年主播、中年主播和其他人群主播人数比例为6∶3∶1,
故用分层随机抽样法抽取20名主播担当平台监管,若样本量按比例分配,则中年主播应抽取20×=6名,C正确;
D选项,从所调查的主播中,随机选取一位作为幸运主播,设幸运主播是青年人为事件A,随机选取一位作为幸运主播,设幸运主播是女性主播为事件B,
则P(A)=0.6,P(AB)==0.24,∴P(B|A)===0.4.D错误.故选AC. ]
三、填空题
8.近年来,我国肥胖人群的规模急速增长,肥胖人群有很大的心血管安全隐患.目前,国际上常用身体质量指数(BMI)来衡量人体胖瘦程度以及是否健康,其计算公式是BMI=.我国成人的BMI数值标准为:BMI<18.5为偏瘦,18.5≤BMI<24为正常,24≤BMI<28为偏胖,BMI≥28为肥胖.为了解某公司员工的身体肥胖情况,研究人员从公司员工体检数据中,利用分层随机抽样得到15名员工的BMI数据如下:23.5,21.6,30.6,22.1,23.7,20.6,25.5,23.9,20.8,21.5,21.8,18.2,25.2,21.5,19.1.则该组数据的第70百分位数为________.
23.7 [15名员工的BMI数据由小到大排列为:18.2,19.1,20.6,20.8,21.5,21.5,21.6,21.8,22.1,23.5,23.7,23.9,25.2,25.5,30.6,由15×70%=10.5,所以该组数据的第70百分位数是第11个数23.7.]
9.某工厂为研究某种产品产量x(单位:t)与所需某种原材料y(单位:t)的相关性,在生产过程中收集4组对应数据(x,y)如下表所示:
x
3
4
5
6
y
2.5
3
4
m
根据表中数据,得出y关于x的经验回归方程为=0.7x+.据此计算出在样本点(4,3)处的残差为-0.15,则的值为________,表中m的值为________.
0.35 4.5 [由在样本点(4,3)处的残差为-0.15,可得当x=4时,=3.15,即3.15=0.7×4+,解得=0.35.又==4.5,==,经验回归直线过点,所以=0.7×4.5+0.35,解得m=4.5.]
四、解答题
10.某乡政府为提高当地农民收入,指导农民种植药材,并在种植药材的土地附近种草放牧,发展畜牧业.牛粪、羊粪等有机肥可以促进药材的生长,发展生态循环农业.如图所示为某农户近7年种植药材的平均收入y(单位:千元)与年份代码x的折线图,
其中wi=.
(1)根据折线图判断y=a+bx与y=c+dx2哪一个适宜作为平均收入y关于年份代码x的回归方程类型?并说明理由.
(2)根据(1)的判断结果及数据,建立y关于x的经验回归方程,并预测2025年该农户种植药材的平均收入.(结果精确到0.01)
(3)结合当地的环境和气候及对种植户的调查统计分析表明:若继续种植现有的药材,农户的收入将接近“瓶颈”.要想继续提高农户的收入,则需要制订新的种植方案.在原有的土地上继续种植原有药材,质量得不到保障,且影响农户经济收入.请先分析原因,并给出建议.
附:相关系数r=,回归直线=x+的斜率和截距的最小二乘估计分别为=,=-≈2.65.
[解] (1)因为(1+2+3+4+5+6+7)=4,
+(5-4)2+(6-4)2+(7-4)2=28,
对于模型y=a+bx,相关系数r=≈0.996,
对于模型y=c+dx2,相关系数r′=≈0.968,
因为0.996>0.968,
所以y=a+bx适宜作为平均收入y关于年份代码x的回归方程.
(2)由(1)可知回归方程类型为y=a+bx,
由已知数据及公式可得=≈4.71,=- ×4≈49.71,
所以y关于x的经验回归方程为=4.71x+49.71,
又年份代码1~7分别对应年份2016~2022,所以2025年对应年份代码为10,
代入可得=4.71×10+49.71=96.81千元,
所以预测2025年该农户种植药材的平均收入为96.81千元.
(3)长期在固定的土地种植固定的药材,土壤的微量元素含量及比例会发生变化,影响药材的生长,产量、质量方面等出现问题;长期种植同种药材,品种较为单一,市场也会趋于饱和,影响收入.
故建议如下:
①扩大种植面积,调整种植品种,进行土壤元素分析,结合当地环境及农作物的种植,进行综合研判,进行套种或轮作;
②增加药材品种,聘请专家指导每块土地药材种植的次序及间隔时间等,采用多元化种植方式,也可根据药材的特性,因地制宜选择种植品种.
11.某学校号召学生参加“每天锻炼1小时”活动,为了了解学生参与活动的情况,随机调查了100名学生一个月(30天)完成锻炼活动的天数,制成如下频数分布表:
天数
[0,5]
(5,10]
(10,15]
(15,20]
(20,25]
(25,30]
人数
4
15
33
31
11
6
附:P(μ-σ≤X≤μ+σ)≈0.682 7;P(μ-2σ≤X≤μ+2σ)≈0.954 5;
P(μ-3σ≤X≤μ+3σ)≈0.997 3;
χ2=(n=a+b+c+d).
α
0.050
0.010
0.001
xα
3.841
6.635
10.828
(1)由频数分布表可以认为,学生参加体育锻炼天数X近似服从正态分布N(μ,σ2),其中μ近似为样本的平均数(每组数据取区间的中间值),且σ=6.1,若全校有3 000名学生,求一个月参加“每天锻炼1小时”活动超过21天的人数(精确到1).
(2)调查数据表明,一个月参加“每天锻炼1小时”活动的天数在(15,30]的学生中有30名男生,天数在[0,15]的学生中有20名男生,学校对当月参加“每天锻炼1小时”活动超过15天的学生授予“运动达人”称号.请填写下面列联表:
性别
活动天数
合计
[0,15]
(15,30]
男生
女生
合计
并依据小概率值α=0.05的独立性检验,能否认为学生性别与获得“运动达人”称号有关联?如果结论是有关联,请解释它们之间如何相互影响.
[解] (1)由频数分布表知
μ=×(4×2.5+15×7.5+33×12.5+31×17.5+11×22.5+6×27.5)=14.9,
则X~N,
∵P(μ-σ≤X≤μ+σ)≈0.682 7,
∴P(X>21)=P(X>14.9+6.1)≈=0.158 65,
∴3 000×0.158 65=475.95≈476,
∴参加“每天锻炼1小时”活动超过21天的人数约为476人.
(2)由频数分布表知,锻炼活动的天数在[0,15]的人数为4+15+33=52,
∵参加“每天锻炼1小时”活动的天数在[0,15]的学生中有20名男生,
参加“每天锻炼1小时”活动的天数在[0,15]的学生中有女生人数:52-20=32,
由频数分布表知,锻炼活动的天数在(15,30]的人数为31+11+6=48,
∵参加“每天锻炼1小时”活动的天数在(15,30]的学生中有30名男生,
∴参加“每天锻炼1小时”活动的天数在(15,30]的学生中有女生人数48-30=18.
列联表如下:
性别
活动天数
合计
[0,15]
(15,30]
男生
20
30
50
女生
32
18
50
合计
52
48
100
零假设为H0:学生性别与获得“运动达人”称号无关.
χ2=≈5.769>3.841,
依据α=0.05的独立性检验,我们推断H0不成立,即可以认为学生性别与获得“运动达人”称号有关,
而且此推断犯错误的概率不大于0.05.根据列联表中的数据得到,男生、女生中活动天数超过15天的频率分别为=0.6和=0.36,可见男生中获得“运动达人”称号的频率是女生中获得“运动达人”的称号频率的≈1.67倍,于是依据频率稳定于概率,我们可以认为男生获得“运动达人”的概率大于女生,即男生更容易获得运动达人称号.
25 / 25
学科网(北京)股份有限公司
学科网(北京)股份有限公司
$