内容正文:
清单04 统计
(8个考点梳理+题型解读+提升训练)
【清单01】一元线性回归模型
我们称
为Y关于x的一元线性回归模型,其中Y称为因变量或响应变量,x称为自变量或解释变量;a和b为模型的未知参数,a称为截距参数,b称为斜率参数;e是Y与bx+a之间的随机误差.
【清单02】线性回归方程与最小二乘法
回归直线方程过样本点的中心(,),是回归直线方程最常用的一个特征
我们将=x+称为Y关于x的线性回归方程,也称经验回归函数或经验回归公式,其图形称为经验回归直线.这种求经验回归方程的方法叫做最小二乘法,求得的,叫做b,a的最小二乘估计(least squares estimate ),
其中
【清单03】残差的概念
对于响应变量Y,通过观测得到的数据称为观测值,通过经验回归方程得到的称为预测值,观测值减去预测值称为残差.残差是随机误差的估计结果,通过残差的分析可以判断模型刻画数据的效果,以及判断原始数据中是否存在可疑数据等,这方面工作称为残差分析.
【清单04】刻画回归效果的方式
(1)残差图法
作图时纵坐标为残差,横坐标可以选为样本编号,或身高数据,或体重估计值等,这样作出的图形称为残差图.若残差点比较均匀地落在水平的带状区域内,带状区域越窄,则说明拟合效果越好.
(2)残差平方和法
残差平方和 (yi-i)2,残差平方和越小,模型拟合效果越好,残差平方和越大,模型拟合效果越差.
(3)利用R2刻画回归效果
决定系数R2是度量模型拟合效果的一种指标,在线性模型中,它代表解释变量客户预报变量的能力.
R2=1-,R2越大
【清单05】2×2列联表
在实践中,由于保存原始数据的成本较高,人们经常按研究问题的需要,将数据分类统计,并做成表格加以保存,我们将这类数据统计表称为2×2列联表,2×2列联表给出了成对分类变量数据的交叉分类频数.
一般地,假设有两个分类变量X和Y,它们的取值分别为{x1,x2}和{y1,y2},其2×2列联表为
y1
y2
合计
x1
a
b
a+b
x2
c
d
c+d
合计
a+c
b+d
a+b+c+d
【清单06】等高堆积条形图
等高条形图和表格相比,更能直观地反映出两个分类变量间是否相互影响,常用等高条形图展示列联表数据的频率特征,依据频率稳定于概率的原理,我们可以推断结果.
【清单07】临界值
χ2 统计量也可以用来作相关性的度量.χ2 越小说明变量之间越独立,χ2越大说明变量之间越相关
χ2=.忽略χ2的实际分布与该近似分布的误差后,对于任何小概率值α,可以找到相应的正实数xα,使得P(χ2≥xα)=α成立.我们称xα为α的临界值,这个临界值就可作为判断χ2大小的标准.
【清单08】独立性检验
基于小概率值α的检验规则是:
当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α;
当χ2<xα时,我们没有充分证据推断H0不成立 ,可以认为X和Y独立.
这种利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验(test of independence).
下表给出了χ2独立性检验中几个常用的小概率值和相应的临界值
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
【清单09】应用独立性检验解决实际问题的大致步骤
(1)提出零假设H0:X和Y相互独立,并给出在问题中的解释;
(2)根据抽样数据整理出2×2列联表,计算χ2的值,并与临界值xα比较;
(3)根据检验规则得出推断结论;
(4)在X和Y不独立的情况下,根据需要,通过比较相应的频率,分析X和Y间的影响规律.
【考点题型一】相关关系的理解
技巧:函数关系是一种确定的关系,而相关关系是非随机变量与随机变量的关系.函数关系是一种因果关系, 而相关关系不一定是因果关系,也可能是伴随关系.
【例1】下列两个变量间的关系,是相关关系的是( )
A.任意实数和它的平方 B.圆半径和圆的周长
C.正多边形的边数和内角度数之和 D.天空中的云量和下雨
【变式1-1】有几组变量:①汽车的重量和汽车每消耗1升汽油所行驶的平均路程;②平均日学习时间和平均学习成绩;③立方体的棱长和体积.其中两个变量成正相关的是( )
A.①③ B.②③
C.② D.③
【变式1-2】对两变量间的关系,下列论述正确的是( )
A.任何两个变量都具有相关关系
B.正方形的面积与该正方形的边长具有相关关系
C.农作物的产量与施化肥量之间是一种确定性关系
D.一个学生的数学成绩与物理成绩之间是一种非确定性的关系
【考点题型二】用2×2列联表分析两分类变量间的关系
技巧:(1)作2×2列联表时,关键是对涉及的变量分清类别.计算时要准确无误.
(2)利用2×2列联表分析两个分类变量间的关系时,首先要根据题中数据获得2×2列联表,然后根据频率特征,即将与 的值相比,直观地反映出两个分类变量间是否相互影响,但方法较粗劣.
【例2】某学校在一次调查“篮球迷”的活动中,获得了如下数据,以下结论最准确的是( )
男生
女生
篮球迷
90
20
非篮球迷
60
30
附:
0.10
0.05
0.01
0.005
k
2.706
3.841
6.635
7.789
A.有的把握认为是否是篮球迷与性别有关
B.有的把握认为是否是篮球迷与性别有关
C.在犯错误的概率不超过0.1的前提下,可以认为是否是篮球迷与性别有关
D.在犯错误的概率不超过0.05的前提下,可以认为是否是篮球迷与性别有关
【变式2-1】某中学为调查高一年级学生的选科倾向,随机抽取了300人,其中选考物理的有220人,选考历史的有80人,统计各选科人数如表所示,则下列说法中正确的是( ).
选考类别
选择科目
思想政治
地理
化学
生物
物理类
80
100
145
115
历史类
50
45
30
35
参考数据:,其中.
附表:
0.10
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
A.选考物理类的学生中选择政治的比例比选考历史类的学生中选择政治的比例高
B.选考物理类的学生中选择地理的比例比选考历史类的学生中选择地理的比例高
C.参照附表,根据小概率值的独立性检验,我们认为选择生物与选考类别无关
D.参照附表,根据小概率值的独立性检验,我们认为选择生物与选考类别有关
【变式2-2】疫苗是为预防、控制传染病的发生、流行,用于人体预防接种的预防性生物制品,其前期研发过程中,一般都会进行动物保护测试,为了考查某种疫苗预防效果,在进行动物试验时,得到如下统计数据:
是否发病
未发病
发病
总计
未注射疫苗
20
注射疫苗
30
总计
50
50
100
现从试验动物中任取一只,取得“注射疫苗”的概率为,则下列判断错误的是( )
公式:
0.10
0.05
0.010
0.001
2.706
3.841
6.635
10.828
.
A.注射疫苗发病的动物数为10
B.从该试验未注射疫苗的动物中任取一只,发病的概率为
C.有99%的把握判断注射疫苗与是否发病有关联
D.有95%的把握判断注射疫苗与是否发病有关联
【变式2-3】某科技公司为了提升其产品的市场竞争力,每年都会投入一定的资金用于研发和市场推广.
(1)该公司从管理层到基层员工中随机抽取了120名进行调研,现将120名员工的学历划分为“高学历”和“低学历”,对投入一定的资金用于研发和市场推广划分为“支持”和“不支持”,整理得到如下数据:
支持
不支持
合计
高学历
30
低学历
40
合计
60
120
请将列联表补充完整并回答:是否有的把握认为高学历群体和低学历群体对投入资金研发和市场推广的满意度有关?
(2)通过对该公司2015年至2024年每年的研发投入(单位:百万元)与年利润增量y(单位:百万元)的数据进行分析得到回归模型为:,且有.
请求出该模型中关于的回归方程并预测投资金额为6百万元时的年利润增量.参考公式及参考数据,其中,临界值表:
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
.
【变式2-4】近日,一部名为“体彩公益金助力‘村’,赛出乡村振兴新气象”的视频在网络上广泛传播,引起了大众的热烈反响.这部视频以贵州省黔东南苗族侗族自治州台江县台盘村为背景,生动展现了台盘村从一个默默无闻的小村庄到因“村”而声名鹊起的历程,揭示了体育精神与乡村振兴的紧密联系.现有一支“村”球队,其中球员甲是其主力队员,经统计该球队在某个赛季的所有比赛中,球员甲是否上场时该球队的胜负情况如表.
甲球员是否上场
球队的胜负情况
合计
胜
负
上场
1
30
未上场
8
合计
5
42
(1)完成列联表,并依据的独立性检验,能否认为球队的胜负与球员甲的出场有关联;
(2)由于队员的不同,球员甲主打的位置会进行调整,且球员甲每场比赛只主打前锋、中锋、后卫中的一个位置.根据以往的数据统计,球员甲上场时,担任的角色为前锋、中锋、后卫的概率分为,相应球队赢球的概率分别为.
①当球员甲上场参加比赛时,判断球员甲主打哪个位置球队赢球的概率更大,并说明理由;
②当球员甲上场参加比赛时,在球队赢了该场比赛的条件下,求甲是前锋的概率.
附:.
0.10
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【考点题型三】残差分析与相关指数的应用
技巧:(1)利用残差分析研究两个变量间的关系时,首先要根据散点图来判断它们是否线性相关,是否可以用线性回归模型来拟合数据,然后通过残差1,2,…,n来判断模型拟合的效果.
(2)若残差点比较均匀地分布在水平带状区域中,带状区域越窄,说明模型拟合度越高,回归方程预报精确度越高.
【例3】假定产品产量x(千件)与单位成本y(元/件)之间存在相关关系.数据如下:
x
2
3
4
3
4
5
y
73
72
71
73
69
68
(1)以x为解释变量,y为预报变量,作出散点图;
(2)求y与x之间的回归直线方程,对于单位成本70元/件时,预报产量为多少;
(3)计算各组残差,并计算残差平方和;
【变式3-1】随着中美贸易战的不断升级,越来越多的国内科技巨头加大了科技研发投入的力度.华为技术有限公司拟对“麒麟”手机芯片进行科技升级,根据市场调研与模拟,得到科技升级投入x(亿元)与科技升级直接收益y(亿元)的数据统计如下:
序号
1
2
3
4
5
6
7
8
9
10
11
12
x
2
3
4
6
8
10
13
21
22
23
24
25
y
13
22
31
42
50
56
58
68.5
68
67.5
66
66
当时,建立了y与x的两个回归模型:模型①:;模型②:;当时,确定y与x满足的线性回归方程为.
(1)根据下列表格中的数据,比较当时模型①、②的相关指数的大小,并选择拟合精度更高、更可靠的模型,预测对“麒麟”手机芯片科技升级的投入为17亿元时的直接收益.
回归模型
模型①
模型②
回归方程
182.4
79.2
(附:刻画回归效果的相关指数,,)
(2)为鼓励科技创新,当科技升级的投入不少于20亿元时,国家给予公司补贴5亿元,以回归方程为预测依据,比较科技升级投入17亿元与20亿元时公司实际收益的大小.
附:用最小二乘法求线性回归方程的系数:
【变式3-2】小张同学对具有线性相关的两个变量x和y进行了统计分析,得到了右表,其中一些数据丢失,只记得这组数据拟合出的y关于x的经验回归方程为,若成等差数列,则( )
x
4
6
8
10
12
y
a
2
b
c
6
A.变量x与y的样本相关系数 B.
C.当时,残差为 D.当时,y的预测值为
【变式3-3】根据变量Y和x的成对样本数据,由一元线性回归模型得到经验回归模型,求得残差图.对于以下四幅残差图,满足一元线性回归模型中对随机误差假设的是( )
A. B.
C. D.
【变式3-4】某无人机的研发费用x(单位:万元)与销售量y(单位:万件)之间的对应数据如表所示:
研发费用x
3.4
4.7
5
5.6
6.3
销售量y
15
16.9
19.2
18
20.9
根据表中数据可得经验回归方程为,则第三个样本点对应的残差为 .
【考点题型四】独立性检验的综合应用
技巧:(1)解答此类题目的关键在于正确利用χ2=计算χ2的值,再用它与临界值xα的大小作比较来判断假设检验是否成立,从而使问题得到解决.
(2)此类题目规律性强,解题比较格式化,填表计算分析比较即可,要熟悉其计算流程,不难理解掌握.
【例4】我校为全面提高学生的语文素养和阅读水平,构建“书香校园”,特举办“课外阅读知识竞赛”,为了调查学生对这次活动的满意程度,在所有参加“课外阅读知识竞赛”的同学中抽取容量为500的样本进行调查,并得到如下2X2列联表:
满意程度
性别
合计
男生
女生
满意
140
400
不满意
100
合计
200
(1)请补全上面的列联表,依据小概率值α=0.05的独立性检验,能否认为满意程度与性别有关系;
(2)若竞赛成绩在前3的同学进入决赛环节,该环节共设置3道试题,且每一道试题必须依次作答,至少答对2道才能进入总决赛,且每人答对这3道试题的概率分别为,,.3道试题答对与否互不影响.用X表示能进入总决赛的人数,求X的分布列及数学期望.
参考公式及数据:.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【变式4-1】为了研究高三学生的性别与身高是否大于的关联性,调查了某中学所有高三年级的学生, 整理得到如下列联表一;然后从该校所有高三学生中获取容量为的样本,整理后得到如下的列联表二:
表一:
性别
身高
合计
低于
不低于
女
男
合计
表二:
性别
身高
合计
低于
不低于
女
男
合计
独立性检验中的几个常用的小概率值和相应的临界值表:
(1)从表一中随机抽取一人,分别用、表示抽到男生、女生,用表示抽到学生身高不低于,计算 、,并判断该中学高三年级学生的性别和身高是否有关联?
(2)请根据表二,依据的独立性检验,能否认为该中学高三年级学生的性别与身高有关联? 对比第一问的结论, 请分析两种判断方式的可靠性. 为了得到准确的结论, 请提出可行性建议;
(3)现在从表二中,抽取样本容量为的样本,其中女生样本数据为:、、、(单位:),男生样本数据为:、、、、、(单位:);求出这个样本的第百分位数,并从低于第百分位数的样本数据中抽取人,记为抽到的男生人数,求的分布列及数学期望.
【变式4-2】为适应社会化安全宣传新形势新要求,充分发挥区域特色和示范效应,深入推进安全宣传进企业、进农村、进社区、进学校、进家庭,普及安全知识、培育安全文化,某单位用简单随机抽样的方法从A,B两个社区中抽取居民进行满意度调查,调查中有“满意”和“不满意”两个选项,调查的部分数据如下表所示:
社区
居民意见
合计
满意
不满意
A社区
30
45
B社区
55
合计
25
(1)完成列联表,根据小概率值的独立性检验,能否认为居民满意度与所在社区有关?
(2)现从已抽取的“不满意”的居民中随机抽取2位居民进行深入调研,用X表示抽取的“不满意”的居民来自A社区的人数,求随机变量X的分布列及数学期望.
附:参考公式:,其中.
0.10
0.05
0.025
0.010
2.706
3.841
5.024
6.635
【变式4-3】某学生兴趣小组随机调查了某市100天中每天的空气质量等级和当天到某公园锻炼的人次,整理数据得到下表(单位:天):
锻炼人次空气质量等级
1(优)
2
16
25
2(良)
5
10
12
3(轻度污染)
6
7
8
4(中度污染)
7
2
0
(1)分别估计该市一天的空气质量等级为1,2,3,4的概率;
(2)求一天中到该公园锻炼的平均人次的估计值(同一组中的数据用该组区间的中点值为代表);
(3)若某天的空气质量等级为1或2,则称这天“空气质量好”;若某天的空气质量等级为3或4,则称这天“空气质量不好”.根据所给数据,完成下面的2×2列联表,并根据列联表,判断能否在犯错误的概率不超过0.05的前提下认为一天中到该公园锻炼的人次与该市当天的空气质量有关?
人次
人次
合计
空气质量好
空气质量不好
合计
附:,
【考点题型五】求回归直线方程
技巧:求线性回归方程的一般步骤
(1)收集样本数据,设为(xi,yi)(i=1,2,…,n)(数据一般由题目给出).
(2)作出散点图,确定x,y具有线性相关关系.
(3)把数据制成表格xi,yi,x,xiyi.
(4)计算,,x,xiyi.
(5)代入公式计算,,公式为
(6)写出线性回归方程=x+.
【例5】近年来,我国铁路事业取得历史性成就、发生历史性变革,路网规模质量大幅提升,建成世界最大的高速铁路网.截至2023年底,我国铁路营业里程达15.9万公里,其中高铁营业里程4.5万公里,继续稳居世界第一.如图,是我国2015-2023年高铁营业里程的发展情况(单位:万公里).
(1)由散点图看出,可用线性回归模型拟合高铁营业里程与年份代码的关系,请用相关系数加以说明(结果精确到0.001;当时,认为线性相关性较强;时,认为线性相关性一般;,认为线性相关性较弱);
(2)求关于的线性回归方程,并预测到哪一年我国高铁的营业里程将达到7万公里(结果精确到0.01).
附:参考公式:相关系数;
回归方程中斜率和截距的最小二乘估计公式分别为,.
参考数据:,,,.
【变式5-1】台州是全国三大电动车生产基地之一,拥有完整的产业链和突出的设计优势.某电动车公司为了抢占更多的市场份额,计划加大广告投入、该公司近5年的年广告费(单位:百万元)和年销售量(单位:百万辆)关系如图所示:
令,数据经过初步处理得:,,,,,,,现有①和②两种方案作为年销售量y关于年广告费x的回归分析模型,其中a,b,m,n均为常数.
(1)请从相关系数的角度,分析哪一个模型拟合程度更好?
(2)根据(1)的分析选取拟合程度更好的回归分析模型及表中数据,求出y关于x的回归方程,并预测年广告费为6(百万元)时,产品的年销售量是多少?
(3)该公司生产的电动车毛利润为每辆200元(不含广告费、研发经费).该公司在加大广告投入的同时也加大研发经费的投入,年研发经费为年广告费的199倍.电动车的年净利润受年广告费和年研发经费影响外还受随机变量影响,设随机变量服从正态分布,且满足.在(2)的条件下,求该公司年净利润的最大值大于1000(百万元)的概率.(年净利润=毛利润×年销售量-年广告费-年研发经费-随机变量).
附:
①相关系数,回归直线中公式分别为,;
②参考数据:,,,.
【变式5-2】某地区2019年至2023年农村居民家庭人均纯收入y(单位:千元)的数据如下表:
年份
2019
2020
2021
2022
2023
年份代号x
1
2
3
4
5
人均纯收入
2.3
3.3
4.1
4.4
4.9
(1)由表可知与具有线性相关关系,求关于的线性回归方程;
(2)利用(1)中的回归方程,预测该地区2025年农村居民家庭人均纯收入;
(3)用(1)中所求线性回归方程得到与对应的人均纯收入预测值,当数据对应残差的绝对值时,将该数据称作一个“好数据”,经过计算统计得到这5个数据中“好数据”有2个,不是“好数据”的有3个,现从5个数据中任选3个,求恰好有两个“好数据”的概率.
【变式5-3】今年立秋以后,我国西南地区持续性高温登上热搜,引发关注讨论、根据专家推测,主要是由于大陆高压和西太平洋副热带高压呈现非常强大,在高压的控制下,西南地区上空晴朗少云,在太阳辐射增温和气流下沉增温的共同作用下,两个地区的气温出现了直接攀升的状态.西南地区某城市一室内游泳馆,为给顾客更好的体验,推出了和两个套餐服务,顾客可自由选择和两个套餐之一;该游泳馆在App平台上推出了优惠券活动,下表是App平台统计某周内周一至周五销售优惠券情况.
星期
1
2
3
4
5
销售量(张)
218
224
230
232
236
经计算可得:.
(1)已知关于的经验回归方程为,求关于的经验回归方程;
(2)若购买优惠券的顾客选择套餐的概率为,选择套餐的概率为,并且套餐包含两张优惠券,套餐包含一张优惠券,记App平台累计销售优惠券为张的概率为.
(i)求及;
(ii)求及的最值.
参考公式:.
【考点题型六】一元线性回归的应用
技巧:我们称为Y关于x的一元线性回归模型,其中Y称为因变量或响应变量,x称为自变量或解释变量;a和b为模型的未知参数,a称为截距参数,b称为斜率参数;e是Y与bx+a之间的随机误差.
【例6】在改革开放成就展上某地区某农产品近几年的产量统计表:
年份
2019
2020
2021
2022
2023
2024
年份代码
1
2
3
4
5
6
年产量(万吨)
6.6
6.7
7
7.1
7.2
7.4
(1)根据表中数据,建立关于的线性回归方程.
(2)根据线性回归方程预测2025年该地区该农产品的年产量.
附:对于一组数据,,…,,
其回归直线方程的斜率和截距的最小二乘估计分别为
,.
【变式6-1】在数字化浪潮汹涌澎湃的当下,DeepSeek以其强大的技术实力,为各领域带来了前所未有的变革与突破.某大型机械制造企业借助DeepSeek强大的数据分析能力,搭建了供应链智能平台.其中,DeepSeek可以实时收集市场需求数据,包括历史销售数据、市场趋势预测、客户订单信息等进行数据分析和优化算法.为统计某零部件产量情况,该企业利用DeepSeek收集到某市1-6月该零部件销售数据,如下表所示.
月份
1
2
3
4
5
6
销售额(万元)
14
16
22
21
24
25
甲、乙两名同学对这组数据进行回归分析,得到两个回归模型:
模型①;模型②,
两位同学对以上回归方程进行残差分析,得到下表:
月份
1
2
3
4
5
6
销售额y(万元)
14
16
22
21
24
25
模型①
估计值
14.7
16.9
19.1
21.3
23.5
25.7
残差
2.9
0.5
模型②
估计值
14.6
16.1
17.8
19.7
21.8
24.1
残差
4.2
1.3
2.2
0.9
计算得到两个模型的残差平方和分别为:,,
若定义:残差的绝对值超过1.5的数据为异常数据.
(1)请你根据残差平方和判断哪个模型拟合效果更好,并在拟合效果较好的模型中判断哪组为异常数据?
(2)在问题(1)中拟合效果较好的模型中剔除异常数据后,请你重新求其经验回归方程,并预测7月份的销售额(保留小数点后一位).
参考公式:,
参考数据:
【变式6-2】人工智能教育是将人工智能与传统教育相结合,借助人工智能和大数据技术打造的智能化教育生态.为了解我国人工智能教育发展状况,通过中国互联网数据平台得到我国2018年-2023年人工智能教育市场规模统计图.如图所示,若用x表示年份代码(2018年用1表示,2019年用2表示,依次类推),用y表示市场规模(单位:亿元),试回答:
(1)根据条形统计图中数据,计算变量y与x的相关系数r,并用r判断两个变量y与x相关关系的强弱(精确到小数点后2位);
(2)若y与x的相关关系拟用线性回归模型表示,试求y关于x的线性回归方程,并据此预测2025年中国人工智能教育市场规模(精确到1亿元).
附:线性回归方程,其中;相关系;
参考数据:
【变式6-3】某中医药企业根据市场调研与模拟,得到研发投入(亿元)与产品收益(亿元)的数据统计如下:
研发投入(亿元)
1
2
3
4
5
产品收益(亿元)
3
7
9
10
11
(1)计算,的相关系数,并判断是否可以认为研发投入与产品收益具有较高的线性相关程度?(若,则线性相关程度一般;若,则线性相关程度较高)
(2)求出关于的线性回归方程,并预测若想收益超过20(亿元),则需研发投入至少多少亿元?(结果保留一位小数)
参考公式:回归直线的斜率和截距的最小二乘法估计公式,相关系数的公式分别为,,.
1 / 1
1 / 1
学科网(北京)股份有限公司
$$
清单04 统计
(8个考点梳理+题型解读+提升训练)
【清单01】一元线性回归模型
我们称
为Y关于x的一元线性回归模型,其中Y称为因变量或响应变量,x称为自变量或解释变量;a和b为模型的未知参数,a称为截距参数,b称为斜率参数;e是Y与bx+a之间的随机误差.
【清单02】线性回归方程与最小二乘法
回归直线方程过样本点的中心(,),是回归直线方程最常用的一个特征
我们将=x+称为Y关于x的线性回归方程,也称经验回归函数或经验回归公式,其图形称为经验回归直线.这种求经验回归方程的方法叫做最小二乘法,求得的,叫做b,a的最小二乘估计(least squares estimate ),
其中
【清单03】残差的概念
对于响应变量Y,通过观测得到的数据称为观测值,通过经验回归方程得到的称为预测值,观测值减去预测值称为残差.残差是随机误差的估计结果,通过残差的分析可以判断模型刻画数据的效果,以及判断原始数据中是否存在可疑数据等,这方面工作称为残差分析.
【清单04】刻画回归效果的方式
(1)残差图法
作图时纵坐标为残差,横坐标可以选为样本编号,或身高数据,或体重估计值等,这样作出的图形称为残差图.若残差点比较均匀地落在水平的带状区域内,带状区域越窄,则说明拟合效果越好.
(2)残差平方和法
残差平方和 (yi-i)2,残差平方和越小,模型拟合效果越好,残差平方和越大,模型拟合效果越差.
(3)利用R2刻画回归效果
决定系数R2是度量模型拟合效果的一种指标,在线性模型中,它代表解释变量客户预报变量的能力.
R2=1-,R2越大
【清单05】2×2列联表
在实践中,由于保存原始数据的成本较高,人们经常按研究问题的需要,将数据分类统计,并做成表格加以保存,我们将这类数据统计表称为2×2列联表,2×2列联表给出了成对分类变量数据的交叉分类频数.
一般地,假设有两个分类变量X和Y,它们的取值分别为{x1,x2}和{y1,y2},其2×2列联表为
y1
y2
合计
x1
a
b
a+b
x2
c
d
c+d
合计
a+c
b+d
a+b+c+d
【清单06】等高堆积条形图
等高条形图和表格相比,更能直观地反映出两个分类变量间是否相互影响,常用等高条形图展示列联表数据的频率特征,依据频率稳定于概率的原理,我们可以推断结果.
【清单07】临界值
χ2 统计量也可以用来作相关性的度量.χ2 越小说明变量之间越独立,χ2越大说明变量之间越相关
χ2=.忽略χ2的实际分布与该近似分布的误差后,对于任何小概率值α,可以找到相应的正实数xα,使得P(χ2≥xα)=α成立.我们称xα为α的临界值,这个临界值就可作为判断χ2大小的标准.
【清单08】独立性检验
基于小概率值α的检验规则是:
当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α;
当χ2<xα时,我们没有充分证据推断H0不成立 ,可以认为X和Y独立.
这种利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验(test of independence).
下表给出了χ2独立性检验中几个常用的小概率值和相应的临界值
α
0.1
0.05
0.01
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
【清单09】应用独立性检验解决实际问题的大致步骤
(1)提出零假设H0:X和Y相互独立,并给出在问题中的解释;
(2)根据抽样数据整理出2×2列联表,计算χ2的值,并与临界值xα比较;
(3)根据检验规则得出推断结论;
(4)在X和Y不独立的情况下,根据需要,通过比较相应的频率,分析X和Y间的影响规律.
【考点题型一】相关关系的理解
技巧:函数关系是一种确定的关系,而相关关系是非随机变量与随机变量的关系.函数关系是一种因果关系, 而相关关系不一定是因果关系,也可能是伴随关系.
【例1】下列两个变量间的关系,是相关关系的是( )
A.任意实数和它的平方 B.圆半径和圆的周长
C.正多边形的边数和内角度数之和 D.天空中的云量和下雨
【答案】D
【分析】根据各选项中两个变量是确定还是非确定性关系可得结论.
【解析】对于ABC,两个变量之间为确定性关系,即两个变量之间均为函数关系,ABC错误;
对于D,根据生活经验,天空中的云量和下雨之间不是确定性关系,虽然有云不一定下雨,但是如果没有云一定不下雨,说明它们之间是相关关系,D正确.
故选:D.
【变式1-1】有几组变量:①汽车的重量和汽车每消耗1升汽油所行驶的平均路程;②平均日学习时间和平均学习成绩;③立方体的棱长和体积.其中两个变量成正相关的是( )
A.①③ B.②③
C.② D.③
【答案】C
【解析】
【分析】利用相关关系和函数关系的概念分析解答.
【解析】①汽车的重量和汽车每消耗1升汽油所行驶的平均路程是负相关关系;
②平均日学习时间和平均学习成绩是正相关关系;
③立方体的棱长和体积是函数关系,不是相关关系.
故选:C
【变式1-2】对两变量间的关系,下列论述正确的是( )
A.任何两个变量都具有相关关系
B.正方形的面积与该正方形的边长具有相关关系
C.农作物的产量与施化肥量之间是一种确定性关系
D.一个学生的数学成绩与物理成绩之间是一种非确定性的关系
【答案】D
【分析】由两个变量之间相关关系与函数关系之间的定义及区别即可求解.
【解析】解:对A:当两个变量之间具有确定关系时,两个变量之间是函数关系,而不是相关关系,所以A错误;
对B:正方形的面积与该正方形的边长之间是函数关系,所以B错误;
对C:农作物的产量与施化肥量之间是相关关系,是非确定性的关系,所以C错误;
对D:学生的数学成绩与物理成绩之间是相关关系,是非确定性的关系,所以D正确;
故选:D.
【考点题型二】用2×2列联表分析两分类变量间的关系
技巧:(1)作2×2列联表时,关键是对涉及的变量分清类别.计算时要准确无误.
(2)利用2×2列联表分析两个分类变量间的关系时,首先要根据题中数据获得2×2列联表,然后根据频率特征,即将与 的值相比,直观地反映出两个分类变量间是否相互影响,但方法较粗劣.
【例2】某学校在一次调查“篮球迷”的活动中,获得了如下数据,以下结论最准确的是( )
男生
女生
篮球迷
90
20
非篮球迷
60
30
附:
0.10
0.05
0.01
0.005
k
2.706
3.841
6.635
7.789
A.有的把握认为是否是篮球迷与性别有关
B.有的把握认为是否是篮球迷与性别有关
C.在犯错误的概率不超过0.1的前提下,可以认为是否是篮球迷与性别有关
D.在犯错误的概率不超过0.05的前提下,可以认为是否是篮球迷与性别有关
【答案】D
【分析】列出列联表,计算即可得解.
【详解】列出列联表:
男生
女生
篮球迷
90
20
110
非篮球迷
60
30
90
150
50
200
,
故在犯错误的概率不超过0.05的前提下,可以认为是否是篮球迷与性别有关.
故选:D
【变式2-1】某中学为调查高一年级学生的选科倾向,随机抽取了300人,其中选考物理的有220人,选考历史的有80人,统计各选科人数如表所示,则下列说法中正确的是( ).
选考类别
选择科目
思想政治
地理
化学
生物
物理类
80
100
145
115
历史类
50
45
30
35
参考数据:,其中.
附表:
0.10
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
A.选考物理类的学生中选择政治的比例比选考历史类的学生中选择政治的比例高
B.选考物理类的学生中选择地理的比例比选考历史类的学生中选择地理的比例高
C.参照附表,根据小概率值的独立性检验,我们认为选择生物与选考类别无关
D.参照附表,根据小概率值的独立性检验,我们认为选择生物与选考类别有关
【答案】C
【分析】分别求出各个比例,即可判断A、B项;列出列联表,求出的值,根据独立性检验的思想,即可判断C、D项.
【详解】对于A项,,,显然,故A项错误;
对于B项,因为,,所以,故B项错误;
对于C项,
根据已知,可列出列联表
选择生物
不选择生物
合计
物理类
115
105
220
历史类
35
45
80
合计
150
150
300
,
所以根据小概率值的独立性检验,我们认为选择生物与选考类别无关,故C项正确;
对于D项,根据C项可知,D项错误.
故选:C.
【变式2-2】疫苗是为预防、控制传染病的发生、流行,用于人体预防接种的预防性生物制品,其前期研发过程中,一般都会进行动物保护测试,为了考查某种疫苗预防效果,在进行动物试验时,得到如下统计数据:
是否发病
未发病
发病
总计
未注射疫苗
20
注射疫苗
30
总计
50
50
100
现从试验动物中任取一只,取得“注射疫苗”的概率为,则下列判断错误的是( )
公式:
0.10
0.05
0.010
0.001
2.706
3.841
6.635
10.828
.
A.注射疫苗发病的动物数为10
B.从该试验未注射疫苗的动物中任取一只,发病的概率为
C.有99%的把握判断注射疫苗与是否发病有关联
D.有95%的把握判断注射疫苗与是否发病有关联
【答案】D
【分析】根据题意结合列联表以及独立性检验的概念逐项分析判断.
【详解】因为从试验动物中任取一只,取得“注射疫苗”的概率为,
所以“注射疫苗”的试验动物有只,
根据题意可得列联表为:
是否发病
未发病
发病
总计
未注射疫苗
20
40
60
注射疫苗
30
10
40
总计
50
50
100
对于选项A:注射疫苗发病的动物数为10,故A正确;
对于选项B:从该试验未注射疫苗的动物中任取一只,发病的概率为,故B正确;
对于选项C、D:因为,
所以有99%的把握判断注射疫苗与是否发病有关联,故C正确,D错误;
故选:D.
【变式2-3】某科技公司为了提升其产品的市场竞争力,每年都会投入一定的资金用于研发和市场推广.
(1)该公司从管理层到基层员工中随机抽取了120名进行调研,现将120名员工的学历划分为“高学历”和“低学历”,对投入一定的资金用于研发和市场推广划分为“支持”和“不支持”,整理得到如下数据:
支持
不支持
合计
高学历
30
低学历
40
合计
60
120
请将列联表补充完整并回答:是否有的把握认为高学历群体和低学历群体对投入资金研发和市场推广的满意度有关?
(2)通过对该公司2015年至2024年每年的研发投入(单位:百万元)与年利润增量y(单位:百万元)的数据进行分析得到回归模型为:,且有.
请求出该模型中关于的回归方程并预测投资金额为6百万元时的年利润增量.参考公式及参考数据,其中,临界值表:
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
.
【答案】(1)列联表见解析,没有
(2),(百万元)
【分析】(1)首先完善列联表,计算出卡方,即可判断;
(2)首先求出,,即可求出,,从而求出回归直线方程,再代入计算可得.
【详解】(1)由题完成列联表得:
支持
不支持
合计
高学历
30
20
50
低学历
30
40
70
合计
60
60
120
由表中的数据可得,
所以没有的把握认为高学历群体和低学历群体对投入资金研发和市场推广的满意度有关.
(2)由,
所以,,
所以,
则,
所以关于的回归方程,当时,,
所以当投资金额为6百万元时年利润增量的预测值为(百万元).
【变式2-4】近日,一部名为“体彩公益金助力‘村’,赛出乡村振兴新气象”的视频在网络上广泛传播,引起了大众的热烈反响.这部视频以贵州省黔东南苗族侗族自治州台江县台盘村为背景,生动展现了台盘村从一个默默无闻的小村庄到因“村”而声名鹊起的历程,揭示了体育精神与乡村振兴的紧密联系.现有一支“村”球队,其中球员甲是其主力队员,经统计该球队在某个赛季的所有比赛中,球员甲是否上场时该球队的胜负情况如表.
甲球员是否上场
球队的胜负情况
合计
胜
负
上场
1
30
未上场
8
合计
5
42
(1)完成列联表,并依据的独立性检验,能否认为球队的胜负与球员甲的出场有关联;
(2)由于队员的不同,球员甲主打的位置会进行调整,且球员甲每场比赛只主打前锋、中锋、后卫中的一个位置.根据以往的数据统计,球员甲上场时,担任的角色为前锋、中锋、后卫的概率分为,相应球队赢球的概率分别为.
①当球员甲上场参加比赛时,判断球员甲主打哪个位置球队赢球的概率更大,并说明理由;
②当球员甲上场参加比赛时,在球队赢了该场比赛的条件下,求甲是前锋的概率.
附:.
0.10
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【答案】(1)列联表见解析,有关联
(2)①球员甲上场打后卫参加比赛时,球队赢球的概率最大,理由见解析;②
【分析】(1)根据题意,得出的列联表,代入公式中求出观测值,将其与临界值进行对比,进而即可求解;
(2)根据条件概率与全概率公式对问题进行逐一分析,进而即可求解.
【详解】(1)根据题意,可得的列联表:
甲球员是否上场
球队的胜负情况
合计
胜
负
上场
29
1
30
未上场
8
4
12
合计
37
5
42
计算得,
因为,所以依据的独立性检验,球队的胜负与球员甲的出场有关联.
(2)①设事件:甲球员上场打前锋;事件:甲球员上场打中锋;
事件:甲球员上场打后卫;事件:球队赢球;
则,
∴当球员甲上场打前峰时,球队赢球的概率为:,
当球员甲上场打中锋时,球队赢球的概率为:,
当球员甲上场打后卫时,球队赢球的概率为:,
∵,∴球员甲上场打后卫参加比赛时,球队赢球的概率最大.
②由①知当球员甲上场参加比赛时,球队赢球的概率为
,
当甲球员上场参加比赛时,在球队赢了某场比赛的条件下,
球员甲是前锋的概率为.
【考点题型三】残差分析与相关指数的应用
技巧:(1)利用残差分析研究两个变量间的关系时,首先要根据散点图来判断它们是否线性相关,是否可以用线性回归模型来拟合数据,然后通过残差1,2,…,n来判断模型拟合的效果.
(2)若残差点比较均匀地分布在水平带状区域中,带状区域越窄,说明模型拟合度越高,回归方程预报精确度越高.
【例3】假定产品产量x(千件)与单位成本y(元/件)之间存在相关关系.数据如下:
x
2
3
4
3
4
5
y
73
72
71
73
69
68
(1)以x为解释变量,y为预报变量,作出散点图;
(2)求y与x之间的回归直线方程,对于单位成本70元/件时,预报产量为多少;
(3)计算各组残差,并计算残差平方和;
【答案】(1)散点图见解析;
(2),千件;
(3)各组残差见解析,残差平方和为.
【分析】(1)根据表中数据描点即可求解;
(2)根据表中数据,求出,,,,代入公式求出线性回归方程的系数,进而求出即可得回归直线方程;
(3)根据残差的定义及残差平方和公式即可求解.
【解析】(1)解:散点图如下:
(2)解:因为,,
,,
所以,
,
所以回归直线方程为,令,则,解得,
所以单位成本70元/件时,预报产量约为千件.
(3)解:各组残差分别为:,
,
,
,
,
,
残差的平方和为.
【变式3-1】随着中美贸易战的不断升级,越来越多的国内科技巨头加大了科技研发投入的力度.华为技术有限公司拟对“麒麟”手机芯片进行科技升级,根据市场调研与模拟,得到科技升级投入x(亿元)与科技升级直接收益y(亿元)的数据统计如下:
序号
1
2
3
4
5
6
7
8
9
10
11
12
x
2
3
4
6
8
10
13
21
22
23
24
25
y
13
22
31
42
50
56
58
68.5
68
67.5
66
66
当时,建立了y与x的两个回归模型:模型①:;模型②:;当时,确定y与x满足的线性回归方程为.
(1)根据下列表格中的数据,比较当时模型①、②的相关指数的大小,并选择拟合精度更高、更可靠的模型,预测对“麒麟”手机芯片科技升级的投入为17亿元时的直接收益.
回归模型
模型①
模型②
回归方程
182.4
79.2
(附:刻画回归效果的相关指数,,)
(2)为鼓励科技创新,当科技升级的投入不少于20亿元时,国家给予公司补贴5亿元,以回归方程为预测依据,比较科技升级投入17亿元与20亿元时公司实际收益的大小.
附:用最小二乘法求线性回归方程的系数:
【答案】(1)回归模型②,72.93(亿元);(2)投入20亿元时,公司的实际收益更大.
【分析】(1)根据表中数据比较和可判断拟合效果,进而求出预测值;
(2)求出,进而求出,得出回归方程得求出结果.
【解析】解:(1)由表格中的数据,,
∴,
∴
可见模型①的相关指数小于模型②的相关指数.
所以回归模型②的拟合效果更好.
所以当亿元时,科技升级直接收益的预测值为
(亿元).
(2)当时,由已知可得
,.
∴.
∴当时,y与x满足的线性回归方程为.
当时,科技升级直接收益的预测值为亿元.
当亿元时,实际收益的预测值为亿元亿元,
∴技术升级投入20亿元时,公司的实际收益更大.
【变式3-2】小张同学对具有线性相关的两个变量x和y进行了统计分析,得到了右表,其中一些数据丢失,只记得这组数据拟合出的y关于x的经验回归方程为,若成等差数列,则( )
x
4
6
8
10
12
y
a
2
b
c
6
A.变量x与y的样本相关系数 B.
C.当时,残差为 D.当时,y的预测值为
【答案】BCD
【分析】利用回归分析以及回归方程的性质必过点即可判断AB,利用残差的定义和回归方程预测即可判断CD.
【详解】由表格中的数据可计算平均数:,
,
又因为成等差数列,所以,则,
根据经验回归方程为必过点,
则,解得,故B正确;
由于经验回归方程为是递增的一次函数,所以两个变量是正相关,
则样本相关系数,故A错误;
当时,,所以残差为,故C正确;
当时,,所以y的预测值为,故D正确;
故选:BCD.
【变式3-3】根据变量Y和x的成对样本数据,由一元线性回归模型得到经验回归模型,求得残差图.对于以下四幅残差图,满足一元线性回归模型中对随机误差假设的是( )
A. B.
C. D.
【答案】D
【分析】根据一元线性回归模型中对随机误差的假定进行判断.
【详解】根据一元线性回归模型中对随机误差的假定,残差应是均值为、方差为的随机变量的观测值.
对于A选项,残差与有线性关系,故A错误;
对于B选项,残差的方差不是一个常数,随着观测时间变大而变小,故B错;
对于C选项,残差与有非线性关系,故C错;
对于D选项,残差比较均匀地分布在以取值为的横轴为对称轴的水平带状区域内,故D正确.
故选:D.
【变式3-4】某无人机的研发费用x(单位:万元)与销售量y(单位:万件)之间的对应数据如表所示:
研发费用x
3.4
4.7
5
5.6
6.3
销售量y
15
16.9
19.2
18
20.9
根据表中数据可得经验回归方程为,则第三个样本点对应的残差为 .
【答案】1.2
【分析】由表格中的数据,根据平均数求得样本中心,代入回归方程可得参数的值,代入第三个样本点的值,集合残差的定义,可得答案.
【详解】由已知,得,,
所以,于是,
当时,,
因此,第三个样本点对应的残差为.
故答案为:.
【考点题型四】独立性检验的综合应用
技巧:(1)解答此类题目的关键在于正确利用χ2=计算χ2的值,再用它与临界值xα的大小作比较来判断假设检验是否成立,从而使问题得到解决.
(2)此类题目规律性强,解题比较格式化,填表计算分析比较即可,要熟悉其计算流程,不难理解掌握.
【例4】我校为全面提高学生的语文素养和阅读水平,构建“书香校园”,特举办“课外阅读知识竞赛”,为了调查学生对这次活动的满意程度,在所有参加“课外阅读知识竞赛”的同学中抽取容量为500的样本进行调查,并得到如下2X2列联表:
满意程度
性别
合计
男生
女生
满意
140
400
不满意
100
合计
200
(1)请补全上面的列联表,依据小概率值α=0.05的独立性检验,能否认为满意程度与性别有关系;
(2)若竞赛成绩在前3的同学进入决赛环节,该环节共设置3道试题,且每一道试题必须依次作答,至少答对2道才能进入总决赛,且每人答对这3道试题的概率分别为,,.3道试题答对与否互不影响.用X表示能进入总决赛的人数,求X的分布列及数学期望.
参考公式及数据:.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【答案】(1)列联表见解析,与性别有关系
(2)分布列见解析,
【分析】(1)完成列联表,并利用独立性检验的步骤完成计算即可;
(2)由题意可知能进入总决赛的人数服从二项分布,再计算出每个人进入决赛的概率,利用二项分布的数学期望公式进行计算即可;
【详解】(1)表如下所示
满意程度
性别
合计
男生
女生
满意
140
260
400
不满意
60
40
100
合计
200
300
500
原假设:满意程度与性别没有关系
依据小概率值α=0.05的独立性检验,认为原假设不成立,即能认为满意程度与性别有关系,此推断犯错率不超过0.05.
(2)设能答对2道题及以上为事件A
X的可能取值为0,1,2,3,X服从二项分布,
又,,
,,
所以的分布列为:
则;
【变式4-1】为了研究高三学生的性别与身高是否大于的关联性,调查了某中学所有高三年级的学生, 整理得到如下列联表一;然后从该校所有高三学生中获取容量为的样本,整理后得到如下的列联表二:
表一:
性别
身高
合计
低于
不低于
女
男
合计
表二:
性别
身高
合计
低于
不低于
女
男
合计
独立性检验中的几个常用的小概率值和相应的临界值表:
(1)从表一中随机抽取一人,分别用、表示抽到男生、女生,用表示抽到学生身高不低于,计算 、,并判断该中学高三年级学生的性别和身高是否有关联?
(2)请根据表二,依据的独立性检验,能否认为该中学高三年级学生的性别与身高有关联? 对比第一问的结论, 请分析两种判断方式的可靠性. 为了得到准确的结论, 请提出可行性建议;
(3)现在从表二中,抽取样本容量为的样本,其中女生样本数据为:、、、(单位:),男生样本数据为:、、、、、(单位:);求出这个样本的第百分位数,并从低于第百分位数的样本数据中抽取人,记为抽到的男生人数,求的分布列及数学期望.
【答案】(1),,有关
(2)无关,建议见解析
(3)第百分位数为,分布列答案见解析,
【分析】(1)利用条件概率公式可求出、的值,即可作出判断;
(2)提出零假设该中学高三年级学生的身高与性别无关,计算出的观测值,结合临界值表可得出结论,结合实际情况可得出合理的建议;
(3)根据百分位数的定义求出样本的第百分位数,分析可知,随机变量的可能取值有、、、,计算出随机变量在不同取值下的概率,可得出随机变量的分布列,进而可求得的值.
【详解】(1)由表格中的数据可得,,
所以,该中学高三年级学生的性别和身高有关联.
(2)零假设该中学高三年级学生的身高与性别无关,
,
依据的独立性检验,没有充分的证据说明不成立,
即该中学高三年级学生的身高与性别无关,
第一问的结论是有关,是利用全体数据得出的结论,数据更全面,更精确,
而第二问是抽取的部分样本,样本的抽取具有随机性,
因此,可能会得出错误的结论,为了提高准确的结论,应该增加样本量.
(3)个数据由小到大的顺序为:、、、、、、、、、,
因为,因此第百分位数为,
身高小于的人共人,其中男生有人,女生有人,
所以随机变量的可能取值有、、、,
,,
,,
故的分布列如下表所示:
因此.
【变式4-2】为适应社会化安全宣传新形势新要求,充分发挥区域特色和示范效应,深入推进安全宣传进企业、进农村、进社区、进学校、进家庭,普及安全知识、培育安全文化,某单位用简单随机抽样的方法从A,B两个社区中抽取居民进行满意度调查,调查中有“满意”和“不满意”两个选项,调查的部分数据如下表所示:
社区
居民意见
合计
满意
不满意
A社区
30
45
B社区
55
合计
25
(1)完成列联表,根据小概率值的独立性检验,能否认为居民满意度与所在社区有关?
(2)现从已抽取的“不满意”的居民中随机抽取2位居民进行深入调研,用X表示抽取的“不满意”的居民来自A社区的人数,求随机变量X的分布列及数学期望.
附:参考公式:,其中.
0.10
0.05
0.025
0.010
2.706
3.841
5.024
6.635
【答案】(1)列联表见解析,居民满意度与所在社区无关.
(2)分布列见解析,
【分析】(1)根据列联表,计算值并根据其与的大小比较得出结论;
(2)由题意,可分析得出变量服从超几何分布,按照其概率公式写出分布列,计算数学期望即得.
【详解】(1)根据题目数据可完善列联表:
社区
居民意见
合计
满意
不满意
A社区
30
15
45
B社区
45
10
55
合计
75
25
100
零假设为:居民满意度与所在社区不具有相关性.
根据列联表中的数据,
得,
根据小概率值的独立性检验,没有充分证据推断不成立,
即认为居民满意度与所在社区无关.
(2)已抽取的“不满意”的居民中,A社区有15人,B社区有10人,
所以随机变量的所有可能取值为0,1,2,
则,,,
所以的分布列为
0
1
2
所以.
【变式4-3】某学生兴趣小组随机调查了某市100天中每天的空气质量等级和当天到某公园锻炼的人次,整理数据得到下表(单位:天):
锻炼人次空气质量等级
1(优)
2
16
25
2(良)
5
10
12
3(轻度污染)
6
7
8
4(中度污染)
7
2
0
(1)分别估计该市一天的空气质量等级为1,2,3,4的概率;
(2)求一天中到该公园锻炼的平均人次的估计值(同一组中的数据用该组区间的中点值为代表);
(3)若某天的空气质量等级为1或2,则称这天“空气质量好”;若某天的空气质量等级为3或4,则称这天“空气质量不好”.根据所给数据,完成下面的2×2列联表,并根据列联表,判断能否在犯错误的概率不超过0.05的前提下认为一天中到该公园锻炼的人次与该市当天的空气质量有关?
人次
人次
合计
空气质量好
空气质量不好
合计
附:,
【答案】(1)答案见解析;
(2)350;
(3)列联表见解析,能在犯错误的概率不超过0.05的前提下认为一天中到该公园锻炼的人次与该市当天的空气质量有关.
【分析】(1)应用频率估计对应等级的概率,即可得;
(2)根据表格数据,结合平均数的求法求一天中到该公园锻炼的平均人次;
(3)由已知数据写出列联表,再应用卡方公式求卡方值,应用独立检验基本思想得到结论.
【详解】(1)由所给数据,得该市一天的空气质量等级为1,2,3,4的概率的估计值如下表:
空气质量等级
1
2
3
4
概率的估计值
0.43
0.27
0.21
0.09
(2)一天中到该公园锻炼的平均人次的估计值为.
(3)根据所给数据,可得2×2列联表:
人次400
人次>400
合计
空气质量好
33
37
70
空气质量不好
22
8
30
合计
55
45
100
根据列联表得.
故能在犯错误的概率不超过0.05的前提下认为一天中到该公园锻炼的人次与该市当天的空气质量有关.
【考点题型五】求回归直线方程
技巧:求线性回归方程的一般步骤
(1)收集样本数据,设为(xi,yi)(i=1,2,…,n)(数据一般由题目给出).
(2)作出散点图,确定x,y具有线性相关关系.
(3)把数据制成表格xi,yi,x,xiyi.
(4)计算,,x,xiyi.
(5)代入公式计算,,公式为
(6)写出线性回归方程=x+.
【例5】近年来,我国铁路事业取得历史性成就、发生历史性变革,路网规模质量大幅提升,建成世界最大的高速铁路网.截至2023年底,我国铁路营业里程达15.9万公里,其中高铁营业里程4.5万公里,继续稳居世界第一.如图,是我国2015-2023年高铁营业里程的发展情况(单位:万公里).
(1)由散点图看出,可用线性回归模型拟合高铁营业里程与年份代码的关系,请用相关系数加以说明(结果精确到0.001;当时,认为线性相关性较强;时,认为线性相关性一般;,认为线性相关性较弱);
(2)求关于的线性回归方程,并预测到哪一年我国高铁的营业里程将达到7万公里(结果精确到0.01).
附:参考公式:相关系数;
回归方程中斜率和截距的最小二乘估计公式分别为,.
参考数据:,,,.
【答案】(1)答案见解析
(2),预测到2030年我国高铁的营业里程将会达到7万公里
【分析】(1)先求出,,结合提议中的公式计算即可求解.
(2)根据最小二乘法计算,进而求出,写出线性回归方程,求出结果.
【详解】(1)由散点图数据得
,
,
又,,,
所以,
故与的线性相关性较强,所以可以用线性回归模型拟合与的关系.
(2)由(1)得,
则,
所以关于的线性回归方程为,
令,即,解得,
即时,高铁的营业里程将会达到7万公里,
所以预测到2030年我国高铁的营业里程将会达到7万公里.
【变式5-1】台州是全国三大电动车生产基地之一,拥有完整的产业链和突出的设计优势.某电动车公司为了抢占更多的市场份额,计划加大广告投入、该公司近5年的年广告费(单位:百万元)和年销售量(单位:百万辆)关系如图所示:
令,数据经过初步处理得:,,,,,,,现有①和②两种方案作为年销售量y关于年广告费x的回归分析模型,其中a,b,m,n均为常数.
(1)请从相关系数的角度,分析哪一个模型拟合程度更好?
(2)根据(1)的分析选取拟合程度更好的回归分析模型及表中数据,求出y关于x的回归方程,并预测年广告费为6(百万元)时,产品的年销售量是多少?
(3)该公司生产的电动车毛利润为每辆200元(不含广告费、研发经费).该公司在加大广告投入的同时也加大研发经费的投入,年研发经费为年广告费的199倍.电动车的年净利润受年广告费和年研发经费影响外还受随机变量影响,设随机变量服从正态分布,且满足.在(2)的条件下,求该公司年净利润的最大值大于1000(百万元)的概率.(年净利润=毛利润×年销售量-年广告费-年研发经费-随机变量).
附:
①相关系数,回归直线中公式分别为,;
②参考数据:,,,.
【答案】(1)模型②的拟合程度更好
(2),13(百万辆)
(3)0.3
【分析】(1)分别求得模型①和②的相关系数,,然后比较得出结论;
(2)利用最小二乘法求解;
(3)由净利润为,求解.
【详解】(1)设模型①和②的相关系数分别为,,
由题意可得:,
,
所以,由相关系数的相关性质可得,模型②的拟合程度更好.
(2)因为,
又由,,
得,
所以,即回归方程为,
当时,,
因此当年广告费为6(百万元)时,产品的销售量大概是13(百万辆).
(3)净利润为,,
令,
所以,
可得在上为增函数,在上为减函数,
所以,
由题意得:,即,
,
即该公司年净利润大于1000(百万元)的概率为0.3.
【变式5-2】某地区2019年至2023年农村居民家庭人均纯收入y(单位:千元)的数据如下表:
年份
2019
2020
2021
2022
2023
年份代号x
1
2
3
4
5
人均纯收入
2.3
3.3
4.1
4.4
4.9
(1)由表可知与具有线性相关关系,求关于的线性回归方程;
(2)利用(1)中的回归方程,预测该地区2025年农村居民家庭人均纯收入;
(3)用(1)中所求线性回归方程得到与对应的人均纯收入预测值,当数据对应残差的绝对值时,将该数据称作一个“好数据”,经过计算统计得到这5个数据中“好数据”有2个,不是“好数据”的有3个,现从5个数据中任选3个,求恰好有两个“好数据”的概率.
【答案】(1)
(2)千元
(3)
【分析】(1)根据已知数据,结合参考数据,分别求得与,即可求得结果;
(2)令,即可求得结果;
(3)根据题意求得好数据个数,再结合组合数,根据古典概型的概率计算公式求解即可.
【详解】(1)根据已知数据以及参考数据可得:,
;
又,
故,
,
故所求线性回归方程为:.
(2)根据(1)所求可得:,令,解得,
故预测该地区2025年农村居民家庭人均纯收入为千元.
(3)根据题意,结合所求线性回归方程可得如下表格:
年份
2019
2020
2021
2022
2023
年份代号x
1
2
3
4
5
人均纯收入
2.3
3.3
4.1
4.4
4.9
2.54
3.17
3.8
4.43
5.06
0.24
0.13
0.3
0.03
0.16
根据“好数据”定义,故组数据中,“好数据”有2组,不是“好数据”的有3组,
从5个数据中任选3个,恰好有两个“好数据”是事件,则.
【变式5-3】今年立秋以后,我国西南地区持续性高温登上热搜,引发关注讨论、根据专家推测,主要是由于大陆高压和西太平洋副热带高压呈现非常强大,在高压的控制下,西南地区上空晴朗少云,在太阳辐射增温和气流下沉增温的共同作用下,两个地区的气温出现了直接攀升的状态.西南地区某城市一室内游泳馆,为给顾客更好的体验,推出了和两个套餐服务,顾客可自由选择和两个套餐之一;该游泳馆在App平台上推出了优惠券活动,下表是App平台统计某周内周一至周五销售优惠券情况.
星期
1
2
3
4
5
销售量(张)
218
224
230
232
236
经计算可得:.
(1)已知关于的经验回归方程为,求关于的经验回归方程;
(2)若购买优惠券的顾客选择套餐的概率为,选择套餐的概率为,并且套餐包含两张优惠券,套餐包含一张优惠券,记App平台累计销售优惠券为张的概率为.
(i)求及;
(ii)求及的最值.
参考公式:.
【答案】(1)
(2)(i),,;(ii),的最大值为,最小值为.
【分析】(1)将相关数据代入和的公式,即可得经验回归方程;
(2)由题意知,,构造等比数列,再利用等比数列的通项公式求解即可.
【详解】(1)由题意,,
则,
.
所以关于的经验回归方程为.
(2)(i)由题意,可知,
,
,
(求解另一种方法:)
(ii)当时,,即,
又,
所以当时,数列为各项都为1的常数列,
即,
所以,又,
所以数列为首项为公比为的等比数列,
所以,即.
当为偶数时,,且随的增大而减小,
因此的最大值为;
当为奇数时,,且随的增大而增大,
因此的最小值为,综上所述,的最大值为,最小值为.
【考点题型六】一元线性回归的应用
技巧:我们称为Y关于x的一元线性回归模型,其中Y称为因变量或响应变量,x称为自变量或解释变量;a和b为模型的未知参数,a称为截距参数,b称为斜率参数;e是Y与bx+a之间的随机误差.
【例6】在改革开放成就展上某地区某农产品近几年的产量统计表:
年份
2019
2020
2021
2022
2023
2024
年份代码
1
2
3
4
5
6
年产量(万吨)
6.6
6.7
7
7.1
7.2
7.4
(1)根据表中数据,建立关于的线性回归方程.
(2)根据线性回归方程预测2025年该地区该农产品的年产量.
附:对于一组数据,,…,,
其回归直线方程的斜率和截距的最小二乘估计分别为
,.
【答案】(1)
(2)7.56万吨
【分析】(1)根据公式直接计算求线性回归方程;
(2)当年份为2025年时,年份代码为,利用线性回归方程求解.
【详解】(1)由题意可知:,
,
,
所以,
又,
故关于的线性回归方程为.
(2)(2)由(1)可得,当年份为2025年时,年份代码为,
此时.
所以可预测2025年该地区该农产品的年产量约为7.56万吨.
【变式6-1】在数字化浪潮汹涌澎湃的当下,DeepSeek以其强大的技术实力,为各领域带来了前所未有的变革与突破.某大型机械制造企业借助DeepSeek强大的数据分析能力,搭建了供应链智能平台.其中,DeepSeek可以实时收集市场需求数据,包括历史销售数据、市场趋势预测、客户订单信息等进行数据分析和优化算法.为统计某零部件产量情况,该企业利用DeepSeek收集到某市1-6月该零部件销售数据,如下表所示.
月份
1
2
3
4
5
6
销售额(万元)
14
16
22
21
24
25
甲、乙两名同学对这组数据进行回归分析,得到两个回归模型:
模型①;模型②,
两位同学对以上回归方程进行残差分析,得到下表:
月份
1
2
3
4
5
6
销售额y(万元)
14
16
22
21
24
25
模型①
估计值
14.7
16.9
19.1
21.3
23.5
25.7
残差
2.9
0.5
模型②
估计值
14.6
16.1
17.8
19.7
21.8
24.1
残差
4.2
1.3
2.2
0.9
计算得到两个模型的残差平方和分别为:,,
若定义:残差的绝对值超过1.5的数据为异常数据.
(1)请你根据残差平方和判断哪个模型拟合效果更好,并在拟合效果较好的模型中判断哪组为异常数据?
(2)在问题(1)中拟合效果较好的模型中剔除异常数据后,请你重新求其经验回归方程,并预测7月份的销售额(保留小数点后一位).
参考公式:,
参考数据:
【答案】(1)模型①拟合效果更好,3月的销售数据为异常数据
(2),预测7月份的销售额约为万元
【分析】(1)根据残差及异常数据的定义判断即可;
(2)剔除3月的销售数据,然后根据表中的数据和公式求出经验回归方程,再由可预测7月份的销售额.
【详解】(1)由题意,,
则模型①拟合效果更好,
其中3月的销售数据为异常数据.
(2)剔除3月的销售数据,得到剩余的五组数据,
此时,,
,,
所以,
则,
则模型①新的经验回归方程为,,
当时,,
由此预测7月份的销售额为万元.
【变式6-2】人工智能教育是将人工智能与传统教育相结合,借助人工智能和大数据技术打造的智能化教育生态.为了解我国人工智能教育发展状况,通过中国互联网数据平台得到我国2018年-2023年人工智能教育市场规模统计图.如图所示,若用x表示年份代码(2018年用1表示,2019年用2表示,依次类推),用y表示市场规模(单位:亿元),试回答:
(1)根据条形统计图中数据,计算变量y与x的相关系数r,并用r判断两个变量y与x相关关系的强弱(精确到小数点后2位);
(2)若y与x的相关关系拟用线性回归模型表示,试求y关于x的线性回归方程,并据此预测2025年中国人工智能教育市场规模(精确到1亿元).
附:线性回归方程,其中;相关系;
参考数据:
【答案】(1),正相关很强
(2),约2677亿元
【分析】(1)根据给出的参考数据求得相关系数 ,相关系数,可以判定;
(2)求得y关于x的线性回归方程为,把代入得计算即可.
【详解】(1)∵,,,,
∴相关系数.
∵相关系数,∴y与x具有线性相关关系,且正相关很强.
(2)设y关于x的线性回归方程为,
其中;
,
∴y关于x的线性回归方程为,
把代入得(亿元),
故据此预测2022年中国人工智能教育市场规模将达到约2677亿元.
【变式6-3】某中医药企业根据市场调研与模拟,得到研发投入(亿元)与产品收益(亿元)的数据统计如下:
研发投入(亿元)
1
2
3
4
5
产品收益(亿元)
3
7
9
10
11
(1)计算,的相关系数,并判断是否可以认为研发投入与产品收益具有较高的线性相关程度?(若,则线性相关程度一般;若,则线性相关程度较高)
(2)求出关于的线性回归方程,并预测若想收益超过20(亿元),则需研发投入至少多少亿元?(结果保留一位小数)
参考公式:回归直线的斜率和截距的最小二乘法估计公式,相关系数的公式分别为,,.
【答案】(1)0.95,相关程度较高
(2),9.4亿元. ,
【分析】(1)由公式计算出相关系数后可得;
(2)求出线性回归方程,通过线性回归方程估算即得.
【详解】(1)由表中数据可知,,,
,,,
则,
因为,故相关程度较高;
(2),,则,
,
故,
令,解得,故研发投入至少9.4亿元.
1 / 1
1 / 1
学科网(北京)股份有限公司
$$