内容正文:
第八章 成对数据的统计分析
教学目标
1. 理解成对数据的含义,会画散点图,能通过散点图直观判断两个变量的线性相关与非线性相关、正相关与负相关。
2. 掌握相关系数r的含义及计算,明确|r|越接近1线性相关越强,会根据r的符号判断相关方向,能利用相关系数定量刻画线性相关程度。
3. 掌握线性回归方程y=bx+a的求法,熟记b计算公式,知道样本中心点(x,y)必在回归直线上,能准确求解回归系数。
4. 理解残差、残差图的意义,会用残差分析回归模型的拟合效果;了解独立性检验的基本思想,会列2×2列联表,能计算统计量并判断变量关联性。
教学重难点
重点
1. 成对变量线性相关关系的判定:散点图直观判断+相关系数定量刻画,掌握正、负相关及线性相关强弱的判断方法。
2. 线性回归方程的求解与应用:熟练计算回归系数b和a,理解回归直线的意义,能利用方程进行简单预报。
3. 残差分析的应用:会计算残差、绘制残差图,能根据残差图判断回归模型的拟合效果。
4. 独立性检验的基本步骤:列联表构建、计算、临界值对比,能准确判断两个分类变量是否有关联。
难点
1. 相关系数r的意义理解:难以理解r的取值与线性相关程度的内在联系,易混淆“相关强”与“因果关系”。
2. 回归系数b的含义与计算:对b的统计意义(x每变1个单位,y的平均变化量)理解模糊,计算过程易出错。
3. 残差分析的本质理解:不会通过残差图规律判断模型缺陷,分不清残差误差、系统误差与随机误差的区别。
4. 统计结论的正确解读:易误将“线性相关”等同于“因果关系”,对回归预报的估计性、独立性检验结论的概率性理解不到位。
5. 实际问题转化:难以将生活中的成对数据问题(如消费与收入)抽象为统计模型,找不到分析切入点。
知识点01 变量间的相关关系
1、变量之间的相关关系
当自变量取值一定时,因变量的取值带有一定的随机性,则这两个变量之间的关系叫相关关系.由于相关关系的不确定性,在寻找变量之间相关关系的过程中,统计发挥着非常重要的作用.我们可以通过收集大量的数据,在对数据进行统计分析的基础上,发现其中的规律,对它们的关系作出判断.
注意:相关关系与函数关系是不同的,相关关系是一种非确定的关系,函数关系是一种确定的关系,而且函数关系是一种因果关系,但相关关系不一定是因果关系,也可能是伴随关系.
2、散点图
将样本中的个数据点描在平面直角坐标系中,所得图形叫做散点图.根据散点图中点的分布可以直观地判断两个变量之间的关系.
(1)如果散点图中的点散布在从左下角到右上角的区域内,对于两个变量的这种相关关系,我们将它称为正相关,如图(1)所示;
(2)如果散点图中的点散布在从左上角到右下角的区域内,对于两个变量的这种相关关系,我们将它称为负相关,如图(2)所示.
3、相关系数
若相应于变量的取值,变量的观测值为,则变量与的相关系数,通常用来衡量与之间的线性关系的强弱,的范围为.
(1)当时,表示两个变量正相关;当时,表示两个变量负相关.
(2)越接近,表示两个变量的线性相关性越强;越接近,表示两个变量间几乎不存在线性相关关系.当时,所有数据点都在一条直线上.
(3)通常当时,认为两个变量具有很强的线性相关关系.
【即学即练】
1.对四组数据进行统计,获得如图散点图,其中线性相关性比较强且负相关的是( )
A. B. C. D.
【答案】B
【分析】根据散点图和相关性的关系,判断结果.
【详解】由散点图知,相关系数对应的散点图呈负相关,
且线性相关性比较强.
故选:B.
2.(多选)对四组数据进行统计,获得如图所示的散点图,关于其相关系数的关系,正确的有( )
A. B. C. D.
【答案】AC
【分析】由散点图结合相关系数定义可得答案.
【详解】由图形特征可知,都是负相关,都是负数,比的相关系数绝对值更大,所以,,都是正相关,比的相关关系更强,所以.
故选:AC
知识点02 线性回归
1、线性回归
线性回归是研究不具备确定的函数关系的两个变量之间的关系(相关关系)的方法.
对于一组具有线性相关关系的数据(x1,y1),(x2,y2),…,(xn,yn),其回归方程的求法为
其中,,,(,)称为样本点的中心.
2、残差分析
对于预报变量,通过观测得到的数据称为观测值,通过回归方程得到的称为预测值,观测值减去预测值等于残差,称为相应于点的残差,即有.残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果以及判断原始数据中是否存在可疑数据等,这方面工作称为残差分析.
(1)残差图
通过残差分析,残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,其中这样的带状区域的宽度越窄,说明模型拟合精确度越高;反之,不合适.
(2)通过残差平方和分析,如果残差平方和越小,则说明选用的模型的拟合效果越好;反之,不合适.
(3)相关指数
用相关指数来刻画回归的效果,其计算公式是:.
越接近于,说明残差的平方和越小,也表示回归的效果越好.
【即学即练】
1.下列命题错误的是( )
A.两个随机变量的线性相关性越强,相关系数的绝对值越接近于1
B.设,且,则
C.线性回归直线一定经过样本点的中心
D.在残差图中,残差点分布的带状区域的宽带越狭窄,其模型拟合的精度越高
【答案】B
【分析】利用相关关系判断A;由正态分布的性质判断B;由线性回归直线的性质判断C;由残差的性质判断D.
【详解】对于A,根据相关系数的意义可知,A正确;
对于B,由,知,即概率密度函数的图像关于直线对称,所以,则,故B错误;
对于C,根据线性回归直线的性质可知,C正确;
对于D,根据残差图的意义可知, D正确;
2.随着互联网行业、传统行业和实体经济的融合不断加深,互联网对社会经济发展的推动效果日益显著,某大型超市计划在不同的线上销售平台开设网店,为确定开设网店的数量,该超市在对网络上相关店铺做了充分的调查后,得到下列信息,如图所示(其中表示开设网店数量,表示这个分店的年销售额总和),现已知,求解下列问题;
(1)经判断,可利用线性回归模型拟合与的关系,求解关于的回归方程;
(2)按照经验,超市每年在网上销售获得的总利润(单位:万元)满足,请根据(1)中的线性回归方程,估算该超市在网上开设多少分店时,才能使得总利润最大.
参考公式;线性回归方程,其中
【答案】(1);(2)开设8或9个分店时,才能使得总利润最大.
【分析】(1)先求得,再根据提供的数据求得,,写出回归直线方程;
(2)由(1)结合,得到,再利用二次函数的性质求解.
【详解】(1)由题意得,
所以.
(2)由(1)知,,
所以当或时能获得总利润最大.
知识点03 非线性回归
解答非线性拟合问题,要先根据散点图选择合适的函数类型,设出回归方程,通过换元将陌生的非线性回归方程化归转化为我们熟悉的线性回归方程.
求出样本数据换元后的值,然后根据线性回归方程的计算方法计算变换后的线性回归方程系数,还原后即可求出非线性回归方程,再利用回归方程进行预报预测,注意计算要细心,避免计算错误.
1、建立非线性回归模型的基本步骤:
(1)确定研究对象,明确哪个是解释变量,哪个是预报变量;
(2)画出确定好的解释变量和预报变量的散点图,观察它们之间的关系(是否存在非线性关系);
(3)由经验确定非线性回归方程的类型(如我们观察到数据呈非线性关系,一般选用反比例函数、二次函数、指数函数、对数函数、幂函数模型等);
(4)通过换元,将非线性回归方程模型转化为线性回归方程模型;
(5)按照公式计算线性回归方程中的参数(如最小二乘法),得到线性回归方程;
(6)消去新元,得到非线性回归方程;
(7)得出结果后分析残差图是否有异常.若存在异常,则检查数据是否有误,或模型是否合适等.
常见的非线性回归模型
(1)指数函数型(且,)
两边取自然对数,,即,
令,原方程变为,然后按线性回归模型求出,.
(2)对数函数型
令,原方程变为,然后按线性回归模型求出,.
(3)幂函数型
两边取常用对数,,即,
令,原方程变为,然后按线性回归模型求出,.
(4)二次函数型
令,原方程变为,然后按线性回归模型求出,.
(5)反比例函数型型
令,原方程变为,然后按线性回归模型求出,.
【即学即练】
1.某池塘中水生植物的覆盖水塘面积(单位:)与水生植物的株数(单位:株)之间的相关关系,收集了4组数据,用模型去拟合与的关系,设,与的数据如表格所示:
3
4
6
7
2.5
3
4
5.9
得到与的线性回归方程,则 .
【答案】
【分析】根据已知求得,,进而代入回归方程可求得,从而得出.然后代入,根据指对互化,即可得出答案.
【详解】由已知可得,,,
所以,有,解得,
所以.
由,得,
所以,
所以.
故答案为:.
2.某生产制造企业统计了近10年的年利润(千万元)与每年投入的某种材料费用(十万元)的相关数据,作出如下散点图:
选取函数作为每年该材料费用和年利润的回归模型.若令,则,得到相关数据如表所示:
31.5
15
15
49.5
(1)求出与的回归方程;
(2)计划明年年利润额突破1亿,则该种材料应至少投入多少费用?(结果保留到万元)参考数据:.
【答案】(1)
(2)498万元
【分析】(1)由表中数据代入最小二乘法公式计算即可;
(2)按照(1)中所求回归方程,结合参考数据,代入计算即可.
【详解】(1)因为
由表中数据得,
所以,所以,
所以年该材料费用和年利润额的回归方程为;
(2)令,得,
所以(十万),
故下一年应至少投入498万元该材料费用.
知识点04 独立性检验
1、分类变量和列联表
(1)分类变量:
变量的不同“值”表示个体所属的不同类别,像这样的变量称为分类变量.
(2)列联表:
①定义:列出的两个分类变量的频数表称为列联表.
②2×2列联表.
一般地,假设有两个分类变量X和Y,它们的取值分别为{x1,x2}和{y1,y2},其样本频数列联表(称为2×2列联表)为
总计
总计
从列表中,依据与的值可直观得出结论:两个变量是否有关系.
2、等高条形图
(1)等高条形图和表格相比,更能直观地反映出两个分类变量间是否相互影响,常用等高条形图表示列联表数据的频率特征.
(2)观察等高条形图发现与相差很大,就判断两个分类变量之间有关系.
3、独立性检验
(1)定义:利用独立性假设、随机变量来确定是否有一定把握认为“两个分类变量有关系”的方法称为两个分类变量的独立性检验.
(2)公式:,其中为样本容量.
(3)独立性检验的具体步骤如下:
①计算随机变量的观测值,查下表确定临界值:
0.5
0.40
0.25
0.15
0.10
0.05
0.025
0.010
0.005
0.001
0.455
0.708
1.323
2.072
2.706
3.841
5.024
6.635
7.879
10.828
②如果,就推断“与有关系”,这种推断犯错误的概率不超过;否则,就认为在犯错误的概率不超过的前提下不能推断“与有关系”.
(2)两个分类变量和是否有关系的判断标准:
统计学研究表明:
当时,认为与无关;
当时,有的把握说与有关;
当时,有的把握说与有关;
当时,有的把握说与有关.
【即学即练】
1.某中学对学生钻研奥数课程的情况进行调查,将每周独立钻研奥数课程超过6小时的学生称为“奥数迷”,否则称为“非奥数迷”,从调查结果中随机抽取100人进行分析,得到数据如表所示:
奥数迷
非奥数迷
总计
男
24
36
60
女
12
28
40
总计
36
64
100
0.1
0.05
0.01
0.001
2.706
3.841
6.635
10.828
(1)对照列联表,根据小概率的独立性检验,是否为“奥数迷”与性别有关?
(2)现从抽取的“奥数迷”中,按性别采用分层抽样的方法抽取3人参加奥数闯关比赛,已知其中男、女学生独立闯关成功的概率分别为,在恰有两人闯关成功的条件下,求两人性别相同的概率.
参考数据与公式:,其中.
【答案】(1)没有90%的把握认为是否为“奥数迷”与性别有关.
(2)
【分析】(1)作零假设,根据表中数据计算得并与作比较,然后得到结论;
(2)由分层抽样得到抽取的男生和女生的人数,记“恰有两人闯关成功”为事件,“没有女生闯关成功”为事件,分别求出则,,由条件概率公式求得. .
【详解】(1)零假设:“奥数迷”与性别无关
根据表中数据计算得
根据小概率的独立性检验,没有充分的证据推断不成立,因此可以认为“奥数迷”与性别无关.
没有90%的把握认为是否为“奥数迷”与性别有关.
(2)根据分层抽样,抽取的男生人数为2人,女生人数为1人,
记“恰有两人闯关成功”为事件,“没有女生闯关成功”为事件,
则,
.
由条件概率的公式得,
故在恰有两人闯关成功的条件下,两人性别相同的概率为
2.近年来,某公司以电影和动漫中的一些元素为主题,开发了一些豪车模型玩具,现抽取了部分孩童,调查他们是否喜爱豪车模型,所得数据统计如下表所示.
性别
男孩
女孩
喜欢豪车模型
340
160
不喜欢豪车模型
300
200
(1)现按照性别进行分层,用分层随机抽样的方法在不喜欢豪车模型的样本孩童中随机抽取10人,再从这10人中随机抽取3人,求至少1人是女孩的概率;
(2)根据的独立性检验,能否认为是否喜欢豪车模型与性别具有相关性.
附:.
0.05
0.01
0.001
3.841
6.635
10.828
【答案】(1)
(2)不能认为是否喜欢豪车模型与性别具有相关性
【分析】(1)根据对立事件的概率及古典概型求解;
(2)计算,与对应临界值比较即可得出结论.
【详解】(1)抽取的10人中,男孩有6人,女孩有4人,
故至少有1人是女孩的概率为.
(2)零假设:是否喜欢豪车模型与性别无关,
则
故不能拒绝零假设,即根据的独立性检验,不能认为是否喜欢豪车模型与性别具有相关性.
题型01 变量间的相关关系
【典例1】某无人机的研发费用x(单位:万元)与销售量y(单位:万件)之间的对应数据如表所示:
研发费用x
3.4
4.7
5
5.6
6.3
销售量y
15
16.9
19.2
18
20.9
根据表中数据可得经验回归方程为,则第三个样本点对应的残差为 .
【答案】1.2
【分析】由表格中的数据,根据平均数求得样本中心,代入回归方程可得参数的值,代入第三个样本点的值,集合残差的定义,可得答案.
【详解】由已知,得,,
所以,于是,
当时,,
因此,第三个样本点对应的残差为.
故答案为:.
【典例2】某产品的广告费用与销售额的统计数据如表:
广告费用(万元)
2
3
4
5
6
销售额(万元)
19
25
34
38
44
根据上表可得回归直线方程为,下列说法正确的是( )
A.回归直线必经过样本点(4,34)
B.样本数据中,销售额的第70百分位数是36
C.
D.据此模型估计广告费用为7万元时销售额为万元
【答案】CD
【分析】首先计算广告费用 和销售额 的平均值,代入回归直线方程求得,接下来分析各个选项即可.
【详解】 的平均值:; 的平均值:.
回归直线方程 必经过点 ,即 .
代入方程得到:,解得:,
选项A:错误,因为回归直线经过的是 ;
选项B:销售额数据从小到大排列为19, 25, 34, 38, 44,第70百分位数的位置为 ,向上取整到第4个数据38,因此选项B错误;
选项C:正确,计算结果为6.8;
选项D:代入回归方程 ,正确.
故选:CD.
若相应于变量的取值,变量的观测值为,则变量与的相关系数,通常用来衡量与之间的线性关系的强弱,的范围为.
(1)当时,表示两个变量正相关;当时,表示两个变量负相关.
(2)越接近,表示两个变量的线性相关性越强;越接近,表示两个变量间几乎不存在线性相关关系.当时,所有数据点都在一条直线上.
(3)通常当时,认为两个变量具有很强的线性相关关系.
【变式1】以下是标号分别为①,②,③的三幅散点图,它们的样本相关系数分别为,那么相关系数的大小关系为 .(按由小到大的顺序排列).
【答案】
【分析】根据给定的散点图,结合相关性强弱及正负相关求得大小关系.
【详解】图①散点线性相关关系较弱,接近于0;
图②散点数据负相关,且线性相关程度很强,接近于;
图③散点数据正相关,且线性相关程度较强,接近于1,
所以相关系数的大小关系为.
故答案为:
【变式2】某医学科研所对人体脂肪含量与年龄这两个变量研究得到一组随机样本数据,运用Excel软件计算得(为人的年龄,为人体脂肪含量).对年龄为37岁的人来说,下面说法正确的是( )
A.年龄为岁的人体内脂肪含量一定为
B.年龄为岁的人体内脂肪含量约为
C.年龄为岁的人群中的体内脂肪含量平均为
D.年龄为岁的人群中的大部分人的体内脂肪含量约为
【答案】C
【分析】根据回归直线的定义,结合所给函数即可得出结论.
【详解】由题意,
在中,当时,,
表示的是年龄为37岁的人群中体内脂肪含量平均为,
故选:C.
【变式3】观察下列散点图,其中两个变量的相关关系判断一定正确的是( )
A.图1中y与x呈正相关
B.图2中y与x不相关
C.图3中y与x的线性相关系数小于0
D.图1中y与x的线性相关系数小于图2中y与x的线性相关系数
【答案】D
【分析】根据给定的散点图,利用正负相关的意义、相关系数的意义逐项判断.
【详解】对于A,图1中随增大而减小, y与x呈负相关,A错误;
对于B,图2中各点较分散,y与x的相关性不强,不能肯定不相关,B错误;
对于C,图3中随增大而增大,y与x呈正相关,相关系数大于0,C错误;
对于D,图1与图2,y与x都呈负相关,相关系数为负,
而图1中y与x的线性相关性较图2中y与x的线性相关性强,
所以,图1中y与x的线性相关系数小于图2中y与x的线性相关系数,D正确.
故选:D
题型02 线性回归
【典例1】有一种速度叫中国速度,有一种骄傲叫中国高铁.中国高铁经过十几年的发展,取得了举世瞩目的成就,使我国完成了从较落后向先进铁路国的跨越式转变.中国的高铁技术不但越来越成熟,而且还走向国外,帮助不少国家修建了高铁.高铁可以说是中国一张行走的名片.截至到2020年,中国高铁运营里程已经达到3.9万公里.下表是2013年至2020年中国高铁每年的运营里程统计表,它反映了中国高铁近几年的飞速发展:
年份
2013
2014
2015
2016
2017
2018
2019
2020
年份代码
1
2
3
4
5
6
7
8
运营里程万公里
1.3
1.6
1.9
2.2
2.5
2.9
3.5
3.9
根据以上数据,回答下面问题.
(1)甲同学用曲线y=bx+a来拟合,并算得相关系数r1=0.97,乙同学用曲线y=cedx来拟合,并算得转化为线性回归方程所对应的相关系数r2=0.99,试问哪一个更适合作为y关于x的回归方程类型,并说明理由;
(2)根据(1)的判断结果及表中数据,求y关于x的回归方程(系数精确到0.01).
参考公式:用最小二乘法求线性回归方程的系数公式:;参考数据:令
【答案】(1)答案见解析;(2).
【分析】(1)比较已知的相关系数大小关系即可得出正确答案;(2)由已知数据求出,结合回归方程变形为,求出和,从而可求出回归方程.
【详解】解:(1)∵,∴更适合作为y关于x的回归方程类型.
(2),由得,
即,则,
,所以.
【典例2】某机构为了解某大学中男生的体重单位:)与身高x(单位:)是否存在较好的线性关系,该机构搜集了7位该校男生的数据,得到如下表格:
序号
1
2
3
4
5
6
7
身高()
161
175
169
178
173
168
180
体重()
52
62
54
70
66
57
73
根据表中数据计算得到关于的线性同归方程为
(1)求
(2)已知且当时,回归方程的拟合效果非常好;当时,回归方程的拟合效果良好.试问该线性回归方程的拟合效果是非常好还是良好?说明你的理由.参考数据:
【答案】(1);(2)该线性回归方程的拟合效果是良好,理由见解析.
【分析】(1)先求,代入回归方程即可求得;
(2)先根据题意求出,根据参数范围进行判断即可.
【详解】解析:(1)∵
将(172,62)代入回归方程得:
∴
(2)
y关于x的线性同归方程为
∴
∴
故该线性回归方程的拟合效果是良好.
对于一组具有线性相关关系的数据(x1,y1),(x2,y2),…,(xn,yn),其回归方程的求法为
其中,,,(,)称为样本点的中心.
【变式1】给出下列命题,其中正确命题为( )
A.投掷一枚均匀的硬币和均匀的骰子(形状为正方体,六个面分别标有数字1,2,3,4,5,6)各一次,记硬币正面向上为事件A,骰子向上的点数是2为事件B,则事件A和事件B同时发生的概率为
B.以模型去拟合一组数据时,为了求出回归方程,设,将其变换后得到线性方程,则,的值分别是和
C.随机变量服从正态分布,,则
D.某选手射击三次,每次击中目标的概率均为,且每次射击都是相互独立的,则该选手至少击中2次的概率为
【答案】ABD
【解析】分别计算事件A和事件B的概率可判断A;根据对数的运算性质可判断B;根据正态分布的性质可判断C; 计算该选手击中2次的概率和3次都击中的概率可判断D.
【详解】对于A,事件A的概率为,事件B的概率为,则事件A和事件B同时发生的概率为,故A正确;
对于B,因为,所以两边取对数得,令,可得,因为,所以,所以,故B正确;
对于C, 随机变量服从正态分布,所以正态曲线关于对称,则,故C错误;
对于D,由题意得,该选手1次未击中, 2次击中的概率为,3次都击中的概率,则至少击中2次的概率为,故D正确.
故选:ABD.
【变式2】关于变量x,y的n个样本点及其线性回归方程.下列说法正确的有( )
A.相关系数r的绝对值|r|越接近0,表示x,y的线性相关程度越强
B.相关指数的值越接近1,表示线性回归方程拟合效果越好
C.残差平方和越大,表示线性回归方程拟合效果越好
D.若,则点一定在线性回归方程上
【答案】BD
【解析】根据回归分析的相关知识,逐一分析四个选项的正误即可.相关系数的绝对值越接近0,线性相关度越弱.相关指数表示拟合效果的好坏,指数越大,拟合程度越好.残差平方和越小,拟合程度越好.线性回归方程一定过样本中心点.
【详解】根据线性相关系数的意义可知,当的绝对值越接近于0时,
两个随机变量线性相关性越弱,则A错误;
用相关指数来刻画回归效果,
越大,说明模型的拟合效果越好,则B正确;
拟合效果的好坏是由残差平方和来体现的,
残差平方和越大,拟合效果越差,则C错误;
样本中心点一定在回归直线上,则D正确.
故选:BD.
【变式3】下列说法中正确的是( )
A.对于独立性检验,的值越大,说明两事件的相关程度越大
B.以模型去拟合一组数据时,为了求出回归方程,设,将其变换后得到线性方程,则的值分别是和0.3
C.在具有线性相关关系的两个变量的统计数据所得的回归直线方程中,,则
D.通过回归直线及回归系数,可以精确反映变量的取值和变化趋势
【答案】ABC
【解析】根据独立性检验、非线性回归方程以及回归直线方程相关知识进行判断.
【详解】对于,根据独立性检验的性质知,的值越大,说明两个事件的相关程度越大,故A正确;
对于,由,两边取自然对数,可得,
,则,因为,所以则故B正确;
对于,由于回归直线过点,故C正确;
对于,通过回归直线及回归系数,可预测变量的取值和变化趋势,故D错误.
故选:ABC.
题型03 非线性回归
【典例1】对具有相关关系的两个变量x和y进行回归分析时,经过随机抽样获得成对的样本点数据,则下列结论正确的是( )
A.若两变量x,y具有线性相关关系,则回归直线至少经过一个样本点
B.若两变量x,y具有线性相关关系,则回归直线一定经过样本点中心
C.若以模型拟合该组数据,为了求出回归方程,设,将其变换后得到线性方程,则a,h的估计值分别是3和6
D.回归分析中常用残差平方和来刻画拟合效果好坏,残差平方和越小,拟合效果越好
【答案】BCD
【分析】根据回归方程的性质判断A,B,比较列方程确定a,h的估计值判断C,根据残差和的意义判断D.
【详解】对于A,若两变量x,y具有线性相关关系,则所有样本点都可能不在回归直线上,A错误;
对于B,若两变量x,y具有线性相关关系,则回归直线一定经过样本点中心,B正确;
对于C,因为,所以,即,又,所以a,h的估计值分别是3和6,C正确;
对于D,残差平方和越小,拟合效果越好,D正确;
故选:BCD.
【典例2】云计算是信息技术发展的集中体现,近年来,我国云计算市场规模持续增长.已知某科技公司2018年至2022年云计算市场规模数据,且市场规模y与年份代码x的关系可以用模型(其中e为自然对数的底数)拟合,设,得到数据统计表如下:
年份
2018年
2019年
2020年
2021年
2022年
年份代码x
1
2
3
4
5
云计算市场规模y/千万元
7.4
11
20
36.6
66.7
2
2.4
3
3.6
4
由上表可得经验回归方程,则2025年该科技公司云计算市场规模y的估计值为( )
A. B. C. D.
【答案】B
【分析】根据可得线性回归方程,再由回归方程求出2025年的预测值,代入即可得解.
【详解】因为,
所以,
即经验回归方程,
当时,,
所以,
即2025年该科技公司云计算市场规模y的估计值为,
故选:B
常见的非线性回归模型
(1)指数函数型(且,)
两边取自然对数,,即,
令,原方程变为,然后按线性回归模型求出,.
(2)对数函数型
令,原方程变为,然后按线性回归模型求出,.
(3)幂函数型
两边取常用对数,,即,
令,原方程变为,然后按线性回归模型求出,.
【变式1】秋天的第一杯奶茶是一个网络词汇,最早出自四川达州一位当地民警之口,民警用“秋天的第一杯奶茶”顺利救下一名女孩,由此而火爆全网.后来很多人开始在秋天里买一杯奶茶送给自己在意的人.某奶茶店主记录了入秋后前7天每天售出的奶茶数量(单位:杯)
如下:
日期
第一天
第二天
第三天
第四天
第五天
第六天
第七天
日期代码
1
2
3
4
5
6
7
杯数
4
15
22
26
29
31
32
(1)请根据以上数据,绘制散点图,并根据散点图判断,与哪一个更适宜作为y关于x的回归方程模型(给出判断即可,不必说明理由);
(2)建立y关于x的回归方程(结果保留1位小数),并根据建立的回归方程,试预测要到哪一天售出的奶茶才能超过35杯?
(3)若每天售出至少25杯即可盈利,则从第一天至第七天中任选三天,记随机变量X表示盈利的天数,求随机变量X的分布列.
参考公式和数据:其中
回归直线方程中,
22.7
1.2
759
235.1
13.2
8.2
【答案】(1)图见解析,更适宜作为关于的回归方程模型;
(2),到第9天才能超过35杯;
(3)分布列见解析.
【分析】(1)根据散点图趋势即可判断;
(2)利用非线性回归方程转化为线性回归方程的方法求解;
(3)根据超几何分布求分布列.
【详解】(1)
根据散点图,知更适宜作为关于的回归方程模型;
(2)令,则,
由已知数据得,
,
所以,
故关于的回归方程为,
进而由题意知,令,整理得,即,
故当时,即到第9天才能超过35杯;
(3)由题意知,这7天中销售超过25杯的有4天,则随机变量的可能取值为
,,
,,
则随机变量的分布列为
0
1
2
3
【变式2】某电商平台统计了近七年小家电的年度广告费支出(万元)与年度销售量(万台)的数据,如表所示:
年份
2016
2017
2018
2019
2020
2021
2022
广告费支出
1
2
4
6
11
13
19
销售量
1.9
3.2
4.0
4.4
5.2
5.3
5.4
其中,
(1)若用线性回归模型拟合与的关系,求出关于的线性回归方程;
(2)若用模型拟合得到的回归方程为,经计算线性回归模型及该模型的分别为0.75和0.88,请根据的数值选择更好的回归模型拟合与的关系,进而计算出年度广告费为何值时,利润的预报值最大?
参考公式:,;
【答案】(1)
(2)选用回归方程更好,时,利润的预报值最大
【分析】(1)根据数据,利用公式即可求出线性回归方程;
(2)越大拟合效果越好,选用回归方程更好,从而计算出结果.
【详解】(1)由题意可得:
所以,
,
关于的线性回归方程:.
(2)因为,越大拟合效果越好,
选用回归方程更好,
,
即当时,时,利润的预报值.
【变式3】2020年初,新型冠状病毒(COVID-19)引起的肺炎疫情爆发以来,各地医疗机构采取了各种针对性的治疗方法,取得了不错的成效,某地开始使用中西医结合方法后,每周治愈的患者人数如下表所示:由表格可得关于的二次回归方程为,则此回归模型第4周的残差(实际值与预报值之差)为( )
周数
1
2
3
4
5
治愈人数
2
17
36
93
142
A.0 B.1 C.4 D.5
【答案】D
【分析】令,则关于的一次回归方程为,求出,根据线性回归方程过样本中心点求出,从而可求得预测值,即可得出残差.
【详解】令,则关于的一次回归方程为,
,
则,解得,
则,
令,得,
所以残差为.
故选:D.
题型04 独立性检验
【典例1】某地区为了检测某种农业有机肥料的效果,农业专家播撒肥料到200块试验田中,一段时间后测量土地的某项肥力指标,按分组,绘制成如下频率分布直方图.试验后发现,产生土地肥力的为160块,其中该项指标不小于60的有110块.假设各块试验田播撒肥料后是否产生肥力相互独立,并用频率估计概率.
(1)填写下面的2×2列联表,并根据列联表判断是否有95%的把握认为播撒肥料后试验田是否产生肥力与指标值有关;
指标值
指标值
产生肥力
未产生肥力
(2)为了检验有机肥第二次播撒的有效性,对第一次播撒有机肥后没有产生肥力的试验田进行第二次播撒,经计算发现同一块试验田在播撒两次有机肥后产生肥力的概率为0.9.记块土地播撒两次有机肥后产生肥力的数量为随机变量.试验后统计数据显示,当时,取得最大值,求参加播撒有机肥实验的块数及的数学期望.
附:.
0.15
0.10
0.050
0.010
0.001
2.072
2.706
3.841
6.635
10.828
【答案】(1)列联表见解析,有
(2)当时,;当时,.
【分析】(1)根据题意求出指标值和指标值的块数,完成列表,求出的值,即可得答案;
(2)根据题意列出不等式组,解得,再根据二项式分布公式求期望即可.
【详解】(1)解:在指标内的有块,
同理:内的有25块,内的有35块,内的有100块,
内的有30块,
指标值
指标值
产生肥力
50
110
未产生肥力
20
20
,
所以有的把握认为播撒肥料后试验田是否产生肥力与指标值有关.
(2)解:当时,
取得最大值,
所以,
解得.
因为,
所以当时,,
当时,.
所以当时,;当时,.
【典例2】某中草药主要是通过清热解毒、宣肺理气来调理机体的气机和阴阳平衡,从而改善症状,可以达到减轻病情、缓解症状、缩短病程的作用.为了了解该中草药预防流感的效果,抽样调查40人,得到如下数据:
患流感
未患流感
服用药
3
17
未服用药
9
11
若由此认为“该药物有效”,则该结论出错的概率不超过( )
A. B. C. D.
【答案】A
【分析】根据题意求出的值,即可得答案.
【详解】由题意知,,
由临界值表可知,认为“该药物有效”,
则该结论出错的概率不超过0.05.
故选:A.
一般地,假设有两个分类变量X和Y,它们的取值分别为{x1,x2}和{y1,y2},其样本频数列联表(称为2×2列联表)为
总计
总计
从列表中,依据与的值可直观得出结论:两个变量是否有关系.
公式:,其中为样本容量.
【变式1】下面命题中说法正确的是 .
①设两个变量之间的线性相关系数为,则越大,的相关性越强;
②等高堆积条形图可以直观的反映一对分类变量之间是否具有关联性;
③如果散点图的散点都落在一条直线上,则;
④正方形的面积与周长是相关关系.
【答案】①②③
【分析】由相关系数、等高堆积条形图和决定系数的性质判断①②③,由相关关系的定义判断④.
【详解】越大,的相关性越强,①正确;
与表格相比,等高堆积条形图可以展示列联表数据的频率特征,能够直观地反映出两个分类变量间是否相互影响,②正确;
若散点图的散点都落在一条直线上,残差平方和为0,,③正确;
正方形的面积与周长是函数关系,④错误.
故答案为:①②③.
【变式2】为了更好地开展多媒体化教学,杭州市某小学对“文理学科教师与喜欢用平板教学”是否有关做了一次研究调查,其中被调查的文科、理科教师人数相同,理科教师喜欢用平板教学的人数占理科教师总人数的80%,文科教师喜欢用平板教学的人数占文科教师总人数的40%,若有95%的把握认为是否喜欢用平板教学和文理学科有关,则调查人数中理科教师人数最少可能是( )
附:,其中.
0.05
0.010
3.841
6.635
A.8 B.12 C.15 D.20
【答案】C
【分析】利用独立性检验列联表及观测值可解得答案.
【详解】由题意被调查的文理科教师人数相同,设理科教师的人数为,由题意可列出列联表:
理科教师
文科教师
合计
喜欢用平板教学
不喜欢用平板教学
合计
.
由于有的把握认为是否喜欢用平板教学和文理学科有关,
所以,
解得,因为,
故的可能取值为:12,13,14,15,16,17,18,19,
即理科教师的人数可以是:12,13,14,15,16,17,18,19,且考虑到喜欢用平板的人数占理科教师总人数的,故人数为15人时,有实际意义.
故选:C
【变式3】我国力争2030年前实现碳达峰,2060年前实现碳中和,是党中央经过深思熟虑作出的重大战略决策,事关中华民族永续发展和构建人类命运共同体.新经济形势下,二氧化碳排放是影响企业效益的重要因素,为了研究节能专利技术对企业效益的影响,现随机抽取100家科技企业进行调查,得到如下数据:
经济效益较好
经济效益较差
合计
节能专利技术
52
29
81
非节能专利技术
8
11
19
合计
60
40
100
则认为节能专利技术有利于企业经济效益的把握为( )
附:,其中.
0.10
0.05
0.010
0.001
2.706
3.841
6.635
10.828
A. B. C. D.
【答案】A
【分析】根据的公式,求出其值,即可得答案.
【详解】解:因为,
故有的把握认为节能专利技术有利于企业经济效益.
故选:A.
题型05 误差分析
【典例1】某电商平台为了对某一产品进行合理定价,采用不同的单价在平台试销,得到的数据如下表所示:
单价x/元
8
8.5
9
9.5
10
销量y/万件
89
85
80
78
68
根据以上数据得到与具有较强的线性关系,若用最小二乘估计得到经验回归方程为,则( )
A.相关系数 B.点一定在经验回归直线上
C. D.时,对应销量的残差为
【答案】BC
【分析】根据平均数计算样本中心,即可判断B,根据负相关即可判断A,根据样本中心在直线上即可求解C,根据残差的计算即可判断D.
【详解】由表中数据可得,
所以样本中心为,故在经验回归直线上,B正确,
由可得与具负相关,故A错误,
将代入可得,解得,C正确,
当时,,所以残差为,D错误,
故选:BC
【典例2】某学校一同学研究温差(单位:℃)与本校当天新增感冒人数(单位:人)的关系,该同学记录了5天的数据:
5
6
8
9
12
16
20
25
28
36
由上表中数据求得温差与新增感冒人数满足经验回归方程,则下列结论不正确的是( )
A.与有正相关关系 B.经验回归直线经过点
C. D.时,残差为0.2
【答案】C
【分析】根据和的变化规律,即可判断A;计算,即可判断B;将样本点中心代入回归直线方程,即可求,即可判断C;根据回归直线方程计算时的,计算,即可判断D.
【详解】由表格可知,越大,越大,所以与有正相关关系,故A正确;
,,
样本点中心为,经验回归直线经过点,故B正确;
将样本点中心代入直线方程,得,所以,故C错误;
,当 时,,,故D正确.
故选:C
类型1:回归分析中的误差(最核心,必掌握)
1. 残差(最基础误差)
定义:单个数据误差=观测值yᵢ - 预报值ŷᵢ
分析技巧:残差绝对值越小,拟合越准;残差图无规律(随机分布在0附近)→无系统误差,拟合优;残差成带状/递增/递减→模型选错(非线当成线性)
2. 系统误差(整体偏差,影响大)
来源:模型不当(非线性用线性回归)、数据测量工具偏差(如秤不准)、试验流程固定缺陷
特点:误差整体偏高/偏低,有规律,可修正(换模型、校准工具)
解题话术:因选用线性模型拟合非线性成对数据,导致整体预报值偏离观测值,存在系统性误差,需更换非线性模型
3. 随机误差(不可避免)
来源:偶然因素(测量时环境波动、读数偏差)
特点:无固定偏向,时大时小,不可消除,可减小(多次测量取平均、增大样本量)
类型2:抽样&测量导致的误差(成对数据源头误差)
1. 抽样误差:成对样本不具代表性(如选10个极端值做身高&体重分析)
解题话术:样本选取片面,未覆盖总体各类情况,成对数据缺乏代表性,导致分析结果偏离总体真实关联
2. 测量误差:成对数据收集时,某一组/两组数据测量不准(如测体重时秤始终多1kg)
特点:若一组数据整体偏差,会导致回归直线平移/倾斜,影响b和a的准确性
【变式1】下列有关回归分析的结论中,正确的有( )
A.若回归方程为,则变量y与x负相关
B.运用最小二乘法求得的经验回归直线一定经过样本点的中心
C.若决定系数的值越接近于1,表示回归模型的拟合效果越好
D.若散点图中所有点都在直线上,则相关系数
【答案】ABC
【分析】根据统计案例相关知识逐项分析判断.
【详解】对于选项A:因为回归方程为,可知,
所以变量y与x负相关,故A正确;
对于选项B:由线性回归方程的性质可知:回归直线一定经过样本点的中心,故B正确;
对于选项C:决定系数的值越接近于1,表示回归模型的拟合效果越好,故C正确;
对于选项D:散点图中所有点都在直线上,则,
且,所以变量y与x正相关,即,可知,故D错误.
故选:ABC.
【变式2】2023年入冬以来,流感高发,某医院统计了一周中连续5天的流感就诊人数y与第天的数据如表所示.
x
1
2
3
4
5
y
21
10a
15a
90
109
根据表中数据可知x,y具有较强的线性相关关系,其经验回归方程为,则( )
A.样本相关系数在内 B.当时,残差为-2
C.点一定在经验回归直线上 D.第6天到该医院就诊人数的预测值为130
【答案】AD
【分析】x,y具有较强的正相关关系,可判断相关系数的范围,判断A;计算x,y的平均值,代入回归直线方程求出a的值,即可求出时的预测值,求得残差,判断B;看是否适合回归直线方程,判断C;将代入回归直线方程,求出预测值,判断D.
【详解】由题意可知x,y具有较强的正相关关系,故样本相关系数在内,A正确;
根据题意得,
故,解得,
故当时,,残差为,B错误;
点即点,当时,,
即点不在经验回归直线上,C错误;
当时,,即第6天到该医院就诊人数的预测值为130,D正确,
故选:AD
【变式3】混凝土的抗压强度x较容易测定,而抗剪强度y不易测定,工程中希望建立一种能由x推算y的经验公式,下表列出了现有的9对数据,分别为,,…,.
x
141
152
168
182
195
204
223
254
277
y
23.1
24.2
27.2
27.8
28.7
31.4
32.5
34.8
36.2
以成对数据的抗压强度x为横坐标,抗剪强度y为纵坐标作出散点图,如图所示.
(1)从上表中任选2个成对数据,求该样本量为2的样本相关系数r.结合r值分析,由简单随机抽样得到的成对样本数据的样本相关系数是否一定能确切地反映变量之间的线性相关关系?
(2)根据散点图,我们选择两种不同的函数模型作为回归曲线,根据一元线性回归模型及最小二乘法,得到经验回归方程分别为:①,②.经验回归方程①和②的残差计算公式分别为,,.
(ⅰ)求;
(ⅱ)经计算得经验回归方程①和②的残差平方和分别为,,经验回归方程①的决定系数,求经验回归方程②的决定系数.
附:相关系数,决定系数,.
【答案】(1),答案见解析
(2)(ⅰ)0;(ⅱ)0.9847
【分析】(1)根据相关系数的计算公式即可求解,由相关系数的定义结合统计学知识即可求解,
(2)根据残差公式以及决定系数的计算公式即可求解.
【详解】(1)不妨设选择的成对数据分别为,,则
.又由表格数据得,当时,,则.
因为任意两个样本点都在一条直线上,则样本量为2的样本相关系数绝对值都是1(在样本相关系数存在的情况下),显然据此推断两个变量完全线性相关是不合理的.
样本相关系数可以反映变量之间相关的正负性及线性相关的程度,但由于样本数据的随机性,样本相关系数往往不能确切地反映变量之间的相关关系.一般来说,样本量越大,根据样本相关系数推新变量之间相关的正负性及线性相关的程度越可靠,而样本量越小,则越不可靠.
(2)(ⅰ)(直线经过数据的中心).
(ⅱ)∵,∴,
则,
越大,越接近于1,则模型的拟合效果越好,因此经验回归方程②的拟合效果更好,为最优模型.
1.现调查某地区某种野生动物的数量,将该地区分成面积相近的100个地块,从这些地块中用简单随机抽样的方法抽取10个作为样本,调查得到样本数据,其中分别表示第个样本的植物覆盖面积(单位:公顷)和这种野生动物的数量,分别表示这10个样本的植物覆盖面积和这种野生动物的数量的平均值,构造向量,并计算得,由选择性必修第一册教材中的知识,我们知道对数据的相关系数,则上述数据的相关系数 .
【答案】0.96/
【分析】计算出,故.
【详解】,故,
,
.
故答案为:0.96
2.对于x,y两个变量,有四组样本数据,分别算出它们的线性相关系数r(如下):,0.72,,0.85,则正相关的变量x,y所对应的线性相关系数是( )
A. B.0.72 C. D.0.85
【答案】BD
【分析】根据线性相关性的特征和线性相关系数的概念意义可解.
【详解】若线性相关系数是正数,则变量x,y正相关.
所以0.72,0.85符合题意,
故选:
3.对四组数据进行统计,获得以下散点图,关于其相关系数的比较,正确的是( )
A. B.
C. D.
【答案】A
【分析】由相关系数的意义结合散点图即可求解.
【详解】由图可知都是正线性相关关系,都是负线性相关关系,且相关性更强,
所以.
故选:A
4.高质量发展是全面建设社会主义现代化国家的首要任务,创新研发是高质量发展的重要前提.某公司研发新产品的投入(单位:百万元)与该产品的收益(单位:百万元)的5组统计数据如下表所示,且经验回归方程为.
x
5
6
8
9
12
y
16
20
25
28
(1)求的值;
(2)若将图表中的点去掉,判断样本相关系数是否改变,并说明你的理由.
参考数据:样本相关系数
【答案】(1);
(2)不变,理由见解析.
【分析】(1)首先求出样本中心,再由样本中心在回归直线上求参数值;
(2)根据所去掉的点,结合相关系数公式判断分子、分母各部分的值是否有变化,即可得结论.
【详解】(1)由题设,,
所以,可得;
(2)由(1)知,,故去掉点后样本中心仍然是,
去掉点前,
去掉点后,
显然前后数值没有改变,同理,的值都没有变化,
所以相关系数不变.
5.已知高中学生的数学成绩,物理成绩,化学成绩两两成正相关关系,随机抽取10名同学,数学成绩和物理成绩的样本线性相关系数为,物理成绩与化学成绩的样本线性相关系数为,求的样本线性相关系数的最大值为 .
(附:相关系数
【答案】
【分析】利用相关系数公式可看成两个维向量的夹角公式,从而把相关系数问题转化为向量夹角问题,即可求解.
【详解】设,
则有,
由相关系数公式得,
设与夹角为与夹角为,
由的样本相关系数为,的样本相关系数为,所以,
由这两个夹角均为锐角且,所以与夹角的可能性是,
则与夹角余弦值的最大值为,此时与样本相关系数最大,
即,
所以的样本线性相关系数的最大值为.
故答案为:.
6.对相关系数,给出下列结论:①越大,线性相关程度越强;②若所有样本点都在直线上,则;③越大,线性相关程度越弱,越接近,线性相关程度越强;④且越接近,线性相关程度越强,越接近,线性相关程度越弱,
其中说法正确的是 填序号
【答案】④
【分析】根据相关系数的性质依次判断即可.
【详解】相关系数可以衡量两个变量之间的相关关系的强弱时,
而,当越接近于,表示两个变量的线性相关性越强,
越接近于时,表示两个变量之间几乎不存在相关关系,
故①③错误,④正确;
若所有样本点都在直线上,则,故②错误.
故综上所述,④正确.
故答案为:④.
7.在某生态系统中,研究人员发现两种生物近期的数量线性相关,且相关系数为0.75,这说明( )
A.一种生物的数量增长时,另一种生物的数量会减少
B.一种生物的数量增长时,另一种生物的数量也增长
C.两种生物的数量增减性有相同的趋势
D.两种生物的数量增减性有相反的趋势
【答案】C
【分析】根据给定的相关系数,易知有正相关且增减性有相同趋势,即可得.
【详解】因为两种生物近期的数量数据相关系数为0.75,
所以两种生物的数量正相关,故两种生物的数量增减性有相同的趋势.
故选:C
8.某校研究学生每周自习时间(小时)与数学成绩(分)的关系,计算得相关系数,并建立线性回归模型,得到决定系数.对残差进行分析时,发现残差与预测值的散点图(是以预测值为横轴,残差为纵轴)呈现明显的先负后正的分布趋势,则( )
A.,说明该模型的拟合效果较差
B.残差平方和等于0.64
C.相关系数为负,说明自习时间与成绩无关
D.残差图显示模型可能不符合线性假设,建议改用非线性模型
【答案】AD
【分析】A 根据决定系数的意义可判断;B利用可判断;C 根据相关系数正负性的意义即可判断;D若符合线性模型,则残差与预测值的散点图应该在零周围随机分布从而可判断.
【详解】决定系数的取值范围在0到1之间,其值越接近1拟合效果越好,其值远小于1,故其拟合效果较差,故A正确;
因,则,但因未给出总平方和,故无从得知残差的平方和,故B错误;
相关系数为负,说明随着自习时间的增加,数学成绩有下降趋势,但不意味着它们无关,故C错误;
若符合线性模型,则残差与预测值的散点图应该在零周围随机分布,而残差与预测值的散点图呈现先负后正的分布趋势,这表明残差不是随机分布的,而是遵循某种模式,故不符合线性回归模型,因此建议改用非线性模型,故D正确.
故选:AD
9.某科技公司在人工智能领域逐年加大投入,根据近年来该公司对产品研发年投入额x(单位:百万元)与其年销售量y(单位:千件)的数据统计,得到散点图如图.用线性回归和指数型回归模型拟合y与x关系的决定系数分别为和,则根据参考数据,下列表达式中最适宜描述y与x之间关系的函数为( )
参考公式:用最小二乘法求经验回归直线方程的系数公式为.
参考数据:令
3
2.5
0.5
10
12
6
A. B. C. D.
【答案】D
【分析】根据给定条件,利用决定系数大小关系排除AB;再利用数表中数据求出斜率判断CD.
【详解】由用线性回归和指数型回归模型拟合y与x关系的决定系数分别为和,
得,则指数型回归模型最适宜拟合y与x关系,排除AB;
设y与x之间关系的函数为,两边取对数得,设,则,
因此,,
即,,C错误,D正确.
故选:D
10.某公司收集了某商品销售收入(单位:万元)与相应的广告支出(单位:万元)共10组数据,绘制出散点图,如图,并利用线性回归模型进行拟合.若将图中10个点中去掉点后再重新进行线性回归分析,则下列说法错误的是 .
①决定系数变小 ②残差平方和变小
③相关系数的值变小 ④自变量与因变量相关性变弱
【答案】①③④
【分析】回归效果越好,则决定系数越大,相关系数的绝对值越大,残差平方和越小.
【详解】从图中可以看出点较其他点,偏离直线远,故去掉点后,回归效果更好,
故决定系数会变大,更接近于1;残差平方和变小;
相关系数的绝对值,即会更接近于1,由图可得与正相关,故会更接近于1,即相关系数的值变大,自变量与因变量相关性变强,故①,③,④错误,②正确.
故答案为:①③④.
11.在某线性回归模型中,计算其决定系数,则下面说法正确的是( )
A.该经验回归方程的拟合效果较好 B.解释变量对于响应变量变化的贡献率约为
C.随机误差对响应变量的影响约占 D.有的样本点在经验回归直线上
【答案】ABC
【分析】首先明确决定系数的意义,决定系数越接近于1,表示回归的效果越好,即可判断A,表示解释变量对于响应变量变化的贡献率,即可判断B,表示随机误差对响应变量的影响,即可判断C.
【详解】对于A,接近1,所以该经验回归方程的拟合效果较好,选项A正确;
对于B,意味着解释变量对于响应变量变化的贡献率约为,选项B正确;
对于C,根据,所以随机误差对响应变量的影响约占,选项C正确;
对于D,绝大部分样本点分布在经验回归直线附近,但不一定有的样本点在经验回归直线上,选项D错误.
故选:ABC.
12.欲知作家性别对读者的性别影响,某出版社派工作人员到各书店随机调查了500位买书的顾客,结果如下表所示.
读者
作家
总计
男作家
女作家
男读者
142
122
264
女读者
103
133
236
总计
245
255
500
则在差错不超过0.05的前提下作者的性别与读者的性别 (填“有关”或“无关”).
0.100
0.050
0.025
0.010
0.001
2.706
3.841
5.024
6.635
10.828
【答案】有关
【分析】计算卡方值,判断跟临界值的关系,即可求得结果.
【详解】零假设:作者的性别与读者的性别无关,
,其中,
由公式得,
所以在犯错误的概率不超过0.05的前提下作者的性别与读者的性别有关.
故答案为:有关.
13.下列说法中正确的是( )
A.相关关系是一种不确定的关系,回归分析是对相关关系的分析,其意义在于对事件的发展趋势进行预测
B.独立性检验对分类变量关系的研究没有100%的把握,所以独立性检验研究的结果在实际中也没有多大的实际意义
C.相关关系可以对变量的发展趋势进行预报,这种预报可能会是错误的
D.独立性检验如果得出的结论有99%的可信度,就意味着这个结论一定是正确的
【答案】AC
【分析】根据独立性检验的意义和思想逐个分析判断即可
【详解】对于A,相关关系虽然是一种不确定关系,但是回归分析可以在某种程度上对变量的发展趋势进行预报,这种预报在尽量减小误差的条件下可以对生产与生活起到一定的指导作用,所以A正确,
对于B,独立性检验是对两个变量是否具有某种关系的一种检验,独立性检验研究的结果在实际中有统计意义,所以B错误,
对于C,相关关系可以对变量的发展趋势进行预报,这种预报可能会是错误的,所以C正确,
对于D,独立性检验依据的是小概率原理,不能100%确定两个变量之间是否具有某种关系,所以D错误,
故选:AC
14.某乡政府为提高当地农民的收入,指导农民种植药材,并取得了较好的效果.以下是某农户近5年种植药材的平均收入的统计数据:
年份
2018
2019
2020
2021
2022
年份代码
1
2
3
4
5
平均收入(千元)
59
61
64
68
73
(1)根据表中数据,现有与两种模型可以拟合与之间的关系,请分别求出两种模型的回归方程;(结果保留一位小数)
(2)统计学中常通过比较残差的平方和来比较两个模型的拟合效果,请根据残差平方和说明上述两个模型哪一个的拟合效果更好,并据此预测2030年该农户种植药材的平均收入.
参考数据:,,其中.
参考公式:经验回归方程中,,.
【答案】(1),;
(2)模型的拟合效果更好,15.98万元.
【分析】(1)根据表格数据,应用最小二乘法求两个不同模型的回归方程;
(2)由残差的定义求两个模型对应的残差并比较大小,即可得结论,再将代入模型估计2030年该农户种植药材的平均收入.
【详解】(1)由表格数据,得,,
所以,,
所以,.
设,则,易得,,
所以.
所以两种模型的回归方程分别为,.
(2)对于,其残差平方和为.
对于,其残差平方和为.
因为,所以模型的拟合效果更好.
当时,,故预测2030年该农户种植药材的平均收入为159.8千元,即15.98万元.
15.大气污染物(大气中直径小于或等于的颗粒物)的浓度超过一定的限度会影响人的身体健康.为了研究的浓度受车流量影响的程度,某校数学建模社团选择了学校附近5个监测点,统计每个监测点内的车流量(单位:千辆),同时在低空相同的高度测定每个监测点该时间段内的的平均浓度(单位:),得到的数据如表所示:
监测点编号
1
2
3
4
5
车流量(千辆)
1.3
1.2
1.6
1.0
0.9
的平均浓度
66
72
113
34
35
(1)建立关于的一元线性回归模型,并用样本相关系数加以说明(一般地,样本相关系数的绝对值在0.75以上(含0.75)认为线性相关性较强,否则认为线性相关性较弱);
(2)我国规定空气中的浓度安全标准为平均浓度为,该地为使平均浓度不超过,拟对车流量作适当控制,请你根据本题数据估计车流量控制的最大值.
参考公式:在经验回归方程中,,;
样本相关系数.
【答案】(1),与的线性相关性较强;
(2)1.24千辆.
【分析】(1)根据表格数据,应用最小二乘法求回归直线方程,由相关系数公式求相关系数并判断相关性强弱;
(2)由(1)所得的回归直线方程有,解不等式即可得答案.
【详解】(1)由表格数据,得,,
,
,
,
所以,,
所以.
样本相关系数.
因为,所以与的线性相关性较强.
(2)令,得,故估计车流量控制的最大值为1.24千辆.
76 / 76
学科网(北京)股份有限公司
学科网(北京)股份有限公司
$
第八章 成对数据的统计分析
教学目标
1. 理解成对数据的含义,会画散点图,能通过散点图直观判断两个变量的线性相关与非线性相关、正相关与负相关。
2. 掌握相关系数r的含义及计算,明确|r|越接近1线性相关越强,会根据r的符号判断相关方向,能利用相关系数定量刻画线性相关程度。
3. 掌握线性回归方程y=bx+a的求法,熟记b计算公式,知道样本中心点(x,y)必在回归直线上,能准确求解回归系数。
4. 理解残差、残差图的意义,会用残差分析回归模型的拟合效果;了解独立性检验的基本思想,会列2×2列联表,能计算统计量并判断变量关联性。
教学重难点
重点
1. 成对变量线性相关关系的判定:散点图直观判断+相关系数定量刻画,掌握正、负相关及线性相关强弱的判断方法。
2. 线性回归方程的求解与应用:熟练计算回归系数b和a,理解回归直线的意义,能利用方程进行简单预报。
3. 残差分析的应用:会计算残差、绘制残差图,能根据残差图判断回归模型的拟合效果。
4. 独立性检验的基本步骤:列联表构建、计算、临界值对比,能准确判断两个分类变量是否有关联。
难点
1. 相关系数r的意义理解:难以理解r的取值与线性相关程度的内在联系,易混淆“相关强”与“因果关系”。
2. 回归系数b的含义与计算:对b的统计意义(x每变1个单位,y的平均变化量)理解模糊,计算过程易出错。
3. 残差分析的本质理解:不会通过残差图规律判断模型缺陷,分不清残差误差、系统误差与随机误差的区别。
4. 统计结论的正确解读:易误将“线性相关”等同于“因果关系”,对回归预报的估计性、独立性检验结论的概率性理解不到位。
5. 实际问题转化:难以将生活中的成对数据问题(如消费与收入)抽象为统计模型,找不到分析切入点。
知识点01 变量间的相关关系
1、变量之间的相关关系
当自变量取值一定时,因变量的取值带有一定的随机性,则这两个变量之间的关系叫相关关系.由于相关关系的不确定性,在寻找变量之间相关关系的过程中,统计发挥着非常重要的作用.我们可以通过收集大量的数据,在对数据进行统计分析的基础上,发现其中的规律,对它们的关系作出判断.
注意:相关关系与函数关系是不同的,相关关系是一种非确定的关系,函数关系是一种确定的关系,而且函数关系是一种因果关系,但相关关系不一定是因果关系,也可能是_________关系.
2、散点图
将样本中的个数据点描在平面直角坐标系中,所得图形叫做散点图.根据散点图中点的分布可以_________判断两个变量之间的关系.
(1)如果散点图中的点散布在从左下角到右上角的区域内,对于两个变量的这种相关关系,我们将它称为_________,如图(1)所示;
(2)如果散点图中的点散布在从左上角到右下角的区域内,对于两个变量的这种相关关系,我们将它称为_________,如图(2)所示.
3、相关系数
若相应于变量的取值,变量的观测值为,则变量与的相关系数,通常用来衡量与之间的线性关系的强弱,的范围为.
(1)当时,表示两个变量正相关;当时,表示两个变量负相关.
(2)越接近,表示两个变量的线性_________;越接近,表示两个变量间几乎不存在线性相关关系.当时,所有数据点_________.
(3)通常当时,认为两个变量具有很强的线性相关关系.
【即学即练】
1.对四组数据进行统计,获得如图散点图,其中线性相关性比较强且负相关的是( )
A. B. C. D.
2.(多选)对四组数据进行统计,获得如图所示的散点图,关于其相关系数的关系,正确的有( )
A. B. C. D.
知识点02 线性回归
1、线性回归
线性回归是研究不具备确定的函数关系的两个变量之间的关系(相关关系)的方法.
对于一组具有线性相关关系的数据(x1,y1),(x2,y2),…,(xn,yn),其回归方程的求法为
其中,,,(,)称为样本点的中心.
2、残差分析
对于预报变量,通过观测得到的数据称为观测值,通过回归方程得到的称为预测值,_________减去_________等于残差,称为相应于点的残差,即有.残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果以及判断原始数据中是否存在可疑数据等,这方面工作称为残差分析.
(1)残差图
通过残差分析,残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,其中这样的带状区域的宽度越窄,说明模型拟合精确度_________;反之,不合适.
(2)通过残差平方和分析,如果残差平方和_________,则说明选用的模型的拟合效果越好;反之,不合适.
(3)相关指数
用相关指数来刻画回归的效果,其计算公式是:.
越接近于,说明残差的平方和越小,也表示回归的效果越好.
【即学即练】
1.下列命题错误的是( )
A.两个随机变量的线性相关性越强,相关系数的绝对值越接近于1
B.设,且,则
C.线性回归直线一定经过样本点的中心
D.在残差图中,残差点分布的带状区域的宽带越狭窄,其模型拟合的精度越高
2.随着互联网行业、传统行业和实体经济的融合不断加深,互联网对社会经济发展的推动效果日益显著,某大型超市计划在不同的线上销售平台开设网店,为确定开设网店的数量,该超市在对网络上相关店铺做了充分的调查后,得到下列信息,如图所示(其中表示开设网店数量,表示这个分店的年销售额总和),现已知,求解下列问题;
(1)经判断,可利用线性回归模型拟合与的关系,求解关于的回归方程;
(2)按照经验,超市每年在网上销售获得的总利润(单位:万元)满足,请根据(1)中的线性回归方程,估算该超市在网上开设多少分店时,才能使得总利润最大.
参考公式;线性回归方程,其中
知识点03 非线性回归
解答非线性拟合问题,要先根据散点图选择合适的函数类型,设出回归方程,通过换元将陌生的非线性回归方程化归转化为我们熟悉的线性回归方程.
求出样本数据换元后的值,然后根据线性回归方程的计算方法计算变换后的线性回归方程系数,还原后即可求出非线性回归方程,再利用回归方程进行预报预测,注意计算要细心,避免计算错误.
1、建立非线性回归模型的基本步骤:
(1)确定研究对象,明确哪个是解释变量,哪个是预报变量;
(2)画出确定好的解释变量和预报变量的散点图,观察它们之间的关系(是否存在非线性关系);
(3)由经验确定非线性回归方程的类型(如我们观察到数据呈非线性关系,一般选用反比例函数、二次函数、指数函数、对数函数、幂函数模型等);
(4)通过换元,将非线性回归方程模型转化为线性回归方程模型;
(5)按照公式计算线性回归方程中的参数(如最小二乘法),得到线性回归方程;
(6)_________,得到非线性回归方程;
(7)得出结果后分析残差图是否有异常.若存在异常,则检查数据是否有误,或模型是否合适等.
常见的非线性回归模型
(1)指数函数型(且,)
两边取自然对数,,即__________________,
令,原方程变为,然后按线性回归模型求出,.
(2)对数函数型
令,原方程变为,然后按线性回归模型求出,.
(3)幂函数型
两边取常用对数,,即,
令,原方程变为__________________,然后按线性回归模型求出,.
(4)二次函数型
令,原方程变为,然后按线性回归模型求出,.
(5)反比例函数型型
令,原方程变为,然后按线性回归模型求出,.
【即学即练】
1.某池塘中水生植物的覆盖水塘面积(单位:)与水生植物的株数(单位:株)之间的相关关系,收集了4组数据,用模型去拟合与的关系,设,与的数据如表格所示:
3
4
6
7
2.5
3
4
5.9
得到与的线性回归方程,则 .
2.某生产制造企业统计了近10年的年利润(千万元)与每年投入的某种材料费用(十万元)的相关数据,作出如下散点图:
选取函数作为每年该材料费用和年利润的回归模型.若令,则,得到相关数据如表所示:
31.5
15
15
49.5
(1)求出与的回归方程;
(2)计划明年年利润额突破1亿,则该种材料应至少投入多少费用?(结果保留到万元)参考数据:.
知识点04 独立性检验
1、分类变量和列联表
(1)分类变量:
变量的不同“值”表示个体所属的不同类别,像这样的变量称为分类变量.
(2)列联表:
①定义:列出的两个分类变量的频数表称为列联表.
②2×2列联表.
一般地,假设有两个分类变量X和Y,它们的取值分别为{x1,x2}和{y1,y2},其样本频数列联表(称为2×2列联表)为
总计
总计
从列表中,依据与的值可直观得出结论:两个变量是否有关系.
2、等高条形图
(1)等高条形图和表格相比,更能直观地反映出两个分类变量间是否相互影响,常用等高条形图表示列联表数据的频率特征.
(2)观察等高条形图发现与相差很大,就判断两个分类变量之间有关系.
3、独立性检验
(1)定义:利用独立性假设、随机变量来确定是否有一定把握认为“两个分类变量有关系”的方法称为两个分类变量的独立性检验.
(2)公式:,其中为样本容量.
(3)独立性检验的具体步骤如下:
①计算随机变量的观测值,查下表确定临界值:
0.5
0.40
0.25
0.15
0.10
0.05
0.025
0.010
0.005
0.001
0.455
0.708
1.323
2.072
2.706
3.841
5.024
6.635
7.879
10.828
②如果,就推断“与有关系”,这种推断犯错误的概率不超过;否则,就认为在犯错误的概率_________的前提下不能推断“与有关系”.
(2)两个分类变量和是否有关系的判断标准:
统计学研究表明:
当时,认为与无关;
当时,有的把握说与有关;
当时,有的把握说与有关;
当时,有的把握说与有关.
【即学即练】
1.某中学对学生钻研奥数课程的情况进行调查,将每周独立钻研奥数课程超过6小时的学生称为“奥数迷”,否则称为“非奥数迷”,从调查结果中随机抽取100人进行分析,得到数据如表所示:
奥数迷
非奥数迷
总计
男
24
36
60
女
12
28
40
总计
36
64
100
0.1
0.05
0.01
0.001
2.706
3.841
6.635
10.828
(1)对照列联表,根据小概率的独立性检验,是否为“奥数迷”与性别有关?
(2)现从抽取的“奥数迷”中,按性别采用分层抽样的方法抽取3人参加奥数闯关比赛,已知其中男、女学生独立闯关成功的概率分别为,在恰有两人闯关成功的条件下,求两人性别相同的概率.
参考数据与公式:,其中.
2.近年来,某公司以电影和动漫中的一些元素为主题,开发了一些豪车模型玩具,现抽取了部分孩童,调查他们是否喜爱豪车模型,所得数据统计如下表所示.
性别
男孩
女孩
喜欢豪车模型
340
160
不喜欢豪车模型
300
200
(1)现按照性别进行分层,用分层随机抽样的方法在不喜欢豪车模型的样本孩童中随机抽取10人,再从这10人中随机抽取3人,求至少1人是女孩的概率;
(2)根据的独立性检验,能否认为是否喜欢豪车模型与性别具有相关性.
附:.
0.05
0.01
0.001
3.841
6.635
10.828
题型01 变量间的相关关系
【典例1】某无人机的研发费用x(单位:万元)与销售量y(单位:万件)之间的对应数据如表所示:
研发费用x
3.4
4.7
5
5.6
6.3
销售量y
15
16.9
19.2
18
20.9
根据表中数据可得经验回归方程为,则第三个样本点对应的残差为 .
【典例2】某产品的广告费用与销售额的统计数据如表:
广告费用(万元)
2
3
4
5
6
销售额(万元)
19
25
34
38
44
根据上表可得回归直线方程为,下列说法正确的是( )
A.回归直线必经过样本点(4,34)
B.样本数据中,销售额的第70百分位数是36
C.
D.据此模型估计广告费用为7万元时销售额为万元
若相应于变量的取值,变量的观测值为,则变量与的相关系数,通常用来衡量与之间的线性关系的强弱,的范围为.
(1)当时,表示两个变量正相关;当时,表示两个变量负相关.
(2)越接近,表示两个变量的线性相关性越强;越接近,表示两个变量间几乎不存在线性相关关系.当时,所有数据点都在一条直线上.
(3)通常当时,认为两个变量具有很强的线性相关关系.
【变式1】以下是标号分别为①,②,③的三幅散点图,它们的样本相关系数分别为,那么相关系数的大小关系为 .(按由小到大的顺序排列).
【变式2】某医学科研所对人体脂肪含量与年龄这两个变量研究得到一组随机样本数据,运用Excel软件计算得(为人的年龄,为人体脂肪含量).对年龄为37岁的人来说,下面说法正确的是( )
A.年龄为岁的人体内脂肪含量一定为
B.年龄为岁的人体内脂肪含量约为
C.年龄为岁的人群中的体内脂肪含量平均为
D.年龄为岁的人群中的大部分人的体内脂肪含量约为
【变式3】观察下列散点图,其中两个变量的相关关系判断一定正确的是( )
A.图1中y与x呈正相关
B.图2中y与x不相关
C.图3中y与x的线性相关系数小于0
D.图1中y与x的线性相关系数小于图2中y与x的线性相关系数
题型02 线性回归
【典例1】有一种速度叫中国速度,有一种骄傲叫中国高铁.中国高铁经过十几年的发展,取得了举世瞩目的成就,使我国完成了从较落后向先进铁路国的跨越式转变.中国的高铁技术不但越来越成熟,而且还走向国外,帮助不少国家修建了高铁.高铁可以说是中国一张行走的名片.截至到2020年,中国高铁运营里程已经达到3.9万公里.下表是2013年至2020年中国高铁每年的运营里程统计表,它反映了中国高铁近几年的飞速发展:
年份
2013
2014
2015
2016
2017
2018
2019
2020
年份代码
1
2
3
4
5
6
7
8
运营里程万公里
1.3
1.6
1.9
2.2
2.5
2.9
3.5
3.9
根据以上数据,回答下面问题.
(1)甲同学用曲线y=bx+a来拟合,并算得相关系数r1=0.97,乙同学用曲线y=cedx来拟合,并算得转化为线性回归方程所对应的相关系数r2=0.99,试问哪一个更适合作为y关于x的回归方程类型,并说明理由;
(2)根据(1)的判断结果及表中数据,求y关于x的回归方程(系数精确到0.01).
参考公式:用最小二乘法求线性回归方程的系数公式:;参考数据:令
【典例2】某机构为了解某大学中男生的体重单位:)与身高x(单位:)是否存在较好的线性关系,该机构搜集了7位该校男生的数据,得到如下表格:
序号
1
2
3
4
5
6
7
身高()
161
175
169
178
173
168
180
体重()
52
62
54
70
66
57
73
根据表中数据计算得到关于的线性同归方程为
(1)求
(2)已知且当时,回归方程的拟合效果非常好;当时,回归方程的拟合效果良好.试问该线性回归方程的拟合效果是非常好还是良好?说明你的理由.参考数据:
对于一组具有线性相关关系的数据(x1,y1),(x2,y2),…,(xn,yn),其回归方程的求法为
其中,,,(,)称为样本点的中心.
【变式1】给出下列命题,其中正确命题为( )
A.投掷一枚均匀的硬币和均匀的骰子(形状为正方体,六个面分别标有数字1,2,3,4,5,6)各一次,记硬币正面向上为事件A,骰子向上的点数是2为事件B,则事件A和事件B同时发生的概率为
B.以模型去拟合一组数据时,为了求出回归方程,设,将其变换后得到线性方程,则,的值分别是和
C.随机变量服从正态分布,,则
D.某选手射击三次,每次击中目标的概率均为,且每次射击都是相互独立的,则该选手至少击中2次的概率为
【变式2】关于变量x,y的n个样本点及其线性回归方程.下列说法正确的有( )
A.相关系数r的绝对值|r|越接近0,表示x,y的线性相关程度越强
B.相关指数的值越接近1,表示线性回归方程拟合效果越好
C.残差平方和越大,表示线性回归方程拟合效果越好
D.若,则点一定在线性回归方程上
【变式3】下列说法中正确的是( )
A.对于独立性检验,的值越大,说明两事件的相关程度越大
B.以模型去拟合一组数据时,为了求出回归方程,设,将其变换后得到线性方程,则的值分别是和0.3
C.在具有线性相关关系的两个变量的统计数据所得的回归直线方程中,,则
D.通过回归直线及回归系数,可以精确反映变量的取值和变化趋势
题型03 非线性回归
【典例1】对具有相关关系的两个变量x和y进行回归分析时,经过随机抽样获得成对的样本点数据,则下列结论正确的是( )
A.若两变量x,y具有线性相关关系,则回归直线至少经过一个样本点
B.若两变量x,y具有线性相关关系,则回归直线一定经过样本点中心
C.若以模型拟合该组数据,为了求出回归方程,设,将其变换后得到线性方程,则a,h的估计值分别是3和6
D.回归分析中常用残差平方和来刻画拟合效果好坏,残差平方和越小,拟合效果越好
【典例2】云计算是信息技术发展的集中体现,近年来,我国云计算市场规模持续增长.已知某科技公司2018年至2022年云计算市场规模数据,且市场规模y与年份代码x的关系可以用模型(其中e为自然对数的底数)拟合,设,得到数据统计表如下:
年份
2018年
2019年
2020年
2021年
2022年
年份代码x
1
2
3
4
5
云计算市场规模y/千万元
7.4
11
20
36.6
66.7
2
2.4
3
3.6
4
由上表可得经验回归方程,则2025年该科技公司云计算市场规模y的估计值为( )
A. B. C. D.
常见的非线性回归模型
(1)指数函数型(且,)
两边取自然对数,,即,
令,原方程变为,然后按线性回归模型求出,.
(2)对数函数型
令,原方程变为,然后按线性回归模型求出,.
(3)幂函数型
两边取常用对数,,即,
令,原方程变为,然后按线性回归模型求出,.
【变式1】秋天的第一杯奶茶是一个网络词汇,最早出自四川达州一位当地民警之口,民警用“秋天的第一杯奶茶”顺利救下一名女孩,由此而火爆全网.后来很多人开始在秋天里买一杯奶茶送给自己在意的人.某奶茶店主记录了入秋后前7天每天售出的奶茶数量(单位:杯)
如下:
日期
第一天
第二天
第三天
第四天
第五天
第六天
第七天
日期代码
1
2
3
4
5
6
7
杯数
4
15
22
26
29
31
32
(1)请根据以上数据,绘制散点图,并根据散点图判断,与哪一个更适宜作为y关于x的回归方程模型(给出判断即可,不必说明理由);
(2)建立y关于x的回归方程(结果保留1位小数),并根据建立的回归方程,试预测要到哪一天售出的奶茶才能超过35杯?
(3)若每天售出至少25杯即可盈利,则从第一天至第七天中任选三天,记随机变量X表示盈利的天数,求随机变量X的分布列.
参考公式和数据:其中
回归直线方程中,
22.7
1.2
759
235.1
13.2
8.2
【变式2】某电商平台统计了近七年小家电的年度广告费支出(万元)与年度销售量(万台)的数据,如表所示:
年份
2016
2017
2018
2019
2020
2021
2022
广告费支出
1
2
4
6
11
13
19
销售量
1.9
3.2
4.0
4.4
5.2
5.3
5.4
其中,
(1)若用线性回归模型拟合与的关系,求出关于的线性回归方程;
(2)若用模型拟合得到的回归方程为,经计算线性回归模型及该模型的分别为0.75和0.88,请根据的数值选择更好的回归模型拟合与的关系,进而计算出年度广告费为何值时,利润的预报值最大?
参考公式:,;
【变式3】2020年初,新型冠状病毒(COVID-19)引起的肺炎疫情爆发以来,各地医疗机构采取了各种针对性的治疗方法,取得了不错的成效,某地开始使用中西医结合方法后,每周治愈的患者人数如下表所示:由表格可得关于的二次回归方程为,则此回归模型第4周的残差(实际值与预报值之差)为( )
周数
1
2
3
4
5
治愈人数
2
17
36
93
142
A.0 B.1 C.4 D.5
题型04 独立性检验
【典例1】某地区为了检测某种农业有机肥料的效果,农业专家播撒肥料到200块试验田中,一段时间后测量土地的某项肥力指标,按分组,绘制成如下频率分布直方图.试验后发现,产生土地肥力的为160块,其中该项指标不小于60的有110块.假设各块试验田播撒肥料后是否产生肥力相互独立,并用频率估计概率.
(1)填写下面的2×2列联表,并根据列联表判断是否有95%的把握认为播撒肥料后试验田是否产生肥力与指标值有关;
指标值
指标值
产生肥力
未产生肥力
(2)为了检验有机肥第二次播撒的有效性,对第一次播撒有机肥后没有产生肥力的试验田进行第二次播撒,经计算发现同一块试验田在播撒两次有机肥后产生肥力的概率为0.9.记块土地播撒两次有机肥后产生肥力的数量为随机变量.试验后统计数据显示,当时,取得最大值,求参加播撒有机肥实验的块数及的数学期望.
附:.
0.15
0.10
0.050
0.010
0.001
2.072
2.706
3.841
6.635
10.828
【典例2】某中草药主要是通过清热解毒、宣肺理气来调理机体的气机和阴阳平衡,从而改善症状,可以达到减轻病情、缓解症状、缩短病程的作用.为了了解该中草药预防流感的效果,抽样调查40人,得到如下数据:
患流感
未患流感
服用药
3
17
未服用药
9
11
若由此认为“该药物有效”,则该结论出错的概率不超过( )
A. B. C. D.
一般地,假设有两个分类变量X和Y,它们的取值分别为{x1,x2}和{y1,y2},其样本频数列联表(称为2×2列联表)为
总计
总计
从列表中,依据与的值可直观得出结论:两个变量是否有关系.
公式:,其中为样本容量.
【变式1】下面命题中说法正确的是 .
①设两个变量之间的线性相关系数为,则越大,的相关性越强;
②等高堆积条形图可以直观的反映一对分类变量之间是否具有关联性;
③如果散点图的散点都落在一条直线上,则;
④正方形的面积与周长是相关关系.
【变式2】为了更好地开展多媒体化教学,杭州市某小学对“文理学科教师与喜欢用平板教学”是否有关做了一次研究调查,其中被调查的文科、理科教师人数相同,理科教师喜欢用平板教学的人数占理科教师总人数的80%,文科教师喜欢用平板教学的人数占文科教师总人数的40%,若有95%的把握认为是否喜欢用平板教学和文理学科有关,则调查人数中理科教师人数最少可能是( )
附:,其中.
0.05
0.010
3.841
6.635
A.8 B.12 C.15 D.20
【变式3】我国力争2030年前实现碳达峰,2060年前实现碳中和,是党中央经过深思熟虑作出的重大战略决策,事关中华民族永续发展和构建人类命运共同体.新经济形势下,二氧化碳排放是影响企业效益的重要因素,为了研究节能专利技术对企业效益的影响,现随机抽取100家科技企业进行调查,得到如下数据:
经济效益较好
经济效益较差
合计
节能专利技术
52
29
81
非节能专利技术
8
11
19
合计
60
40
100
则认为节能专利技术有利于企业经济效益的把握为( )
附:,其中.
0.10
0.05
0.010
0.001
2.706
3.841
6.635
10.828
A. B. C. D.
题型05 误差分析
【典例1】某电商平台为了对某一产品进行合理定价,采用不同的单价在平台试销,得到的数据如下表所示:
单价x/元
8
8.5
9
9.5
10
销量y/万件
89
85
80
78
68
根据以上数据得到与具有较强的线性关系,若用最小二乘估计得到经验回归方程为,则( )
A.相关系数 B.点一定在经验回归直线上
C. D.时,对应销量的残差为
【典例2】某学校一同学研究温差(单位:℃)与本校当天新增感冒人数(单位:人)的关系,该同学记录了5天的数据:
5
6
8
9
12
16
20
25
28
36
由上表中数据求得温差与新增感冒人数满足经验回归方程,则下列结论不正确的是( )
A.与有正相关关系 B.经验回归直线经过点
C. D.时,残差为0.2
类型1:回归分析中的误差(最核心,必掌握)
1. 残差(最基础误差)
定义:单个数据误差=观测值yᵢ - 预报值ŷᵢ
分析技巧:残差绝对值越小,拟合越准;残差图无规律(随机分布在0附近)→无系统误差,拟合优;残差成带状/递增/递减→模型选错(非线当成线性)
2. 系统误差(整体偏差,影响大)
来源:模型不当(非线性用线性回归)、数据测量工具偏差(如秤不准)、试验流程固定缺陷
特点:误差整体偏高/偏低,有规律,可修正(换模型、校准工具)
解题话术:因选用线性模型拟合非线性成对数据,导致整体预报值偏离观测值,存在系统性误差,需更换非线性模型
3. 随机误差(不可避免)
来源:偶然因素(测量时环境波动、读数偏差)
特点:无固定偏向,时大时小,不可消除,可减小(多次测量取平均、增大样本量)
类型2:抽样&测量导致的误差(成对数据源头误差)
1. 抽样误差:成对样本不具代表性(如选10个极端值做身高&体重分析)
解题话术:样本选取片面,未覆盖总体各类情况,成对数据缺乏代表性,导致分析结果偏离总体真实关联
2. 测量误差:成对数据收集时,某一组/两组数据测量不准(如测体重时秤始终多1kg)
特点:若一组数据整体偏差,会导致回归直线平移/倾斜,影响b和a的准确性
【变式1】下列有关回归分析的结论中,正确的有( )
A.若回归方程为,则变量y与x负相关
B.运用最小二乘法求得的经验回归直线一定经过样本点的中心
C.若决定系数的值越接近于1,表示回归模型的拟合效果越好
D.若散点图中所有点都在直线上,则相关系数
【变式2】2023年入冬以来,流感高发,某医院统计了一周中连续5天的流感就诊人数y与第天的数据如表所示.
x
1
2
3
4
5
y
21
10a
15a
90
109
根据表中数据可知x,y具有较强的线性相关关系,其经验回归方程为,则( )
A.样本相关系数在内 B.当时,残差为-2
C.点一定在经验回归直线上 D.第6天到该医院就诊人数的预测值为130
【变式3】混凝土的抗压强度x较容易测定,而抗剪强度y不易测定,工程中希望建立一种能由x推算y的经验公式,下表列出了现有的9对数据,分别为,,…,.
x
141
152
168
182
195
204
223
254
277
y
23.1
24.2
27.2
27.8
28.7
31.4
32.5
34.8
36.2
以成对数据的抗压强度x为横坐标,抗剪强度y为纵坐标作出散点图,如图所示.
(1)从上表中任选2个成对数据,求该样本量为2的样本相关系数r.结合r值分析,由简单随机抽样得到的成对样本数据的样本相关系数是否一定能确切地反映变量之间的线性相关关系?
(2)根据散点图,我们选择两种不同的函数模型作为回归曲线,根据一元线性回归模型及最小二乘法,得到经验回归方程分别为:①,②.经验回归方程①和②的残差计算公式分别为,,.
(ⅰ)求;
(ⅱ)经计算得经验回归方程①和②的残差平方和分别为,,经验回归方程①的决定系数,求经验回归方程②的决定系数.
附:相关系数,决定系数,.
1.现调查某地区某种野生动物的数量,将该地区分成面积相近的100个地块,从这些地块中用简单随机抽样的方法抽取10个作为样本,调查得到样本数据,其中分别表示第个样本的植物覆盖面积(单位:公顷)和这种野生动物的数量,分别表示这10个样本的植物覆盖面积和这种野生动物的数量的平均值,构造向量,并计算得,由选择性必修第一册教材中的知识,我们知道对数据的相关系数,则上述数据的相关系数 .
2.对于x,y两个变量,有四组样本数据,分别算出它们的线性相关系数r(如下):,0.72,,0.85,则正相关的变量x,y所对应的线性相关系数是( )
A. B.0.72 C. D.0.85
3.对四组数据进行统计,获得以下散点图,关于其相关系数的比较,正确的是( )
A. B.
C. D.
4.高质量发展是全面建设社会主义现代化国家的首要任务,创新研发是高质量发展的重要前提.某公司研发新产品的投入(单位:百万元)与该产品的收益(单位:百万元)的5组统计数据如下表所示,且经验回归方程为.
x
5
6
8
9
12
y
16
20
25
28
(1)求的值;
(2)若将图表中的点去掉,判断样本相关系数是否改变,并说明你的理由.
参考数据:样本相关系数
5.已知高中学生的数学成绩,物理成绩,化学成绩两两成正相关关系,随机抽取10名同学,数学成绩和物理成绩的样本线性相关系数为,物理成绩与化学成绩的样本线性相关系数为,求的样本线性相关系数的最大值为 .
(附:相关系数
6.对相关系数,给出下列结论:①越大,线性相关程度越强;②若所有样本点都在直线上,则;③越大,线性相关程度越弱,越接近,线性相关程度越强;④且越接近,线性相关程度越强,越接近,线性相关程度越弱,
其中说法正确的是 填序号
7.在某生态系统中,研究人员发现两种生物近期的数量线性相关,且相关系数为0.75,这说明( )
A.一种生物的数量增长时,另一种生物的数量会减少
B.一种生物的数量增长时,另一种生物的数量也增长
C.两种生物的数量增减性有相同的趋势
D.两种生物的数量增减性有相反的趋势
8.某校研究学生每周自习时间(小时)与数学成绩(分)的关系,计算得相关系数,并建立线性回归模型,得到决定系数.对残差进行分析时,发现残差与预测值的散点图(是以预测值为横轴,残差为纵轴)呈现明显的先负后正的分布趋势,则( )
A.,说明该模型的拟合效果较差
B.残差平方和等于0.64
C.相关系数为负,说明自习时间与成绩无关
D.残差图显示模型可能不符合线性假设,建议改用非线性模型
9.某科技公司在人工智能领域逐年加大投入,根据近年来该公司对产品研发年投入额x(单位:百万元)与其年销售量y(单位:千件)的数据统计,得到散点图如图.用线性回归和指数型回归模型拟合y与x关系的决定系数分别为和,则根据参考数据,下列表达式中最适宜描述y与x之间关系的函数为( )
参考公式:用最小二乘法求经验回归直线方程的系数公式为.
参考数据:令
3
2.5
0.5
10
12
6
A. B. C. D.
10.某公司收集了某商品销售收入(单位:万元)与相应的广告支出(单位:万元)共10组数据,绘制出散点图,如图,并利用线性回归模型进行拟合.若将图中10个点中去掉点后再重新进行线性回归分析,则下列说法错误的是 .
①决定系数变小 ②残差平方和变小
③相关系数的值变小 ④自变量与因变量相关性变弱
11.在某线性回归模型中,计算其决定系数,则下面说法正确的是( )
A.该经验回归方程的拟合效果较好 B.解释变量对于响应变量变化的贡献率约为
C.随机误差对响应变量的影响约占 D.有的样本点在经验回归直线上
12.欲知作家性别对读者的性别影响,某出版社派工作人员到各书店随机调查了500位买书的顾客,结果如下表所示.
读者
作家
总计
男作家
女作家
男读者
142
122
264
女读者
103
133
236
总计
245
255
500
则在差错不超过0.05的前提下作者的性别与读者的性别 (填“有关”或“无关”).
0.100
0.050
0.025
0.010
0.001
2.706
3.841
5.024
6.635
10.828
13.下列说法中正确的是( )
A.相关关系是一种不确定的关系,回归分析是对相关关系的分析,其意义在于对事件的发展趋势进行预测
B.独立性检验对分类变量关系的研究没有100%的把握,所以独立性检验研究的结果在实际中也没有多大的实际意义
C.相关关系可以对变量的发展趋势进行预报,这种预报可能会是错误的
D.独立性检验如果得出的结论有99%的可信度,就意味着这个结论一定是正确的
14.某乡政府为提高当地农民的收入,指导农民种植药材,并取得了较好的效果.以下是某农户近5年种植药材的平均收入的统计数据:
年份
2018
2019
2020
2021
2022
年份代码
1
2
3
4
5
平均收入(千元)
59
61
64
68
73
(1)根据表中数据,现有与两种模型可以拟合与之间的关系,请分别求出两种模型的回归方程;(结果保留一位小数)
(2)统计学中常通过比较残差的平方和来比较两个模型的拟合效果,请根据残差平方和说明上述两个模型哪一个的拟合效果更好,并据此预测2030年该农户种植药材的平均收入.
参考数据:,,其中.
参考公式:经验回归方程中,,.
15.大气污染物(大气中直径小于或等于的颗粒物)的浓度超过一定的限度会影响人的身体健康.为了研究的浓度受车流量影响的程度,某校数学建模社团选择了学校附近5个监测点,统计每个监测点内的车流量(单位:千辆),同时在低空相同的高度测定每个监测点该时间段内的的平均浓度(单位:),得到的数据如表所示:
监测点编号
1
2
3
4
5
车流量(千辆)
1.3
1.2
1.6
1.0
0.9
的平均浓度
66
72
113
34
35
(1)建立关于的一元线性回归模型,并用样本相关系数加以说明(一般地,样本相关系数的绝对值在0.75以上(含0.75)认为线性相关性较强,否则认为线性相关性较弱);
(2)我国规定空气中的浓度安全标准为平均浓度为,该地为使平均浓度不超过,拟对车流量作适当控制,请你根据本题数据估计车流量控制的最大值.
参考公式:在经验回归方程中,,;
样本相关系数.
2 / 20
学科网(北京)股份有限公司
学科网(北京)股份有限公司
$