内容正文:
第8章 成对数据的统计分析
1. 成对数据间的关系:来自同一对象的两组数据称为成对数据. 研究成对数据相关性的方法称为相关分析.
2. 相关系数
(1)公式:一些成对数据具有明显的相关性,且在绘制出散点图后可以用一条直线进行拟合,也就是说具有线性相关性.
设由变量 和 获得的两组数据分别为 和 ,其对应关系为 ,两组数据 和 的线性相关系数是度量两个变量 和 之间线性相关程度的统计量,其计算公式为 ,其中 ,它们分别是这两组数据的算术平均数. 线性相关系数常常简称为相关系数, 也称为皮尔逊相关系数.
(2)相关性质:相关系数 的值满足 , 越接近1,两个变量的线性相关程度越高; 越接近 0 , 两个变量的线性相关程度越低.
时,当 的值由小变大, 的值具有由小变大的变化趋势,称这种相关为正相关;
时,当 的值由小变大, 的值具有由小变大的变化趋势,称这种相关为负相关.
(3)特点:相关系数 描述的是两个变量之间线性关系的方向与程度,是一种定量分析的方法,相关系数具有以下特点:
① 相关系数的计算公式关于 和 这两个变量是对称的. 画散点图时,不论以哪个变量作为横轴 (纵轴), 所得的相关系数都一样.
② 两个变量的相关系数与这两个变量的单位无关, 相关系数的结果都一样.
③ 与平均数和标准差一样, 相关系数不仅会受到数据量多少的影响, 也会受到少数异常值较大的影响.
用相关系数来描述两个随机变量的相关性, 一般要求这两个变量均满足正态分布.
3. 一元线性回归分析的基本思想
一般地,设给定一组有线性相关关系的成对数据 和一个线性方程 (或称线性模型) .①
当变量 取值 时,令 ,它是变量 与 对应的理想值. 但数据中的 与 不一定相同,它们的差 称为在 处的离差,当 时称为正离差,而当 时称为负离差, 显然, 离差直观地描述了单对数据与线性方程①的贴近度.
我们用离差的平方和 来刻画直线与点之间的拟合程度. 称为拟合误差. 我们把拟合误差取得最小值时得到的线性方程(线性模型)记为 ,并称之为变量 随 波动的回归方程或回归模型,其中自变量 称为解释变量,因变量 称为反应变量,回归方程所定义的直线称为回归直线,回归方程的系数 (或称回归模型的参数) 与 称为回归系数. 由一组有某种线性关系的成对数据求其回归方程的方法称为一元线性回归分析.
回归系数 与 的计算公式: 的算术平均值,数对 称为样本点的中心.
我们的回归分析是基于 取最小值的假设,即基于所有离差的平方和取最小值的假设进行的. 这种回归分析的方法称为最小二乘法, 由最小二乘法导出的估计量称为最小二乘估计量, 所得到的回归系数 与 又称为模型参数 与 的最小二乘估计.
4. 一元线性回归分析的应用举例
建立一元线性回归模型的一般步骤如下:
① 确定研究对象,从一组数据出发,根据实际问题,明确哪个变量是自变量,哪个变量是因变量;
② 对确定的自变量和因变量,绘制相应的散点图,观察它们之间的关系(如是否存在线性关系等);
③ 若观察到数据呈线性关系,则选用线性方程 ;
④ 利用最小二乘法估计线性方程中的参数 ,得到回归方程 ;
⑤ 得出结果后计算离差,采用统计方法检验模型是否合适(这一步本书不作要求);
⑥ 利用所求的回归方程进行预测.
5. 相关分析和回归分析作为处理成对数据的两种基本统计方法, 它们有如下联系与区别:
① 相关分析主要测定变量之间相关性的强弱和变化方向, 而回归分析则是在相关分析的基础上建立回归模型, 定量地描述变量间具体的变动关系, 只有在两组变量具有线性相关生时, 才作线性回归分析, 得到回归直线.
② 在相关分析中,两个变量的地位是对等的. 而在同归分析中,要考察的是一个变量随另一个变量的变化趋势, 其中自变量是解释变量, 因变量是反应变量.
③ 回归分析具有因果分析和预测的功能, 可以分析反应变量受解释变量的影响程度, 也可以通过回归方程求得反应变量的计算值来估计其他同类的观察值.
④ 在相关分析中, 一般要求两个变量的总体都满足正态分布, 而在回归分析时, 一般只要求反应变量的总体满足正态分布.
6. 列联表独立性检验:两个分类变量分别占两行和两列, 形成 4 个格子, 每个格子中的数据是同时满足所在行列对应类别的个体的频数. 这些数据都是通过实际调查得到的, 称为观察值. 这些观察值形成的 2 行 2 列的频数表格,称为 2 行 2 列列联表,简称 列联表,也称为四格表.
要检验两个随机变量是否有关,统计上一般先假设它们没有关系, 即相互独立, 再进行统计检验,这种假设称为原假设,也称为零假设,习惯上用 表示.
为了描述观察值与预期值之间的总体偏差,我们引入统计量
的值越大,说明观察值与预期值的总体偏差越大,原假设成立的可能性就越小.
分布概率:
以 为例,其含义是: 如果原假设成立,那么 成立的概率约为 0.05, 这是一个小概率事件,不太可能发生. 0.05、0.01 等小概率值在统计上称为显著性水平,记作 . 方便起见, 本书的显著性水平规定为 0.05 .
7. 列联表 检验的计算公式:设有两组分类数据 ,每组数据的两种状态分别用 0 和 1 表示,则可得到下面的 列联表:
组
组
总计
0
1
总计
其中, 为实际观察值. 由 ,经过变形可得 的一般计算公式: ,其中 检验方法在统计学中称为 列联表独立性检验.
8. 列联表独立性检验通常有如下步骤:
① 提出两个随机变量没有关系的原假设 ;
② 确定显著性水平 ,本书中规定 ,也即 ;
③ 计算统计量 的值;
④ 统计决断: 比较上述 值与 3.841 的大小. 若 ,则否定 ; 若 ,则接受 . 根据上述推断作出结论.
易错01 混淆相关关系与函数关系
错误:将变量的相关关系当成确定性的函数关系,认为变量之间有严格唯一对应关系。
注意:相关关系是非确定性的随机关系,只有趋势无固定取值;函数关系是确定性对应关系,二者本质不同。
1.在下列两个量之间的关系中,属于相关关系的是( )
A.匀速直线运动中时间与位移的关系 B.学生的成绩和身高
C.一块农田的小麦产量与施肥量 D.正n边形的边数与内角度数之和
【答案】C
【详解】A、D是函数关系;B是不相关关系,也不是函数关系;
C是相关关系,一般来说,农田的施肥量越大,小麦产量一般会越多.
2.下列语句所表示的事件中的因素不具有相关关系的是( )
A.瑞雪兆丰年 B.名师出高徒
C.吸烟有害健康 D.喜鹊叫喜
【答案】D
【分析】根据相关关系的概念分别判断.
【详解】瑞雪对农作物有好处,可能使得农作物丰收,所以瑞雪兆丰年具有相关关系,
名师出高徒也具有相关关系,吸烟有害健康也具有相关关系,
而喜鹊叫喜,没有必然的关系,所以ABC正确,D错误.
故选:D.
3.(多选)在下列各变量之间的关系中,属于相关关系的是( )
A.汽车的重量和百公里耗油量 B.正n边形的边数与内角度数之和
C.一块农田的小麦产量与施肥量 D.家庭的经济条件与学生的学习成绩
【答案】AC
【分析】根据相关关系与函数关系的概念,可得答案.
【详解】汽车的重量越大,百公里耗油量会越多.一般来说,农田的施肥量越大,小麦产量一般会越多.
可得A、C是相关关系.B是函数关系.D中家庭的经济条件与学生的学习成绩之间不是相关关系,也不是函数关系.
故选:AC.
4.(多选)下列关系中,是相关关系的为( )
A.学生的学习态度与学习成绩之间的关系
B.教师的教学水平与学生的学习成绩之间的关系
C.学生的身高与学生的学习成绩之间的关系
D.家庭的经济条件与学生的学习成绩之间的关系
【答案】AB
【分析】由两个变量的相关关系的定义进行判断.
【详解】A中学生的学习态度与学习成绩之间不是因果关系,但具有相关性,是相关关系;
B中教师的教学水平与学生的学习成绩之间的关系是相关关系;C,D都不具备相关关系.
故选:AB
5.(多选)有下列关系:①人的年龄与他(她)拥有的财富之间的关系;②曲线上的点与该点的坐标之间的关系;③森林中同一种树木,其断面直径与高度之间的关系;④角的度数与它的正弦值.其中,具有相关关系的是( )
A.① B.② C.③ D.④
【答案】AC
【分析】根据相关关系的概念判断.
【详解】①③具有相关关系,②④具有确定的关系,即函数关系.
故选:AC
易错02 相关系数正负、强弱判断失误
错误:误以为相关系数绝对值越大,相关性越强;混淆正负相关含义,或认为系数为0就是无任何关系。
注意:相关系数正负只定相关方向,绝对值大小定相关强弱;系数为0仅代表无线性相关,可能存在非线性相关。
6.甲、乙、丙、丁各自研究两个随机变量的数据,若甲、乙、丙、丁计算得到各自研究的两个随机变量的样本相关系数分别为,,,,则这四人中,研究的两个随机变量的线性相关程度最高的是( )
A.甲 B.乙 C.丙 D.丁
【答案】B
【详解】因为,
所以这四人中,乙研究的两个随机变量的线性相关程度最高.
7.已知为随机变量X和Y的样本相关系数,为随机变量M和N的样本相关系数,则下列说法正确的是( )
A.若,则X和Y负相关
B.若,则M和N线性不相关
C.若,,则X和Y的线性相关程度比M和N的线性相关程度强
D.若越接近1,则M和N的线性相关程度越弱
【答案】B
【分析】利用,且越接近1,线性相关程度越强,越接近0,线性相关程度越弱,结合每个选项的条件逐项判断即可.
【详解】A,若,则X和Y正相关,故A错误;
B,若,则M和N线性不相关,故B正确;
C,若,,则,
所以X和Y的线性相关程度比M和N的线性相关程度弱,故C错误;
D,若越接近1,则M和N的线性相关程度越强,故D错误.
故选:B
8.对四组数据进行统计,获得如图散点图,其中线性相关性比较强且负相关的是( )
A. B. C. D.
【答案】B
【详解】对于AC,散点图分布总体是斜向上,故AC中对应的两个变量之间是正相关;
对于BD,散点图分布总体是斜向下,但B中散点分布较为集中,
而D中散点分布较为分散,故B中对应的两个变量相关性较强且为负相关.
9.已知变量与变量正相关,样本数据中,,…,和,,…,的均值分别是,,将成对数据按照平移后绘制散点图,关于该散点图说法正确的是( )
A.大部分散点位于第一、四象限 B.大部分散点位于第二、三象限
C.大部分散点位于第一、三象限 D.大部分散点位于第二、四象限
【答案】C
【详解】因为变量与变量正相关,
所以,
设,
所以,
所以变量与变量正相关,因此大部分散点位于第一、三象限.
10.已知变量与,与分别都成线性相关关系,且与相关系数满足,且与相关系数满足,下列结论正确的是( )
A.与负相关,与负相关,且与的相关性更强
B.与负相关,与正相关,且与的相关性更强
C.与负相关,与正相关,且与的相关性更弱
D.与正相关,与负相关,且与的相关性更弱
【答案】C
【分析】根据相关系数的概念判断.
【详解】由题可知,且,
与成负相关关系,与成正相关关系,且与的相关性更弱.
故选:C.
11.通过计算样本相关系数可以反映两个随机变量之间的线性相关程度,以下四个选项中分别计算出四个样本的相关系数,则反映样本数据成正相关,并且线性相关程度最强的是( )
A. B. C. D.
【答案】A
【分析】根据样本相关系数性质,可得结论.
【详解】根据样本相关系数性质,当时,样本数据正相关,故排除D,
当越接近1时,成对样本数据的线性相关程度越强,对比A、B、C选项,A最大.
故选:A.
12.分别对、、三组成对数据做相关性分析,计算出其对应的相关系数分别为、,,则、、三组相关性的强弱从弱到强排序依次为________.
【答案】
【详解】已知三组相关系数的绝对值为:,,,
,
、、三组相关性的强弱从弱到强排序依次为.
易错03 回归直线性质记忆错误
错误:认为回归直线过所有样本点,或随意代入普通点求解回归参数。
注意:回归直线是拟合所有样本点的最优直线,不一定过任意样本点,唯一必过样本均值中心点。
13.对具有线性相关关系的变量x,y,测得一组数据如下表,根据表中数据,利用最小二乘法得到经验回归方程,据此模型预测当x=20时,y的估计值为( )
x
7
9
11
13
y
2
3
5
6
A.10 B.11 C.12 D.13
【答案】B
【详解】由题意可得:,
因经验回归方程经过样本中心点,故,解得,
所以经验回归方程为,
当时,.
14.已知变量,具有线性相关关系,由样本数据(,2,3,4,5)得到关于的经验回归方程为,若,,则当时,的预测值为( )
A. B. C. D.
【答案】A
【详解】由,,得,,
点在回归直线上,故,解得,
,
故当时,.
15.为了探究六年级学生每日自主阅读时间与语文成绩的关系,某研究小组随机调查了50名学生,得到成对样本数据,其中表示每日自主阅读时间(单位:小时),表示语文成绩(单位:分).经计算得回归直线方程为.下列说法正确的是( )
A.该样本数据的相关系数为5.2
B.当阅读时间每增加1小时,语文成绩平均增加5.2分
C.该样本数据中,至少有一个点在回归直线上
D.若某学生每日阅读时间为2小时,则他的语文成绩一定为分
【答案】B
【分析】根据相关系数范围可以判断A;由回归系数定义可以判断B对;根据回归方程性质可以判断C,D.
【详解】对于A,相关系数取值范围是,故错误;
对于B,回归系数的含义是:当自变量每增加1个单位时,因变量平均增加的量。
这里表示每日自主阅读时间(小时),表示语文成绩(分),所以当阅读时间每增加1小时,语文成绩平均增加5.2分,故正确;
对于C,回归直线是对样本的拟合直线,不一定经过样本点,故错误;
对于D,当时,,为预测值,不是确定值,故错误.
16.下列命题中不正确的是( )
A.线性回归方程对应的直线一定经过样本点的中心
B.线性回归方程对应的直线至少经过其样本数据点中的一个点
C.线性回归方程为时,变量与具有负的线性相关关系
D.用最小二乘法求回归方程是为了使最小
【答案】B
【分析】利用线性回归直线的性质逐个分析判断即可.
【详解】对于A,线性回归直线一定经过样本点的中心,故A正确;
对于B,线性回归直线是样本点的‘最佳’拟合直线,可能不经过任何一个样本点,故B错误;
对于C,线性回归直线中的系数为,
则变量与具有负的线性相关关系,故C正确:
对于D,最小二乘法的核心思想就是通过寻找最佳的回归系数,
使得所有的观测值与回归直线上的预测值之间的残差平方和达到最小,
数学表达式是,故D正确.
易错04 混淆残差的计算逻辑
错误:计算残差时用预报值减去实际值,颠倒计算顺序。
注意:残差固定为实际值减预报值,残差越小,对应样本点拟合效果越好。
17.为调查某企业年利润Y(单位:万元)和它的年研究费用x(单位:万元)的相关性,收集了5组成对数据(x,y),如表所示:
x
1
2
3
4
5
Y
50
60
70
80
100
由上表中数据求得Y关于x的经验回归方程为,据此计算出样本点处的残差为( )
A.4 B.5 C.-4 D.-5
【答案】C
【详解】依题意,,,
由回归方程必过样本中心,得,解得,
所以在样本点处的残差为.
18.某校研究性学习小组收集了某地区近几年的某种经济指标与年份的数据,经计算得经验回归方程为.若年该经济指标的实际值为,则残差为( )
A. B. C. D.
【答案】D
【详解】由经验回归方程为得:
预测值,
残差实际值预测值.
19.已知变量、满足线性相关关系,经验回归方程为且,.现有一对观测数据为,若该数据的残差为0.6,则__________.
【答案】11.6
【详解】由题意,经验回归方程经过点,
则得,解得,所以.
当时,,
则.
20.已知变量x,y的统计数据如下表,对表中数据作分析,发现y与x之间具有线性相关关系,利用最小二乘法,计算得到经验回归直线方程为且当x=9时,残差为-0.1.则当x=11时,y的预测值为___________.
x
5
6
7
8
9
y
3.5
4
5
6
6.5
【答案】
【分析】经验回归直线方程过样本点的中心,所以把代入,结合残差公式联立方程组可求得的值,再代入求解即可.
【详解】由已知得,所以,①
又因为时,残差为-0.1,故,②
联立①②得;所以经验回归直线方程为,
所以,当时,.
21.用函数拟合一组数据,则观测数据的残差为________.
【答案】
【详解】当时,,
所以残差为
易错05 残差图判断模型拟合效果出错
错误:认为残差点分布越分散、带状区域越宽,拟合效果越好。
注意:残差点均匀分布在水平窄带状区域,拟合效果最优;带状越宽、点越杂乱,拟合精度越差。
22.下列残差图满足一元线性回归模型中对随机误差的假定的是( )
A. B.
C. D.
【答案】A
【分析】一元线性回归模型中对随机误差的假定是:随机误差是均值为0,且相互独立,方差为常数的正态分布.反映在残差图上,满足假定的残差图的特征是:残差均匀地分布在以横轴(一般为解释变量或观测顺序等)为中心的水平带状区域内,且残差之间没有明显的趋势性或规律性.根据这些特征对每个选项的残差图进行分析判断.
【详解】对于选项A,观察选项A的残差图,可以看到残差均匀地分布在以横轴为中心的水平带状区域内.残差没有明显的上升、下降趋势,也没有呈现出某种曲线形状等规律性.这表明随机误差满足均值为0,相互独立且方差为常数的假定,所以选项A符合一元线性回归模型中对随机误差的假定.
对于选项B,选项B的残差图中,残差呈现出明显的上升趋势.这意味着残差不是相互独立的,且其均值也不是稳定的0,不满足一元线性回归模型中随机误差相互独立且均值为0的假定,所以选项B不符合要求.
对于选项C,选项C的残差图呈现出“U”型曲线的形状.这种形状说明残差具有明显的规律性,不是随机分布的,不满足随机误差相互独立且方差为常数的假定,所以选项C不符合要求.
对于选项D,选项D的残差图虽然看起来大致分布在一定区域内,但仔细观察可以发现,残差在横轴两侧的分布并不是均匀的,在某些区间内残差的波动较大,而在另一些区间内波动较小,这说明方差不是常数,不满足一元线性回归模型中对随机误差方差为常数的假定,所以选项D不符合要求.
故选:A.
23.根据变量Y和x的成对样本数据,由一元线性回归模型得到经验回归模型,求得残差图.对于以下四幅残差图,满足一元线性回归模型中对随机误差假设的是( )
A. B.
C. D.
【答案】D
【分析】根据一元线性回归模型中对随机误差的假定进行判断.
【详解】根据一元线性回归模型中对随机误差的假定,残差应是均值为、方差为的随机变量的观测值.
对于A选项,残差与有线性关系,故A错误;
对于B选项,残差的方差不是一个常数,随着观测时间变大而变小,故B错;
对于C选项,残差与有非线性关系,故C错;
对于D选项,残差比较均匀地分布在以取值为的横轴为对称轴的水平带状区域内,故D正确.
故选:D.
24.下列残差图满足一元线性回归模型中对随机误差的假定的是( )
A. B.
C. D.
【答案】A
【分析】根据一元线性回归模型中对随机误差的假定:残差应是均值为0、方差为的随机变量的观测值逐项分析即可求解.
【详解】对于A,残差比较均匀地分布在以取值为0的横轴为对称轴的水平带状区域内,故A正确;
对于B,残差与观测时间有线性关系,故B错误;
对于C,残差与观测时间有非线性关系,故C错误;
对于D,残差的方差不是一个常数,随观测时间变大而变大,故D错误.
故选:A.
25.(多选)成对数据和的一元线性回归模型为,依据模型可建立经验回归方程,用回归方程可得到响应变量的预测值及残差,残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果.对下列四幅残差图的描述正确的是( )
A.图甲显示残差的方差随观测时间变大而变大
B.图乙满足一元线性回归模型对随机误差的假设
C.图丙说明残差与观测时间有非线性关系,应在模型中加入时间的非线性函数部分
D.图丁说明残差与观测时间有线性相关性,故满足一元线性回归模型对随机误差的假设
【答案】ABC
【分析】根据一元线性回归模型中对随机误差的假定进行判断.
【详解】根据一元线性回归模型中对随机误差的假定,残差应是均值为、方差为的随机变量的观测值.
对于A选项,由图可知残差的方差随观测时间变大而变大,故A正确;
对于B选项,由图可知残差比较均匀地分布在水平带状区域内,满足一元线性回归模型对随机误差的假设,故B正确;
对于C选项,由图知残差与观测时间有非线性关系,应在模型中加入时间的非线性函数部分,故C正确;
对于D选项,由图知残差与有线性关系,不符合题意,故D错误.
26.在政府发布的光伏发电补贴政策的引导下,西北某地光伏发电装机量急剧上升,现对2016年至2023年的新增光伏装机量进行调查,根据散点图选择了两个模型进行拟合,并得到相应的经验回归方程.为判断模型的拟合效果,甲、乙、丙三位同学进行了如下分析:
(1)甲同学通过计算残差作出了两个模型的残差图,如图所示;
(2)乙同学求出模型①的残差平方和为0.4175、模型②的残差平方和为1.5625;
(3)丙同学分别求出模型①的决定系数、模型②的决定系数为;
经检验,模型①拟合效果最佳,则甲、乙、丙三位同学中,运算结果肯定出错的同学是________.(填“甲”或“乙”或“丙”)
【答案】丙
【分析】应用残差图,残差平方和,决定系数的性质判定即可.
【详解】甲的残差图中,模型①的残差点更均匀地分布在以横轴为对称轴的水平带状区域内,且水平带状区域更窄,说明模型①拟合效果更好;
残差平方和越大,即决定系数越小,说明数据点越离散,
所以乙的计算结果显示模型①的拟合效果更好,而丙的计算结果显示模型②的拟合效果更好.
故答案为:丙.
易错06 决定系数意义理解偏差
错误:误以为决定系数越小,回归模型拟合效果越好。
注意:决定系数取值在0到1之间,数值越接近1,模型对数据的解释能力越强,拟合效果越好。
27.决定系数可以用来比较两个模型的拟合效果,的计算公式为,则越大,表示残差平方和越________(填“大”或“小”),即拟合效果越________(填“好”或“差”).
【答案】 小 好
【详解】略
28.已知相关变量和的散点图如图所示,若用与拟合时,决定系数分别为和,则比较和的大小结果为( )
A. B. C. D.不确定
【答案】C
【分析】根据决定系数的定义判断即可.
【详解】由散点图知,用拟合的效果比用拟合的效果要好,
所以.
故选:C.
29.某同学用收集到的6组数据对制作成如图所示的散点图(点旁的数据为该点坐标),并由最小二乘法计算得到回归直线的方程:,相关系数为,决定系数为;经过残差分析,确定点E为“离群点”(对应残差过大的点),把它去掉后,再用剩下的5组数据计算得到回归直线的方程:相关系数为,决定系数为.则以下结论中,正确的是( ).
① ② ③ ④
A.①② B.①②③ C.②④ D.②③④
【答案】B
【分析】利用回归方程的性质,利用相关系数和相关指数分析解答.
【详解】由散点图可知,x,y之间是正相关关系,所以,故①正确;
由散点图可知,回归直线的斜率是正数,且的斜率大于的斜率,
所以,故②③正确:
由散点图可知,去掉“离群点”E后,相关性更强,拟合的效果更好,
所以,故④错误.
故选:B.
易错07 独立性检验概念误区
错误:卡方值较大时,直接判定两个分类变量有必然因果关系。
注意:独立性检验仅能判断变量是否有关联、是否独立,无法证明变量存在因果关系。
30.下列关于独立性检验的说法正确的是( )
A.独立性检验是对两个变量是否具有线性相关关系的一种检验
B.独立性检验可以确定两个变量之间是否具有某种关系
C.利用独立性检验推断吸烟与患肺病的关联中,若有的把握认为吸烟与患肺病有关系时,我们不可以说在100个吸烟的人中,有99人患肺病
D.在一个列联表中,由计算得的值,则的值越大,判断两个变量间有关联的把握就越小
【答案】C
【详解】对于A,独立性检验是通过卡方计算来判断两个变量存在关联的可能性的一种方法,并非检验二者是否是线性相关,A错误;
对于B,独立性检验并不能确定两个变量相关,B错误;
对于C,是指“抽烟”和“患肺病”存在关联的可能性大小,并非抽烟人中患肺病的发病率,
因此不可以说在100个吸烟的人中,有99人患肺病,C正确;
对于D,在一个列联表中,由计算得的值,则的值越大,判断两个变量间有关联的把握就越大,D错误.
31.为了验证牛的毛色(黑色、红色)和角(有角、无角)这两对相对性状是否相关,某学院进行了一次数据统计,根据形成的列联表,计算得到,根据小概率值的独立性检验(已知独立性检验中),下列结论正确的是( )
A.牛的毛色与角无关
B.牛的毛色与角无关,此推断犯错误的概率不超过0.05
C.牛的毛色与角有关
D.牛的毛色与角有关,此推断犯错误的概率不超过0.05
【答案】A
【分析】根据卡方独立性检验规则,比较与临界值即可得出结论.
【详解】因为,所以牛的毛色与角无关.
故选:A.
32.根据分类变量与的观测数据,计算得到,依据小概率值()的独立性检验,则( )
A.变量与不独立
B.变量与独立
C.变量与不独立,这个结论犯错误的概率不超过0.1
D.变量与独立,这个结论犯错误的概率不超过0.1
【答案】B
【分析】根据独立性检验的概念可得正确的选项.
【详解】因为,所以在显著性水平下,
没有充分证据拒绝原假设,因此我们认为变量与是独立的,
故选:B
33.在性别与吃零食这两个分类变量的计算中,下列说法正确的是( )
①若的观测值为,我们有的把握认为吃零食与性别有关系,那么在100个吃零食的人中必有99人是女性;
②从独立性检验可知有的把握认为吃零食与性别有关系时,我们说某人吃零食,那么此人是女性的可能性为;
③若从统计量中求出有的把握认为吃零食与性别有关系,是指有的可能性使得出的判断出现错误.
A.①② B.①③ C.②③ D.③
【答案】D
【分析】由独立性检验相关概念可得答案.
【详解】①若的观测值为,我们有的把握认为吃零食与性别有关系,那么在100个吃零食的人中必有99人是女性,故①不正确;
②独立性检验是用来考察两个分类变量是否具有关联性,并且能较精确地给出这种判断的可靠程度,
而不是给出事件的概率,故②不正确;
③若从统计量中求出有的把握认为吃零食与性别有关系,是指有的可能性使得出的判断出现错误,③正确。
故选:D
34.利用来确定在多大程度上可以认为“两个分类变量有关系”的方法称为两个分类变量的独立性检验.利用独立性检验不仅可以考察两个分类变量是否有关系,而且( )
A.能较精确的给出这种判断的可靠程度
B.得出的结论完全正确,不会出错
C.的观测值很大时(比如大于20),则得出的零假设完全正确,不会出错
D.的观测值很小时(比如小于2),则得出的零假设肯定错误
【答案】A
【分析】运用独立性检验的思想逐项判断即可得结论.
【详解】对于A ,独立性检验不仅可以判断两个分类变量是否有关联,
还能通过计算卡方统计量()和对应的概率值,
给出这种判断的可靠程度(即显著性水平),故A正确;
对于B,独立性检验是基于概率统计的推断方法,不能保证结论完全正确,
仍有犯拒真或取伪的可能。故B错误;
对于C,的观测值很大时,仅表示拒绝零假设(变量独立)的可信度很高,
但不能保证结论“完全正确”,统计检验总有误差,故C错误;
对于D:的观测值很小时,表明没有足够证据拒绝零假设(变量独立),
但不能说明结论“肯定错误”,可能存在样本不足或变量实际关系较弱的情况,故D错误.
故选:A.
易错08 独立性检验临界值判断失误
错误:卡方值大于临界值时,认为变量一定有关联;小于临界值则认为变量无任何关联。
注意:卡方值大于临界值,是有充分把握认为变量有关联;小于临界值,是无足够证据证明有关联,并非绝对独立。
35.独立性检验中,若小于临界值,则下列结论正确的是( )
A.两个变量一定相互独立 B.两个变量一定不独立
C.没有充分证据表明两个变量有关 D.两个变量有关联的可能性为
【答案】C
【分析】根据独立性检验的基本逻辑即可求解.
【详解】对于A,小于临界值,并不意味着“一定相互独立”,只是无足够证据反对独立,故A错误;
对于B,小于临界值,并不意味着“一定不独立”,只是无足够证据反对独立,故B错误;
对于C,这是独立性检验的基本逻辑:当时,无充分证据支持变量相关,即不能认为有关联,故C正确;
对于D,对应的把握认为两个变量有关联,而实际上,故D错误.
36.调查某医院一段时间内婴儿出生的时间(白天与晚上)和性别(男与女)的关联性,对样本数据分析统计,计算得到,依据小概率值的独立性检验,下列说法正确的是( )(附:)
A.婴儿90%在白天出生
B.婴儿性别与出生时间无关联
C.有0.1的把握认为婴儿性别与出生时间有关联
D.婴儿性别与出生时间有关联,此推断犯错误的概率不大于0.1
【答案】D
【分析】求出并与比较即可求解.
【详解】因为,
依据小概率值的独立性检验,
所以婴儿性别与出生时间有关联,此推断犯错误的概率不大于0.1.
故选:D.
37.某医疗研究机构为检验某种新研发的药物对特定疾病治疗是否有效,随机选取了200名患者进行双盲实验.其中100人服用新药,100人服用旧药,统计结果如下表
治愈
未治愈
合计
服用新药
67
33
100
服用旧药
48
52
100
合计
115
85
200
附:统计量临界值表
0.10
0.05
0.01
0.005
2.706
3.841
6.635
7.879
其中.
则下列说法正确的是( )
A.有的把握认为新研发的药物对特定疾病治疗有效
B.有的把握认为新研发的药物对特定疾病治疗无效
C.有的把握认为新研发的药物对特定疾病治疗无效
D.有的把握认为新研发的药物对特定疾病治疗有效
【答案】D
【分析】求出的值,即可得答案。
【详解】因为,
又因为当时,对应的犯错的概率为,
所以有的把握认为新研发的药物对特定疾病治疗有效.
38.统计学中,常用的显著性水平以及对应的分位数如下表所示.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
在检验与是否有关的过程中,根据已知数据计算得,则( )
A.在犯错误的概率不超过1的前提下,可以认为与有关
B.在犯错误的概率不超过的前提下,可以认为与有关
C.有的把握认为与有关
D.有的把握认为与有关
【答案】C
【分析】根据独立性检验的应用判断选项.
【详解】因为,所以,
所以在犯错误的概率不超过的前提下,
可以认为与有关或有的把握认为与有关.
39.为了研究高中学生中性别与对乡村音乐态度(喜欢和不喜欢两种态度)的关系,运用2×2列联表进行独立性检验,得到的结论是有99%的把握认为性别与喜欢乡村音乐有关系,则的值可以为( )
A.2.853 B.3.841 C.6.758 D.6.451
【答案】C
【分析】由题意,对比选项即可得解.
【详解】有的把握认为性别与喜欢乡村音乐有关系,则.
故选:C.
1.对变量、有观测数据,得散点图1;对变量、有观测数据,得散点图2.分别用、表示变量与、与之间的线性相关系数,则下列说法正确的是( ).
A.变量与呈现正相关,且
B.变量与呈现负相关,且
C.变量与呈现正相关,且
D.变量与呈现负相关,且
【答案】D
【分析】根据散点图的分布的趋势和集中程度可得正确的选项.
【详解】对于图1,散点总体斜向上分布,故变量与呈现正相关,故排除B;
对于图2,散点总体斜向上分布,故变量与呈现负相关,故排除C;
图1中散点图分布较为集中,图2中的散点图分布较为分散,故,
故选:D.
2.对两个变量x,y进行线性相关性检验,得线性相关系数,对两个变量u,v进行线性相关性检验,得线性相关系数,则下列判断正确的是( )
A.变量x与变量y正相关,变量u与变量v负相关,变量x与变量y的线性相关性更强
B.变量x与变量y负相关,变量u与变量v正相关,变量x与变量y的线性相关性更强
C.变量x与变量y负相关,变量u与变量v正相关,变量u与变量v的线性相关性更强
D.变量x与变量y正相关,变量u与变量v负相关,变量u与变量v的线性相关性更强
【答案】D
【分析】根据相关系数的正负判断正负相关,并根据相关系数绝对值大小得到相关性强弱.
【详解】由线性相关系数知x与y正相关,
由线性相关系数知u与v负相关,
又,所以变量u与变量v的线性相关性比变量x与变量y的线性相关性更强.
故选:D
3.有一散点图如图,在5个数据中去掉后,下列说法正确的是( )
A.变量与变量的线性相关性变弱 B.数据的方差变大
C.相关系数变小 D.残差平方和变小
【答案】D
【分析】利用散点图分析数据,判断相关系数,方差,残差的平方和的变化情况.
【详解】从散点图可分析出,若去掉点,则剩下的点更能集中在一条直线附近,
所以解释变量与响应变量的线性相关性变强,
数据的离散程度减小,所以方差变小,相关系数会变大,
因为拟合效果越好,所以残差平方和变小.
故选:D
4.已知下列四个命题:①残差图中残差点所在的水平带状区域越宽,则回归方程的预报精确度越高;②甲、乙两个模型的决定系数分别约为0.88和0.80,则模型乙的拟合效果更好;③回归直线恒过点,且至少过一个样本点;④在线性回归分析中,样本相关系数r的绝对值越接近1时,成对样本数据的线性相关程度越强.其中真命题的个数是( )
A.4 B.3 C.2 D.1
【答案】D
【详解】对于①,残差图中,残差点所在水平带状区域越窄,说明残差波动越小,
即回归方程的预报精确度越高,残差点所在水平带状区域越宽,说明残差波动越大,
即回归方程的预报精确度越低,错误;
对于②,决定系数越接近1,说明模型对数据的拟合效果越好,故模型甲的拟合效果更好,错误;
对于③,回归直线过样本数据,,,的中心点,
并不一定过样本数据中的某一个点,错误;
对于④,在线性回归分析中,样本相关系数r的绝对值越接近1时,成对样本数据的线性相关程度越强,正确.
5.某学校一同学研究温差与本校当天新增感冒人数(人)的关系,该同学记录了5天的数据:
5
6
8
9
12
17
20
25
28
35
经过拟合,发现基本符合经验回归方程,则下列选项错误的是( )
A.样本中心点为 B.
C.时,残差为 D.相关系数
【答案】B
【分析】由回归直线必过样本中心可判断A项,代入样本中心点即可判断B,由残差公式可判断C项,由线性回归方程的斜率即可相关系数正负可判断D项.
【详解】对于A项,因为,,
所以样本中心点为,故A项正确;
对于B项,由回归直线必过样本中心可得:,解得:,故B项不正确;
对于C项,由B项知,,令,则,
所以残差为,故C项正确;
对于D项,经验回归方程中,斜率,说明与正相关,
故相关系数,故D项正确.
6.下列命题正确的是( )
A.残差图中残差点所在的水平带状区域越宽,则回归方程的预报精确度越高;
B.当相关系数时,两个变量负相关;
C.甲、乙两个模型的分别约为0.88和0.80,则模型乙的拟合效果更好;
D.线性回归直线必过样本数据的中心点;
【答案】D
【分析】利用回归直线的性质,相关系数和决定系数的规定及残差分析的分析方式,逐项判断即可.
【详解】选项A:残差图中残差点所在的水平带状区域越宽,说明观测值与预报值之间的差距越大,数据分布越分散,因此回归方程的预报精确度就越差,所以选项A错误;
选项B:当相关系数时,说明两个变量正相关,所以选项B错误;
选项C:模型的决定系数越大,说明残差平方和越小,拟合效果越好,,所以模型甲的拟合效果更好,所以选项C错误;
选项D:回归直线的定义规定回归直线必过样本数据的中心点,所以选项D正确.
7.以下说法不正确的是( )
A.样本数据1,1,1,3,3,3的极差为2,标准差为1
B.对具有线性相关关系的变量,,其经验回归方程为,若样本数据的中心点为,则实数的值为2
C.对一个容量为的总体,抽取容量为的样本,当选取简单随机抽样、系统抽样和分层抽样三种不同方法抽取样本时,三种方法的总体中每个个体被抽中的概率均相等
D.根据分类变量与的成对样本数据,计算得到,则依据的独立性检验,可以认为“与无关联”
【答案】D
【详解】对于A,在样本数据1,1,1,3,3,3中,最大值是3,最小值是1,所以极差为.
样本数据的平均数为,则标准差,所以选项A正确.
对于B,已知经验回归方程为,样本数据的中心点为,
因为样本数据的中心点为一定在经验回归方程上,所以,则,所以选项B正确.
对于C,简单随机抽样、系统抽样和分层抽样都是等概率抽样,即总体中每个个体被抽中的概率均为,所以选项C正确.
对于D,已知,依据的独立性检验,
当时,我们有的把握认为“与有关联”,所以选项D错误.
8.为研究蔬菜植株感染红叶螨能否引起植株形成某种抗体,使用列联表独立性检验.随机抽取一定量植株,获得观察数据,制作列联表.提出原假设:感染与形成抗体__________;确定显著性水平;若计算得;依据,从而__________原假设,即得统计决断.( )
A.有关;拒绝 B.有关;接受 C.无关;拒绝 D.无关;接受
【答案】D
【详解】在独立性检验中,提出原假设:感染与形成抗体无关,当计算得到的统计量小于临界值时,就接受原假设.
9.(多选)下列说法正确的是( )
A.散点图能得到两个变量的相关关系
B.成对的统计数据一定能画出散点图
C.若变量和满足关系且变量与正相关,则与也正相关
D.散点图中的所有点落在一条直线上,则对应变量呈线性相关
【答案】BC
【分析】根据相关关系、散点图的定义判断即可.
【详解】对于A,散点图不一定能得到两个变量的相关关系,故A错误;
对于B,对任意给定的成对的统计数据一定能画出散点图,故B正确;
对于C,变量和满足关系,则变量与呈正相关,变量与正相关,
所以与也正相关,故C正确;
对于D,散点图中的所有点落在一条直线上,则变量之间是一种线性的函数关系,不属于相关关系,故D错误.
故选:BC.
10.(多选)通过随机抽样,得到变量和变量的7对数据,并绘制成散点图如图所示,已知变量和变量线性相关,且回归直线是图中直线,则下列说法正确的是( )
A.直线的斜率是负数
B.变量与变量正相关
C.相关系数
D.若去掉图中点后,剩余数据的相关系数变大
【答案】AC
【分析】根据数据的散点图,结合相关性、相关系数的概念与定义,逐项判定,即可得解.
【详解】对于A、B、C:由图可知直线的斜率是负数,所以变量与变量负相关,相关系数,故A、C正确,B错误;
对于D:若去掉图中点后,剩余的数据会更集中,相关程度会更高,相关系数的绝对值变大,又,所以相关系数变小,故D错误.
故选:AC.
11.(多选)下列结论正确的是( )
A.两个变量的相关性越弱,相关系数越小
B.经验回归直线一定经过点
C.在线性回归方程中,当变量每增加一个单位时,平均减少0.5个单位
D.在做回归分析时,残差点均匀分布在横轴两侧,且分布的带状区域的宽度越窄表示回归效果越差
【答案】BC
【分析】根据相关系数与线性相关性的关系可判断选项A;根据回归直线的特点即可判断选项B,C;根据残差分析法判断回归模型的拟合效果即可判断选项D.
【详解】对于A,两个变量的相关性越弱,相关系数越小,故A错误;
对于B,回归直线一定经过样本中心,故B正确;
对于C,在线性回归方程中,当变量每增加一个单位时,平均减少0.5个单位,故C正确;
对于D,在做回归分析时,残差图中残差点均匀分布在横轴两侧,且分布的带状区域的宽度越窄,说明选用的模型拟合精度越高,表示回归效果越好,故D错误.
12.(多选)某电子商城统计了最近5个月某品牌电脑的实际销量,如下表所示:
时间x(月份)
1
2
3
4
5
销量y(百台)
0.3
0.4
0.6
0.7
0.9
若y与x线性相关,且经验回归方程为:,则下列说法正确的是( )
A.变量x,y正相关
B.
C.可以预测当时,商城内该电脑的销量为1百台
D.当时,残差为
【答案】ABD
【分析】求出样本中心点,进而求出经验回归方程,再逐项求解判断.
【详解】对于A,由,得变量x,y正相关,A正确;
对于B,,
因此,B正确;
对于C,,当时,(百台),C错误;
对于D,当时,,残差为,D正确.
13.(多选)如图所示,有一散点图在5个数据中去掉后,下列说法中错误的是( )
A.残差平方和变大 B.相关系数变小
C.决定系数变小 D.解释变量与响应变量的相关性变强
【答案】ABC
【分析】利用散点图分析数据,判断相关系数,相关指数,残差平方和的变化情况即可得.
【详解】从散点图可分析出,若去掉点,则解释变量与响应变量的线性相关性变强,
且是正相关,所以相关系数变大,决定系数变大,残差平方和变小,
故A、B、C错误,D正确.
14.(多选)如果散点图中所有的散点都落在一条斜率为非0的直线上,则( )
A.解释变量和响应变量是线性函数关系 B.解释变量和响应变量是线性相关关系
C.相关系数 D.决定系数
【答案】AD
【分析】根据散点图得这两个变量线性相关,由此逐项判断得解.
【详解】由散点图中所有的散点都落在一条斜率为非0的直线上,
得解释变量和响应变量是线性函数关系,不是线性相关关系,,,BC错误,AD正确.
故选:AD
15.(多选)一组样本数据.其中,求得其经验回归方程为:,残差为.对样本数据进行处理:,得到新的数据,求得其经验回归方程为:,其残差为,分布如图所示,且,则( )
A.样本负相关 B.
C. D.处理后的决定系数变大
【答案】ABD
【分析】利用回归方程判断A;利用样本中心点计算判断B;利用图象的波动性判断CD.
【详解】对于A,经验回归方程中斜率,则样本负相关,A正确;
对于B,原样本均值:,由,得,B正确:
对于C,由图1的数据波动较大可得比更集中,则,C错误;
对于D,由图1的残差平方和较图2的残差平方和大知,处理后拟合效果更好,决定系数变大,D正确.
故选:ABD
16.(多选)有一幅散点图如图所示,从5个数据点中去掉,则下列说法中正确的是( )
A.残差平方和变大
B.相关系数r变大
C.决定系数变大
D.解释变量x与响应变量y的线性相关程度变强
【答案】BCD
【分析】根据散点图得到偏离直线,结合相关系数,决定系数和残差平方和的定义得到答案.
【详解】由散点图分析可知,偏离直线,
去掉后,解释变量x与响应变量y的线性相关程度变强,
相关系数r变大,决定系数变大,残差平方和变小.
故选:BCD.
17.(多选)下列说法正确的有( )
A.利用残差图分析模型的刻画效果,若残差比较均匀的分布在以取值为0的横轴为对称轴的水平带状区域内,则说明该模型刻画数据的效果较好
B.可以用决定系数来比较两个模型的拟合效果,越大模型拟合效果越好
C.已知样本数据的方差为4,则数据的标准差是4
D.设两个变量的样本相关系数为,则越大其线性相关程度越强
【答案】ABC
【分析】应用线性相关系数、残差图的意义,决定系数、方差的性质等一一检验即可.
【详解】对于A:在残差图中,残差点比较均匀地落在水平的带状区域内,说明选用的模型比较合适,故A正确;
对于B:决定指数来刻画回归的效果,值越大,说明模型的拟合效果越好,故B正确;
对于C:样本数据的方差为4,则数据的方差为,故标准差为4,故C正确;
对于D:相关系数的绝对值的大小越接近于1,两个变量的线性相关性越强,反之,线性相关性越弱,因此D选项错误;
故选:ABC
18.(多选)为研究某种树树高和胸径的关系,某人随机测量了10棵该品种树的胸径(单位:cm)和树高(单位:m)的数据,已知其中一组数据为,且,求得回归方程为,并绘制了如下残差图,则下列结论正确的是( )
A.由残差图可判定树高与胸径的关系大致符合上述回归模型
B.数据对应的残差为0.9
C.该种树的平均树高约为22.29m
D.删除一组数据后,重新求得的回归直线的斜率变小
【答案】AC
【分析】对于A:分析残差图判断模型拟合程度,且集中在0附近,所以由残差图可判定树高与胸径的关系符合上述回归模型,判定的即可;对于C:根据回归方程经过样本中心,代入计算即可;对于B:运用残差概念,计算残差即可;对于D:分析删除一组数据对回归直线斜率的影响即可.
【详解】对于A:分析残差图判断模型拟合程度,由残差图可知,残差分布比较均匀,且集中在0附近,
所以由残差图可判定树高与胸径的关系大致符合上述回归模型,选项 A正确;
对于B:计算数据对应的残差,当时,,残差为,选项B错误;
对于C:已知,则样本中心点的横坐标,
将代入回归方程,
可得,所以该种树的平均树高约为,选项C正确;
对于D:分析删除一组数据对回归直线斜率的影响,删除数据后,
因为大于样本中心点的横坐标,且小于通过回归方程计算出的对应的预测值,
所以删除该点后,剩下的数据整体上可能使得树高与胸径的正相关关系更明显,即重新求得的回归直线的斜率变大,选项D错误.
故选:AC.
19.下面命题中说法正确的是______.
①设两个变量之间的线性相关系数为,则越大,的相关性越强;
②等高堆积条形图可以直观的反映一对分类变量之间是否具有关联性;
③如果散点图的散点都落在一条直线上,则;
④正方形的面积与周长是相关关系.
【答案】①②③
【分析】由相关系数、等高堆积条形图和决定系数的性质判断①②③,由相关关系的定义判断④.
【详解】越大,的相关性越强,①正确;
与表格相比,等高堆积条形图可以展示列联表数据的频率特征,能够直观地反映出两个分类变量间是否相互影响,②正确;
若散点图的散点都落在一条直线上,残差平方和为0,,③正确;
正方形的面积与周长是函数关系,④错误.
故答案为:①②③.
20.红铃虫(Pectinophora gossypiella)是棉花的主要害虫之一,其产卵数与温度有关.现收集到一只红铃虫的产卵数(个)和温度()的8组观测数据,制成图1所示的散点图.现用两种模型①,②分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图.
根据收集到的数据,计算得到如下值:
25
2.9
646
168
422688
50.4
70308
表中;;;
(1)根据残差图,比较模型①、②的拟合效果,哪种模型比较合适?
(2)根据(1)中所选择的模型,求出关于的回归方程.
附:对于一组数据,其回归直线的斜率和截距的最小二乘估计分别为,,
【答案】(1)①;
(2)
【分析】(1)根据残差点的分布情况分析即可;
(2)取对数,将非线性回归转化为线性回归,然后根据所给数据代入公式即可得回归方程.
【详解】(1)模型①更合适.
模型①残差点比较均匀地落在水平的带状区域中,且带状区域的宽度比模型②带状宽度窄,
所以模型①的拟合精度更高,回归方程的预报精度相应就会越高,故选模型①比较合适.
(2)令与温度可以用线性回归方程来拟合,则.
, ,
则关于的线性回归方程为,即,
产卵数关于温度的回归方程为.
21.黄河鲤是我国华北地区的主要淡水养殖品种之一,其鳞片金黄、体形梭长,尤以色泽鲜丽、肉质细嫩、气味清香而著称.为研究黄河鲤早期生长发育的规律,丰富黄河鲤早期养殖经验,某院校研究小组以当地某水产养殖基地的黄河鲤仔鱼为研究对象,从出卵开始持续观察20天,试验期间,每天固定时段从试验水体中随机取出同批次9尾黄河鲤仔鱼测量体长,取其均值作为第天的观测值(单位:),其中,.根据以往的统计资料,该组数据可以用Logistic曲线拟合模型或Logistic非线性回归模型进行统计分析,其中a,b,u为参数.基于这两个模型,绘制得到如下的散点图和残差图:
(1)你认为哪个模型的拟合效果更好?分别结合散点图和残差图进行说明:
(2)假定,且黄河鲤仔鱼的体长与天数具有很强的相关关系.现对数据进行初步处理,得到如下统计量的值:,,,,,,其中,,根据(1)的判断结果及给定数据,求关于的经验回归方程,并预测第22天时仔鱼的体长(结果精确到小数点后2位).
附:对于一组数据,,…,其回归直线的斜率和截距的最小二乘估计分别为,;参考数据:.
【答案】(1)拟合效果更好,答案见解析
(2),
【分析】(1)根据散点图,结合两个模型的特征进行判断即可;
(2)根据对数的运算性质,结合题中所给的公式和数据进行求解即可.
【详解】(1)Logistic非线性回归模型拟合效果更好.
从散点图看,散点更均匀地分布在该模型拟合曲线附近;
从残差图看,该模型下的残差更均匀地集中在以残差为0的直线为对称轴的水平带状区域内.
(2)将转化为,
则,所以,
所以.
所以关于的经验回归方程为.
当时,体长.
22.2024年2月10日至17日(正月初一至初八),“2024•内江市中区新春极光焰火草地狂欢节”在川南大草原举行,共举行了8场精彩的烟花秀节目.前5场的观众人数(单位:万人)与场次的统计数据如表所示:
场次编号
1
2
3
4
5
观众人数
0.7
0.8
1
1.2
1.3
(1)已知可用线性回归模型拟合与的关系,请建立关于的线性回归方程;
(2)若该烟花秀节目分A、B、C三个等次的票价,某机构随机调查了该烟花秀节目现场200位观众的性别与购票情况,得到的部分数据如表所示,请将列联表补充完整,并判断能否有的把握认为该烟花秀节目的观众是否购买A等票与性别有关.
购买A等票
购买非A等票
总计
男性观众
50
女性观众
60
总计
100
200
参考公式及参考数据:回归方程中斜率与截距的最小二乘法估计公式分别为,其中.
0.100
0.050
0.010
2.706
3.841
6.635
【答案】(1)
(2)表格见解析,没有
【分析】(1)利用表中数据结合最小二乘法计算回归直线即可;
(2)根据题意补全列联表即可,再由卡方公式及独立性检验的思想判定结果即可.
【详解】(1)由表格可知,
,,所以,
则;
(2)根据数据补全表格如下:
购买A等票
购买非A等票
总计
男性观众
40
50
90
女性观众
60
50
110
总计
100
100
200
所以,
故没有的把握认为该烟花秀节目的观众是否购买A等票与性别有关.
23.糟蛋是新鲜鸭蛋(或鸡蛋)用优质糯米糟制而成,是中国别具一格的特色传统美食,以浙江平湖糟蛋、陕州糟蛋和四川宜宾糟蛋最为著名.平湖糟蛋采用优质鸭蛋、上等糯米和酒糟糟渍而成,经过糟渍蛋壳脱落,只有一层薄膜包住蛋体,其蛋白呈乳白色,蛋黄为橘红色,味道鲜美.糟蛋营养丰富,每百克中约含蛋白质15.8克、钙24.8克、磷11.1克、铁0.31克,并含有维持人体新陈代谢必须的18种氨基酸.现有平湖糟蛋的两家生产工厂,产品按质量分为特级品、一级品和二级品,其中特级品和一级品都是优等品,二级品为合格品.为了比较两家工厂的糟蛋质量,分别从这两家工厂的产品中各选取了200个糟蛋,产品质量情况统计如下表:
优等品
合格品
合计
特级品
一级品
二级品
工厂甲
100
75
25
200
工厂乙
120
30
50
200
合计
220
105
75
400
(1)从400个糟蛋中任取一个,记事件表示取到的糟蛋是优等品,事件表示取到的糟蛋来自于工厂甲.求;
(2)依据小概率值的独立性检验,从优等品与合格品的角度能否据此判断两家工厂生产的糟蛋质量有差异?
附:参考公式:,其中.
独立性检验临界值表:
0.10
0.05
0.010
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【答案】(1)
(2)认为两家工厂生产的糟蛋质量有差异
【分析】(1)根据条件概率的知识求得.
(2)先绘制列联表,然后计算的值,从而作出判断.
【详解】(1).
(2)列联表:
优等品
合格品
合计
工厂甲
175
25
200
工厂乙
150
50
200
合计
325
75
400
零假设为:两家工厂生产的糟蛋质量没有差异.
,
依据小概率值的独立性检验,我们推断不成立,即认为两家工厂生产的糟蛋质量有差异.
1/6
学科网(北京)股份有限公司
$
第8章 成对数据的统计分析
1. 成对数据间的关系:来自同一对象的两组数据称为成对数据. 研究成对数据相关性的方法称为相关分析.
2. 相关系数
(1)公式:一些成对数据具有明显的相关性,且在绘制出散点图后可以用一条直线进行拟合,也就是说具有线性相关性.
设由变量 和 获得的两组数据分别为 和 ,其对应关系为 ,两组数据 和 的线性相关系数是度量两个变量 和 之间线性相关程度的统计量,其计算公式为 ,其中 ,它们分别是这两组数据的算术平均数. 线性相关系数常常简称为相关系数, 也称为皮尔逊相关系数.
(2)相关性质:相关系数 的值满足 , 越接近1,两个变量的线性相关程度越高; 越接近 0 , 两个变量的线性相关程度越低.
时,当 的值由小变大, 的值具有由小变大的变化趋势,称这种相关为正相关;
时,当 的值由小变大, 的值具有由小变大的变化趋势,称这种相关为负相关.
(3)特点:相关系数 描述的是两个变量之间线性关系的方向与程度,是一种定量分析的方法,相关系数具有以下特点:
① 相关系数的计算公式关于 和 这两个变量是对称的. 画散点图时,不论以哪个变量作为横轴 (纵轴), 所得的相关系数都一样.
② 两个变量的相关系数与这两个变量的单位无关, 相关系数的结果都一样.
③ 与平均数和标准差一样, 相关系数不仅会受到数据量多少的影响, 也会受到少数异常值较大的影响.
用相关系数来描述两个随机变量的相关性, 一般要求这两个变量均满足正态分布.
3. 一元线性回归分析的基本思想
一般地,设给定一组有线性相关关系的成对数据 和一个线性方程 (或称线性模型) .①
当变量 取值 时,令 ,它是变量 与 对应的理想值. 但数据中的 与 不一定相同,它们的差 称为在 处的离差,当 时称为正离差,而当 时称为负离差, 显然, 离差直观地描述了单对数据与线性方程①的贴近度.
我们用离差的平方和 来刻画直线与点之间的拟合程度. 称为拟合误差. 我们把拟合误差取得最小值时得到的线性方程(线性模型)记为 ,并称之为变量 随 波动的回归方程或回归模型,其中自变量 称为解释变量,因变量 称为反应变量,回归方程所定义的直线称为回归直线,回归方程的系数 (或称回归模型的参数) 与 称为回归系数. 由一组有某种线性关系的成对数据求其回归方程的方法称为一元线性回归分析.
回归系数 与 的计算公式: 的算术平均值,数对 称为样本点的中心.
我们的回归分析是基于 取最小值的假设,即基于所有离差的平方和取最小值的假设进行的. 这种回归分析的方法称为最小二乘法, 由最小二乘法导出的估计量称为最小二乘估计量, 所得到的回归系数 与 又称为模型参数 与 的最小二乘估计.
4. 一元线性回归分析的应用举例
建立一元线性回归模型的一般步骤如下:
① 确定研究对象,从一组数据出发,根据实际问题,明确哪个变量是自变量,哪个变量是因变量;
② 对确定的自变量和因变量,绘制相应的散点图,观察它们之间的关系(如是否存在线性关系等);
③ 若观察到数据呈线性关系,则选用线性方程 ;
④ 利用最小二乘法估计线性方程中的参数 ,得到回归方程 ;
⑤ 得出结果后计算离差,采用统计方法检验模型是否合适(这一步本书不作要求);
⑥ 利用所求的回归方程进行预测.
5. 相关分析和回归分析作为处理成对数据的两种基本统计方法, 它们有如下联系与区别:
① 相关分析主要测定变量之间相关性的强弱和变化方向, 而回归分析则是在相关分析的基础上建立回归模型, 定量地描述变量间具体的变动关系, 只有在两组变量具有线性相关生时, 才作线性回归分析, 得到回归直线.
② 在相关分析中,两个变量的地位是对等的. 而在同归分析中,要考察的是一个变量随另一个变量的变化趋势, 其中自变量是解释变量, 因变量是反应变量.
③ 回归分析具有因果分析和预测的功能, 可以分析反应变量受解释变量的影响程度, 也可以通过回归方程求得反应变量的计算值来估计其他同类的观察值.
④ 在相关分析中, 一般要求两个变量的总体都满足正态分布, 而在回归分析时, 一般只要求反应变量的总体满足正态分布.
6. 列联表独立性检验:两个分类变量分别占两行和两列, 形成 4 个格子, 每个格子中的数据是同时满足所在行列对应类别的个体的频数. 这些数据都是通过实际调查得到的, 称为观察值. 这些观察值形成的 2 行 2 列的频数表格,称为 2 行 2 列列联表,简称 列联表,也称为四格表.
要检验两个随机变量是否有关,统计上一般先假设它们没有关系, 即相互独立, 再进行统计检验,这种假设称为原假设,也称为零假设,习惯上用 表示.
为了描述观察值与预期值之间的总体偏差,我们引入统计量
的值越大,说明观察值与预期值的总体偏差越大,原假设成立的可能性就越小.
分布概率:
以 为例,其含义是: 如果原假设成立,那么 成立的概率约为 0.05, 这是一个小概率事件,不太可能发生. 0.05、0.01 等小概率值在统计上称为显著性水平,记作 . 方便起见, 本书的显著性水平规定为 0.05 .
7. 列联表 检验的计算公式:设有两组分类数据 ,每组数据的两种状态分别用 0 和 1 表示,则可得到下面的 列联表:
组
组
总计
0
1
总计
其中, 为实际观察值. 由 ,经过变形可得 的一般计算公式: ,其中 检验方法在统计学中称为 列联表独立性检验.
8. 列联表独立性检验通常有如下步骤:
① 提出两个随机变量没有关系的原假设 ;
② 确定显著性水平 ,本书中规定 ,也即 ;
③ 计算统计量 的值;
④ 统计决断: 比较上述 值与 3.841 的大小. 若 ,则否定 ; 若 ,则接受 . 根据上述推断作出结论.
错误:将变量的相关关系当成确定性的函数关系,认为变量之间有严格唯一对应关系。
注意:相关关系是非确定性的随机关系,只有趋势无固定取值;函数关系是确定性对应关系,二者本质不同。
1.在下列两个量之间的关系中,属于相关关系的是( )
A.匀速直线运动中时间与位移的关系 B.学生的成绩和身高
C.一块农田的小麦产量与施肥量 D.正n边形的边数与内角度数之和
2.下列语句所表示的事件中的因素不具有相关关系的是( )
A.瑞雪兆丰年 B.名师出高徒
C.吸烟有害健康 D.喜鹊叫喜
3.(多选)在下列各变量之间的关系中,属于相关关系的是( )
A.汽车的重量和百公里耗油量 B.正n边形的边数与内角度数之和
C.一块农田的小麦产量与施肥量 D.家庭的经济条件与学生的学习成绩
4.(多选)下列关系中,是相关关系的为( )
A.学生的学习态度与学习成绩之间的关系
B.教师的教学水平与学生的学习成绩之间的关系
C.学生的身高与学生的学习成绩之间的关系
D.家庭的经济条件与学生的学习成绩之间的关系
5.(多选)有下列关系:①人的年龄与他(她)拥有的财富之间的关系;②曲线上的点与该点的坐标之间的关系;③森林中同一种树木,其断面直径与高度之间的关系;④角的度数与它的正弦值.其中,具有相关关系的是( )
A.① B.② C.③ D.④
错误:误以为相关系数绝对值越大,相关性越强;混淆正负相关含义,或认为系数为0就是无任何关系。
注意:相关系数正负只定相关方向,绝对值大小定相关强弱;系数为0仅代表无线性相关,可能存在非线性相关。
6.甲、乙、丙、丁各自研究两个随机变量的数据,若甲、乙、丙、丁计算得到各自研究的两个随机变量的样本相关系数分别为,,,,则这四人中,研究的两个随机变量的线性相关程度最高的是( )
A.甲 B.乙 C.丙 D.丁
7.已知为随机变量X和Y的样本相关系数,为随机变量M和N的样本相关系数,则下列说法正确的是( )
A.若,则X和Y负相关
B.若,则M和N线性不相关
C.若,,则X和Y的线性相关程度比M和N的线性相关程度强
D.若越接近1,则M和N的线性相关程度越弱
8.对四组数据进行统计,获得如图散点图,其中线性相关性比较强且负相关的是( )
A. B. C. D.
9.已知变量与变量正相关,样本数据中,,…,和,,…,的均值分别是,,将成对数据按照平移后绘制散点图,关于该散点图说法正确的是( )
A.大部分散点位于第一、四象限 B.大部分散点位于第二、三象限
C.大部分散点位于第一、三象限 D.大部分散点位于第二、四象限
10.已知变量与,与分别都成线性相关关系,且与相关系数满足,且与相关系数满足,下列结论正确的是( )
A.与负相关,与负相关,且与的相关性更强
B.与负相关,与正相关,且与的相关性更强
C.与负相关,与正相关,且与的相关性更弱
D.与正相关,与负相关,且与的相关性更弱
11.通过计算样本相关系数可以反映两个随机变量之间的线性相关程度,以下四个选项中分别计算出四个样本的相关系数,则反映样本数据成正相关,并且线性相关程度最强的是( )
A. B. C. D.
12.分别对、、三组成对数据做相关性分析,计算出其对应的相关系数分别为、,,则、、三组相关性的强弱从弱到强排序依次为________.
错误:认为回归直线过所有样本点,或随意代入普通点求解回归参数。
注意:回归直线是拟合所有样本点的最优直线,不一定过任意样本点,唯一必过样本均值中心点。
13.对具有线性相关关系的变量x,y,测得一组数据如下表,根据表中数据,利用最小二乘法得到经验回归方程,据此模型预测当x=20时,y的估计值为( )
x
7
9
11
13
y
2
3
5
6
A.10 B.11 C.12 D.13
14.已知变量,具有线性相关关系,由样本数据(,2,3,4,5)得到关于的经验回归方程为,若,,则当时,的预测值为( )
A. B. C. D.
15.为了探究六年级学生每日自主阅读时间与语文成绩的关系,某研究小组随机调查了50名学生,得到成对样本数据,其中表示每日自主阅读时间(单位:小时),表示语文成绩(单位:分).经计算得回归直线方程为.下列说法正确的是( )
A.该样本数据的相关系数为5.2
B.当阅读时间每增加1小时,语文成绩平均增加5.2分
C.该样本数据中,至少有一个点在回归直线上
D.若某学生每日阅读时间为2小时,则他的语文成绩一定为分
16.下列命题中不正确的是( )
A.线性回归方程对应的直线一定经过样本点的中心
B.线性回归方程对应的直线至少经过其样本数据点中的一个点
C.线性回归方程为时,变量与具有负的线性相关关系
D.用最小二乘法求回归方程是为了使最小
错误:计算残差时用预报值减去实际值,颠倒计算顺序。
注意:残差固定为实际值减预报值,残差越小,对应样本点拟合效果越好。
17.为调查某企业年利润Y(单位:万元)和它的年研究费用x(单位:万元)的相关性,收集了5组成对数据(x,y),如表所示:
x
1
2
3
4
5
Y
50
60
70
80
100
由上表中数据求得Y关于x的经验回归方程为,据此计算出样本点处的残差为( )
A.4 B.5 C.-4 D.-5
18.某校研究性学习小组收集了某地区近几年的某种经济指标与年份的数据,经计算得经验回归方程为.若年该经济指标的实际值为,则残差为( )
A. B. C. D.
19.已知变量、满足线性相关关系,经验回归方程为且,.现有一对观测数据为,若该数据的残差为0.6,则__________.
20.已知变量x,y的统计数据如下表,对表中数据作分析,发现y与x之间具有线性相关关系,利用最小二乘法,计算得到经验回归直线方程为且当x=9时,残差为-0.1.则当x=11时,y的预测值为___________.
x
5
6
7
8
9
y
3.5
4
5
6
6.5
21.用函数拟合一组数据,则观测数据的残差为________.
错误:认为残差点分布越分散、带状区域越宽,拟合效果越好。
注意:残差点均匀分布在水平窄带状区域,拟合效果最优;带状越宽、点越杂乱,拟合精度越差。
22.下列残差图满足一元线性回归模型中对随机误差的假定的是( )
A. B.
C. D.
23.根据变量Y和x的成对样本数据,由一元线性回归模型得到经验回归模型,求得残差图.对于以下四幅残差图,满足一元线性回归模型中对随机误差假设的是( )
A. B.
C. D.
24.下列残差图满足一元线性回归模型中对随机误差的假定的是( )
A. B.
C. D.
25.(多选)成对数据和的一元线性回归模型为,依据模型可建立经验回归方程,用回归方程可得到响应变量的预测值及残差,残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果.对下列四幅残差图的描述正确的是( )
A.图甲显示残差的方差随观测时间变大而变大
B.图乙满足一元线性回归模型对随机误差的假设
C.图丙说明残差与观测时间有非线性关系,应在模型中加入时间的非线性函数部分
D.图丁说明残差与观测时间有线性相关性,故满足一元线性回归模型对随机误差的假设
26.在政府发布的光伏发电补贴政策的引导下,西北某地光伏发电装机量急剧上升,现对2016年至2023年的新增光伏装机量进行调查,根据散点图选择了两个模型进行拟合,并得到相应的经验回归方程.为判断模型的拟合效果,甲、乙、丙三位同学进行了如下分析:
(1)甲同学通过计算残差作出了两个模型的残差图,如图所示;
(2)乙同学求出模型①的残差平方和为0.4175、模型②的残差平方和为1.5625;
(3)丙同学分别求出模型①的决定系数、模型②的决定系数为;
经检验,模型①拟合效果最佳,则甲、乙、丙三位同学中,运算结果肯定出错的同学是________.(填“甲”或“乙”或“丙”)
错误:误以为决定系数越小,回归模型拟合效果越好。
注意:决定系数取值在0到1之间,数值越接近1,模型对数据的解释能力越强,拟合效果越好。
27.决定系数可以用来比较两个模型的拟合效果,的计算公式为,则越大,表示残差平方和越________(填“大”或“小”),即拟合效果越________(填“好”或“差”).
28.已知相关变量和的散点图如图所示,若用与拟合时,决定系数分别为和,则比较和的大小结果为( )
A. B. C. D.不确定
29.某同学用收集到的6组数据对制作成如图所示的散点图(点旁的数据为该点坐标),并由最小二乘法计算得到回归直线的方程:,相关系数为,决定系数为;经过残差分析,确定点E为“离群点”(对应残差过大的点),把它去掉后,再用剩下的5组数据计算得到回归直线的方程:相关系数为,决定系数为.则以下结论中,正确的是( ).
① ② ③ ④
A.①② B.①②③ C.②④ D.②③④
错误:卡方值较大时,直接判定两个分类变量有必然因果关系。
注意:独立性检验仅能判断变量是否有关联、是否独立,无法证明变量存在因果关系。
30.下列关于独立性检验的说法正确的是( )
A.独立性检验是对两个变量是否具有线性相关关系的一种检验
B.独立性检验可以确定两个变量之间是否具有某种关系
C.利用独立性检验推断吸烟与患肺病的关联中,若有的把握认为吸烟与患肺病有关系时,我们不可以说在100个吸烟的人中,有99人患肺病
D.在一个列联表中,由计算得的值,则的值越大,判断两个变量间有关联的把握就越小
31.为了验证牛的毛色(黑色、红色)和角(有角、无角)这两对相对性状是否相关,某学院进行了一次数据统计,根据形成的列联表,计算得到,根据小概率值的独立性检验(已知独立性检验中),下列结论正确的是( )
A.牛的毛色与角无关
B.牛的毛色与角无关,此推断犯错误的概率不超过0.05
C.牛的毛色与角有关
D.牛的毛色与角有关,此推断犯错误的概率不超过0.05
32.根据分类变量与的观测数据,计算得到,依据小概率值()的独立性检验,则( )
A.变量与不独立
B.变量与独立
C.变量与不独立,这个结论犯错误的概率不超过0.1
D.变量与独立,这个结论犯错误的概率不超过0.1
33.在性别与吃零食这两个分类变量的计算中,下列说法正确的是( )
①若的观测值为,我们有的把握认为吃零食与性别有关系,那么在100个吃零食的人中必有99人是女性;
②从独立性检验可知有的把握认为吃零食与性别有关系时,我们说某人吃零食,那么此人是女性的可能性为;
③若从统计量中求出有的把握认为吃零食与性别有关系,是指有的可能性使得出的判断出现错误.
A.①② B.①③ C.②③ D.③
34.利用来确定在多大程度上可以认为“两个分类变量有关系”的方法称为两个分类变量的独立性检验.利用独立性检验不仅可以考察两个分类变量是否有关系,而且( )
A.能较精确的给出这种判断的可靠程度
B.得出的结论完全正确,不会出错
C.的观测值很大时(比如大于20),则得出的零假设完全正确,不会出错
D.的观测值很小时(比如小于2),则得出的零假设肯定错误
错误:卡方值大于临界值时,认为变量一定有关联;小于临界值则认为变量无任何关联。
注意:卡方值大于临界值,是有充分把握认为变量有关联;小于临界值,是无足够证据证明有关联,并非绝对独立。
35.独立性检验中,若小于临界值,则下列结论正确的是( )
A.两个变量一定相互独立 B.两个变量一定不独立
C.没有充分证据表明两个变量有关 D.两个变量有关联的可能性为
36.调查某医院一段时间内婴儿出生的时间(白天与晚上)和性别(男与女)的关联性,对样本数据分析统计,计算得到,依据小概率值的独立性检验,下列说法正确的是( )(附:)
A.婴儿90%在白天出生
B.婴儿性别与出生时间无关联
C.有0.1的把握认为婴儿性别与出生时间有关联
D.婴儿性别与出生时间有关联,此推断犯错误的概率不大于0.1
37.某医疗研究机构为检验某种新研发的药物对特定疾病治疗是否有效,随机选取了200名患者进行双盲实验.其中100人服用新药,100人服用旧药,统计结果如下表
治愈
未治愈
合计
服用新药
67
33
100
服用旧药
48
52
100
合计
115
85
200
附:统计量临界值表
0.10
0.05
0.01
0.005
2.706
3.841
6.635
7.879
其中.
则下列说法正确的是( )
A.有的把握认为新研发的药物对特定疾病治疗有效
B.有的把握认为新研发的药物对特定疾病治疗无效
C.有的把握认为新研发的药物对特定疾病治疗无效
D.有的把握认为新研发的药物对特定疾病治疗有效
38.统计学中,常用的显著性水平以及对应的分位数如下表所示.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
在检验与是否有关的过程中,根据已知数据计算得,则( )
A.在犯错误的概率不超过1的前提下,可以认为与有关
B.在犯错误的概率不超过的前提下,可以认为与有关
C.有的把握认为与有关
D.有的把握认为与有关
39.为了研究高中学生中性别与对乡村音乐态度(喜欢和不喜欢两种态度)的关系,运用2×2列联表进行独立性检验,得到的结论是有99%的把握认为性别与喜欢乡村音乐有关系,则的值可以为( )
A.2.853 B.3.841 C.6.758 D.6.451
1.对变量、有观测数据,得散点图1;对变量、有观测数据,得散点图2.分别用、表示变量与、与之间的线性相关系数,则下列说法正确的是( ).
A.变量与呈现正相关,且
B.变量与呈现负相关,且
C.变量与呈现正相关,且
D.变量与呈现负相关,且
2.对两个变量x,y进行线性相关性检验,得线性相关系数,对两个变量u,v进行线性相关性检验,得线性相关系数,则下列判断正确的是( )
A.变量x与变量y正相关,变量u与变量v负相关,变量x与变量y的线性相关性更强
B.变量x与变量y负相关,变量u与变量v正相关,变量x与变量y的线性相关性更强
C.变量x与变量y负相关,变量u与变量v正相关,变量u与变量v的线性相关性更强
D.变量x与变量y正相关,变量u与变量v负相关,变量u与变量v的线性相关性更强
3.有一散点图如图,在5个数据中去掉后,下列说法正确的是( )
A.变量与变量的线性相关性变弱 B.数据的方差变大
C.相关系数变小 D.残差平方和变小
4.已知下列四个命题:①残差图中残差点所在的水平带状区域越宽,则回归方程的预报精确度越高;②甲、乙两个模型的决定系数分别约为0.88和0.80,则模型乙的拟合效果更好;③回归直线恒过点,且至少过一个样本点;④在线性回归分析中,样本相关系数r的绝对值越接近1时,成对样本数据的线性相关程度越强.其中真命题的个数是( )
A.4 B.3 C.2 D.1
5.某学校一同学研究温差与本校当天新增感冒人数(人)的关系,该同学记录了5天的数据:
5
6
8
9
12
17
20
25
28
35
经过拟合,发现基本符合经验回归方程,则下列选项错误的是( )
A.样本中心点为 B.
C.时,残差为 D.相关系数
6.下列命题正确的是( )
A.残差图中残差点所在的水平带状区域越宽,则回归方程的预报精确度越高;
B.当相关系数时,两个变量负相关;
C.甲、乙两个模型的分别约为0.88和0.80,则模型乙的拟合效果更好;
D.线性回归直线必过样本数据的中心点;
7.以下说法不正确的是( )
A.样本数据1,1,1,3,3,3的极差为2,标准差为1
B.对具有线性相关关系的变量,,其经验回归方程为,若样本数据的中心点为,则实数的值为2
C.对一个容量为的总体,抽取容量为的样本,当选取简单随机抽样、系统抽样和分层抽样三种不同方法抽取样本时,三种方法的总体中每个个体被抽中的概率均相等
D.根据分类变量与的成对样本数据,计算得到,则依据的独立性检验,可以认为“与无关联”
8.为研究蔬菜植株感染红叶螨能否引起植株形成某种抗体,使用列联表独立性检验.随机抽取一定量植株,获得观察数据,制作列联表.提出原假设:感染与形成抗体__________;确定显著性水平;若计算得;依据,从而__________原假设,即得统计决断.( )
A.有关;拒绝 B.有关;接受 C.无关;拒绝 D.无关;接受
9.(多选)下列说法正确的是( )
A.散点图能得到两个变量的相关关系
B.成对的统计数据一定能画出散点图
C.若变量和满足关系且变量与正相关,则与也正相关
D.散点图中的所有点落在一条直线上,则对应变量呈线性相关
10.(多选)通过随机抽样,得到变量和变量的7对数据,并绘制成散点图如图所示,已知变量和变量线性相关,且回归直线是图中直线,则下列说法正确的是( )
A.直线的斜率是负数
B.变量与变量正相关
C.相关系数
D.若去掉图中点后,剩余数据的相关系数变大
11.(多选)下列结论正确的是( )
A.两个变量的相关性越弱,相关系数越小
B.经验回归直线一定经过点
C.在线性回归方程中,当变量每增加一个单位时,平均减少0.5个单位
D.在做回归分析时,残差点均匀分布在横轴两侧,且分布的带状区域的宽度越窄表示回归效果越差
12.(多选)某电子商城统计了最近5个月某品牌电脑的实际销量,如下表所示:
时间x(月份)
1
2
3
4
5
销量y(百台)
0.3
0.4
0.6
0.7
0.9
若y与x线性相关,且经验回归方程为:,则下列说法正确的是( )
A.变量x,y正相关
B.
C.可以预测当时,商城内该电脑的销量为1百台
D.当时,残差为
13.(多选)如图所示,有一散点图在5个数据中去掉后,下列说法中错误的是( )
A.残差平方和变大 B.相关系数变小
C.决定系数变小 D.解释变量与响应变量的相关性变强
14.(多选)如果散点图中所有的散点都落在一条斜率为非0的直线上,则( )
A.解释变量和响应变量是线性函数关系 B.解释变量和响应变量是线性相关关系
C.相关系数 D.决定系数
15.(多选)一组样本数据.其中,求得其经验回归方程为:,残差为.对样本数据进行处理:,得到新的数据,求得其经验回归方程为:,其残差为,分布如图所示,且,则( )
A.样本负相关 B.
C. D.处理后的决定系数变大
16.(多选)有一幅散点图如图所示,从5个数据点中去掉,则下列说法中正确的是( )
A.残差平方和变大
B.相关系数r变大
C.决定系数变大
D.解释变量x与响应变量y的线性相关程度变强
17.(多选)下列说法正确的有( )
A.利用残差图分析模型的刻画效果,若残差比较均匀的分布在以取值为0的横轴为对称轴的水平带状区域内,则说明该模型刻画数据的效果较好
B.可以用决定系数来比较两个模型的拟合效果,越大模型拟合效果越好
C.已知样本数据的方差为4,则数据的标准差是4
D.设两个变量的样本相关系数为,则越大其线性相关程度越强
18.(多选)为研究某种树树高和胸径的关系,某人随机测量了10棵该品种树的胸径(单位:cm)和树高(单位:m)的数据,已知其中一组数据为,且,求得回归方程为,并绘制了如下残差图,则下列结论正确的是( )
A.由残差图可判定树高与胸径的关系大致符合上述回归模型
B.数据对应的残差为0.9
C.该种树的平均树高约为22.29m
D.删除一组数据后,重新求得的回归直线的斜率变小
19.下面命题中说法正确的是______.
①设两个变量之间的线性相关系数为,则越大,的相关性越强;
②等高堆积条形图可以直观的反映一对分类变量之间是否具有关联性;
③如果散点图的散点都落在一条直线上,则;
④正方形的面积与周长是相关关系.
20.红铃虫(Pectinophora gossypiella)是棉花的主要害虫之一,其产卵数与温度有关.现收集到一只红铃虫的产卵数(个)和温度()的8组观测数据,制成图1所示的散点图.现用两种模型①,②分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图.
根据收集到的数据,计算得到如下值:
25
2.9
646
168
422688
50.4
70308
表中;;;
(1)根据残差图,比较模型①、②的拟合效果,哪种模型比较合适?
(2)根据(1)中所选择的模型,求出关于的回归方程.
附:对于一组数据,其回归直线的斜率和截距的最小二乘估计分别为,,
21.黄河鲤是我国华北地区的主要淡水养殖品种之一,其鳞片金黄、体形梭长,尤以色泽鲜丽、肉质细嫩、气味清香而著称.为研究黄河鲤早期生长发育的规律,丰富黄河鲤早期养殖经验,某院校研究小组以当地某水产养殖基地的黄河鲤仔鱼为研究对象,从出卵开始持续观察20天,试验期间,每天固定时段从试验水体中随机取出同批次9尾黄河鲤仔鱼测量体长,取其均值作为第天的观测值(单位:),其中,.根据以往的统计资料,该组数据可以用Logistic曲线拟合模型或Logistic非线性回归模型进行统计分析,其中a,b,u为参数.基于这两个模型,绘制得到如下的散点图和残差图:
(1)你认为哪个模型的拟合效果更好?分别结合散点图和残差图进行说明:
(2)假定,且黄河鲤仔鱼的体长与天数具有很强的相关关系.现对数据进行初步处理,得到如下统计量的值:,,,,,,其中,,根据(1)的判断结果及给定数据,求关于的经验回归方程,并预测第22天时仔鱼的体长(结果精确到小数点后2位).
附:对于一组数据,,…,其回归直线的斜率和截距的最小二乘估计分别为,;参考数据:.
22.2024年2月10日至17日(正月初一至初八),“2024•内江市中区新春极光焰火草地狂欢节”在川南大草原举行,共举行了8场精彩的烟花秀节目.前5场的观众人数(单位:万人)与场次的统计数据如表所示:
场次编号
1
2
3
4
5
观众人数
0.7
0.8
1
1.2
1.3
(1)已知可用线性回归模型拟合与的关系,请建立关于的线性回归方程;
(2)若该烟花秀节目分A、B、C三个等次的票价,某机构随机调查了该烟花秀节目现场200位观众的性别与购票情况,得到的部分数据如表所示,请将列联表补充完整,并判断能否有的把握认为该烟花秀节目的观众是否购买A等票与性别有关.
购买A等票
购买非A等票
总计
男性观众
50
女性观众
60
总计
100
200
参考公式及参考数据:回归方程中斜率与截距的最小二乘法估计公式分别为,其中.
0.100
0.050
0.010
2.706
3.841
6.635
购买A等票
购买非A等票
总计
男性观众
40
50
90
女性观众
60
50
110
总计
100
100
200
23.糟蛋是新鲜鸭蛋(或鸡蛋)用优质糯米糟制而成,是中国别具一格的特色传统美食,以浙江平湖糟蛋、陕州糟蛋和四川宜宾糟蛋最为著名.平湖糟蛋采用优质鸭蛋、上等糯米和酒糟糟渍而成,经过糟渍蛋壳脱落,只有一层薄膜包住蛋体,其蛋白呈乳白色,蛋黄为橘红色,味道鲜美.糟蛋营养丰富,每百克中约含蛋白质15.8克、钙24.8克、磷11.1克、铁0.31克,并含有维持人体新陈代谢必须的18种氨基酸.现有平湖糟蛋的两家生产工厂,产品按质量分为特级品、一级品和二级品,其中特级品和一级品都是优等品,二级品为合格品.为了比较两家工厂的糟蛋质量,分别从这两家工厂的产品中各选取了200个糟蛋,产品质量情况统计如下表:
优等品
合格品
合计
特级品
一级品
二级品
工厂甲
100
75
25
200
工厂乙
120
30
50
200
合计
220
105
75
400
(1)从400个糟蛋中任取一个,记事件表示取到的糟蛋是优等品,事件表示取到的糟蛋来自于工厂甲.求;
(2)依据小概率值的独立性检验,从优等品与合格品的角度能否据此判断两家工厂生产的糟蛋质量有差异?
附:参考公式:,其中.
独立性检验临界值表:
0.10
0.05
0.010
0.005
0.001
2.706
3.841
6.635
7.879
10.828
优等品
合格品
合计
工厂甲
175
25
200
工厂乙
150
50
200
合计
325
75
400
1/6
学科网(北京)股份有限公司
$