内容正文:
统计与成对数据的统计分析
统计
分层抽样中的计算:
频率分布直方图中的计算
百分位数的计算
众数、中位数、平均数的计算
方差、标准差的计算
分层抽样的比例
成对数据的统计分析
1 相关关系的定义
2 散点图
3 样本相关系数r的定义
4 经验回归方程
①残差
②残差图
③决定系数
④模型优劣
独立性检验
学校 数学成绩 合计
不优秀(Y=0) 优秀(Y=1)
甲校(X=0) 33 10 43
乙校(X=1) 38 7 45
合计 71 17 88
a b
c d
α 0.1 0.05 0.01 0.005 0.001
xα 2.706 3.841 6.635 7.879 10.828
1 相关关系的定义
我们知道,一个人的体重与他的身高有关系.一般而言,个子高的人往往体重值较大,个子矮的人往往体重值较小.但身高并不是决定体重的唯一因素,例如生活中的饮食习惯、体育锻炼、睡眠时间以及遗传因素等也是影响体重的重要因素.
体重
身高
变量1
变量2
影响
像这样,两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系.
相关关系 函数关系
相同点 都是两个变量间的关系
不同点 不确定关系 确定性关系
因果关系、伴随关系...... 因果关系
相关关系与函数关系的异同点
2.下列关系中为相关关系的有( )
①学生的学习态度和学习成绩之间的关系;
②教师的执教水平与学生的学习成绩之间的关系;
③学生的身高与学生的学习成绩之间的关系;
④人的身高与视力的关系.
A.①② B.①③ C.②③ D.②④
1(多选题)下列关系中,属于相关关系的是( )
A.正方形的边长与面积之间的关系 B.职工工资与消费水平之间的关系
C.圆的面积与半径之间的关系 D.降雪量与交通事故的发生率之间的关系
BD
A
相关关系的定义
在对人体的脂肪含量和年龄之间关系的研究中,科研人员获得了一些年龄和脂肪含量的简单随机样本数据,如表所示.表中每个编号下的年龄和脂肪含量数据都是对同一个体的观测结果,它们构成了成对数据.
编号 1 2 3 4 5 6 7 8 9 10 11 12 13 14
年龄/岁 23 27 39 41 45 49 50 53 54 56 57 58 60 61
脂肪含量% 9.5 17.8 21.2 25.9 27.5 26.3 28.2 29.6 30.2 31.4 30.8 33.5 35.2 34.6
根据以上数据,
你能推断人体的脂肪含量与年龄之间存在怎样的关系吗?
为了更加直观地描述上述成对样本数据中脂肪含量与年龄之间的关系,类似于用直方图描述单个变量样本数据的分布特征,我们用图形展示成对样本数据的变化特征.用横轴表示年龄,纵轴表示脂肪含量,则表中每个编号下的成对样本数据都可用直角坐标系中的点表示出来.
特征:散点大致落在一条从左下到右上的直线附近
2 散点图
由这些点组成了如图所示的统计图.我们把这样的统计图叫做散点图.
正相关
负相关
线性相关
非线性相关(曲线相关)
相关
不相关
正相关
负相关
当一个变量的值增加时,另一个变量的相应值也呈增加的趋势,就称这两个变量
当一个变量的值增加时,另一个变量的相应值呈减小的趋势,就称这两个变量
3 样本相关系数r的定义
对于变量x和y随机抽取的n对样本数据(x1,y1),(x2,y2),...,(xn,yn),可利用样本相关系数r来衡量两个变量之间的线性相关关系的强弱,样本相关系数的具体计算公式为:
当r>0时,称成对样本数据正相关.
当r<0时,称成对样本数据负相关.
当|r|越接近1时,
成对样本数据的线性相关程度越强;
当|r|越接近0时,
成对样本数据的线性相关程度越弱.
1.在以下4幅散点图中,推断哪些图中的y和x之间存在相关关系?其中哪些正相关,哪些负相关?哪些图所对应的成对样本数据呈现出线性相关关系?哪些图所对应的成对样本数据呈现出非线性相关关系?
编号 1 2 3 4 5 6 7 8 9 10 11 12 13 14
年龄/岁 23 27 39 41 45 49 50 53 54 56 57 58 60 61
脂肪含量/% 9.5 17.8 21.2 25.9 27.5 26.3 28.2 29.6 30.2 31.4 30.8 33.5 35.2 34.6
郑同学 张同学 黄同学 L同学 H同学
数学/分 110 100 117 83 67
物理/分 75 70 88 58 45
线性相关关系的判断方法——散点图法
散点图的制作
建立平面直角坐标系
描点
散点图的分析
观察各点及位置
判断是否分布在一条直线附近
散点图的作用
判断两个变量之间的关系
班上5个学生的数学和物理成绩如下表:
画出散点图,判断数学成绩与物理成绩是否呈现出线性相关关系,若具有相关关系,请说出是正相关还是负相关.
20
40
60
80
100
120
数学
20
40
60
80
100
物理
2.随机抽取10家航空公司,对其最近一年的航班正点率和顾客投诉次数进行调查,
所得数据如下:
航空公司编号 1 2 3 4 5 6 7 8 9 10
航班正点率/% 81.8 76.8 76.6 75.7 73.8 72.2 71.2 70.8 91.4 68.5
顾客投诉/次 21 58 85 68 74 93 72 122 18 125
顾客投诉次数和航班正点率之间是否呈现出线性相关关系?它们之间的相关程度如何?变化趋势有何特征?
复习巩固
经验回归方程
注意:
最小二乘法
求回归系数
我们将
称为Y关于x的经验回归方程,也称经验回归函数或经验回归公式,
其图形称为经验回归直线,这种求经验回归方程的方法叫最小二乘法.
例 一次考试中,某班数学成绩均在90分以上,其中6名学生的数学,物理成绩如下表:
(1)根据上表中学生的数学、物理成绩绘制散点图;
(2)根据这些数据建立物理成绩y关于数学成绩x的经验回归直线方程;
(3)若某位同学的数学成绩为122分,估计他的物理成绩.
数学
成绩
物理
成绩
y
x
124
126
128
130
132
134
136
82
84
86
88
(1)散点图如下
(3) x=122时,
∴估计该同学的物理 成绩为79分.
∴经验回归直线方程为:
问题5:利用下表的数据,依据最小二乘法估计一元回归模型参数的公式,求出儿子身高Y 关于父亲身高x的经验回归方程.
问题:当x=176时,
如果一位父亲身高为176cm,他儿子一定能长到177cm吗?
177
为什么?
儿子的身高不一定会是177cm,这是因为还有其他影响儿子身高的因素,回归模型中的随机误差清楚地表达了这种影响,父亲的身高不能完全决定儿子的身高,不过,我们可以作出推测,当父亲的身高为176cm时,儿子身高一般在177cm左右.
如果把父亲身高为176cm的所有儿子身高作为一个子总体,那么177cm是这个子总体均值的估计值.
1.残差
例如,对于表中的第六个观测,
预测值为
残差为
我们称yi为响应变量Y的观测值,
为了研究回归模型的有效性,定义残差为:
残差是随机误差的估计值,通过对残差的分析,可以判断回归模型刻画数据的效果,以及判断原始数据中是否存在可疑数据等,这方面的工作称为残差分析.
176-173.265=2.735cm
样本相关系数为r≈0.886
父亲的身高为172cm,其儿子身高的观测值为y6=176cm
类似地,可以得到其它的残差,如下表
2.残差图
作图时纵坐标为残差,横坐标可以选为样本编号,或身高数据,或体重估计值等,这样作出的图形称为残差图.
为使数据更加直观,用父亲作为横坐标,残差作为纵坐标,可以画出残差图.
根据一元线性回归模型中对随机误差的假定:
残差应是均值为0,方差为σ2的随机变量的观测值.
1.残差点比较均匀地落在水平的带状区域内,说明选用的模型比较适合,
2.这样的带状区域的宽度越窄,说明模型拟合精度越高.
所以,只有图(4)满足一元线性回归模型对随机误差的假设.
图(1)显示残差与观测时间有线性关系,应将时间变量纳入模型;
图(2)显示残差与观测时间有非线性关系,应在模型中加入时间的非线性函数部分;
图(3)说明残差的方差不是一个常数,随观测时间变大而变大;
图(4)的残差比较均匀地集中在以横轴为对称轴的水平带状区域内.
观察图中四幅残差图,你认为哪一个残差满足一元线性回归模型对随机误差的假定?
在使用经验回归方程进行预测时,需要注意下列问题:
(1)经验回归方程只适用于所研究的样本的总体,例如,根据我国父亲身高与儿子身高的数据建立的经验回归方程,不能用来描述美国父亲身高与儿子身高之间的关系,同样,根据生长在南方多雨地区的树高与胸径的数据建立的经验回归方程,不能用来描述北方干早地区的树高与胸径之间的关系。
(2)经验回归方程一般都有时效性,例如,根据20世纪80年代的父亲身高与儿子身高的数据建立的经验回归方程,不能用来描述现在的父亲身高与儿子身高之间的关系。
(3)解释变量的取值不能离样本数据的范围太远,一般解释变量的取值在样本数据范围内,经验回归方程的预报效果会比较好,超出这个范围越远,预报的效果越差,
(4)不能期望经验回归方程得到的预报值就是响应变量的精确值,事实上,它是响应变量的可能取值的平均值。
决定系数
在残差分析中,如果在同一量纲下考虑残差平方和的大小来比较回归模型的优劣是有意义的,但是如果两个回归模型的量纲不同,就不能这样比较,应剔除量纲的影响,用相对误差来比较.
用回归平方和 ,占总平方和 的比例来表示.
与经验回归方程无关
与经验回归方程有关
R2越接近1,即模型的拟合效果越好.
R2越接近0,意味着残差平方和越大,即模型的拟合效果越差.
由于
计算有直线模型R12=0.7325,对数模型R22=0.9983,这也表明对数模型拟合效果更好.
令
数据检验
除了前面的方法外,还可用新的观测数据来检验,如下图是后续记录数据,将其标于散点图中(绿色)
观察后可发现,对数回归方程对新数据的预报效果远远好于直线方程!
相关关系的判断
散点图
相关关系的强弱
相关系数 r
线性相关
回归方程
回归方程的优劣
残差分析、决定系数R2
前面所讨论的变量,如人的身高与体重,树的胸径与树的高度,短跑100m世界纪录和创纪录的时间等,都是数值变量,数值变量的取值为实数.其大小和运算都有实际含义.
在现实生活中,人们经常需要回答一定范围内的两种现象或性质之间是否存在关联性或相互影响的问题.例如,就读不同学校是否对学生的成绩有影响,不同班级学生用于体育锻炼的时间是否有差别,吸烟是否会增加患肺癌的风险,等等,本节将要学习的独立性检验方法为我们提供了解决这类问题的方案.
例1 为比较甲、乙两所学校学生的数学水平,采用简单随机抽样的方法抽取88名学生.通过测验得到了如下数据:甲校43名学生中有10名数学成绩优秀;乙校45名学生中有7名数学成绩优秀.试分析两校学生中数学成绩优秀率之间是否存在差异.
甲校学生中数学成绩不优秀和数学成绩优秀的频率分别为
乙校学生中数学成绩不优秀和数学成绩优秀的频率分别为
事实上,“两校学生的数学成绩优秀率存在差异”这个结论是根据样本中两个频率间存在差异推断出来的.
有可能出现这种情况:在随机抽取的这个样本中,两个频率间确实存在差异,但两校学生的数学成绩优秀率实际上是没有差别的.
你认为“两校学生的数学成绩优秀率存在差异”这一结论是否有可能是错误的?
卡方统计量
独立性检验
学校 数学成绩 合计
不优秀(Y=0) 优秀(Y=1)
甲校(X=0) 33 10 43
乙校(X=1) 38 7 45
合计 71 17 88
a b
c d
α 0.1 0.05 0.01 0.005 0.001
xα 2.706 3.841 6.635 7.879 10.828
下表给出了χ2独立性检验中几个常用的小概率值和相应的临界值:
例如,对于给定一个小概率值α=0.05,有如下的具体检验规则:
(1)当 时,我们推断H0不成立,即认为X与Y不独立,该推断犯错误的 概率不超过0.05;
(2)当 时,我们没有充分证据推断H0不成立,可以认为X与Y独立.
小于则独立,没有关系,无差异,没影响
大于则不独立,有关系,有差异,有影响
例2 依据小概率值α=0.1的χ2独立性检验,分析例1中的抽样数据, 能否据此推断两校学生的数学成绩优秀率有差异?
解:零假设为H0:分类变量X与Y相互独立,
即两校学生的数学成绩优秀率无差异.
根据表中的数据,计算得到
根据小概率值α=0.1的卡方独立性检验,没有充分证据推断H0不成立.
因此可以认为H0成立,即认为两校的数学成绩优秀率没有差异.
学校 数学成绩 合计
不优秀(Y=0) 优秀(Y=1)
甲校(X=0) 33 10 43
乙校(X=1) 38 7 45
合计 71 17 88
α 0.1 0.05 0.01 0.005 0.001
xα 2.706 3.841 6.635 7.879 10.828
a
b
c
d
$$