8.2一元线性回归分析(讲义)《统计学基础》(上海交通大学出版社)

2024-07-22
| 3页
| 195人阅读
| 14人下载
普通

内容正文:

讲稿纸 2019---2020学年 第 一 学期 第 1 周 第5页 任务二 一元线性回归分析 一、回归分析的概念 通过相关分析可以说明变量之间相关关系的方向和程度,但是却不能说明变量之间具体的数量因果关系。当自变量给出一个数值时,因变量可能取值是多少,这是相关分析不能解决的,需要通过回归分析的方法实现。 回归分析,就是建立一个数学方程来反映变量之间具体的相互依存关系,并最终通过给定的自变量数值来估计或预测因变量可能的数值,该数学方程称为回归模型。 “回归”一词源于19世纪英国生物学家高尔登对人体遗传学的研究,他发现子女有回归或回复到上一代原有特性的倾向。高尔登的学生——统计学家皮尔生把这一概念和数理统计方法结合,最终形成了回归分析的理论体系。 二、一元线性回归 在回归分析中,如果变量之间的回归模型是直线方程,则这类回归分析称为线性回归分析(直线回归),该直线方程称为线性回归方程。如果直线方程中只有一个自变量和一个因变量,称之为一元线性回归分析;若存在两个或两个以上的自变量和一个因变量,称之为多元线性回归分析。 设因变量为Y,自变量为X,为进一步探讨变量Y与X之间的统计规律性,用数学模型描述为 Y=β0+β1X+ε 公式将变量Y与X之间的关系用两个部分描述。一部分是由于X的变化引起Y线性变化的部分,即β0+β1 X;另一部分是由其他一切随机因素引起的,记为ε。公式称为变量Y对X的总体一元线性回归模型。一般称Y为被解释变量,或因变量;X为解释变量,或自变量。式中β0和β1是未知参数,β0为回归常数,β1为回归系数。ε表示其他随机因素的影响,一般假定ε是不可观测的随机误差,它是一个随机变量,通常假定ε服从期望为0、方差为σ2的正态分布。在这个假定下,进一步有Y|X~N(β0+β1 X,σ2),它表示在X给定时随机变量Y也服从正态分布,且E(Y|X)=β0+β1 X,Var(Y)=σ2。 公式从平均意义上表达了变量Y与X的统计规律性。这一点在应用上非常重要,因为我们经常关心的正是这个平均值。由公式,只要估计出参数β0和β1,就可以算出当X已知时E(Y)=β0+β1 X的值。通常: E(Y|X)=β0+β1 X 公式称为总体一元线性回归方程,在图形上它表示一条截距为β0、斜率为β1的直线,这条直线称为一元线性回归直线。如果X=0,则β0是X=0时Y概率分布的均值;β1表示X每变动一个单位时Y概率分布的均值的变化,即当X每增加一个单位时,Y平均变化β1个单位。 在实际生活中,总体的真值在多数情况下是未知的,这时就只能从总体中抽取部分单位作为样本,依据样本回归模型来推断总体回归模型。 三、在参数β0,β1的最小二乘估计 为实际数据配合一条回归直线来表明两个现象之间数量关系的统计方法有很多。从数学上看,利用普通最小二乘估计配合的直线是最合理的直线回归方程表达式。最小二乘法,又称最小平方法,是通过要求各散点到回归直线的距离平方和最小来求得回归直线。 四、一元回归方程的评价 获得样本回归方程 =+x后,我们不能直接就用它去作分析和预测,因为 是依据实际观察资料建立起来的,方程是否真正描述了y与x之间的统计规律,还必须进行进一步的分析和评价。一元线性回归模型的评价包括拟合优度检验和方程的显著性检验,它是利用统计学中的抽样理论来检验回归方程的可靠性。 1.一元线性回归模型拟合优度检验 回归方程的拟合优度检验是检验样本观测点与回归直线的接近程度。 如果各观测点聚集在回归直线附近,则说明回归直线对观测值的拟合程度好,从而评价回归方程对样本数据的代表性高,用回归方程对实际问题进行分析和预测的效果好。判断回归模型拟合程度的好坏,最常用的指标是可决系数R2,又称判定系数,它是建立在总离差平方和分解的基础之上的。 2.一元线性回归方程的显著性检验 样本回归方程反映了在观察数据范围内变量之间的线性依存关系,统计研究的目的在于通过样本来推断总体,但由于抽样的随机性,不同的样本所得结果各有不同,所以由样本变量反映的关系与总体之间必然有差异。判定系数R 2反映了方程拟合的程度,但是R 2仍然是在样本范围内计算出来的,至于总体变量之间是否存在线性关系依然不能肯定,因此需要有检验的方法,线性回归的显著性检验就是用来解决这类问题的数理统计学中选取统计量 ,即回归变差与剩余变差的比例大小来体现x和y的线性相关关系的相对大小。统计量F服从自由度为(1,n-2)的F分布。根据F值的大小来判定回归直线的斜率β1是否等于0。基本步骤如下: ①提出假设:H0:β1=0;H1:β1≠0。 ②根据样本观测值计算F值。 ③给定显著性水平a,查自由度为(1,n-2)的F分布表,确定临界值Fa(1,n-2)。 ④若F ≥ Fa(1,n-2),则拒绝H0,说明总体回归系数β1≠0,即线性关系是显著的,否则线性关系不显著。 3.估计标准误差 估计标准误差是从另一个角度说明回归直线拟合程度的度量值,对于给定的xi ;根据回归模型就可以求出yi 的预测值。用来预测yi 的精度如何,产生的误差有多大是统计上所关心的。统计上用估计标准误差这个指标来度量回归方程的可靠性,对回归方程进行评价。估计标准误差是根据观察值与回归直线的偏离来计算的。一个回归模型的估计标准误差用公式表示为 值得注意的是上式中分母是用(n-2)而不是(n-1)或n去除,这是因为n个观察值的数据点用于计算参数与时失去了2个自由度,还余下(n-2)个自由度。 从定义上看,Sy是观察值y对估计值 的平均离差。同在一般变量数列中通过标准差来反映变量x与其平均数之间的平均变异程度相似,在回归分析中,Sy则反映了所有观察值y与之间的平均变异程度。在回归的过程中,对给定的自变量x值,变量y并非总是分布在回归直线上,而是分布在它的周围,这样在y与之间必然形成一定的离差。如果离差的值很小,则说明估计值 与观察值y比较接近,在图形中观察点越靠近回归直线,即表明回归方程较好地反映了两个变量之间的关系,其代表性较强;相反,如果离差的值较大,即观察值y与估计值 的差距很大,在图形中观察点远离直线,这说明除已知自变量之外,尚有其他重要因素在影响着因变量的变动,方程的精确度较低,代表性差。由此可见,通过估计标准误差可以反映回归方程的代表性与精确程度。 估计标准误差从定义上计算所需工作量大,可将其变换,简化公式如下: 4.区间估计 建立回归模型的目的就是为了能够用它进行预测,经过检验的回归方程可以用作区间估计,所谓区间估计是指对于给定的x值,求出y的平均值的置信区间或y的某个各别值的预测区间。当自变量给定,要预测因变量时,先将x=x0代入公式,得。是对应于x0的点估计值,但我们往往更希望能给出因变量的一个预测值范围。 任务三 多元线性回归分析 一、多元线性回归模型 多元线性回归分析是研究一个因变量与多个自变量之间线性相关关系的统计分析方法。事实上,大量社会经济现象总是多个因素作用的结果。多元线性回归考虑到多个自变量对因变量的影响,能够更真实地反映现象之间的相互关系,因此在实践中应用更广。 假设一个随机变量Y与m个非随机变量X之间存在线性相关关系。 二、多元线性回归模型的参数估计 多元线性回归模型的参数βi (i =0,1,2,…,m)及σ2在一般情况下都是未知数,必须根据样本数据( yj,x1 j,x2 j,…,xm j )来估计。回归参数βi (i =0,1,2,…,m)的估计方法还是“最小二乘法”。根据样本数据(yj,x1j,x2j,…,xmj )来估计βi (i =0,1,2,…,m)使得残差平方和取最小的值。 三、多元线性回归模型的评价 与一元线性回归模型相同,我们在得到多元线性回归模型以后也需要对模型中所包含的自变量是否确实与因变量之间存在线性相关关系,以及回归模型的拟合效果如何进行分析检验。 1.拟合优度检验 与一元线性回归时一样,我们也可以定义多元线性回归的总离差平方和为SST,并把它分解为SSR和SSE两个部分。 2.多元线性回归模型的显著性检验 多元线性回归模型的显著性检验包括两个方面的内容:一是对整个回归方程的显著性检验(F检验);二是对各回归系数的显著性检验(t检验)。在一元线性回归方程的检验时,这两个检验是等价的,但在多元线性回归模型的检验时两者却不同。 学科网(北京)股份有限公司 $$

资源预览图

8.2一元线性回归分析(讲义)《统计学基础》(上海交通大学出版社)
1
所属专辑
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。