8.2一元线性回归模型及其应用(两课时) 课件-2025-2026学年高二下学期数学人教A版选择性必修第三册

2026-03-10
| 58页
| 4338人阅读
| 13人下载
普通

内容正文:

8.2.1 一元线性回归模型 8.2 一元线性回归模型及其应用 收集数据 整理数据 分析数据 统计推断 研究统计问题的一般流程: 简单随机抽样 分层抽样 频数分布表 频率分布直方图 茎叶图 散点图 ...... 众数 中位数 平均数 方差 标准差 用样本估计总体 ??? 单一数据 成对数据 单一数据 线性相关系数r ...... 成对数据 离散型随机变量 ...... 连续型随机变量 (正态分布) 复习回顾 最后,是我们的课堂小结. 问题1:生活经验告诉我们,儿子的身高与父亲的身高相关.一般来说,父亲的身高较高时,儿子的身高通常也较高.为了进一步研究两者之间的关系,有人调查了14名男大学生的身高及其父亲的身高,得到的数据如表1所示. 编号 1 2 3 4 5 6 7 8 9 10 11 12 13 14 父亲身高/cm 174 170 173 169 182 172 180 172 168 166 182 173 164 180 儿子身高/cm 176 176 170 170 185 176 178 174 170 168 178 172 165 182 课堂探究 … 172 … 父亲身高 … 176 174 … 儿子身高 儿子身高不是父亲身高的函数 思考1:根据表中的数据,儿子身高和父亲身高这两个变量之间的关系可以用函数模型刻画吗? 编号 1 2 3 4 5 6 7 8 9 10 11 12 13 14 父亲身高/cm 174 170 173 169 182 172 180 172 168 166 182 173 164 180 儿子身高/cm 176 176 170 170 185 176 178 174 170 168 178 172 165 182 课堂探究 思考1: 根据表中的数据,儿子身高和父亲身高这两个变量之间的关系可以用函数模型刻画吗? 编号 1 2 3 4 5 6 7 8 9 10 11 12 13 14 父亲身高/cm 174 170 173 169 182 172 180 172 168 166 182 173 164 180 儿子身高/cm 176 176 170 170 185 176 178 174 170 168 178 172 165 182 … 170 … 儿子身高 … 173 169 … 父亲身高 父亲身高不是儿子身高的函数 课堂探究 . . . . . . . 利用前面表示数据的方法,以横轴表示父亲身高、纵轴表示儿子身高建立直角坐标系,将表格中的成对样本数据表示为散点图,如下图所示: 课堂探究 思考2:经过刚才的分析,你觉得儿子身高与父亲身高的关系是怎样的? 儿子身高与父亲身高不是函数关系,而是相关关系. 追问:儿子身高与父亲身高的关系是正相关还是负相关?是线性相关还是曲线相关? 随着父亲身高的增加,儿子身高呈增加的趋势,所以是正相关. 优先考虑线性相关. 儿子身高与父亲身高呈正线性相关关系 课堂探究 7 思考3:能否进一步验证刚才的结论? 样本相关系数为: 表明儿子身高和父亲身高正线性相关,且相关程度较高. 课堂探究 ≈0.886 8 思考4:除父亲身高外,还有哪些因素影响儿子的身高? 随机误差e 母亲身高 生活环境 饮食习惯 体育锻炼 …… 追问:如何理解随机误差e对儿子身高的影响? 假设没有随机误差,则儿子身高x只受父亲身高Y影响,则 事实上,相关系数 ,故 也可以记作 课堂探究 9 思考5:随机误差e有哪些特征? 随机误差e是一个随机变量 由于随机误差表示大量已知和未知的各种影响之和,它们会相互抵消,为使问题简洁,可以假设随机误差e的均值为0,方差为与父亲身高无关的定值,即E(e)=0,D(e)=. ①可取正或取负 ②有些无法测量 ③不可事先设定 课堂探究 因为误差是随机的,即取各种正负误差的可能性一样,所以它们均值的理想状态应该为0. 如果随机误差时一个不为0的常数,则可以将合并到截距项a中,否则模型无法确定,即参数没有唯一解. 另外,如果不为0,则表示存在系统误差,在实际建模中也不希望模型有系统误差,即模型不存在非随机误差. 追问1:为什么要假设E(e)=0,而不假设其为某个不为0的常数? 课堂探究 思考6:你能否考虑到上述随机因素的作用,用类似于函数的表达式,表达儿子身高与父亲身高的关系吗? 我们称(1)式为Y关于x的一元线性回归模型. 如果用x表示父亲身高,Y表示儿子身高,e表示随机误差. 假定随机误差的均值为0,方差为与父亲身高无关的定值σ2,则它们之间的关系可以表示为 其中,Y称为因变量或响应变量, x称为自变量或解释变量;a和b为模型的未知参数,a称为截距参数,b称为斜率参数. 函数模型与回归模型有什么区别? 课堂探究 为什么用大写的 Y,小写的 x? 追问1:你能结合父亲与儿子身高的实例,说明回归模型(1)的意义? 对于父亲身高为的某一名男大学生,他的身高并不一定为 bxi+a ,它仅是该子总体的一个观测值,这个观测值与均值有一个误差项ei=yi -(+a). 可以解释为父亲身高为的所有男大学生身高组成一个子总体,该子总体的均值为 bxi+a ,即该子总体的均值与父亲的身高是线性函数关系. 追问2:对于父亲身高为xi的某一名男大学生,他的身高yi一定是bxi+a吗? 课堂探究 课本107页 在一元线性回归模型(1) 中,参数b的含义是什么? 解:参数b的含义可以解释为解释变量x对响应变量Y的均值的影响,变量x每增加1个单位,响应变量Y的均值将增加b个单位. 例如,教科书中父亲身高为175 cm的儿子身高的均值比父亲身高为174cm的儿子身高的均值高出0.839cm. 注意:因为响应变量Y最终取值,除了受变量x的影响,还要受随机误差e的影响,所以不能解释成解释变量x每增加一个单位,响应变量Y增加b个单位. 牛刀小试 (1)除父亲身高外,其他可能影响儿子身高的因素,比如母亲身高、生活环境、饮食习惯和锻炼时间等; (2)在测量儿子身高时,由于测量工具、测量精度所产生的测量误差; (3)实际问题中,我们不知道儿子身高和父亲身高的相关关系是什么,可以利用一元线性回归模型来近似这种关系,这种近似关系也是产生随机误差e的原因. 产生随机误差e的原因有: 追问3:你能结合具体实例解释产生模型(1)中随机误差项的原因吗? 课堂探究 8.2.2 一元线性回归模型参数的最小二乘估计 问题1:为了研究两个变量之间的相关关系,我们建立了一元线性回归模型表达式 刻画的是变量Y与变量x之间的线性相关关系,其中参数a和b未知,我们能否通过样本数据估计参数a和b? 参数a和b刻画了变量Y与变量x的线性关系,因此通过样本数据估计这两个参数,相当于寻找一条适当的直线,使表示成对样本数据的这些散点在整体上与这条直线最接近. 与函数模型不同,回归模型的参数一般是无法精确求出的,只能通过成对样本数据估计这两个参数. 课堂探究 思考1:从成对样本数据出发,如何用数学的方法刻画“从整体上看,各散点与直线最接近”? 思路1:先画出一条直线,测量出各点到直线的距离,然后移动直线,到达一个使距离的和最小的位置,测量出此时的斜率和截距,就得到一条直线. 儿子身高/cm 父亲身高/cm 190 185 180 175 170 165 160 课堂探究 18 儿子身高 174 170 173 169 182 172 180 172 168 166 182 173 164 180 176 176 170 170 185 176 178 174 170 168 178 172 165 182 思路2:可以在散点图中选两点画一条直线,使得直线两侧点的个数基本相同,把这条直线作为所求直线. 儿子身高/cm 父亲身高/cm 190 185 180 175 170 165 160 思考1:从成对样本数据出发,如何用数学的方法刻画“从整体上看,各散点与直线最接近”? 课堂探究 19 儿子身高 174 170 173 169 182 172 180 172 168 166 182 173 164 180 176 176 170 170 185 176 178 174 170 168 178 172 165 182 思路3:在散点图中多取几对点,确定出几条直线,再分别求出这些直线的斜率、截距的平均数作为所求直线的斜率和截距. 儿子身高/cm 父亲身高/cm 190 185 180 175 170 165 160 思考1:从成对样本数据出发,如何用数学的方法刻画“从整体上看,各散点与直线最接近”? 课堂探究 20 儿子身高 174 170 173 169 182 172 180 172 168 166 182 173 164 180 176 176 170 170 185 176 178 174 170 168 178 172 165 182 儿子身高/cm 父亲身高/cm 190 185 180 175 170 165 160 设满足一元线性回归模型的两个变量的n对样本数据为 (x1,y1),(x2,y2),…, (xn,yn). 设 表示点 到直线 的距离, 表示点 到直线 的竖直距离, 表示直线 的倾斜角,则 ,所以思路1可以用中的距离可以用竖直距离替换. 由 ,得 .显然 越小,表示点 与点 的“距离”越小,即样本数据点离直线 的竖直距离越小.因此可以用这n个竖直距离之和 来刻画各样本观测数据与直线 的“整体接近程度”. 课堂探究 21 儿子身高 174 170 173 169 182 172 180 172 168 166 182 173 164 180 176 176 170 170 185 176 178 174 170 168 178 172 165 182 求a, b的值,使Q(a, b)最小 随机误差平方和: 课堂探究 思考2:如何求a,b的值,使 最小? 记 课堂探究 23 注意到 所以 当 取最小值时, 取最小值0,即 . 此时 课堂探究 24 上式是关于b的二次函数,因此要使Q取得最小值,当且仅当b的取值为 综上,当a,b的取值为 时, Q达到最小. 课堂探究 25 易得:(1)经验回归直线必过样本中心 ; (2) 与相关系数r符号相同. 我们将 称为Y 关于x 的经验回归方程,也称经验回归函数或经验回归公式,其图形称为经验回归直线,这种求经验回归方程的方法叫最小二乘法,求得的 , 叫做b,a的最小二乘估计. 课堂探究 26 1、一元线性回归模型和经验回归方程有什么区别和联系? 一元线性回归模型:含有未知参数和模型假设. 经验回归方程:由样本数据估计出来的,依赖于样本数据. 概念辨析 问题2:利用上节课的数据,依据用最小二乘估计一元线性回归模型参数的公式,求出儿子身高Y关于父亲身高x的经验回归方程. 利用公式(2)可以计算出b=0.839, a=28.957, 得到儿子身高Y关于父亲身高x的经验回归方程为 儿子身高/cm 父亲身高/cm 190 185 180 175 170 165 160 相应的经验回归直线如下图所示: 课堂探究 儿子身高 174 170 173 169 182 172 180 172 168 166 182 173 164 180 176 176 170 170 185 176 178 174 170 168 178 172 165 182 追问1:当x=176时, ,如果一位父亲身高为176cm,他儿子长大后身高一定能长到177cm吗?为什么? 儿子的身高不一定会是177cm,这是因为还有其他影响儿子身高的因素,回归模型中的随机误差清楚地表达了这种影响,父亲的身高不能完全决定儿子的身高,不过,我们可以作出推测,当父亲的身高为176cm时,儿子身高一般在177cm左右. 如果把父亲身高为176cm的所有儿子身高作为一个子总体,那么177cm是这个子总体均值的估计值. 一般地,因为E(Y)=bx+a,是bx+a的估计值,所以是E(Y)的估计值. 课堂探究 29 追问2:根据经验回归方程 中斜率的具体含义,高个子的父亲一定生高个子的儿子吗?同样,矮个子的父亲一定生矮个子的儿子吗? 根据经验回归方程 中斜率0.839可以解释为父亲身高每增加1cm,其儿子的身高平均增加0.839cm. 分析模型可以发现,高个子父亲有生高个子儿子的趋势,但一群高个子父亲的儿子们的平均身高要低于父亲们的平均身高,例如x=185(cm),则 矮个子父亲有生矮个子儿子的趋势,但一群矮个子父亲的儿子们的平均身高要高于父亲们的平均身高,例如x=170(cm),则 英国著名统计学家高尔顿把这种后代的身高像中间值靠近的趋势称为“回归现象”.后来,人们把由一个或多个变量的变化去推测另一个变量的变化的方法称为回归分析. 课堂探究 2、要正确理解经验回归方程的适用范围. 总体是否发生变化 时间是否发生变化 取值范围是否变化 预测的是子总体的均值,而且还可能有偏差 概念辨析 对于响应变量Y,通过观测得到的数据为观测值,通过经验回归方程得到的 称为预测值,观测值减去预测值称为残差,即 . 残差是随机误差的估计值,通过对残差的分析可判断回归模型刻画数据的效果,以及判断原始数据中是否存在可疑数据等,这方面的工作称为残差分析. 概念新知 32 思考: 儿子身高与父亲身高的关系,运用残差分析所得的一元线性回归模型的有效性吗? 残差图: 作图时纵坐标为残差, 横坐标可以选为样本编号, 或身高数据或体重估计值等,这样作出的图形称为残差图. 课堂探究 从上面的残差图可以看出,残差有正有负,残差点比较均匀地分布在横轴的两边,可以判断样本数据基本满足一元线性回归模型对于随机误差的假设.所以,通过观察残差图可以直观判断样本数据是否满足一元线性回归模型的假设,从而判断回归模型拟合的有效性. 为了使数据更加直观,用父亲身高作为横坐标,残差作为纵坐标,可以画出残差图,如下图所示: 课堂探究 (1) (2) (3) 追问:观察以下四幅残差图,你认为哪一个残差满足一元线性回归模型中对随机误差的假定? (4) 图(1)显示残差与观测时间有线性关系,应将时间变量纳入模型; 图(2)显示残差与观测时间有非线性关系,应在模型中加入时间的非线性函数部分; 图(3)说明残差的方差不是一个常数,随观测时间变大而变大 图(4)的残差比较均匀地集中在以横轴为对称轴的水平带状区域内. 课堂探究 一般地, 建立经验回归方程后,通常需要对模型刻画数据的效果进行分析.借助残差分析还可以对模型进行改进,使我们能根据改进模型作出更符合实际的预测与决策. 2.残差的平方和越小越好; 3.原始数据中的可疑数据往往是残差绝对值过大的数据; 4. 对数据刻画效果比较好的残差图特征:残差点比较均匀的集中在水平带状区域内. 1.残差等于观测值减预测值 残差的性质: 课堂探究 x 1 2 3 4 y 1 3 4 5 例 已知变量x,y有如下对应数据: (1) 作出散点图; (2) 用最小二乘法求关于x, y的经验回归方程. 解:(1) 散点图如下: 典例精讲 ∴所求经验回归方程为 解:(2) x 1 2 3 4 y 1 3 4 5 典例精讲 求经验回归方程的步骤: 总结提升 例1 经验表明,一般树的胸径(树的主干在地面以上1.3m处的直径)越大,树就越高,由于测量树高比测量胸径困难,因此研究人员希望由胸径预测树高. 在研究树高与胸径之间的关系时,某林场收集了某种树的一些数据(如下表),试根据这些数据建立树高关于胸径的经验回归方程. 编号 1 2 3 4 5 6 7 8 9 10 11 12 胸径/cm 18.1 20.1 22.2 24.4 26.0 28.3 29.6 32.4 33.7 35.7 38.3 40.2 树高/cm 18.8 19.2 21.0 21.0 22.1 22.1 22.4 22.6 23.0 24.3 23.9 24.7 解:以胸径为横坐标、树高为纵坐标作散点图如图示. 散点大致分布在一条从左下角到右上角的直线附近,表明两个变量正线性相关,因此可以用一元线性回归模型刻画树高与胸径之间的关系. 典例精讲 用d表示胸径,h表示树高,根据最小二乘法,计算可得经验回归方程为 编号 1 2 3 4 5 6 7 8 9 10 11 12 胸径/cm 18.1 20.1 22.2 24.4 26.0 28.3 29.6 32.4 33.7 35.7 38.3 40.2 树高/cm 18.8 19.2 21.0 21.0 22.1 22.1 22.4 22.6 23.0 24.3 23.9 24.7 相应的经验回归直线如图(1)所示. (1) 例1 经验表明,一般树的胸径(树的主干在地面以上1.3m处的直径)越大,树就越高,由于测量树高比测量胸径困难,因此研究人员希望由胸径预测树高. 在研究树高与胸径之间的关系时,某林场收集了某种树的一些数据(如下表),试根据这些数据建立树高关于胸径的经验回归方程. 典例精讲 编号 胸径/cm 树高观测值/m 树高预测值/m 残差/m 1 18.1 18.8 19.4 -0.6 2 20.1 19.2 19.9 -0.7 3 22.2 21.0 20.4 0.6 4 24.4 21.0 20.9 0.1 5 26.0 22.1 21.3 0.8 6 28.3 22.1 21.9 0.2 7 29.6 22.4 22.2 0.2 8 32.4 22.6 22.9 -0.3 9 33.7 23.0 23.2 -0.2 10 35.7 24.3 23.7 0.6 11 38.3 23.9 24.4 -0.5 12 40.2 24.7 24.9 -0.2 计算残差: 典例精讲 以胸径为横坐标,残差为纵坐标,作残差图,如图(2)所示. 作残差图: 观察残差表和残差图,可以看到,残差的绝对值最大是0.8,所有残差分布在以横轴为对称轴、宽度小于2的带状区域内. 可见经验回归方程较好地刻画了树高与胸径的关系,我们可以根据经验回归方程由胸径预测树高. 0 0.5 1.0 -0.5 -1.0 15 20 25 30 35 40 残差/m 胸径/cm • • • • • • • • • • • • • • 45 (2) 典例精讲 建立回归模型的步骤 总结提升 问题 人们常将男子短跑100m的高水平运动员称为“百米飞人”. 下表给出了1968年之前男子短跑100m世界纪录产生的年份和世界纪录的数据. 试依据这些成对数据,建立男子短跑100m世界纪录关于纪录产生年份的经验回归方程. 编号 1 2 3 4 5 6 7 8 年份 1896 1912 1921 1930 1936 1956 1960 1968 记录/s 11.80 10.60 10.40 10.30 10.20 10.10 10.00 9.95 1. 画散点图: 课堂探究 由散点图可知,散点看上去大致分布在一条直线附近,似乎可用一元线性回归模型 建立经验回归方程. 根据最小二乘法,由表中数据可得经验回归 方程为 2. 求经验回归方程: 将经验回归方程叠加到散点图,如图(3)所示. 由图形可知,第一点远离经验回归直线,并且前后两时间段中的散点都在经验回归直线的上方,中间时间段的散点都在经验回归直线的下方. 这说明散点并不是随机分布在经验回归直线的周围,而是围绕着经验回归直线有一定的变化规律,即成对样本数据呈现出明显的非线性相关的特征. (3) 课堂探究 用ti表示编号为i的年份数据,用yi表示编号为i的纪录数据,则经验回归方程①和②的残差计算公式分别为 两个经验回归方程的残差(精确到0.001)如下表所示. 观察各项残差的绝对值,发现经验回归方程②远远小于①,即经验回归方程②的拟合效果要远远好于①. 编号 1 2 3 4 5 6 7 8 t 1896 1912 1921 1930 1936 1956 1960 1968 0.591 -0.284 -0.301 -0.218 -0.196 0.111 0.092 0.205 -0.001 0.007 -0.012 0.015 -0.018 0.052 -0.021 -0.022 课堂探究 3. 修改模型: 对模型进行修改,以使其更好地反映散点的分布特征. 仔细观察图形,可以发现散点更趋向于落在中间下凸且递减的某条曲线附近. 回顾已有的函数知识,可以发现函数y=-lnx的图象具有类似的形状特征. 注意到100m短跑的第一个世界纪录产生于1896年,因此可以认为散点是集中在曲线 的周围. 其中c1和c2为未知参数,且c2 < 0. 用上述函数刻画数据变化的趋势,这是一个非线性经验回归函数,其中c1, c2 是待定参数. 现在问题转化为如何利用成对数据估计参数c1和c2. 课堂探究 为了利用一元线性回归模型估计参数c1和c2,我们引进一个中间变量x,令x=ln(t-1895). 通过x=ln(t-1895),将年份变量数据进行变换,得到新的成对数据(精确到0.01),如下表所示. 编号 1 2 3 4 5 6 7 8 x 0.00 2.83 3.26 3.56 3.71 4.11 4.17 4.29 Y/s 11.80 10.60 10.40 10.30 10.20 10.10 10.00 9.95 作出上表的散点图: 由散点图可知,现在散点的分布呈现出很强的线性相关特征,故可以一元线性回归模型 建立经验回归方程. 课堂探究 根据最小二乘法,可得新的经验回归方程为 再在散点图中画出( * )式所对应的经验回归直线,如图(4)所示. (4) 图(4)表明,经验回归方程(*)对于改进后的成对数据具有非常好的拟合精度. 将图(4)与图(3)进行对比,可以发现x和Y之间的线性相关程度比原始样本数据的线性相关程度强得多. 将x=ln(t-1895)代入(*)式,得到由创纪录年份预报世界纪录的经验回归方程 课堂探究 在同一坐标系中画出成对数据散点图、非线性经验回归方程②的图象(蓝色)以及经验回归方程①的图象(红色),如图(5)所示. 我们发现,散点图中各散点都非常靠近②的图象,表明非线性经验回归方程②对于原始数据的拟合效果远远好于经验回归方程①. (5) 下面通过残差来比较这两个经验回归方程对数据刻画的好坏. 课堂探究 在一般情况下,直接比较两个模型的残差比较困难,因为在某些散点上一个模型的残差的绝对值比另一个模型的小,而另一些散点的情况则相反. 可以通过比较残差的平方和来比较两个模型的效果. 由 可知Q2小于Q1. 因此在残差平方和最小的标准下,非线性回归模型 的拟合效果要优于一元线性回归模型的拟合效果. 课堂探究 决定系数R2: 通过前面的讨论我们知道,当残差的平方和越小,经验回归模型的拟合效果就越好,故我们可以用决定系数R2来验证模型的拟合效果. 决定系数R2的计算公式为 在R2表达式中,由于 与经验回归方程无关,残差平方和 与经验回归方程有关,因此R2越大,表示残差平方和越小,即模型的拟合效果越好; R2越小,表示残差平方和越大,即模型的拟合效果越差. 概念新知 决定系数R2: 决定系数是总偏差平方和中回归平方和所占的比重. 显然0≤R2≤1,R2越接近1,则线性回归刻画的效果越好. 还可以证明,在一元线性回归模型中R2=r2,即决定系数R2等于响应变量与解释变量的样本相关系数r的平方. 回归平方和 总偏差平方和 概念新知 编号 1 2 3 4 5 6 7 8 t 1896 1912 1921 1930 1936 1956 1960 1968 0.591 -0.284 -0.301 -0.218 -0.196 0.111 0.092 0.205 -0.001 0.007 -0.012 0.015 -0.018 0.052 -0.021 -0.022 由上述残差表可算出经验回归方程①和②的决定系数R2分别为 由于 因此经验回归方程②的刻画效果比经验回归方程①的好很多. 课堂探究 课堂小结 求经验回归方程的步骤: 总结提升 建立回归模型的步骤 总结提升 $

资源预览图

8.2一元线性回归模型及其应用(两课时) 课件-2025-2026学年高二下学期数学人教A版选择性必修第三册
1
8.2一元线性回归模型及其应用(两课时) 课件-2025-2026学年高二下学期数学人教A版选择性必修第三册
2
8.2一元线性回归模型及其应用(两课时) 课件-2025-2026学年高二下学期数学人教A版选择性必修第三册
3
8.2一元线性回归模型及其应用(两课时) 课件-2025-2026学年高二下学期数学人教A版选择性必修第三册
4
8.2一元线性回归模型及其应用(两课时) 课件-2025-2026学年高二下学期数学人教A版选择性必修第三册
5
8.2一元线性回归模型及其应用(两课时) 课件-2025-2026学年高二下学期数学人教A版选择性必修第三册
6
所属专辑
相关资源
示范课
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。