第47讲 成对数据的统计分析——2027届高三数学一轮复习课件

2026-06-22
| 86页
| 277人阅读
| 1人下载
普通

摘要:

该高中数学高考复习课件聚焦“成对数据的统计分析”专题,依据课标要求梳理了样本相关系数、一元线性回归模型、独立性检验三大核心考点,通过近五年高考真题分析明确相关系数计算与回归方程构建占60%、独立性检验占30%的高频考查权重,归纳出相关关系判断、非线性回归转化等常考题型。 课件亮点在于“真题溯源+模型转化+素养提升”策略,如以2025年上海卷奥运成绩回归题为例,示范“数据标准化—模型选择—残差检验”三步法,培养学生用数学眼光观察数据规律、用数学思维构建回归模型的素养。设“易错点警示”专栏,帮助学生规避相关系数符号判断等误区,教师可依托分层训练实现精准复习,助力学生高效冲刺。

内容正文:

第8章 统计、成对数据的统计分析 第47讲 成对数据的统计分析 1 【课标要求】 1.了解样本相关系数的统计含义. 2.了解样本相关系数与标准化数据向量夹角的关系,会通过相关系数比较多组成对数据的相关性. 3.了解一元线性回归模型的含义. 4.了解模型参数的统计意义. 5.了解最小二乘原理,掌握一元线性回归模型参数的最小二乘估计方法,会用一元线性回归模型进行预测. 6.理解2×2列联表的统计意义. 7.了解2×2列联表独立性检验及其应用. 2 【知识要点】 1.两个变量的线性相关 (1)相关关系 两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系. (2)散点图 将各数据在平面直角坐标系中的对应点画出来,得到表示两个变量的一组数据的图形,这样的图形叫做散点图.利用散点图,可以判断两个变量是否相关,相关时是正相关还是负相关. 3 (3)正相关 在散点图中,如果当一个变量的值增加时,另一个变量的相应值也呈现   的趋势,则称这两个变量正相关.  (4)负相关 在散点图中,如果当一个变量的值增加时,另一个变量的相应值呈现   的趋势,则称这两个变量负相关.  增加 减少 4 (5)线性相关 ①一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在   附近,我们就称这两个变量线性相关.  ②一般地,如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量非线性相关或曲线相关. 一条直线 5 2.样本相关系数 (1)相关系数<m></m>的计算 变量<m></m>和变量<m></m>的样本相关系数<m></m>的计算公式如下: <m></m> <m></m>. 6 (2)相关系数r的性质 ①当r>0时,称成对样本数据  相关;当r<0时,称成对样本数据   相关;当r=0时,成对样本数据间没有线性相关关系.  ②样本相关系数r的取值范围为   .  当|r|越接近1时,成对样本数据的线性相关程度越   ;  当|r|越接近0时,成对样本数据的线性相关程度越   .  负 [-1,1] 正 强 弱 7 3.一元线性回归模型 经验回归方程与最小二乘法 我们将<m></m>称为<m></m>关于<m></m>的经验回归方程,也称经验回归函数或经验回归公式, 其图形称为经验回归直线.这种求经验回归方程的方法叫做最小二乘法,求得的<m></m>,<m></m>叫 做<m></m>,<m></m>的最小二乘估计,其中 <m></m> 8 4.残差与残差分析 (1)残差:对于响应变量Y,通过观测得到的数据称为   ,通过经验回归方程得到的称为   ,   减去   称为残差.  (2)残差分析:残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果,以及判断原始数据中是否存在可疑数据等,这方面工作称为残差分析. 观测值 预测值 观测值 预测值 9 ②残差平方和法 残差平方和为 ,残差平方和______,模型的拟合效果越好. 越小 (3)刻画回归效果的方式 ①残差图法 作图时纵坐标为残差,横坐标为自变量x,这样作出的图形称为残差图.在残差图中,残差点比较均匀地分布在以取值为0的横轴为对称轴的水平的带状区域内,说明选用的模型比较合适,这样的带状区域的宽度越窄,说明模型拟合精度越高. 10 ③利用决定系数 刻画回归效果 ,越____,模型的拟合效果越好; 越____,模型的拟合效果 越差. 大 小 11 5.独立性检验系数 已知分类变量,的抽样数据的 列联表如下: 合计 合计 记 ,则随机变量 ,读作卡方. 12 6.独立性检验 (1)小概率值α 基于小概率值α的检验规则: 当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α; 当χ2<xα时,我们没有充分证据推断H0不成立,可以认为X和Y独立. 常用的小概率值和相应的临界值如下表: α 0.1 0.05 0.01 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 13 (2)独立性检验的定义: 利用随机变量   的取值推断分类变量X和Y   的方法称为χ2独立性检验,简称独立性检验.  (3)独立性检验的步骤 ①提出零假设H0:X和Y相互独立,并给出在问题中的解释. ②根据抽样数据整理出2×2列联表,计算χ2的值,并与临界值xα比较. ③根据检验规则得出推断结论. ④在X和Y不独立的情况下,根据需要,通过比较相应的频率,分析X和Y间的影响规律. χ2 是否独立 14 【基础检测】 概念辨析 1.判断下列结论是否正确(请在括号中打“√”或“×”) (1)经验回归直线=x+至少经过点(x1,y1),(x2,y2),…,(xn,yn)中的一个.(  ) (2)样本相关系数的绝对值越接近1,成对样本数据的线性相关程度越强.(  ) (3)残差平方和越大,线性回归模型的拟合效果越好.(  ) (4)应用独立性检验的基本思想对两个变量间的关系作出的推断一定是正确的.(  ) (5)若分类变量X,Y关系越密切,则由观测数据计算得到的χ2的观测值越小.(  ) × √ × × × 15 教材改编 2.[选择性必修3p95T2]如图所示的两个变量不具有相关关系的有    .(填序号)  ①④ [解析] ①是确定的函数关系;②中的点大都分布在一条曲线周围;③中的点大都分布在一条直线周围;④中的点的分布没有任何规律可言,x,y不具有相关关系. 16 3.[选择性必修3p95T2]两个变量的相关关系有①正相关,②负相关,③不相关,则下列散点图从左到右分别反映的变量间的相关关系是(  ) A.①②③ B.②③① C.②①③ D.①③② D [解析] 第一个散点图中,散点图中的点是从左下角区域分布到右上角区域,是正相关;第三个散点图中,散点图中的点是从左上角区域分布到右下角区域,是负相关;第二个散点图中,散点图中的点的分布没有什么规律,是不相关,所以应该是①③②. 17 4.已知变量x与y正相关,且由观测数据算得样本平均数=3,=3.5,则由该观测数据算得的经验回归方程可能是(  ) A.=0.4x+2.3 B.=2x-2.4 C.=-2x+9.5 D.=-0.3x+4.4 A [解析] 由题意,x与y正相关,故排除C,D,将()代入经验回归方程检验得A正确. 18 5.某池塘中水生植物的覆盖水塘面积x(单位:dm2)与水生植物的株数y(单位:株)之间有相关关系,收集了4组数据,用模型y=cekx(c>0)去拟合x与y的关系,设z=ln y,x与z的数据如表格所示: x 3 4 6 7 z 2.5 3 4 5.9 得到x与z的线性回归方程=0.78x+,则=    .  e-0.05 [解析] 由已知可得,==5,==3.85, 所以,有3.85=0.78×5+,解得=-0.05,所以=0.78x-0.05.由z=ln y,得ln =0.78x-0.05,所以=e0.78x-0.05,所以=e-0.05. 19 考点1 成对数据的统计相关性 角度1.变量间相关关系的判断 例1 (1)(多选)某校地理学兴趣小组在某座山测得海拔高度、气压和沸点的六组数据绘制成散点图如图所示,则下列说法正确的是(   ) A.沸点与海拔高度呈正相关 B.沸点与气压呈正相关 C.沸点与海拔高度呈负相关 D.沸点与海拔高度、沸点与气压的 相关性都很强 BCD 20 [解析] 由左图知气压随海拔高度的增加而减小,由右图知沸点随气压的升高而升高,所以沸点与气压呈正相关,沸点与海拔高度呈负相关,由于两个散点图中的点都分布在直线附近,所以沸点与海拔高度、沸点与气压的相关性都很强,故B,C,D正确,A错误. 21 (2)(多选)下列说法正确的是(   ) A.在线性回归分析中,相关系数r的值越大,变量间的相关性越强 B.自变量取值一定时,因变量的取值带有一定随机性的两个变量之间的关系叫做相关关系 C.在残差图中,残差点分布的带状区域的宽度越狭窄,其模型拟合的精度越高 D.在回归分析中,R2为0.98的模型比R2为0.80的模型拟合的效果好 BCD [解析] 对于A. 在线性回归分析中,相关系数r的绝对值越接近1,变量间的相关性越强,故A错误;对于B. 根据相关关系的定义知B正确;对于C. 在残差图中,残差点分布的带状区域的宽度越狭窄,其模型拟合的精度越高,故C正确;对于D. 在回归分析中,R2的值越大,模型拟合的效果越好,故D正确;故选BCD. 22 [小结]对两个变量的相关关系的判断有两个方法:一是根据散点图进行判断,具有很强的直观性,直接得出两个变量是正相关或负相关,线性回归分析以散点图为基础,拟合效果的好坏可由散点图直接判断;二是计算相关系数法,这种方法能比较准确地反映相关程度,相关系数的绝对值越接近1,相关性就越强,相关系数就是描述相关性强弱的,相关性有正相关和负相关,强相关和弱相关. 23 角度2.相关系数的计算及应用 例2 (2025·全国·模拟预测)氮氧化物是一种常见的大气污染物,它是由氮和氧两种元素组成的化合物,有多种不同的形式.下图为我国2014年至2022年氮氧化物排放量(单位:万吨)的折线图,其中,年份代码1~9分别对应年份2014~2022. 24 计算得yi=12200,=1125,tiyi=52640. (1)是否可用线性回归模型拟合y与t的关系?请用折线图和相关系数加以说明; (2)是否可用题中数据拟合得到的线性回归模型预测2023年和2033年的氮氧化物排放量?请说明理由. 附:相关系数r=≈3.87. 25 (1)是否可用线性回归模型拟合y与t的关系?请用折线图和相关系数加以说明; [解析] (1)从折线图看,各点近似落在一条直线附近,因而可以用线性回归模型拟合y与t的关系.因为 (ti-)2=(i-5)2=60,所以该组数据的相关系数 r= = =≈-0.96. |r|>0.95,因而可以用线性回归模型拟合y与t的关系. 26 (2)是否可用题中数据拟合得到的线性回归模型预测2023年和2033年的氮氧化物排放量?请说明理由. 附:相关系数r=≈3.87. [解析] (2)可以用回归模型预测2023年的氮氧化物排放量,但不可以预测2033年的氮氧化物排放量,理由如下: ①2023年与题设数据的年份较接近,因而可以认为,短期内氮氧化物的排放量将延续(1)中的线性趋势,故可以用(1)中的回归模型进行预测; ②2033年与题设数据的年份相距过远,而影响氮氧化物排放量的因素有很多,这些因素在短期内可能保持,但从长期角度看很有可能会变化,因而用(1)中的回归模型预测是不准确的. 27 1.甲、乙、丙、丁四位同学各自对A,B两变量的线性相关性做试验,并用回归分析方法分别求得相关系数r如下表:   甲 乙 丙 丁 r -0.82 -0.78 -0.69 -0.85 则结果体现A,B两变量有更强的线性相关性的试验者是(  ) A.甲 B.乙 C.丙 D.丁 D [解析] ∵0.85>0.82>0.78>0.69,且相关系数的绝对值越接近1,则两个变量的线性相关性越强,∴能体现出A,B两变量有更强的线性相关性的是丁.故选D. 对应训练 28 2.根据身高和体重散点图,下列说法正确的是(  ) A.身高越高,体重越重 B.身高越高,体重越轻 C.身高与体重正相关 D.身高与体重负相关 C [解析] 由于身高比较高的人,其体重可能大,也可能小,则选项AB不正确; 由散点图知,身高和体重有明显的相关性,且身高增加时,体重也呈现增加的趋势, 所以身高与体重正相关,C正确,D错误.故选C. 29 3.某学校高三年级共有4个班,其中实验班和普通班各2个,且各班学生人数大致相当.在高三第一次数学统一测试成绩揭晓后,教师对这4个班的数学成绩进行了统计分析,其中涉及试题“难度”和“区分度”等指标.根据该校的实际情况,规定其具体含义如下:难度=,区分度=. (1)现从这4个班中各随机抽取5名学生,统计这20名学生的数学成绩如下表:   数学成绩 普通班 61,62,62,70,71,72,73,74,74,81 实验班 76,82,82,83,84,87,88,90,93,95 请根据以上样本数据,估计该次考试试题的难度和区分度; 30 考试序号 1 2 3 4 5 6 难度x 0.65 0.71 0.73 0.76 0.77 0.82 区分度y 0.12 0.16 0.16 0.19 0.20 0.13 (2)为了研究试题的区分度与难度的关系,调取了该校上一届高三6次考试的成绩分析数据,得到下表: ①用公式r = 计算区分度y与难度x之间的相关系数r(精确到0.001); ②判断y与x之间相关关系的强与弱,并说明是否适宜用线性回归模型拟合y与x之间的关系. 参考数据:xiyi=0.7134, 31 (1)现从这4个班中各随机抽取5名学生,统计这20名学生的数学成绩如下表:   数学成绩 普通班 61,62,62,70,71,72,73,74,74,81 实验班 76,82,82,83,84,87,88,90,93,95 请根据以上样本数据,估计该次考试试题的难度和区分度; [解析] (1)由题中表格知,实验班这10人的数学总成绩为860,普通班这10人的数学总成绩为700,故这20人的数学平均成绩为=78,由此估计这4个班的总平均分为78,所以难度为=0.78. 由=86估计实验班的平均分为86,由=70估计普通班的平均分为70, 所以区分度为=0.16. 32 (2)为了研究试题的区分度与难度的关系,调取了该校上一届高三6次考试的成绩分析数据,得到下表: 考试序号 1 2 3 4 5 6 难度x 0.65 0.71 0.73 0.76 0.77 0.82 区分度y 0.12 0.16 0.16 0.19 0.20 0.13 ①用公式r计算区分度y与难度x之间的相关系数r(精确到0.001); 33 [解析](2)①由于 (xi-)(yi-)=(xiyi-xi-yi+·) =xiyi-xi-yi+· =xiyi-·-·+· =xiyi-·. 且xiyi=0.7134,≈0.0092, 34 6·=6×0.74×0.16=0.7104. ∴r= = = ≈0.326. 35 ②判断y与x之间相关关系的强与弱,并说明是否适宜用线性回归模型拟合y与x之间的关系. 参考数据: xiyi=0.7134, [解析]②由于r≈0.326∈[0.30,0.75),故两者之间相关性非常一般,不适宜用线性回归模型拟合y与x之间的关系,即使用线性回归模型来拟合,效果也不理想. 36 考点2 回归模型 角度1.线性回归模型 例3 (2025·上海)2024年巴黎奥运会,中国获得了男子4×100米混合泳接力金牌.以下是历届奥运会男子4×100米混合泳接力项目冠军成绩记录(单位:秒),数据按照升序排列. 206.78 207.46 207.95 209.34 209.35 210.68 213.73 214.84 216.93 216.93 (1)求这组数据的极差与中位数; (2)从这10个数据中任选3个,求恰有2个数据在211以上的概率; (3)若比赛成绩y关于年份x的回归方程为y=-0.311x+,年份x的平均数为2006,预测2028年冠军队的成绩(精确到0.01秒). 37 (1)求这组数据的极差与中位数; [解析] (1)由题意,数据的最大值为216.93,最小值为206.78, 则极差为216.93-206.78=10.15; 数据中间两数为209.35与210.68, 则中位数为=210.015. 故极差为10.15,中位数为210.015; 38 (2)从这10个数据中任选3个,求恰有2个数据在211以上的概率; [解析] (2)由题意,数据共10个,211以上数据共有4个, 故设事件A=“恰有2个数据在211以上”, 则P(A)==, 故恰有2个数据在211以上的概率为; 39 (3)若比赛成绩y关于年份x的回归方程为y=-0.311x+,年份x的平均数为2006,预测2028年冠军队的成绩(精确到0.01秒). [解析] (3)由题意,成绩的平均数为 (206.78+207.46+207.95+209.34+209.35+210.68+213.73+214.84+216.93+216.93)÷10=211.399, 由直线y=-0.311x+过(2006,211.399), 则=211.399+0.311×2006=835.265, 故回归直线方程为y=-0.311x+835.265. 当x=2028时,y=-0.311×2028+835.265=204.557≈204.56. 故预测2028年冠军队的成绩为204.56秒. 40 [小结]求经验回归方程可分如下四步来完成 (1)列:列表表示xi,yi,,xiyi. (2)算:计算,,,xiyi. (3)代:代入公式计算,的值. (4)写:写出经验回归方程. 41 角度2.非线性回归模型 例4 红铃虫(Pectinophora gossypiella)是棉花的主要害虫之一,其产卵数与温度有关.现收集到一只红铃虫的产卵数y(个)和温度x(℃)的8组观测数据,制成图1所示的散点图.现用两种模型①y=ebx+a,②y=cx2+d分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图. 42 根据收集到的数据,计算得到如下值:表中zi=ln yi; =zi; ti=;=ti; (1)根据残差图,比较模型①、②的拟合效果,应选择哪个模型?并说明理由; (2)根据(1)中所选择的模型,求出y关于x的回归方程(系数精确到0.01),并求温度为34 ℃时,产卵数y的预报值. (参考数据:e5.18≈178,e5.46≈235,e5.5≈245,e5.83≈340) 附:对于一组数据(ω1,v1),(ω2,v2),…,(ωn,vn),其回归直线=+ω的斜率和截距的最小二乘估计分别为= =-. 43 25 2.89 646 (xi-)2 168 (ti-)2 422688 (zi-)(xi-) 48.48 (yi-)(ti-) 70308 44 (1)根据残差图,比较模型①、②的拟合效果,应选择哪个模型?并说明理由; [解析] (1)应该选择模型①. 由于模型①残差点比较均匀地落在水平的带状区域中,且带状区域的宽度比模型②带状宽度窄,所以模型①的拟合精度更高,回归方程的预报精度相应就会越高,故选模型①比较合适. 45 (2)根据(1)中所选择的模型,求出y关于x的回归方程(系数精确到0.01),并求温度为34 ℃时,产卵数y的预报值.(参考数据:e5.18≈178,e5.46≈235,e5.5≈245,e5.83≈340) 附:对于一组数据(ω1,v1),(ω2,v2),…,(ωn,vn),其回归直线=+ω的斜率和截距的最小二乘估计分别为= =-. 25 2.89 646 (xi-)2 168 (ti-)2 422688 (zi-)(xi-) 48.48 (yi-)(ti-) 70308 46 [解析] (2)令z=ln y,z与温度x可以用线性回归方程来拟合,则=+x. = = ≈0.29, 所以=-=2.89-0.29×25≈-4.36, 则z关于x的线性回归方程为=0.29x-4.36. 于是有ln y=0.29x-4.36, 所以产卵数y关于温度x的回归方程为=e0.29x-4.36, 当x=34时,y=e0.29×34-4.36=e5.5≈245(个). 所以气温在34 ℃时,一个红铃虫的产卵数的预报值为245个. 47 [小结]非线性回归问题有时并不给出经验公式.可以画出已知数据的散点图,把它与学过的各种函数(幂函数、指数函数、对数函数等)图象作比较,挑选一种跟这些散点拟合得最好的函数,然后采用适当的变量变换,把问题化为线性回归模型问题,使之得到解决. 48 4.某工厂为了对新研发的一种产品进行合理定价,将该产品按事先拟定的价格进行试销,得到如下数据: 单价x(元) 8 8.2 8.4 8.6 8.8 9 销量y(件) 90 84 83 80 75 68 (1)已知=-20,求回归直线方程=x+; (2)预计在今后的销售中,销量与单价服从(1)中的关系,且该产品的成本是5元/件,为使工厂获得最大利润,该产品的单价应定为多少元?(利润=销售收入-成本) 对应训练 49 (1)已知=-20,求回归直线方程=x+; [解析] (1)根据表中数据, 计算=×(8+8.2+8.4+8.6+8.8+9)=8.5, =×(90+84+83+80+75+68)=80, 且=-20, ∴=-=80-(-20)×8.5=250, ∴y关于x的线性回归方程为=-20x+250. 50 (2)预计在今后的销售中,销量与单价服从(1)中的关系,且该产品的成本是5元/件,为使工厂获得最大利润,该产品的单价应定为多少元?(利润=销售收入-成本) [解析](2)设工厂获得的利润为L元, 则L=x(-20x+250)-5(-20x+250) =-20+281.25, 则该产品的单价应定为8.75元时,工厂获得的利润最大. 51 5.随着经济的发展,某地居民收入逐年增长,下表是该地某银行连续五年的储蓄存款(年底余额): 年份x 2021 2022 2023 2024 2025 储蓄存款y (千亿元) 5 6 7 8 10 为了研究计算的方便,工作人员将上表的数据进行了处理,t=x-2020,z=y-5得到下表: 时间代号t 1 2 3 4 5 z 0 1 2 3 5 52 (1)求z关于t的经验回归方程; (2)通过(1)中的方程,求出y关于x的经验回归方程; (3)用所求经验回归方程预测到2026年年底,该银行储蓄存款可达多少? 附:对于经验回归方程=x+,其中= =-. 53 (1)求z关于t的经验回归方程; [解析] (1)设z关于t的经验回归方程为=t+, 经计算得:=(1+2+3+4+5)=3,=(0+1+2+3+5)=2.2, tizi=1×0+2×1+3×2+4×3+5×5=45, =12+22+32+42+52=55, ∴==1.2,=-=2.2-1.2×3=-1.4, ∴=1.2t-1.4; 54 (2)通过(1)中的方程,求出y关于x的经验回归方程; [解析](2)将t=x-2020,z=y-5代入=1.2t-1.4 得:-5=1.2×(x-2020)-1.4, 即=1.2x-2420.4; 55 (3)用所求经验回归方程预测到2026年年底,该银行储蓄存款可达多少? 附:对于经验回归方程=x+,其中= =-. [解析](3)∵x=2026时,=1.2×2026-2420.4=10.8(千亿元), ∴预测到2026年年底,该银行储蓄存款额可达10.8千亿元. 56 6.(2025·浙江台州·二模)某电动车公司为了 抢占更多的市场份额,计划加大广告投入、 该公司近5年的年广告费xi(单位:百万元) 和年销售量yi(单位:百万辆)关系如图所示: 令vi=ln xi(i=1,2,…,5), 数据经过初步处理得: yi 44 vi 4.8 (xi-)2 10 (yi-)2 40.3 (vi-)2 1.612 (xi-)(yi-) 19.5 (yi-)(vi-) 8.06 57 现有①y=bx+a和②y=nln x+m两种方案作为年销售量y关于年广告费x的回归分析模型,其中a,b,m,n均为常数. (1)请从相关系数的角度,分析哪一个模型拟合程度更好? (2)根据(1)的分析,选取拟合程度更好的回归分析模型及表中数据,求出y关于x的回归方程,并预测年广告费为6(百万元)时,产品的年销售量是多少? 58 附:①相关系数r= , 回归直线=+x中,= =-; ②参考数据:=8.06,≈20.1,ln 5≈1.6,ln 6≈1.8. 59 (1)请从相关系数的角度,分析哪一个模型拟合程度更好? [解析] (1)设模型①和②的相关系数分别为r1,r2. 由题意可得:r1= = = ≈0.97, r2= = = =1. 所以<,由相关系数的相关性质可得,模型②的拟合程度更好. 60 (2)根据(1)的分析,选取拟合程度更好的回归分析模型及表中数据,求出y关于x的回归方程,并预测年广告费为6(百万元)时,产品的年销售量是多少? 附:①相关系数r= , 回归直线=+x中,= =-; ②参考数据:=8.06,≈20.1,ln 5≈1.6,ln 6≈1.8. 61 [解析] (2)因为= = =5, 又由=vi=0.96,=yi=8.8, 得=-5=8.8-0.96×5=4, 所以=5v+4,即回归方程为=5ln x+4.当x=6时,=5ln 6+4≈13, 因此当年广告费为6(百万元)时,产品的销售量大概是13(百万辆). 62 考点3 独立性检验 例5 (2025·山东临沂·二模)体育是培养学生高尚人格的重要途径之一.足球作为一项团队运动项目,深受学生喜爱,为了解学生喜爱足球运动是否与性别有关,随机抽取了100名学生作为样本,统计得到如下的列联表:   喜爱足球运动 不喜爱足球运动 合计 男生 40 a   女生 b 25   合计     100 63 已知从这100名学生样本中随机抽取1个,抽到喜爱足球运动的学生的概率为. (1)求a,b; (2)根据小概率值α=0.001的独立性检验,判断学生喜爱足球运动是否与性别有关? 附:χ2=. α 0.01 0.005 0.001 xα 6.635 7.879 10.828 64 (1)求a,b; [解析] (1)因为从这100名学生样本中随机抽取1个,抽到喜爱足球运动的学生的概率为, 所以b=100×-40=20,a=100-40-25-b=15; 65 (2)根据小概率值α=0.001的独立性检验,判断学生喜爱足球运动是否与性别有关? 附:χ2= . α 0.01 0.005 0.001 xα 6.635 7.879 10.828 [解析] (2)零假设H0:喜爱足球运动与性别无关. 作出列联表如下:   喜爱足球运动 不喜爱足球运动 合计 男生 40 15 55 女生 20 25 45 合计 60 40 100 由题χ2=≈8.249<10.828=x0.001, 根据小概率值α=0.001的独立性检验,我们推断H0成立, 也就是说没有99.9%的把握认为喜爱足球运动与性别有关. 66 [小结]1.独立性检验的关键是准确地计算χ2,在计算时,要充分利用2×2列联表. 2.独立性检验的步骤: (1)根据样本数据制成2×2列联表; (2)根据公式χ2=计算χ2的值; (3)比较χ2与临界值xα的大小关系作统计推断. 67 7.环境监测部门为调研汽车流量对空气质量的影响,在某监测点统计每日过往的汽车流量x(单位:辆)和空气中的PM2.5的平均浓度y(单位:μg/m3).调研人员采集了50天的数据,制作了关于(xi,yi)(i=1,2,3,…,50)的散点图,并用直线x=1500与y=100将散点图分成如图所示的四个区域Ⅰ、Ⅱ、Ⅲ、Ⅳ,落入对应区域的样本点的个数依次为6,20,16,8. 对应训练 68 (1)完成下面的2×2列联表,并根据小概率值α=0.01的独立性检验,能否认为“PM2.5的平均浓度不小于100 μg/m3”与“汽车日流量不小于1500辆”有关联? PM2.5的 平均浓度y 汽车日流量x 总计 x<1500 x≥1500 y<100       y≥100       合计       [解析] (1)2×2列联表如下: PM2.5的 平均浓度y 汽车日流量x 总计 x<1500 x≥1500 y<100 16 8 24 y≥100 6 20 26 合计 22 28 50 69 零假设H0:“PM2.5平均浓度不小于100μg/m3”与“汽车日流量不小于1500辆”无关, 根据列联表中的数据,经计算得到χ2=≈9.62>6.635=x0.01, 依据小概率值α=0.01的独立性检验,我们推断H0不成立,即认为“PM2.5的平均浓度不小于100 μg/m3”与“汽车日流量不小于1500辆”有关,此推断犯错误的概率不大于0.01. 70 (2)经计算得经验回归方程为=0.12x-73.36,且这50天的汽车日流量x的标准差sx=252,PM2.5的平均浓度y的标准差sy=36. (ⅰ)求相关系数r,并判断该经验回归方程是否有价值; [解析] (2)(ⅰ)因为经验回归方程为=0.12x-73.36, 所以==0.12, 又因为=252,=36, 所以r= = ·=0.12× =0.84. ∵|r|=0.84>0.75,∴y与x有较强的相关性, ∴该经验回归方程有价值. 71 (ⅱ)若这50天的汽车日流量x满足=1.2×108,试推算这50天的PM2.5日均浓度y的平均数.(精确到0.1) 参考公式:χ2= ,其中n=a+b+c+d. α 0.100 0.050 0.010 0.001 xα 2.706 3.841 6.635 10.828 经验回归方程=+x,其中=.相关系数r=. 若|r|≥0.75,则认为y与x有较强的线性相关性. ≈152.856. 72 [解析](ⅱ)sx=252===,解得≈1528.56. 而样本中心点()位于经验回归直线=0.12x-73.36上,因此可推算≈0.12×1528.56-73.36=110.1(μg/m3). 73 考点4 残差分析及应用 例6 车胎凹槽深度是影响汽车刹车的因素,汽车行驶会导致轮胎胎面磨损.某实验室通过试验测得行驶里程与某品牌轮胎凹槽深度的数据如下: 行驶里程/万km 0.00 0.64 1.29 1.93 2.57 3.22 3.86 4.51 5.15 轮胎凹槽深度/mm 10.02 8.37 7.39 6.48 5.82 5.20 4.55 4.16 3.82 以行驶里程为横坐标、轮胎凹槽深度为纵坐标作散点图,如图所示. 74 (1)根据散点图,可认为散点集中在直线y=bx+a附近,由此判断行驶里程与轮胎凹槽深度线性相关,并计算得如下数据,请求出行驶里程与轮胎凹槽深度的相关系数(保留两位小数),并推断它们线性相关程度的强弱; 2.57 6.20 115.10 29.46 附:相关系数 r = 75 [解析] (1)由题意,r= = =≈-0.96, ∵r=-0.96<0,∴|r|=0.96>0.75, ∴行驶里程与轮胎凹槽深度成负相关,且相关性较强. 76 (2)通过散点图,也可认为散点集中在曲线y=c1+c2ln(x+1)附近,考虑使用对数回归模型,并求得经验回归方程=10.11-3.75ln(x+1)及该模型的决定系数R2=0.998. 已知(1)中的线性回归模型为=9.158-1.149x,在同一坐标系作出这两个模型,据图直观回答:哪个模型的拟合效果更好?并用决定系数验证你的观察所得. 附:线性回归模型中,决定系数等于相关系数的平方,即R2=r2. [解析] (2)由图象可知,车胎凹槽深度与对数回归预报值残差、偏离更小,拟合度更高,线性回归预报值偏差较大.由题(1)得线性回归模型=9.158-1.149x的相关系数r=-0.96, 决定系数R2=r2=(0.96)2≈0.922, 由题意,对数回归模型y=10.11-3.75ln(x+1)的决定系数R2=0.998, ∵0.998>0.922, ∴对数回归模型的拟合度更高. 77 [小结]刻画回归效果的三种方法 (1)残差图法,残差点比较均匀地落在水平的带状区域内说明选用的模型比较合适. (2)残差平方和法:残差平方和(yi-)2越小,模型的拟合效果越好. (3)R2法:R2=1-越接近1,表明模型的拟合效果越好. 78 8.首届中国国际进口博览会在国家会展中心(上海)举行,吸引了58个“一带一路”沿线国家的超过1000多家企业参展,成为共建“一带一路”的又一个重要支撑.某企业为了参加这次盛会,提升行业竞争力,加大了科技投入.该企业连续6年来的科技投入x(百万元)与收益y(百万元)的数据统计如下: 科技投入x 2 4 6 8 10 12 收益y 5.6 6.5 12.0 27.5 80.0 129.2 并根据数据绘制散点图如图所示: 对应训练 79 根据散点图的特点,甲认为样本点分布在指数曲线y=c·2bx的周围,据此他对数据进行了一些初步处理.如下表: 43.5 4.5 854.0 34.7 12730.4 70 其中zi=log2yi,=zi. 80 (1)请根据表中数据,建立y关于x的回归方程(保留一位小数); [解析] (1)==7,令z=log2y=bx+log2c; 令a=log2c,则z=bx+a. 根据最小二乘估计可知:= =≈0.5, 从而=-=4.5-0.5×7=1,故回归方程为z=0.5x+1,即y=20.5x+1. 81 (2)乙认为样本点分布在二次曲线y=mx2+n的周围,并计算得回归方程为y=0.92x2-12.0,以及该回归模型的相关指数R2=0.94,试比较甲乙两人所建立的模型,谁的拟合效果更好. 附:对于一组数据(u1,v1),(u2,v2),…,(un,vn),其回归直线方程=+u的斜率和截距的最小二乘估计分别为==-, 相关指数:R2=1- . 82 [解析] (2)甲建立的回归模型的残差: yi 5.6 6.5 12.0 27.5 80.0 129.2 4 8 16 32 64 128 yi- 1.6 -1.5 -4 -4.5 16 1.2 则(yi-)2=298.5,从而R2=1-≈1-0.02=0.98>0.94, 即甲建立的回归模型拟合效果更好. 83 走进高考 1.(2025·全国一卷)为研究某疾病与超声波检查结果的关系,从做过超声波检查的人群中随机调查了1000人,得到如下列联表: 超声波检查结果组别 正常 不正常 合计 患该疾病 20 180 200 未患该疾病 780 20 800 合计 800 200 1000 84 (1)记超声波检查结果不正常者患该疾病的概率为P,求P的估计值; [解析] (1)根据表格可知,检查结果不正常的200人中有180人患病, 所以P的估计值为=; 85 (2)根据小概率值α=0.001的独立性检验,分析超声波检查结果是否与患该疾病有关. 附:χ2=, P(x2≥k) 0.050 0.010 0.001 k 3.841 6.635 10.828 [解析](2)零假设为H0:超声波检查结果与患病无关, 根据表中数据可得,χ2= =765.625>10.828=x0.001, 根据小概率值α=0.001的χ2独立性检验,我们推断H0不成立, 即认为超声波检查结果与患该病有关,该推断犯错误的概率不超过0.001. 86 $

资源预览图

第47讲 成对数据的统计分析——2027届高三数学一轮复习课件
1
第47讲 成对数据的统计分析——2027届高三数学一轮复习课件
2
第47讲 成对数据的统计分析——2027届高三数学一轮复习课件
3
第47讲 成对数据的统计分析——2027届高三数学一轮复习课件
4
第47讲 成对数据的统计分析——2027届高三数学一轮复习课件
5
第47讲 成对数据的统计分析——2027届高三数学一轮复习课件
6
相关资源
示范课
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。