统计与成对数据的统计分析之成对数据的统计分析(讲义+课件)-2025届高三数学一轮复习

2024-11-12
| 3份
| 114页
| 334人阅读
| 1人下载
普通

内容正文:

2025届高考数学一轮复习教案讲义(解析版)——统计与成对数据的统计分析之成对数据的统计分析 【知识梳理】 1.变量的相关关系 (1)相关关系的分类:正相关和负相关. (2)线性相关:一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们就称这两个变量线性相关. 一般地,如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量非线性相关或曲线相关. 2.样本相关系数 (1)相关系数r的计算 变量x和变量y的样本相关系数r的计算公式如: r=. (2)相关系数r的性质 ①当r>0时,称成对样本数据正相关;当r<0时,成对样本数据负相关;当r=0时,成对样本数据间没有线性相关关系. ②样本相关系数r的取值范围为[-1,1]. 当|r|越接近1时,成对样本数据的线性相关程度越强; 当|r|越接近0时,成对样本数据的线性相关程度越弱. 3.一元线性回归模型 (1)我们将=x+称为Y关于x的经验回归方程,其中 (2)决定系数 R2=1-,R2越大,即拟合效果越好,R2越小,模型拟合效果越差. 4.列联表与独立性检验 (1)关于分类变量X和Y的抽样数据的2×2列联表 X Y 合计 Y=0 Y=1 X=0 a b a+b X=1 c d c+d 合计 a+c b+d n=a+b+c+d 记n=a+b+c+d,则随机变量 χ2=. (2)独立性检验 基于小概率值α的检验规则是: 当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α; 当χ2<xα时,我们没有充分证据推断H0不成立 ,可以认为X和Y独立. 下表给出了χ2独立性检验中几个常用的小概率值和相应的临界值 α 0.1 0.05 0.01 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 [常用结论] 1.求解经验回归方程的关键是确定回归系数,,应充分利用回归直线过样本点的中心(,). 2.根据χ2的值可以判断两个分类变量有关的可信程度,若χ2越大,则两个分类变量有关的把握越大. 3.回归分析和独立性检验都是基于成对样本观测数据进行估计或推断,得出的结论都可能犯错误. 【诊断自测】 1.思考辨析(在括号内打“√”或“×”) (1)散点图无法判断两个变量是否相关.(  ) (2)通过经验回归方程=x+可以估计预报变量的取值和变化趋势.(  ) (3)只有两个变量有相关关系,所得到的回归模型才有预测价值.(  ) (4)事件X,Y关系越密切,则由观测数据计算得到的χ2的值越小.(  ) 答案 (1)× (2)√ (3)√ (4)× 解析 (1)散点图是判断两个变量是否相关的一种重要方法和手段. (4)χ2的值越大,相关性越强,关系越密切. 2.(选修三P139T3)根据分类变量x与y的观测数据,计算得到χ2=2.974.依据α=0.05的独立性检验,结论为(  ) A.变量x与y不独立 B.变量x与y不独立,这个结论犯错误的概率不超过0.05 C.变量x与y独立 D.变量x与y独立,这个结论犯错误的概率不超过0.05 答案 D 解析 由χ2=2.974<3.841=x0.05,可知x,y独立,这个结论犯错误的概率不超过0.05. 3.(选修三P103T1改编)两个变量的相关关系有:①正相关;②负相关;③不相关,则下列散点图从左到右分别反映的变量间的相关关系是(  ) A.①②③ B.②③① C.②①③ D.①③② 答案 D 解析 第一个图大体趋势从左向右上升,故正相关,第二个图不相关,第三个图大体趋势从左向右下降,故负相关,故选D. 4.(多选)在统计中,由一组样本数据(x1,y1),(x2,y2),…,(xn,yn)利用最小二乘法得到两个变量的经验回归方程为=x+,那么下列说法正确的是(  ) A.直线=x+必经过点(,) B.直线=x+表示最接近y与x之间真实关系的一条直线 C.相关系数为r,且|r|越接近于1,相关程度越大;|r|越接近于0,相关程度越小 D.用决定系数R2来刻画回归效果,R2越小说明拟合效果越好 答案 ABC 解析 直线=x+必过样本点中心即点(,),故A正确; 直线=x+是采用最小二乘法求解出的直线方程,接近真实关系,故B正确; 相关系数r的绝对值越接近于1,表示相关程度越强,越接近于0,相关程度越弱,故C正确; 用决定系数R2来刻画回归效果,R2越大,说明模型的拟合效果越好,故D错误.考点一 成对数据的相关性 例1 (1)(2023·天津卷)调查某种群花萼长度和花瓣长度,所得数据如图所示,其中相关系数r=0.824 5,下列说法正确的是(  ) A.花瓣长度和花萼长度没有相关性 B.花瓣长度和花萼长度呈负相关 C.花瓣长度和花萼长度呈正相关 D.若从样本中抽取一部分,则这部分的相关系数一定是0.824 5 答案 C 解析 因为相关系数r=0.824 5>0.75,所以花瓣长度和花萼长度的相关性较强,并且呈正相关,所以选项A,B错误,选项C正确; 因为相关系数与样本的数据有关,所以当样本发生变化时,相关系数也会发生变化,所以选项D错误.故选C. (2)(2024·杭州质检)某兴趣小组研究光照时长x(h)和向日葵种子发芽数量y(颗)之间的关系,采集5组数据,作如图所示的散点图.若去掉D(10,2),则下列说法正确的是(  ) A.相关系数r变小 B.决定系数R2变小 C.残差平方和变大 D.解释变量x与预报变量y的相关性变强 答案 D 解析 可知点D偏离程度较大,去掉点D后,相关系数r变大,决定系数R2变大,残差平方和变小,解释变量x与预报变量y的相关性变强.故选D. 方法总结 判定两个变量相关性的方法 (1)画散点图:点的分布从左下角到右上角,两个变量正相关;点的分布从左上角到右下角,两个变量负相关. (2)样本相关系数:当r>0时,正相关;当r<0时,负相关;|r|越接近于1,相关性越强. (3)决定系数法:利用决定系数判定,R2越接近1,模型的拟合效果越好,相关性越强. 训练1 (1)(2023·上海卷)已知某校50名学生的身高与体重的散点图如图所示,则下列说法正确的是(  ) A.身高越高,体重越重 B.身高越高,体重越轻 C.身高与体重成正相关 D.身高与体重成负相关 答案 C 解析 由题图可知,身高越高的体重不一定就越重或越轻,但总体上来说,样本学生的身高和体重之间具有明显的相关性,个子高的学生往往更重一些,所以身高与体重成正相关.故选C. (2)在一组样本数据(x1,y1),(x2,y2),…,(xn,yn)(n≥2,x1,x2,…,xn不全相等)的散点图中,若所有样本点(xi,yi)(i=1,2,…,n)都在直线y=-x+1上,则这组样本数据的样本相关系数为(  ) A.-1 B.0 C.- D.1 答案 A 解析 因为样本点在直线y=-x+1上,呈现完全负相关,样本相关系数为-1. 考点二 回归分析 角度1 线性回归分析 例2 为实施乡村振兴,科技兴农,某村建起了田园综合体,并从省城请来专家进行技术指导,根据统计,该田园综合体西红柿亩产量的增加量y(千克)与某种液体肥料每亩使用量x(千克)之间的对应数据如下: x(千克) 2 4 5 6 8 y(千克) 300 400 400 400 500 (1)由上表数据可知,可用经验回归模型拟合y与x的关系,请计算样本相关系数r并加以说明(若|r|>0.75,则线性相关程度很高,可用经验回归模型拟合); (2)求y关于x的经验回归方程,并预测当液体肥料每亩使用量为15千克时,西红柿亩产量的增加量约为多少千克? 附:相关系数r=, 经验回归方程=+x的斜率和截距的最小二乘估计公式分别为 =,=-,≈3.16. 解 (1)由已知数据可得==5, ==400, 所以 (xi-)(yi-)=(-3)×(-100)+(-1)×0+0×0+1×0+3×100=600, = =2, = =100, 所以样本相关系数r= ==≈0.95>0.75. 所以可用经验回归模型拟合y与x的关系. (2)===30, =400-5×30=250, 所以经验回归方程为=30x+250. 当x=15时,=30×15+250=700(千克), 即当液体肥料每亩使用量为15千克时,西红柿亩产量的增加量约为700千克. 角度2 非线性回归分析 例3 (2024·广州质检)一企业生产某种产品,通过加大技术创新投入降低了每件产品成本.为了调查年技术创新投入x(单位:千万元)对每件产品成本y(单位:元)的影响,对近10年的年技术创新投入xi和每件产品成本yi(i=1,2,3,…,10)的数据进行分析,得到如下散点图,并计算得:=6.8,=70, =3, =1.6, =350. (1)根据散点图可知,可用函数模型y=+α拟合y与x的关系,试建立y关于x的回归方程; (2)已知该产品的年销售额m(单位:千万元)与每件产品成本y的关系为m=-+++100.该企业的年投入成本除了年技术创新投入,还要投入其他成本10千万元,根据(1)的结果回答:当年技术创新投入x为何值时,年利润的预报值最大? (注:年利润=年销售额-年投入成本) 参考公式:对于一组数据(u1,v1),(u2,v2),…,(un,vn),其回归直线v=α+βu的斜率和截距的最小二乘估计分别为 =,=-. 解 (1)令u=,则y关于u的线性回归方程为y=+u, 依题意,得 ===200, =-=70-200×0.3=10, 则y=10+200u, 所以y关于x的回归方程为y=10+. (2)由y=10+,得x=, 年利润M=m-x-10 =-+++100--10 =-(y-20)2+90.8 当y=20时,年利润M取得最大值, 此时,x===20, 所以当年技术创新投入20千万元时,年利润的预报值最大. 方法总结 回归分析问题的类型及解题方法 (1)求经验回归方程 ①当两个系数均未知时,可利用公式法求解; ②当两个系数已知一个求另一个时,可利用经验回归直线过样本点的中心求解. (2)利用经验回归方程进行预测,把经验回归方程看作一次函数,求函数值. (3)经验回归方程的拟合效果可以利用相关系数判断,当|r|越趋近于1时,两变量的线性相关性越强. 训练2 (2024·西安调研)某商业银行对存款利率与日存款总量的关系进行调研,发现存款利率每上升一定的百分点,日均存款总额就会发生一定的变化,经过统计得到下表: 利率上升百分点x 0.1 0.2 0.3 0.4 0.5 日均存款总额y(亿元) 0.2 0.35 0.5 0.65 0.8 (1)在给出的坐标系中画出上表数据的散点图; (2)根据上表提供的数据,用最小二乘法求出y关于x的经验回归方程=x+; (3)已知现行利率下的日均存款总额为0.625亿元,试根据(2)中的经验回归方程,预测日均存款总额为现行利率下的2倍时,利率需上升多少个百分点? 参考公式及数据:①=,=-,②xiyi=0.9,x=0.55. 解 (1)如图所示. (2)由表格数据可得 =×(0.1+0.2+0.3+0.4+0.5)=0.3, =×(0.2+0.35+0.5+0.65+0.8)=0.5, 所以===1.5, =-=0.5-1.5×0.3=0.05, 故=1.5x+0.05. (3)设利率需上升x个百分点, 由(2)得,0.625×2=1.5x+0.05,解得x=0.8, 所以预测利率需上升0.8个百分点. 考点三 独立性检验 例4 (2023·全国甲卷改编)一项试验旨在研究臭氧效应,试验方案如下:选40只小白鼠,随机地将其中20只分配到试验组,另外20只分配到对照组,试验组的小白鼠饲养在高浓度臭氧环境,对照组的小白鼠饲养在正常环境,一段时间后统计每只小白鼠体重的增加量(单位:g). 试验结果如下: 对照组的小白鼠体重的增加量从小到大排序为 15.2 18.8 20.2 21.3 22.5 23.2 25.8 26.5 27.5 30.1 32.6 34.3 34.8 35.6 35.6 35.8 36.2 37.3 40.5 43.2 试验组的小白鼠体重的增加量从小到大排序为 7.8 9.2 11.4 12.4 13.2 15.5 16.5 18.0 18.8 19.2 19.8 20.2 21.6 22.8 23.6 23.9 25.1 28.2 32.3 36.5 (1)计算试验组的样本平均数; (2)①求40只小白鼠体重的增加量的中位数m,再分别统计两样本中小于m与不小于m的数据的个数,完成如下列联表: <m ≥m 对照组 试验组 ②根据①中的列联表,依据小概率值α=0.050的独立性检验,能否认为小白鼠在高浓度臭氧环境中与在正常环境中体重的增加量有差异? 附:χ2=, α 0.100 0.050 0.010 xα 2.706 3.841 6.635 解 (1)试验组的样本平均数为×(7.8+9.2+11.4+12.4+13.2+15.5+16.5+18.0+18.8+19.2+19.8+20.2+21.6+22.8+23.6+23.9+25.1+28.2+32.3+36.5)=19.8. (2)①将40个数据按照从小到大的顺序依次排列,得最中间的两个数据即第20个和第21个数据分别为23.2和23.6,则40只小白鼠体重的增加量的中位数m==23.4. 列联表如下: <m ≥m 对照组 6 14 试验组 14 6 ②零假设为H0:小白鼠在高浓度臭氧环境中与在正常环境中体重的增加量没有差异. χ2= ==6.4>3.841=x0.050, 依据小概率值α=0.050的独立性检验,我们推断H0不成立,所以在犯错误的概率不超过0.050的前提下,即认为小白鼠在高浓度臭氧环境中与在正常环境中体重的增加量有差异. 方法总结 独立性检验的一般步骤 (1)根据样本数据制成2×2列联表. (2)根据公式χ2=计算. (3)比较χ2与临界值的大小关系,作统计推断. 训练3 某学生兴趣小组随机调查了某市100天中每天的空气质量等级和当天到某公园锻炼的人次,整理数据得到下表(单位:天): 锻炼人次 空气质量等级     [0,200] (200,400] (400,600] 1(优) 2 16 25 2(良) 5 10 12 3(轻度污染) 6 7 8 4(中度污染) 7 2 0 (1)分别估计该市一天的空气质量等级为1,2,3,4的概率; (2)求一天中到该公园锻炼的平均人次的估计值(同一组中的数据用该组区间的中点值为代表); (3)若某天的空气质量等级为1或2,则称这天“空气质量好”;若某天的空气质量等级为3或4,则称这天“空气质量不好”.根据所给数据,完成下面的2×2列联表,并根据列联表,能否在犯错误的概率不超过0.050的前提下,认为一天中到该公园锻炼的人次与该市当天的空气质量有关? 人次≤400 人次>400 空气质量好 空气质量不好 附:χ2=, α 0.050 0.010 0.001 xα 3.841 6.635 10.828 解 (1)由所给数据,得该市一天的空气质量等级为1,2,3,4的概率的估计值如下表: 空气质量等级 1 2 3 4 概率的估计值 0.43 0.27 0.21 0.09 (2)一天中到该公园锻炼的平均人次的估计值为(100×20+300×35+500×45)=350. (3)根据所给数据,可得2×2列联表: 人次≤400 人次>400 空气质量好 33 37 空气质量不好 22 8 零假设为H0:一天中到该公园锻炼的人次与该市当天的空气质量无关. 根据列联表得χ2=≈5.820>3.841=x0.050. 根据小概率值α=0.050的独立性检验,可推断H0不成立,所以在犯错误的概率不超过0.050的前提下,可认为一天中到该公园锻炼的人次与该市当天的空气质量有关. 习题演练 1.某机构为调查网游爱好者是否有性别差异,通过调研数据统计:在500名男生中有200名爱玩网游,在400名女生中有50名爱玩网游.若要确定网游爱好是否与性别有关时,用下列最适合的统计方法是(  ) A.均值 B.方差 C.独立性检验 D.回归分析 答案 C 解析 由题意可知,“爱玩网游”与“性别”是两类变量,其是否有关,应用独立性检验判断. 2.甲、乙、丙、丁四位同学各自对A,B两个变量的线性相关性做试验,并用回归分析方法分别求得样本相关系数r与残差平方和m,如下表: 甲 乙 丙 丁 r 0.82 0.78 0.69 0.85 m 106 115 124 103 则哪位同学的试验结果体现A,B两个变量有更强的线性相关性?(  ) A.甲 B.乙 C.丙 D.丁 答案 D 解析 r的绝对值越大,m越小,线性相关性越强. 3.根据如表样本数据: x 2 3 4 5 6 y 4 2.5 -0.5 -2 -3 得到的经验回归方程为=x+,则(  ) A.>0,>0 B.>0,<0 C.<0,>0 D.<0,<0 答案 B 解析 由表中的数据可得,变量y随着x的增大而减小,则<0, ==4, ==0.2, 又经验回归方程=x+经过样本点中心(4,0.2),可得>0. 4.某公司在2019~2023年的收入与支出情况如下表所示: 收入x(亿元) 2.2 2.6 4.0 5.3 5.9 支出y(亿元) 0.2 1.5 2.0 2.5 3.8 根据表中数据可得经验回归方程为=0.8x+,依此估计该公司收入为8亿元时的支出为(  ) A.4.2亿元 B.4.4亿元 C.5.2亿元 D.5.4亿元 答案 C 解析 根据题表中的数据,由题意得 =×(2.2+2.6+4.0+5.3+5.9)=4, =×(0.2+1.5+2.0+2.5+3.8)=2, ∴=2-0.8×4=-1.2, ∴经验回归方程为=0.8x-1.2, 当x=8时,=0.8×8-1.2=5.2(亿元), 即预测该公司收入为8亿元时的支出为5.2亿元. 5.(2024·河北“五个一”联盟联考)某医院为了提高服务水平和病人满意度,对一周前出院的病人进行电话回访,主要涉及住院期间护士的服务态度、医生是否收取红包、对医院有什么建议等问题.某天上午回访的5人中,通话时间(单位:秒)如表所示: 序号x 1 2 3 4 5 时间y 37 65 21 m 32 根据表中数据,得到y关于x的经验回归方程=x+40.9.据此求出(5,32)残差为-7.4,则m=(  ) (残差=实际值-观测值) A.45 B.25 C.37 D.7 答案 A 解析 由题知,当x=5时, =5+40.9=32+7.4=39.4,解得=-0.3, 所以y关于x的回归方程为=-0.3x+40.9. 当x==3时, ==-0.3×3+40.9=40, 所以×(37+65+21+m+32)=40, 解得m=45,故选A. 6.(多选)(2024·南京调研)为研究混凝土的抗震强度y与抗压强度x的关系,某研究部门得到下表的样本数据: x 140 150 170 180 195 y 23 24 26 28 28 若y与x线性相关,且经验回归方程为=0.1x+,则下列说法正确的是(  ) A.=9.1 B.当x增加1个单位时,y增加约0.1个单位 C.y与x正相关 D.若抗压强度为220时,抗震强度一定是33.1 答案 ABC 解析 由题意可得 ==167, ==25.8, 所以25.8=0.1×167+,解得=9.1, 所以经验回归方程为=0.1x+9.1,A正确; 对于B,由=0.1x+9.1,可知当x增加一个单位时,y增加约0.1个单位,B正确; 对于C,因为0.1>0,所以y与x正相关,C正确; 对于D,当x=220时,=0.1×220+9.1=31.1,抗震强度约为31.1,D错误. 7.(多选)为了解阅读量多少与幸福感强弱之间的关系,一个调查机构根据所得到的数据,绘制了如下所示的2×2列联表(个别数据暂用字母表示): 幸福感强 幸福感弱 合计 阅读量多 m 18 72 阅读量少 36 n 78 合计 90 60 150 计算得:χ2≈12.981,参照下表: α 0.10 0.05 0.025 0.010 0.005 0.001 xα 2.706 3.841 5.024 6.635 7.879 10.828 对于下面的选项,正确的是(  ) A.根据小概率值α=0.010的独立性检验,可以认为“阅读量多少与幸福感强弱无关” B.m=54 C.根据小概率值α=0.005的独立性检验,可以在犯错误的概率不超过0.5%的前提下认为“阅读量多少与幸福感强弱有关” D.n=52 答案 BC 解析 ∵χ2≈12.981>7.879>6.635, ∴根据小概率值α=0.010的独立性检验,可以在犯错误的概率不超过1%的前提下认为“阅读量多少与幸福感强弱有关”, 根据小概率值α=0.005的独立性检验,可以在犯错误的概率不超过0.5%的前提下认为“阅读量多少与幸福感强弱有关”, ∴A错,C正确, ∵m+36=90,18+n=60, ∴m=54,n=42, ∴B正确,D错. 8.某市物价部门对本市的5家商场的某商品一天的销售量及其价格进行调查,5家商场的售价x(元/件)和销售量y(件)的数据如下表所示: 售价x 9 9.5 m 10.5 11 销售量y 11 n 8 6 5 由表中数据可知,销售量y与售价x之间有较强的线性相关关系,其经验回归方程是=-3.2x+40,且m+n=20,则其中的n=________. 答案 10 解析 ==8+, ==6+, 回归直线一定经过样本点中心(,), 即6+=-3.2+40, 即3.2m+n=42. 又m+n=20,所以m=10,n=10. 9.已知x和y的散点图如图所示,在相关关系中,若用=c1ec2x拟合时的决定系数为R,用=x+拟合时的决定系数为R,则R,R中较大的是________. 答案 R 解析 由散点图知,用=c1ec2x拟合的效果比 =x+拟合的效果要好, 所以R>R,故较大者为R. 10.一项研究同年龄段的男、女生的注意力差别的脑功能实验,其实验数据如表所示: 性别 注意力 稳定 不稳定 男 29 7 女 33 5 则χ2=________(精确到小数点后三位),依据概率值α=0.05的独立性检验,该实验______该年龄段的学生在注意力的稳定性上对于性别没有显著差异(填拒绝或支持). 答案 0.538 支持 解析 由表中数据可知a=29,b=7,c=33, d=5,n=a+b+c+d=74, 根据χ2=,计算可知 χ2=≈0.538<3.841=x0.05, 所以没有充分证据认为学生在注意力的稳定性上与性别有关, 即该实验支持该年龄段的学生在注意力的稳定性上对于性别没有显著差异. 11.(2024·济南调研)某芯片制造企业使用新技术对某款芯片进行生产.生产该款芯片有三道工序,这三道工序互不影响.已知批次甲的三道工序次品率分别为,,. (1)求批次甲芯片的次品率; (2)该企业改进生产工艺后,生产了批次乙的芯片.某手机厂商获得批次甲与批次乙的芯片,并在某款手机上使用.现对使用这款手机的100名用户回访,对开机速度进行调查.据统计,安装批次甲的有40名,其中对开机速度满意的有30名;安装批次乙的有60名,其中对开机速度满意的有55名.试整理出2×2列联表(单位:名),并依据小概率值α=0.05的独立性检验,分析芯片批次是否与用户对开机速度满意有关. 批次 是否满意 合计 满意 不满意 甲 乙 合计 附:χ2=. α 0.1 0.05 0.01 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 解 (1)批次甲芯片的次品率为 1-=1-××=. (2)零假设为H0:芯片批次与用户对开机速度满意无关,得2×2列联表如下: 批次 是否满意 合计 满意 不满意 甲 30 10 40 乙 55 5 60 合计 85 15 100 所以χ2= =≈5.229>3.841, 所以依据α=0.05的独立性检验,我们推断H0不成立, 所以认为芯片批次与用户对开机速度满意有关,此推断犯错误的概率不大于0.05. 12.(2022·全国乙卷)某地经过多年的环境治理,已将荒山改造成了绿水青山.为估计一林区某种树木的总材积量,随机选取了10棵这种树木,测量每棵树的根部横截面积(单位:m2)和材积量(单位:m3),得到如下数据: 样本号i 1 2 3 4 5 6 7 8 9 10 总和 根部横截面积xi 0.04 0.06 0.04 0.08 0.08 0.05 0.05 0.07 0.07 0.06 0.6 材积量yi 0.25 0.40 0.22 0.54 0.51 0.34 0.36 0.46 0.42 0.40 3.9 并计算得x=0.038,y=1.615 8,xiyi=0.247 4. (1)估计该林区这种树木平均一棵的根部横截面积与平均一棵的材积量; (2)求该林区这种树木的根部横截面积与材积量的样本相关系数(精确到0.01); (3)现测量了该林区所有这种树木的根部横截面积,并得到所有这种树木的根部横截面积总和为186 m2.已知树木的材积量与其根部横截面积近似成正比.利用以上数据给出该林区这种树木的总材积量的估计值. 附:相关系数r=, ≈1.377. 解 (1)样本中10棵这种树木的根部横截面积的平均值==0.06(m2), 样本中10棵这种树木的材积量的平均值 ==0.39(m3), 据此可估计该林区这种树木平均一棵的根部横截面积为0.06 m2,平均一棵的材积量为0.39 m3. (2)r= = = =≈≈0.97. (3)设该林区这种树木的总材积量的估计值为Y m3, 又已知树木的材积量与其根部横截面积近似成正比, 可得=,解得Y=1 209. 则该林区这种树木的总材积量估计为1 209 m3. 13.(多选)(2024·长沙适应性考试)自然环境中,大气压受到各种因素的影响,如温度、湿度、风速和海拔等方面的改变,都将导致大气压发生相应的变化,其中以海拔的影响最为显著.如图是根据一组观测数据得到海拔6千米~15千米的大气压强散点图,根据一元线性回归模型得到经验回归方程为1=-4.0x+68.5,决定系数为R=0.99;根据非线性回归模型得到经验回归方程为2=132.9e-0.163x,决定系数为R=0.99,则下列说法正确的是(  ) A.由散点图可知,大气压强与海拔高度负相关 B.由方程1=-4.0x+68.5可知,海拔每升高1千米,大气压强必定降低4.0 kPa C.由方程1=-4.0x+68.5可知,样本点(11,22.6)的残差为-1.9 D.对比两个回归模型,结合实际情况,方程2=132.9e-0.163x的预报效果更好 答案 ACD 解析 对于A,由题图知,海拔高度越高,大气压强越小,所以大气压强与海拔高度负相关,故A正确; 对于B,经验回归直线得到的数据为估计值,而非精确值,故B错误; 对于C,当x=11时,1=-4.0×11+68.5=24.5, 又由散点图知观测值为22.6,所以样本点(11,22.6)的残差为22.6-24.5=-1.9,故C正确; 对于D,随着海拔高度的增加,大气压强越来越小,但不可能为负数,因此方程2=132.9e-0.163x的预报效果更好,故D正确. 14.(2024·厦门质检)移动物联网广泛应用于生产制造、公共服务、个人消费等领域.截至2023年底,我国移动物联网连接数达18.45亿户,成为全球主要经济体中首个实现“物超人”的国家.如图是2019~2023年移动物联网连接数W与年份代码t的散点图,其中年份2019~2023对应的t分别为1~5. (1)根据散点图推断两个变量是否线性相关.计算样本相关系数(精确到0.01),并推断它们的相关程度; (2)①假设变量x与变量Y的n对观测数据为(x1,y1),(x2,y2),…,(xn,yn),两个变量满足一元线性回归模型(随机误差ei=yi-bxi).请推导:当随机误差平方和Q=e取得最小值时,参数b的最小二乘估计; ②令变量x=t-,y=w-,则变量x与变量Y满足一元线性回归模型利用①中结论求y关于x的经验回归方程,并预测2025年移动物联网连接数. 附:样本相关系数 r=, (wi-)2=76.9, (ti-)(wi-)=27.2, wi=60.8,≈27.7. 解 (1)由散点图可以看出样本点都集中在一条直线附近, 由此推断两个变量线性相关. 因为=×(1+2+3+4+5)=3, 所以 (ti-)2=(1-3)2+(2-3)2+(3-3)2+(4-3)2+(5-3)2=10, 所以r===≈≈0.98. 所以这两个变量正线性相关,且相关程度很强. (2)①Q=e= (yi-bxi)2 = (y-2bxiyi+b2x) =b2x-2bxiyi+y, 要使Q取得最小值,当且仅当=. ②由①知== ==2.72, 所以y关于x的经验回归方程为=2.72x, 又===12.16, 所以当t=7时,x=7-3=4, w=+=2.72×4+12.16=23.04, 所以预测2025年移动物联网连接数为23.04亿户. 学科网(北京)股份有限公司 $$2025届高考数学一轮复习讲义 课件——统计与成对数据的统计分析之成对数据的统计分析 知识梳理 1.变量的相关关系 (1)相关关系的分类:正相关和负相关. (2)线性相关:一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在__________附近,我们就称这两个变量线性相关. 一般地,如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量非线性相关或曲线相关. 一条直线 3 正 负 [-1,1] 强 弱 4 大 小 5 6 (2)独立性检验 基于小概率值α的检验规则是: 当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α; 当χ2<xα时,我们没有充分证据推断H0不成立 ,可以认为X和Y独立. 下表给出了χ2独立性检验中几个常用的小概率值和相应的临界值 α 0.1 0.05 0.01 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 常用结论 诊断自测 × √ √ × 解析 (1)散点图是判断两个变量是否相关的一种重要方法和手段. (4)χ2的值越大,相关性越强,关系越密切. 2.(选修三P139T3)根据分类变量x与y的观测数据,计算得到χ2=2.974.依据α=0.05的独立性检验,结论为(  ) A.变量x与y不独立 B.变量x与y不独立,这个结论犯错误的概率不超过0.05 C.变量x与y独立 D.变量x与y独立,这个结论犯错误的概率不超过0.05 D 解析 由χ2=2.974<3.841=x0.05,可知x,y独立,这个结论犯错误的概率不超过0.05. 3.(选修三P103T1改编)两个变量的相关关系有:①正相关;②负相关;③不相关,则下列散点图从左到右分别反映的变量间的相关关系是(  ) D 解析 第一个图大体趋势从左向右上升,故正相关,第二个图不相关,第三个图大体趋势从左向右下降,故负相关,故选D. A.①②③ B.②③① C.②①③ D.①③② ABC 相关系数r的绝对值越接近于1,表示相关程度越强,越接近于0,相关程度越弱,故C正确; 用决定系数R2来刻画回归效果,R2越大,说明模型的拟合效果越好,故D错误. 考点一 成对数据的相关性 例1 (1)(2023·天津卷)调查某种群花萼长度和花瓣长度,所得数据如图所示,其中相关系数r=0.824 5,下列说法正确的是(  ) A.花瓣长度和花萼长度没有相关性 B.花瓣长度和花萼长度呈负相关 C.花瓣长度和花萼长度呈正相关 D.若从样本中抽取一部分,则这部分的相关系数一定是0.824 5 C 解析 因为相关系数r=0.824 5>0.75,所以花瓣长度和花萼长度的相关性较强,并且呈正相关,所以选项A,B错误,选项C正确; 因为相关系数与样本的数据有关,所以当样本发生变化时,相关系数也会发生变化,所以选项D错误.故选C. (2)(2024·杭州质检)某兴趣小组研究光照时长x(h)和向日葵种子发芽数量y(颗)之间的关系,采集5组数据,作如图所示的散点图.若去掉D(10,2),则下列说法正确的是(  ) A.相关系数r变小 B.决定系数R2变小 C.残差平方和变大 D.解释变量x与预报变量y的相关性变强 D 解析 可知点D偏离程度较大,去掉点D后,相关系数r变大,决定系数R2变大,残差平方和变小,解释变量x与预报变量y的相关性变强.故选D. 方法总结 判定两个变量相关性的方法 (1)画散点图:点的分布从左下角到右上角,两个变量正相关;点的分布从左上角到右下角,两个变量负相关. (2)样本相关系数:当r>0时,正相关;当r<0时,负相关;|r|越接近于1,相关性越强. (3)决定系数法:利用决定系数判定,R2越接近1,模型的拟合效果越好,相关性越强. 训练1 (1)(2023·上海卷)已知某校50名学生的身高与体重的散点图如图所示,则下列说法正确的是(  ) A.身高越高,体重越重 B.身高越高,体重越轻 C.身高与体重成正相关 D.身高与体重成负相关 C 解析 由题图可知,身高越高的体重不一定就越重或越轻,但总体上来说,样本学生的身高和体重之间具有明显的相关性,个子高的学生往往更重一些,所以身高与体重成正相关.故选C. A 考点二 回归分析 角度1 线性回归分析 例2 为实施乡村振兴,科技兴农,某村建起了田园综合体,并从省城请来专家进行技术指导,根据统计,该田园综合体西红柿亩产量的增加量y(千克)与某种液体肥料每亩使用量x(千克)之间的对应数据如下: x(千克) 2 4 5 6 8 y(千克) 300 400 400 400 500 (1)由上表数据可知,可用经验回归模型拟合y与x的关系,请计算样本相关系数r并加以说明(若|r|>0.75,则线性相关程度很高,可用经验回归模型拟合); 方法总结 回归分析问题的类型及解题方法 (1)求经验回归方程 ①当两个系数均未知时,可利用公式法求解; ②当两个系数已知一个求另一个时,可利用经验回归直线过样本点的中心求解. (2)利用经验回归方程进行预测,把经验回归方程看作一次函数,求函数值. (3)经验回归方程的拟合效果可以利用相关系数判断,当|r|越趋近于1时,两变量的线性相关性越强. 训练2 (2024·西安调研)某商业银行对存款利率与日存款总量的关系进行调研,发现存款利率每上升一定的百分点,日均存款总额就会发生一定的变化,经过统计得到下表: 利率上升百分点x 0.1 0.2 0.3 0.4 0.5 日均存款总额           y(亿元) 0.2 0.35 0.5 0.65 0.8 (1)在给出的坐标系中画出上表数据的散点图; 解 如图所示. 解 由表格数据可得 解 设利率需上升x个百分点, 由(2)得,0.625×2=1.5x+0.05,解得x=0.8, 所以预测利率需上升0.8个百分点. 考点三 独立性检验 例4 (2023·全国甲卷改编)一项试验旨在研究臭氧效应,试验方案如下:选40只小白鼠,随机地将其中20只分配到试验组,另外20只分配到对照组,试验组的小白鼠饲养在高浓度臭氧环境,对照组的小白鼠饲养在正常环境,一段时间后统计每只小白鼠体重的增加量(单位:g). 试验结果如下: 对照组的小白鼠体重的增加量从小到大排序为 15.2 18.8 20.2 21.3 22.5 23.2 25.8 26.5 27.5 30.1 32.6 34.3 34.8 35.6 35.6 35.8 36.2 37.3 40.5 43.2 试验组的小白鼠体重的增加量从小到大排序为 7.8 9.2 11.4 12.4 13.2 15.5 16.5 18.0 18.8 19.2 19.8 20.2 21.6 22.8 23.6 23.9 25.1 28.2 32.3 36.5 (1)计算试验组的样本平均数; (2)①求40只小白鼠体重的增加量的中位数m,再分别统计两样本中小于m与不小于m的数据的个数,完成如下列联表:   <m ≥m 对照组     试验组       <m ≥m 对照组 6 14 试验组 14 6 解 零假设为H0:小白鼠在高浓度臭氧环境中与在正常环境中体重的增加量没有差异. 依据小概率值α=0.050的独立性检验,我们推断H0不成立,所以在犯错误的概率不超过0.050的前提下,即认为小白鼠在高浓度臭氧环境中与在正常环境中体重的增加量有差异. 方法总结 训练3 某学生兴趣小组随机调查了某市100天中每天的空气质量等级和当天到某公园锻炼的人次,整理数据得到下表(单位:天): 锻炼人次 空气质量等级     [0,200] (200,400] (400,600] 1(优) 2 16 25 2(良) 5 10 12 3(轻度污染) 6 7 8 4(中度污染) 7 2 0 (1)分别估计该市一天的空气质量等级为1,2,3,4的概率; 解 由所给数据,得该市一天的空气质量等级为1,2,3,4的概率的估计值如下表: 空气质量等级 1 2 3 4 概率的估计值 0.43 0.27 0.21 0.09 (2)求一天中到该公园锻炼的平均人次的估计值(同一组中的数据用该组区间的中点值为代表); 解 根据所给数据,可得2×2列联表:   人次≤400 人次>400 空气质量好 33 37 空气质量不好 22 8 零假设为H0:一天中到该公园锻炼的人次与该市当天的空气质量无关. 根据小概率值α=0.050的独立性检验,可推断H0不成立,所以在犯错误的概率不超过0.050的前提下,可认为一天中到该公园锻炼的人次与该市当天的空气质量有关. 习题演练 1.某机构为调查网游爱好者是否有性别差异,通过调研数据统计:在500名男生中有200名爱玩网游,在400名女生中有50名爱玩网游.若要确定网游爱好是否与性别有关时,用下列最适合的统计方法是(  ) A.均值 B.方差 C.独立性检验 D.回归分析 C 解析 由题意可知,“爱玩网游”与“性别”是两类变量,其是否有关,应用独立性检验判断. D 解析 r的绝对值越大,m越小,线性相关性越强. B C 解析 根据题表中的数据,由题意得 A ABC 解析 由题意可得 7.(多选)为了解阅读量多少与幸福感强弱之间的关系,一个调查机构根据所得到的数据,绘制了如下所示的2×2列联表(个别数据暂用字母表示):   幸福感强 幸福感弱 合计 阅读量多 m 18 72 阅读量少 36 n 78 合计 90 60 150 计算得:χ2≈12.981,参照下表: α 0.10 0.05 0.025 0.010 0.005 0.001 xα 2.706 3.841 5.024 6.635 7.879 10.828 对于下面的选项,正确的是(  ) A.根据小概率值α=0.010的独立性检验,可以认为“阅读量多少与幸福感强弱无关” B.m=54 C.根据小概率值α=0.005的独立性检验,可以在犯错误的概率不超过0.5%的前提下认为“阅读量多少与幸福感强弱有关” D.n=52 BC 解析 ∵χ2≈12.981>7.879>6.635, ∴根据小概率值α=0.010的独立性检验,可以在犯错误的概率不超过1%的前提下认为“阅读量多少与幸福感强弱有关”, 根据小概率值α=0.005的独立性检验,可以在犯错误的概率不超过0.5%的前提下认为“阅读量多少与幸福感强弱有关”,∴A错,C正确, ∵m+36=90,18+n=60,∴m=54,n=42,∴B正确,D错. 10 10.一项研究同年龄段的男、女生的注意力差别的脑功能实验,其实验数据如表所示: 性别 注意力 稳定 不稳定 男 29 7 女 33 5 0.538 则χ2=________(精确到小数点后三位),依据概率值α=0.05的独立性检验,该实验______该年龄段的学生在注意力的稳定性上对于性别没有显著差异(填拒绝或支持). 支持 解析 由表中数据可知a=29,b=7,c=33,d=5,n=a+b+c+d=74, 所以没有充分证据认为学生在注意力的稳定性上与性别有关, 即该实验支持该年龄段的学生在注意力的稳定性上对于性别没有显著差异. (2)该企业改进生产工艺后,生产了批次乙的芯片.某手机厂商获得批次甲与批次乙的芯片,并在某款手机上使用.现对使用这款手机的100名用户回访,对开机速度进行调查.据统计,安装批次甲的有40名,其中对开机速度满意的有30名;安装批次乙的有60名,其中对开机速度满意的有55名.试整理出2×2列联表(单位:名),并依据小概率值α=0.05的独立性检验,分析芯片批次是否与用户对开机速度满意有关. 批次 是否满意 合计 满意 不满意 甲       乙       合计       α 0.1 0.05 0.01 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 解 零假设为H0:芯片批次与用户对开机速度满意无关,得2×2列联表如下: 批次 是否满意 合计 满意 不满意 甲 30 10 40 乙 55 5 60 合计 85 15 100 所以依据α=0.05的独立性检验,我们推断H0不成立, 所以认为芯片批次与用户对开机速度满意有关,此推断犯错误的概率不大于0.05. (1)估计该林区这种树木平均一棵的根部横截面积与平均一棵的材积量; (2)求该林区这种树木的根部横截面积与材积量的样本相关系数(精确到0.01); 解 设该林区这种树木的总材积量的估计值为Y m3, 又已知树木的材积量与其根部横截面积近似成正比, ACD 解析 对于A,由题图知,海拔高度越高,大气压强越小,所以大气压强与海拔高度负相关,故A正确; 对于B,经验回归直线得到的数据为估计值,而非精确值,故B错误; 14.(2024·厦门质检)移动物联网广泛应用于生产制造、公共服务、个人消费等领域.截至2023年底,我国移动物联网连接数达18.45亿户,成为全球主要经济体中首个实现“物超人”的国家.如图是2019~2023年移动物联网连接数W与年份代码t的散点图,其中年份2019~2023对应的t分别为1~5. (1)根据散点图推断两个变量是否线性相关.计算样本相关系数(精确到0.01),并推断它们的相关程度; 解 由散点图可以看出样本点都集中在一条直线附近, 由此推断两个变量线性相关. 2.样本相关系数 (1)相关系数r的计算 变量x和变量y的样本相关系数r的计算公式如: r=. (2)相关系数r的性质 ①当r>0时,称成对样本数据____相关;当r<0时,成对样本数据____相关; 当r=0时,成对样本数据间没有线性相关关系. ②样本相关系数r的取值范围为_________. 当|r|越接近1时,成对样本数据的线性相关程度越____; 当|r|越接近0时,成对样本数据的线性相关程度越____. 3.一元线性回归模型 (1)我们将=x+称为Y关于x的经验回归方程,其中 (2)决定系数 R2=1-,R2越_____,即拟合效果越好,R2越_____,模型拟合效果越差. 4.列联表与独立性检验 (1)关于分类变量X和Y的抽样数据的2×2列联表 X Y 合计 Y=0 Y=1 X=0 a b a+b X=1 c d c+d 合计 a+c b+d n=a+b+c+d 记n=a+b+c+d,则随机变量χ2=. 1.求解经验回归方程的关键是确定回归系数,,应充分利用回归直线过样本点的中心(,). 2.根据χ2的值可以判断两个分类变量有关的可信程度,若χ2越大,则两个分类变量有关的把握越大. 3.回归分析和独立性检验都是基于成对样本观测数据进行估计或推断,得出的结论都可能犯错误. 1.思考辨析(在括号内打“√”或“×”) (1)散点图无法判断两个变量是否相关.(  ) (2)通过经验回归方程=x+可以估计预报变量的取值和变化趋势.(  ) (3)只有两个变量有相关关系,所得到的回归模型才有预测价值.(  ) (4)事件X,Y关系越密切,则由观测数据计算得到的χ2的值越小.(  ) 4.(多选)在统计中,由一组样本数据(x1,y1),(x2,y2),…,(xn,yn)利用最小二乘法得到两个变量的经验回归方程为=x+,那么下列说法正确的是(   ) A.直线=x+必经过点(,) B.直线=x+表示最接近y与x之间真实关系的一条直线 C.相关系数为r,且|r|越接近于1,相关程度越大;|r|越接近于0,相关程度越小 D.用决定系数R2来刻画回归效果,R2越小说明拟合效果越好 解析 直线=x+必过样本点中心即点(,),故A正确; 直线=x+是采用最小二乘法求解出的直线方程,接近真实关系,故B正确; (2)在一组样本数据(x1,y1),(x2,y2),…,(xn,yn)(n≥2,x1,x2,…,xn不全相等)的散点图中,若所有样本点(xi,yi)(i=1,2,…,n)都在直线y=-x+1上,则这组样本数据的样本相关系数为(  ) A.-1 B.0 C.- D.1 解析 因为样本点在直线y=-x+1上,呈现完全负相关,样本相关系数为-1. 所以样本相关系数r===≈0.95>0.75. 所以可用经验回归模型拟合y与x的关系. 解 由已知数据可得==5,==400, 所以(xi-)(yi-)=(-3)×(-100)+(-1)×0+0×0+1×0+3×100=600, ==2, ==100, (2)求y关于x的经验回归方程,并预测当液体肥料每亩使用量为15千克时,西红柿亩产量的增加量约为多少千克? 附:相关系数r=, 经验回归方程=+x的斜率和截距的最小二乘估计公式分别为 =,=-,≈3.16. 解 ===30,=400-5×30=250, 所以经验回归方程为=30x+250. 当x=15时,=30×15+250=700(千克), 即当液体肥料每亩使用量为15千克时,西红柿亩产量的增加量约为700千克. 角度2 非线性回归分析 例3 (2024·广州质检)一企业生产某种产品,通过加大技术创新投入降低了每件产品成本.为了调查年技术创新投入x(单位:千万元)对每件产品成本y(单位:元)的影响,对近10年的年技术创新投入xi和每件产品成本yi(i=1,2,3,…,10)的数据进行分析,得到如下散点图,并计算得:=6.8,=70,=3,=1.6,=350. 所以y关于x的回归方程为y=10+. (1)根据散点图可知,可用函数模型y=+α拟合y与x的关系,试建立y关于x的回归方程; 解 令u=,则y关于u的线性回归方程为y=+u, 依题意,得===200,=-=70-200×0.3=10, 则y=10+200u, (2)已知该产品的年销售额m(单位:千万元)与每件产品成本y的关系为m=-+++100.该企业的年投入成本除了年技术创新投入,还要投入其他成本10千万元,根据(1)的结果回答:当年技术创新投入x为何值时,年利润的预报值最大? (注:年利润=年销售额-年投入成本) 参考公式:对于一组数据(u1,v1),(u2,v2),…,(un,vn),其回归直线v= α+βu的斜率和截距的最小二乘估计分别为=,=-. 此时,x===20, 所以当年技术创新投入20千万元时,年利润的预报值最大. 解 由y=10+,得x=, 年利润M=m-x-10=-+++100--10 =-(y-20)2+90.8 当y=20时,年利润M取得最大值, 所以===1.5, =-=0.5-1.5×0.3=0.05, 故=1.5x+0.05. (2)根据上表提供的数据,用最小二乘法求出y关于x的经验回归方程=x+; =×(0.1+0.2+0.3+0.4+0.5)=0.3, =×(0.2+0.35+0.5+0.65+0.8)=0.5, (3)已知现行利率下的日均存款总额为0.625亿元,试根据(2)中的经验回归方程,预测日均存款总额为现行利率下的2倍时,利率需上升多少个百分点? 参考公式及数据:①=,=-,②xiyi=0.9,x=0.55. 解 试验组的样本平均数为×(7.8+9.2+11.4+12.4+13.2+15.5+16.5+18.0+18.8+19.2+19.8+20.2+21.6+22.8+23.6+23.9+25.1+28.2+32.3+36.5)=19.8. 解 将40个数据按照从小到大的顺序依次排列,得最中间的两个数据即第20个和第21个数据分别为23.2和23.6,则40只小白鼠体重的增加量的中位数 m==23.4. 列联表如右: ②根据①中的列联表,依据小概率值α=0.050的独立性检验,能否认为小白鼠在高浓度臭氧环境中与在正常环境中体重的增加量有差异? 附:χ2=, α 0.100 0.050 0.010 xα 2.706 3.841 6.635 χ2===6.4>3.841=x0.050, 独立性检验的一般步骤 (1)根据样本数据制成2×2列联表. (2)根据公式χ2=计算. (3)比较χ2与临界值的大小关系,作统计推断. 解 一天中到该公园锻炼的平均人次的估计值为(100×20+300×35+500×45)=350. (3)若某天的空气质量等级为1或2,则称这天“空气质量好”;若某天的空气质量等级为3或4,则称这天“空气质量不好”.根据所给数据,完成下面的2×2列联表,并根据列联表,能否在犯错误的概率不超过0.050的前提下,认为一天中到该公园锻炼的人次与该市当天的空气质量有关? 人次≤400 人次>400 空气质量好 空气质量不好 附:χ2=, α 0.050 0.010 0.001 xα 3.841 6.635 10.828 根据列联表得χ2=≈5.820>3.841=x0.050. 2.甲、乙、丙、丁四位同学各自对A,B两个变量的线性相关性做试验,并用回归分析方法分别求得样本相关系数r与残差平方和m,如下表: 甲 乙 丙 丁 r 0.82 0.78 0.69 0.85 m 106 115 124 103 则哪位同学的试验结果体现A,B两个变量有更强的线性相关性?(  ) A.甲 B.乙 C.丙 D.丁 又经验回归方程=x+经过样本点中心(4,0.2),可得>0. 3.根据如表样本数据: x 2 3 4 5 6 y 4 2.5 -0.5 -2 -3 得到的经验回归方程为=x+,则(  ) A.>0,>0 B.>0,<0 C.<0,>0 D.<0,<0 解析 由表中的数据可得,变量y随着x的增大而减小,则<0, ==4,==0.2, ∴=2-0.8×4=-1.2,∴经验回归方程为=0.8x-1.2, 当x=8时,=0.8×8-1.2=5.2(亿元), 即预测该公司收入为8亿元时的支出为5.2亿元. 4.某公司在2019~2023年的收入与支出情况如下表所示: 收入x(亿元) 2.2 2.6 4.0 5.3 5.9 支出y(亿元) 0.2 1.5 2.0 2.5 3.8 根据表中数据可得经验回归方程为=0.8x+,依此估计该公司收入为8亿元时的支出为(  ) A.4.2亿元 B.4.4亿元 C.5.2亿元 D.5.4亿元 =×(2.2+2.6+4.0+5.3+5.9)=4,=×(0.2+1.5+2.0+2.5+3.8)=2, 5.(2024·河北“五个一”联盟联考)某医院为了提高服务水平和病人满意度,对一周前出院的病人进行电话回访,主要涉及住院期间护士的服务态度、医生是否收取红包、对医院有什么建议等问题.某天上午回访的5人中,通话时间(单位:秒)如表所示: 序号x 1 2 3 4 5 时间y 37 65 21 m 32 根据表中数据,得到y关于x的经验回归方程=x+40.9.据此求出(5,32)残差为-7.4,则m=(  ) (残差=实际值-观测值) A.45 B.25 C.37 D.7 解得m=45,故选A. 解析 由题知,当x=5时,=5+40.9=32+7.4=39.4,解得=-0.3, 所以y关于x的回归方程为=-0.3x+40.9. 当x==3时,==-0.3×3+40.9=40, 所以×(37+65+21+m+32)=40, 6.(多选)(2024·南京调研)为研究混凝土的抗震强度y与抗压强度x的关系,某研究部门得到下表的样本数据: x 140 150 170 180 195 y 23 24 26 28 28 若y与x线性相关,且经验回归方程为=0.1x+,则下列说法正确的是(   ) A.=9.1 B.当x增加1个单位时,y增加约0.1个单位 C.y与x正相关 D.若抗压强度为220时,抗震强度一定是33.1 对于B,由=0.1x+9.1,可知当x增加一个单位时,y增加约0.1个单位,B正确; 对于C,因为0.1>0,所以y与x正相关,C正确; 对于D,当x=220时,=0.1×220+9.1=31.1,抗震强度约为31.1,D错误. ==167,==25.8, 所以25.8=0.1×167+,解得=9.1, 所以经验回归方程为=0.1x+9.1,A正确; 即6+=-3.2+40,即3.2m+n=42. 又m+n=20,所以m=10,n=10. 8.某市物价部门对本市的5家商场的某商品一天的销售量及其价格进行调查, 5家商场的售价x(元/件)和销售量y(件)的数据如下表所示: 售价x 9 9.5 m 10.5 11 销售量y 11 n 8 6 5 由表中数据可知,销售量y与售价x之间有较强的线性相关关系,其经验回归方程是=-3.2x+40,且m+n=20,则其中的n=________. 解析 ==8+,==6+, 回归直线一定经过样本点中心(,), 9.已知x和y的散点图如图所示,在相关关系中,若用=c1ec2x拟合时的决定系数为R,用=x+拟合时的决定系数为R,则R,R中较大的是________. R 解析 由散点图知,用=c1ec2x拟合的效果比=x+拟合的效果要好, 所以R>R,故较大者为R. 根据χ2=,计算可知 χ2=≈0.538<3.841=x0.05, 11.(2024·济南调研)某芯片制造企业使用新技术对某款芯片进行生产.生产该款芯片有三道工序,这三道工序互不影响.已知批次甲的三道工序次品率分别为,,. (1)求批次甲芯片的次品率; 解 批次甲芯片的次品率为1-=1-××=. 附:χ2=. 所以χ2==≈5.229>3.841, 12.(2022·全国乙卷)某地经过多年的环境治理,已将荒山改造成了绿水青山.为估计一林区某种树木的总材积量,随机选取了10棵这种树木,测量每棵树的根部横截面积(单位:m2)和材积量(单位:m3),得到如下数据: 样本号i 1 2 3 4 5 6 7 8 9 10 总和 根部横截面积xi 0.04 0.06 0.04 0.08 0.08 0.05 0.05 0.07 0.07 0.06 0.6 材积量yi 0.25 0.40 0.22 0.54 0.51 0.34 0.36 0.46 0.42 0.40 3.9 并计算得x=0.038,y=1.615 8,xiyi=0.247 4. 解 样本中10棵这种树木的根部横截面积的平均值==0.06(m2), 样本中10棵这种树木的材积量的平均值==0.39(m3), 据此可估计该林区这种树木平均一棵的根部横截面积为0.06 m2,平均一棵的材积量为0.39 m3. 解 r== = =≈≈0.97. (3)现测量了该林区所有这种树木的根部横截面积,并得到所有这种树木的根部横截面积总和为186 m2.已知树木的材积量与其根部横截面积近似成正比.利用以上数据给出该林区这种树木的总材积量的估计值. 附:相关系数r=,≈1.377. 可得=,解得Y=1 209. 则该林区这种树木的总材积量估计为1 209 m3. A.由散点图可知,大气压强与海拔高度负相关 B.由方程1=-4.0x+68.5可知,海拔每升高1千米,大气压强必定降低4.0 kPa C.由方程1=-4.0x+68.5可知,样本点(11,22.6)的残差为-1.9 D.对比两个回归模型,结合实际情况,方程2=132.9e-0.163x的预报效果更好 13.(多选)(2024·长沙适应性考试)自然环境中,大气压受到各种因素的影响,如温度、湿度、风速和海拔等方面的改变,都将导致大气压发生相应的变化,其中以海拔的影响最为显著.如图是根据一组观测数据得到海拔6千米~15千米的大气压强散点图,根据一元线性回归模型得到经验回归方程为1=-4.0x+68.5,决定系数为R=0.99;根据非线性回归模型得到经验回归方程为2=132.9e-0.163x,决定系数为R=0.99,则下列说法正确的是(   ) 对于C,当x=11时,1=-4.0×11+68.5=24.5, 又由散点图知观测值为22.6,所以样本点(11,22.6)的残差为22.6-24.5=-1.9,故C正确; 对于D,随着海拔高度的增加,大气压强越来越小,但不可能为负数,因此方程2=132.9e-0.163x的预报效果更好,故D正确. 所以这两个变量正线性相关,且相关程度很强. 因为=×(1+2+3+4+5)=3, 所以(ti-)2=(1-3)2+(2-3)2+(3-3)2+(4-3)2+(5-3)2=10, 所以r===≈≈0.98. (2)①假设变量x与变量Y的n对观测数据为(x1,y1),(x2,y2),…,(xn,yn),两个变量满足一元线性回归模型(随机误差ei=yi-bxi).请推导:当随机误差平方和Q=e取得最小值时,参数b的最小二乘估计; 解 Q=e=(yi-bxi)2=(y-2bxiyi+b2x)=b2x-2bxiyi+y, 要使Q取得最小值,当且仅当=. ②令变量x=t-,y=w-,则变量x与变量Y满足一元线性回归模型利用①中结论求y关于x的经验回归方程,并预测2025年移动物联网连接数. 附:样本相关系数r=, (wi-)2=76.9,(ti-)(wi-)=27.2,wi=60.8,≈27.7. w=+=2.72×4+12.16=23.04, 所以预测2025年移动物联网连接数为23.04亿户. 解 由①知====2.72, 所以y关于x的经验回归方程为=2.72x, 又===12.16, 所以当t=7时,x=7-3=4, $$ 2025届高考数学一轮复习教案讲义(原卷版)——统计与成对数据的统计分析之成对数据的统计分析 【知识梳理】 1.变量的相关关系 (1)相关关系的分类:正相关和负相关. (2)线性相关:一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在 附近,我们就称这两个变量线性相关. 一般地,如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量非线性相关或曲线相关. 2.样本相关系数 (1)相关系数r的计算 变量x和变量y的样本相关系数r的计算公式如: r=. (2)相关系数r的性质 ①当r>0时,称成对样本数据 相关;当r<0时,成对样本数据 相关;当r=0时,成对样本数据间没有线性相关关系. ②样本相关系数r的取值范围为 . 当|r|越接近1时,成对样本数据的线性相关程度越 ; 当|r|越接近0时,成对样本数据的线性相关程度越 . 3.一元线性回归模型 (1)我们将=x+称为Y关于x的经验回归方程,其中 (2)决定系数 R2=1-,R2越 ,即拟合效果越好,R2越 ,模型拟合效果越差. 4.列联表与独立性检验 (1)关于分类变量X和Y的抽样数据的2×2列联表 X Y 合计 Y=0 Y=1 X=0 a b a+b X=1 c d c+d 合计 a+c b+d n=a+b+c+d 记n=a+b+c+d,则随机变量 χ2=. (2)独立性检验 基于小概率值α的检验规则是: 当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α; 当χ2<xα时,我们没有充分证据推断H0不成立 ,可以认为X和Y独立. 下表给出了χ2独立性检验中几个常用的小概率值和相应的临界值 α 0.1 0.05 0.01 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 [常用结论] 1.求解经验回归方程的关键是确定回归系数,,应充分利用回归直线过样本点的中心(,). 2.根据χ2的值可以判断两个分类变量有关的可信程度,若χ2越大,则两个分类变量有关的把握越大. 3.回归分析和独立性检验都是基于成对样本观测数据进行估计或推断,得出的结论都可能犯错误. 【诊断自测】 1.思考辨析(在括号内打“√”或“×”) (1)散点图无法判断两个变量是否相关.(  ) (2)通过经验回归方程=x+可以估计预报变量的取值和变化趋势.(  ) (3)只有两个变量有相关关系,所得到的回归模型才有预测价值.(  ) (4)事件X,Y关系越密切,则由观测数据计算得到的χ2的值越小.(  ) 2.(选修三P139T3)根据分类变量x与y的观测数据,计算得到χ2=2.974.依据α=0.05的独立性检验,结论为(  ) A.变量x与y不独立 B.变量x与y不独立,这个结论犯错误的概率不超过0.05 C.变量x与y独立 D.变量x与y独立,这个结论犯错误的概率不超过0.05 3.(选修三P103T1改编)两个变量的相关关系有:①正相关;②负相关;③不相关,则下列散点图从左到右分别反映的变量间的相关关系是(  ) A.①②③ B.②③① C.②①③ D.①③② 4.(多选)在统计中,由一组样本数据(x1,y1),(x2,y2),…,(xn,yn)利用最小二乘法得到两个变量的经验回归方程为=x+,那么下列说法正确的是(  ) A.直线=x+必经过点(,) B.直线=x+表示最接近y与x之间真实关系的一条直线 C.相关系数为r,且|r|越接近于1,相关程度越大;|r|越接近于0,相关程度越小 D.用决定系数R2来刻画回归效果,R2越小说明拟合效果越好 考点一 成对数据的相关性 例1 (1)(2023·天津卷)调查某种群花萼长度和花瓣长度,所得数据如图所示,其中相关系数r=0.824 5,下列说法正确的是(  ) A.花瓣长度和花萼长度没有相关性 B.花瓣长度和花萼长度呈负相关 C.花瓣长度和花萼长度呈正相关 D.若从样本中抽取一部分,则这部分的相关系数一定是0.824 5 (2)(2024·杭州质检)某兴趣小组研究光照时长x(h)和向日葵种子发芽数量y(颗)之间的关系,采集5组数据,作如图所示的散点图.若去掉D(10,2),则下列说法正确的是(  ) A.相关系数r变小 B.决定系数R2变小 C.残差平方和变大 D.解释变量x与预报变量y的相关性变强 方法总结 判定两个变量相关性的方法 (1)画散点图:点的分布从左下角到右上角,两个变量正相关;点的分布从左上角到右下角,两个变量负相关. (2)样本相关系数:当r>0时,正相关;当r<0时,负相关;|r|越接近于1,相关性越强. (3)决定系数法:利用决定系数判定,R2越接近1,模型的拟合效果越好,相关性越强. 训练1 (1)(2023·上海卷)已知某校50名学生的身高与体重的散点图如图所示,则下列说法正确的是(  ) A.身高越高,体重越重 B.身高越高,体重越轻 C.身高与体重成正相关 D.身高与体重成负相关 (2)在一组样本数据(x1,y1),(x2,y2),…,(xn,yn)(n≥2,x1,x2,…,xn不全相等)的散点图中,若所有样本点(xi,yi)(i=1,2,…,n)都在直线y=-x+1上,则这组样本数据的样本相关系数为(  ) A.-1 B.0 C.- D.1 考点二 回归分析 角度1 线性回归分析 例2 为实施乡村振兴,科技兴农,某村建起了田园综合体,并从省城请来专家进行技术指导,根据统计,该田园综合体西红柿亩产量的增加量y(千克)与某种液体肥料每亩使用量x(千克)之间的对应数据如下: x(千克) 2 4 5 6 8 y(千克) 300 400 400 400 500 (1)由上表数据可知,可用经验回归模型拟合y与x的关系,请计算样本相关系数r并加以说明(若|r|>0.75,则线性相关程度很高,可用经验回归模型拟合); (2)求y关于x的经验回归方程,并预测当液体肥料每亩使用量为15千克时,西红柿亩产量的增加量约为多少千克? 附:相关系数r=, 经验回归方程=+x的斜率和截距的最小二乘估计公式分别为 =,=-,≈3.16. 角度2 非线性回归分析 例3 (2024·广州质检)一企业生产某种产品,通过加大技术创新投入降低了每件产品成本.为了调查年技术创新投入x(单位:千万元)对每件产品成本y(单位:元)的影响,对近10年的年技术创新投入xi和每件产品成本yi(i=1,2,3,…,10)的数据进行分析,得到如下散点图,并计算得:=6.8,=70, =3, =1.6, =350. (1)根据散点图可知,可用函数模型y=+α拟合y与x的关系,试建立y关于x的回归方程; (2)已知该产品的年销售额m(单位:千万元)与每件产品成本y的关系为m=-+++100.该企业的年投入成本除了年技术创新投入,还要投入其他成本10千万元,根据(1)的结果回答:当年技术创新投入x为何值时,年利润的预报值最大? (注:年利润=年销售额-年投入成本) 参考公式:对于一组数据(u1,v1),(u2,v2),…,(un,vn),其回归直线v=α+βu的斜率和截距的最小二乘估计分别为 =,=-. 方法总结 回归分析问题的类型及解题方法 (1)求经验回归方程 ①当两个系数均未知时,可利用公式法求解; ②当两个系数已知一个求另一个时,可利用经验回归直线过样本点的中心求解. (2)利用经验回归方程进行预测,把经验回归方程看作一次函数,求函数值. (3)经验回归方程的拟合效果可以利用相关系数判断,当|r|越趋近于1时,两变量的线性相关性越强. 训练2 (2024·西安调研)某商业银行对存款利率与日存款总量的关系进行调研,发现存款利率每上升一定的百分点,日均存款总额就会发生一定的变化,经过统计得到下表: 利率上升百分点x 0.1 0.2 0.3 0.4 0.5 日均存款总额y(亿元) 0.2 0.35 0.5 0.65 0.8 (1)在给出的坐标系中画出上表数据的散点图; (2)根据上表提供的数据,用最小二乘法求出y关于x的经验回归方程=x+; (3)已知现行利率下的日均存款总额为0.625亿元,试根据(2)中的经验回归方程,预测日均存款总额为现行利率下的2倍时,利率需上升多少个百分点? 参考公式及数据:①=,=-,②xiyi=0.9,x=0.55. 考点三 独立性检验 例4 (2023·全国甲卷改编)一项试验旨在研究臭氧效应,试验方案如下:选40只小白鼠,随机地将其中20只分配到试验组,另外20只分配到对照组,试验组的小白鼠饲养在高浓度臭氧环境,对照组的小白鼠饲养在正常环境,一段时间后统计每只小白鼠体重的增加量(单位:g). 试验结果如下: 对照组的小白鼠体重的增加量从小到大排序为 15.2 18.8 20.2 21.3 22.5 23.2 25.8 26.5 27.5 30.1 32.6 34.3 34.8 35.6 35.6 35.8 36.2 37.3 40.5 43.2 试验组的小白鼠体重的增加量从小到大排序为 7.8 9.2 11.4 12.4 13.2 15.5 16.5 18.0 18.8 19.2 19.8 20.2 21.6 22.8 23.6 23.9 25.1 28.2 32.3 36.5 (1)计算试验组的样本平均数; (2)①求40只小白鼠体重的增加量的中位数m,再分别统计两样本中小于m与不小于m的数据的个数,完成如下列联表: <m ≥m 对照组 试验组 ②根据①中的列联表,依据小概率值α=0.050的独立性检验,能否认为小白鼠在高浓度臭氧环境中与在正常环境中体重的增加量有差异? 附:χ2=, α 0.100 0.050 0.010 xα 2.706 3.841 6.635 方法总结 独立性检验的一般步骤 (1)根据样本数据制成2×2列联表. (2)根据公式χ2=计算. (3)比较χ2与临界值的大小关系,作统计推断. 训练3 某学生兴趣小组随机调查了某市100天中每天的空气质量等级和当天到某公园锻炼的人次,整理数据得到下表(单位:天): 锻炼人次 空气质量等级     [0,200] (200,400] (400,600] 1(优) 2 16 25 2(良) 5 10 12 3(轻度污染) 6 7 8 4(中度污染) 7 2 0 (1)分别估计该市一天的空气质量等级为1,2,3,4的概率; (2)求一天中到该公园锻炼的平均人次的估计值(同一组中的数据用该组区间的中点值为代表); (3)若某天的空气质量等级为1或2,则称这天“空气质量好”;若某天的空气质量等级为3或4,则称这天“空气质量不好”.根据所给数据,完成下面的2×2列联表,并根据列联表,能否在犯错误的概率不超过0.050的前提下,认为一天中到该公园锻炼的人次与该市当天的空气质量有关? 人次≤400 人次>400 空气质量好 空气质量不好 附:χ2=, α 0.050 0.010 0.001 xα 3.841 6.635 10.828 习题演练 1.某机构为调查网游爱好者是否有性别差异,通过调研数据统计:在500名男生中有200名爱玩网游,在400名女生中有50名爱玩网游.若要确定网游爱好是否与性别有关时,用下列最适合的统计方法是(  ) A.均值 B.方差 C.独立性检验 D.回归分析 2.甲、乙、丙、丁四位同学各自对A,B两个变量的线性相关性做试验,并用回归分析方法分别求得样本相关系数r与残差平方和m,如下表: 甲 乙 丙 丁 r 0.82 0.78 0.69 0.85 m 106 115 124 103 则哪位同学的试验结果体现A,B两个变量有更强的线性相关性?(  ) A.甲 B.乙 C.丙 D.丁 3.根据如表样本数据: x 2 3 4 5 6 y 4 2.5 -0.5 -2 -3 得到的经验回归方程为=x+,则(  ) A.>0,>0 B.>0,<0 C.<0,>0 D.<0,<0 4.某公司在2019~2023年的收入与支出情况如下表所示: 收入x(亿元) 2.2 2.6 4.0 5.3 5.9 支出y(亿元) 0.2 1.5 2.0 2.5 3.8 根据表中数据可得经验回归方程为=0.8x+,依此估计该公司收入为8亿元时的支出为(  ) A.4.2亿元 B.4.4亿元 C.5.2亿元 D.5.4亿元 5.(2024·河北“五个一”联盟联考)某医院为了提高服务水平和病人满意度,对一周前出院的病人进行电话回访,主要涉及住院期间护士的服务态度、医生是否收取红包、对医院有什么建议等问题.某天上午回访的5人中,通话时间(单位:秒)如表所示: 序号x 1 2 3 4 5 时间y 37 65 21 m 32 根据表中数据,得到y关于x的经验回归方程=x+40.9.据此求出(5,32)残差为-7.4,则m=(  ) (残差=实际值-观测值) A.45 B.25 C.37 D.7 6.(多选)(2024·南京调研)为研究混凝土的抗震强度y与抗压强度x的关系,某研究部门得到下表的样本数据: x 140 150 170 180 195 y 23 24 26 28 28 若y与x线性相关,且经验回归方程为=0.1x+,则下列说法正确的是(  ) A.=9.1 B.当x增加1个单位时,y增加约0.1个单位 C.y与x正相关 D.若抗压强度为220时,抗震强度一定是33.1 7.(多选)为了解阅读量多少与幸福感强弱之间的关系,一个调查机构根据所得到的数据,绘制了如下所示的2×2列联表(个别数据暂用字母表示): 幸福感强 幸福感弱 合计 阅读量多 m 18 72 阅读量少 36 n 78 合计 90 60 150 计算得:χ2≈12.981,参照下表: α 0.10 0.05 0.025 0.010 0.005 0.001 xα 2.706 3.841 5.024 6.635 7.879 10.828 对于下面的选项,正确的是(  ) A.根据小概率值α=0.010的独立性检验,可以认为“阅读量多少与幸福感强弱无关” B.m=54 C.根据小概率值α=0.005的独立性检验,可以在犯错误的概率不超过0.5%的前提下认为“阅读量多少与幸福感强弱有关” D.n=52 8.某市物价部门对本市的5家商场的某商品一天的销售量及其价格进行调查,5家商场的售价x(元/件)和销售量y(件)的数据如下表所示: 售价x 9 9.5 m 10.5 11 销售量y 11 n 8 6 5 由表中数据可知,销售量y与售价x之间有较强的线性相关关系,其经验回归方程是=-3.2x+40,且m+n=20,则其中的n=________. 9.已知x和y的散点图如图所示,在相关关系中,若用=c1ec2x拟合时的决定系数为R,用=x+拟合时的决定系数为R,则R,R中较大的是________. 10.一项研究同年龄段的男、女生的注意力差别的脑功能实验,其实验数据如表所示: 性别 注意力 稳定 不稳定 男 29 7 女 33 5 则χ2=________(精确到小数点后三位),依据概率值α=0.05的独立性检验,该实验______该年龄段的学生在注意力的稳定性上对于性别没有显著差异(填拒绝或支持). 11.(2024·济南调研)某芯片制造企业使用新技术对某款芯片进行生产.生产该款芯片有三道工序,这三道工序互不影响.已知批次甲的三道工序次品率分别为,,. (1)求批次甲芯片的次品率; (2)该企业改进生产工艺后,生产了批次乙的芯片.某手机厂商获得批次甲与批次乙的芯片,并在某款手机上使用.现对使用这款手机的100名用户回访,对开机速度进行调查.据统计,安装批次甲的有40名,其中对开机速度满意的有30名;安装批次乙的有60名,其中对开机速度满意的有55名.试整理出2×2列联表(单位:名),并依据小概率值α=0.05的独立性检验,分析芯片批次是否与用户对开机速度满意有关. 批次 是否满意 合计 满意 不满意 甲 乙 合计 附:χ2=. α 0.1 0.05 0.01 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 12.(2022·全国乙卷)某地经过多年的环境治理,已将荒山改造成了绿水青山.为估计一林区某种树木的总材积量,随机选取了10棵这种树木,测量每棵树的根部横截面积(单位:m2)和材积量(单位:m3),得到如下数据: 样本号i 1 2 3 4 5 6 7 8 9 10 总和 根部横截面积xi 0.04 0.06 0.04 0.08 0.08 0.05 0.05 0.07 0.07 0.06 0.6 材积量yi 0.25 0.40 0.22 0.54 0.51 0.34 0.36 0.46 0.42 0.40 3.9 并计算得x=0.038,y=1.615 8,xiyi=0.247 4. (1)估计该林区这种树木平均一棵的根部横截面积与平均一棵的材积量; (2)求该林区这种树木的根部横截面积与材积量的样本相关系数(精确到0.01); (3)现测量了该林区所有这种树木的根部横截面积,并得到所有这种树木的根部横截面积总和为186 m2.已知树木的材积量与其根部横截面积近似成正比.利用以上数据给出该林区这种树木的总材积量的估计值. 附:相关系数r=, ≈1.377. 13.(多选)(2024·长沙适应性考试)自然环境中,大气压受到各种因素的影响,如温度、湿度、风速和海拔等方面的改变,都将导致大气压发生相应的变化,其中以海拔的影响最为显著.如图是根据一组观测数据得到海拔6千米~15千米的大气压强散点图,根据一元线性回归模型得到经验回归方程为1=-4.0x+68.5,决定系数为R=0.99;根据非线性回归模型得到经验回归方程为2=132.9e-0.163x,决定系数为R=0.99,则下列说法正确的是(  ) A.由散点图可知,大气压强与海拔高度负相关 B.由方程1=-4.0x+68.5可知,海拔每升高1千米,大气压强必定降低4.0 kPa C.由方程1=-4.0x+68.5可知,样本点(11,22.6)的残差为-1.9 D.对比两个回归模型,结合实际情况,方程2=132.9e-0.163x的预报效果更好 14.(2024·厦门质检)移动物联网广泛应用于生产制造、公共服务、个人消费等领域.截至2023年底,我国移动物联网连接数达18.45亿户,成为全球主要经济体中首个实现“物超人”的国家.如图是2019~2023年移动物联网连接数W与年份代码t的散点图,其中年份2019~2023对应的t分别为1~5. (1)根据散点图推断两个变量是否线性相关.计算样本相关系数(精确到0.01),并推断它们的相关程度; (2)①假设变量x与变量Y的n对观测数据为(x1,y1),(x2,y2),…,(xn,yn),两个变量满足一元线性回归模型(随机误差ei=yi-bxi).请推导:当随机误差平方和Q=e取得最小值时,参数b的最小二乘估计; ②令变量x=t-,y=w-,则变量x与变量Y满足一元线性回归模型利用①中结论求y关于x的经验回归方程,并预测2025年移动物联网连接数. 附:样本相关系数 r=, (wi-)2=76.9, (ti-)(wi-)=27.2, wi=60.8,≈27.7. 第 54 页 学科网(北京)股份有限公司 $$

资源预览图

统计与成对数据的统计分析之成对数据的统计分析(讲义+课件)-2025届高三数学一轮复习
1
统计与成对数据的统计分析之成对数据的统计分析(讲义+课件)-2025届高三数学一轮复习
2
统计与成对数据的统计分析之成对数据的统计分析(讲义+课件)-2025届高三数学一轮复习
3
所属专辑
相关资源
示范课
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。