第九章 §9.3 成对数据的统计分析(新高考通用)-【2026年高考数学一轮备考·学霸专练】

2025-06-06
| 2份
| 34页
| 254人阅读
| 10人下载
至善教育
进店逛逛

内容正文:

第九章 统计与成对数据的统计分析 §9.3 成对数据的统计分析 【考情分析·探规律】 考点 考情分析(2021-2024) 命题趋势 变量间的相关关系 2024·天津卷 2023·天津卷 2022·全国乙卷 了解样本相关系数的统计含义;了解一元线性回归模型和2×2列联表,会运用这些方法解决简单的实际问题;会利用统计软件进行数据分析。 【知识梳理】 1.变量的相关关系 (1)相关关系:两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系. (2)相关关系的分类:正相关和负相关. (3)线性相关:一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们就称这两个变量线性相关. 2.样本相关系数 (1)r=. (2)当r>0时,称成对样本数据正相关;当r<0时,称成对样本数据负相关. (3)|r|≤1;当|r|越接近1时,成对样本数据的线性相关程度越强;当|r|越接近0时,成对样本数据的线性相关程度越弱. 3.一元线性回归模型 (1)我们将x+称为Y关于x的经验回归方程, 其中 (2)残差:观测值减去预测值所得的差称为残差. 4.列联表与独立性检验 (1)关于分类变量X和Y的抽样数据的2×2列联表: X Y 合计 Y=0 Y=1 X=0 a b a+b X=1 c d c+d 合计 a+c b+d n=a+b+c+d (2)计算统计量χ2=,利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验. 【名师点拨】 1.求解经验回归方程的关键是确定回归系数,,应充分利用回归直线过样本点的中心(,). 2.根据χ2的值可以判断两个分类变量有关的可信程度,若χ2越大,则两个分类变量有关的把握越大. 3.回归分析和独立性检验都是基于成对样本观测数据进行估计或推断,得出的结论都可能犯错误. 【随堂训练】 1.思考辨析(在括号内打“√”或“×”) (1)散点图无法判断两个变量是否相关.(  ) (2)通过经验回归方程=x+可以估计预报变量的取值和变化趋势.(  ) (3)只有两个变量有相关关系,所得到的回归模型才有预测价值.(  ) (4)事件X,Y关系越密切,则由观测数据计算得到的χ2的值越小.(  ) 2.(多选)下列说法正确的是(  ) A.两个具有线性相关关系的变量的相关性越强,则样本相关系数r的值越接近于1 B.当r=1时,两变量呈函数关系 C.当经验回归方程为=0.3-0.7x时,变量x和y负相关 D.在经验回归方程=0.4+0.5x中,当x每增加1个单位时,相应观测值y增加0.5个单位 3.想要检验喜欢参加体育活动是不是与性别有关,应该提出统计假设H0为(  ) A.男性喜欢参加体育活动 B.女性不喜欢参加体育活动 C.喜欢参加体育活动与性别有关 D.喜欢参加体育活动与性别无关 4.已知变量x和y的统计数据如表: x 6 7 8 9 10 y 3.5 4 5 6 6.5 若由表中数据得到经验回归方程为=0.8x+,则当x=10时的残差为    (注:观测值减去预测值所得的差称为残差).  【解题技巧】 1.经验回归直线过点(,). 2.求时,常用公式. 3.回归分析和独立性检验都是基于成对样本观测数据进行估计或推断,得出的结论都可能犯错误. 【必练核心题型】 题型一 成对数据的相关性 【典例】1.(多选)(2025·绵阳模拟)下列说法正确的是(  ) A.回归分析中,样本相关系数r的取值范围为(-1,1) B.回归分析中,残差图中残差比较均匀地分布在以取值为0的横轴为对称轴的水平带状区域内,且宽度越窄表示拟合效果越好 C.回归分析中,决定系数R2越大,说明残差平方和越小,拟合效果越好 D.两个随机变量的线性相关性越强,样本相关系数的绝对值越接近于0 【典例】2.已知变量x与变量y线性相关,x与y的样本相关系数为-0.8,且由观测数据算得样本平均数=5,=6,则由该观测数据算得的经验回归方程可能是(  ) A.=0.8x+2 B.=x+1 C.=-0.8x+9 D.=-x+11 【变式训练】 变式1.(多选)下列有关回归分析的结论中,正确的有(  ) A.若经验回归方程为=5+2x,则变量y与x正相关 B.运用最小二乘法求得的经验回归直线一定经过点(,) C.决定系数R2的值越接近于1,表示回归模型的拟合效果越好 D.若散点图中所有点都在直线y=0.93x-3.6上,则样本相关系数r=0.93 题型二 回归模型 命题点1 一元线性回归模型 【典例】1.氮氧化物是一种常见的大气污染物,如图为我国2014年至2022年氮氧化物排放量(单位:万吨)的折线图,其中年份代码1~9分别对应年份2014~2022. 已知yi≈12 000,≈1 100,≈7.7,tiyi≈51 800. (1)可否用一元线性回归模型拟合y与t的关系?请分别根据折线图和样本相关系数加以说明; (2)若根据所给数据建立经验回归方程=-138t+2 025,可否用此方程来预测2025年和2035年我国的氮氧化物排放量?请说明理由. 附:样本相关系数r=. 命题点2 非线性回归模型 【典例】2.某大型现代化农场在种植某种大棚有机无公害的蔬菜时,为创造更大价值,提高亩产量,积极开展技术创新活动.该农场采用了延长光照时间的方案,该农场选取了20间大棚(每间一亩)进行试点,得到各间大棚产量数据并绘制成散点图.光照时长为x(单位:小时),大棚蔬菜产量为y(单位:吨/亩),记w=ln x. 参考数据: xi yi wi xiyi wiyi 290 102.4 52 4 870 540.28 137 1 578.2 272.1 参考公式:y关于x的经验回归方程x+中,,. (1)根据散点图判断,y=a+bx与y=c+dln x哪一个适宜作为大棚蔬菜产量y关于光照时长x的经验回归方程类型(给出判断即可,不必说明理由); (2)根据(1)的判断结果及表中数据,建立y关于x的经验回归方程(结果保留小数点后两位); (3)根据实际种植情况,发现上述回归方程在光照时长位于6~14小时内拟合程度良好,利用(2)中所求方程估计当光照时长为e2小时时(e为自然对数的底数),大棚蔬菜的亩产量. 【变式训练】红蜘蛛是柚子的主要害虫之一,能对柚子树造成严重伤害,每只红蜘蛛的平均产卵数y(个)和平均温度x(摄氏度)有关,现收集了以往某地的7组数据,得到下面的散点图及一些统计量的值. 参考数据(z=ln y): xiyi xizi 5 215 17 713 714 27 81.3 3.6 (1)根据散点图判断,y=bx+a与y=cedx(其中e=2.718…为自然对数的底数)哪一个更适合作为平均产卵数y(个)关于平均温度x(摄氏度)的经验回归方程类型?(给出判断即可,不必说明理由) (2)由(1)的判断结果及表中数据,求出y关于x的经验回归方程. 附:x+中,,. 题型三 列联表与独立性检验 【典例】1.(2025·八省联考)为考察某种药物A对预防疾病B的效果,进行了动物(单位:只)试验,得到如下列联表: 药物 疾病 合计 未患病 患病 未服用 100 80 s 服用 150 70 220 合计 250 t 400 (1)求s,t; (2)记未服用药物A的动物患疾病B的概率为p,给出p的估计值; (3)根据小概率值α=0.01的独立性检验,能否认为药物A对预防疾病B有效? 附:χ2=. α 0.05 0.01 0.001 xα 3.841 6.635 10.828 【变式训练】(2025·绵阳诊断)近年来,随着深入贯彻新时代强军思想,越来越多的优秀青年学子献身国防,投身军营,高考结束后,很多高考毕业生报考了军事类院校.从某地区学校的高三年级中随机抽取了900名学生,其中男生500人,女生400人,通过调查,有报考军事类院校意向的男生、女生各100名. (1)完成给出的列联表,并分别估计该地区高三男、女学生有报考军事类院校意向的概率; 有报考意向 无报考意向 合计 男学生 女学生 合计 (2)根据小概率值α=0.10的独立性检验,能否认为学生有报考军事类院校的意向与性别有关? 参考公式及数据:χ2=,n=a+b+c+d. α 0.10 0.05 0.010 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 【限时训练】(限时:60分钟) 一、单项选择题(每小题5分,共30分) 1.下列两个变量中,成正相关的两个变量是(  ) A.汽车自身的重量与行驶每公里的耗油量 B.正方形的面积与边长 C.花费在体育活动上的时间与期末考试数学成绩 D.期末考试随机编排的准考证号与期末考试成绩总分 2.为了研究性别与对乡村音乐态度(喜欢和不喜欢两种态度)的关系,运用2×2列联表进行独立性检验,经计算χ2=8.01,则“性别与喜欢乡村音乐有关系”这个推断犯错误的概率不超过(参考数据:x0.005=7.879,x0.001=10.828)(  ) A.0.1% B.0.5% C.99.5% D.99.9% 3.下表为2018年—2023年的中国数字经济规模(单位:万亿元): 年份 2018 2019 2020 2021 2022 2023 年份代码x 1 2 3 4 5 6 中国数字经济规模y 31.3 35.8 39.2 45.5 50.2 53.9 则下列所给函数模型中比较适合这一组数据关系的是(  ) A.y=2x+30 B.y=30+log2(x+1) C.y=28× D.y=2x+30 4.学校开设了游泳选修课.某教练为了解学生对游泳运动的喜好和性别是否有关,在全校学生中随机选取了男、女生各n人进行调查,并绘制了如图所示的等高堆积条形图.则(  ) 参考公式及数据:χ2=,其中n=a+b+c+d. α 0.1 0.01 0.001 xα 2.706 6.635 10.828 A.参与调查的女生中喜欢游泳运动的人数比不喜欢游泳运动的人数多 B.全校学生中喜欢游泳运动的男生人数比喜欢游泳运动的女生人数多 C.若n=50,依据α=0.01的独立性检验,可以认为游泳运动的喜好和性别有关 D.若n=100,依据α=0.01的独立性检验,可以认为游泳运动的喜好和性别有关 5.为了研究y关于x的线性相关关系,收集了5组样本数据(见下表): x 1 2 3 4 5 y 0.5 0.9 1 1.1 1.5 若已求得经验回归方程为x+0.34,则下列选项中正确的是(  ) 附:样本相关系数r=. A.=0.21 B.当x=8时,y的预测值为2.2 C.样本数据y的第40百分位数为1 D.去掉样本点(3,1)后,x与y的样本相关系数r不会改变 6.某学校数学兴趣小组在探究姜撞奶随着时间变化的降温及凝固情况的数学建模活动中,将时间x(分钟)与温度y(摄氏度)的关系用模型y=c1(其中e为自然对数的底数)拟合.设z=ln y,变换后得到一组数据: x 2 2.5 3 3.5 4 z 4.04 4.01 3.98 3.96 3.91 由上表可得经验回归方程=-0.062x+,则c1等于(  ) A.-4 B.e-4 C.4.166 D.e4.166 二、多项选择题(每小题6分,共12分) 7.(2025·长春模拟)暑假结束后,为了解假期中学生锻炼身体情况,学生处对所有在校学生做问卷调查,并随机抽取了180人的调查问卷,其中男生比女生少20人,并将调查结果绘制得到等高堆积条形图.在被调查者中,下列说法正确的是(  ) 参考公式及数据:χ2=,其中n=a+b+c+d. α 0.1 0.05 0.01 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 A.男生中不经常锻炼的人数比女生中经常锻炼的人数多 B.男生中经常锻炼的人数比女生中经常锻炼的人多8人 C.经常锻炼者中男生的频率是不经常锻炼者中男生的频率的2倍 D.根据小概率值α=0.01的独立性检验,可以认为假期是否经常锻炼与性别有关 8.某科技公司统计了一款APP最近5个月的下载量,如表所示,若y与x线性相关,且经验回归方程为=-0.6x+,则(  ) 月份编号x 1 2 3 4 5 下载量y(万次) 5 4.5 4 3.5 2.5 A.y与x负相关 B.=5.6 C.预测第6个月的下载量约为2.1万次 D.残差绝对值的最大值为0.2 三、填空题(每小题5分,共10分) 9.(2025·汉中模拟)奶茶店老板对本店在12月份出售热饮的杯数y与当天的平均气温x(℃)进行线性回归分析,随机收集了该月某4天的相关数据(如表),并由最小二乘法求得经验回归方程为=45-2x.表中有一个数据看不清楚,请你推断出该数据的值为      .  气温x(℃) 10 6 2 -2 售出热饮的杯数y 24 ■ 42 48 10.在某病毒疫苗的研发过程中,需要利用基因编辑小鼠进行动物实验.现随机抽取100只基因编辑小鼠对该病毒疫苗进行实验,得到如下2×2列联表(部分数据缺失): 被某病毒感染 未被某病毒感染 合计 注射疫苗 10 50 未注射疫苗 30 50 合计 30 100 计算可知,根据小概率值α=    的独立性检验,认为 “给基因编辑小鼠注射该种疫苗能起到预防该病毒感染的效果”.  附:χ2=,其中n=a+b+c+d. α 0.1 0.05 0.01 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 四、解答题(共27分) 11.(13分)甲、乙两台机床生产同种产品,产品按质量分为一级品和二级品,为了比较两台机床产品的质量,分别用两台机床各生产了200件产品,产品的质量情况统计如表: 一级品 二级品 合计 甲机床 150 50 200 乙机床 120 80 200 合计 270 130 400 (1)甲机床、乙机床生产的产品中一级品的频率分别是多少?(6分) (2)依据小概率值α=0.01的独立性检验,能否认为甲机床的产品质量与乙机床的产品质量有差异?(7分) 附:χ2=,n=a+b+c+d. α 0.05 0.01 0.001 xα 3.841 6.635 10.828 12.(14分)为了了解高中学生课后自主学习数学时间x(分钟/天)和他们的数学成绩y(分)的关系,某实验小组做了调查,得到一些数据,如表所示. 编号 1 2 3 4 5 学习时间x(分钟/天) 30 40 50 60 70 数学成绩y(分) 65 78 85 99 108 (1)求数学成绩y与学习时间x的样本相关系数(精确到0.001);(5分) (2)请用样本相关系数说明该组数据中y与x之间的关系可用线性回归模型进行拟合,并求出y关于x的经验回归方程,并由此预测每天课后自主学习数学时间为100分钟时的数学成绩;(5分) (3)基于上述调查,某校提倡学生周末在校自主学习.经过一学期的实施后,抽样调查了220位学生.按照是否参与周末在校自主学习以及成绩是否有进步统计,得到2×2列联表.依据表中数据及小概率值α=0.001的独立性检验,分析“周末在校自主学习与成绩进步”是否有关.(4分) 没有进步 有进步 合计 参与周末在校自主学习 35 130 165 未参与周末在校自主学习 25 30 55 合计 60 160 220 参考数据:xiyi=22 820, yi=435,=38 999,≈107.4,xi的方差为200. 方差:s2=, 样本相关系数:r=. 经验回归方程x+中斜率和截距的最小二乘估计公式分别为,,χ2=. α 0.10 0.05 0.010 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 【尖子拔高训练】13题5分,14题6分,共11分 13.某课外兴趣小组为研究数学成绩优秀是否与性别有关,通过随机抽样调查,得到成对样本观测数据的分类统计结果,并计算得出χ2≈6.816,经查阅χ2独立性检验的小概率值和相应的临界值,知x0.01=6.635,则下列判断正确的是(  ) A.若某人数学成绩优秀,那么他为男生的概率是0.010 B.每100个数学成绩优秀的人中就会有1名是女生 C.数学成绩优秀与性别有关,此推断犯错误的概率不大于0.01 D.在犯错误的概率不超过1%的前提下认为数学成绩优秀与性别无关 14.(多选)某地新开了一条夜市街,每晚平均客流量为2万人,每晚最多能接纳的客流量为10万人,主办公司决定通过微信公众号和其他APP进行广告宣传提高营销效果.通过调研,公司发现另一处同等规模的夜市街投入的广告费x(单位:万元)与每晚增加的客流量y(单位:千人)存在如下关系: x/万元 1 2 3 4 5 6 y/千人 5 6 8 9 12 20 现用曲线C:×2x拟合变量x与y的相关关系,并利用一元线性回归模型求参数,(精确到0.01),以所求经验回归方程C为预测依据,则(  ) 参考数据:=10,xiyi=257,=91, 2i=126,=5 460, 2iyi=1 906. 附:一元线性回归模型参数的最小二乘估计公式:,. A.=5.82 B.曲线C经过点(log221,10) C.广告费每增加1万元,每晚客流量平均增加3 000人 D.若广告费超过9万元,则每晚客流量会超过夜市街的接纳能力 学科网(北京)股份有限公司 $$ 第九章 统计与成对数据的统计分析 §9.3 成对数据的统计分析 【考情分析·探规律】 考点 考情分析(2021-2024) 命题趋势 变量间的相关关系 2024·天津卷 2023·天津卷 2022·全国乙卷 了解样本相关系数的统计含义;了解一元线性回归模型和2×2列联表,会运用这些方法解决简单的实际问题;会利用统计软件进行数据分析。 【知识梳理】 1.变量的相关关系 (1)相关关系:两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系. (2)相关关系的分类:正相关和负相关. (3)线性相关:一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们就称这两个变量线性相关. 2.样本相关系数 (1)r=. (2)当r>0时,称成对样本数据正相关;当r<0时,称成对样本数据负相关. (3)|r|≤1;当|r|越接近1时,成对样本数据的线性相关程度越强;当|r|越接近0时,成对样本数据的线性相关程度越弱. 3.一元线性回归模型 (1)我们将x+称为Y关于x的经验回归方程, 其中 (2)残差:观测值减去预测值所得的差称为残差. 4.列联表与独立性检验 (1)关于分类变量X和Y的抽样数据的2×2列联表: X Y 合计 Y=0 Y=1 X=0 a b a+b X=1 c d c+d 合计 a+c b+d n=a+b+c+d (2)计算统计量χ2=,利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验. 【名师点拨】 1.求解经验回归方程的关键是确定回归系数,,应充分利用回归直线过样本点的中心(,). 2.根据χ2的值可以判断两个分类变量有关的可信程度,若χ2越大,则两个分类变量有关的把握越大. 3.回归分析和独立性检验都是基于成对样本观测数据进行估计或推断,得出的结论都可能犯错误. 【随堂训练】 1.思考辨析(在括号内打“√”或“×”) (1)散点图无法判断两个变量是否相关.(  ) (2)通过经验回归方程=x+可以估计预报变量的取值和变化趋势.(  ) (3)只有两个变量有相关关系,所得到的回归模型才有预测价值.(  ) (4)事件X,Y关系越密切,则由观测数据计算得到的χ2的值越小.(  ) 【答案】(1)× (2)√ (3)√ (4)× 【解析】(1)散点图是判断两个变量是否相关的一种重要方法和手段. (4)χ2的值越大,相关性越强,关系越密切. 2.(多选)下列说法正确的是(  ) A.两个具有线性相关关系的变量的相关性越强,则样本相关系数r的值越接近于1 B.当r=1时,两变量呈函数关系 C.当经验回归方程为=0.3-0.7x时,变量x和y负相关 D.在经验回归方程=0.4+0.5x中,当x每增加1个单位时,相应观测值y增加0.5个单位 【答案】BC 【解析】两个具有线性相关关系的变量的相关性越强,则样本相关系数r的绝对值越接近于1,故A错误;当样本相关系数r=1时,两变量呈确定的函数关系,故B正确;因为斜率小于0,所以变量x和y负相关,故C正确;在经验回归方程=0.4+0.5x中,当x每增加1个单位时,相应观测值y约增加0.5个单位,故D错误. 3.想要检验喜欢参加体育活动是不是与性别有关,应该提出统计假设H0为(  ) A.男性喜欢参加体育活动 B.女性不喜欢参加体育活动 C.喜欢参加体育活动与性别有关 D.喜欢参加体育活动与性别无关 【答案】D 【解析】独立性检验是一种假设性检验,假设有反证法的意味,应假设两类变量无关,在该假设下构造的随机变量χ2应该很小,如果χ2很小,则不能肯定或否定假设,反之,则在一定程度上说明假设不合理,即认为两个变量在一定程度上有关,所以想要检验喜欢参加体育活动是不是与性别有关,应该提出统计假设H0:喜欢参加体育活动与性别无关. 4.已知变量x和y的统计数据如表: x 6 7 8 9 10 y 3.5 4 5 6 6.5 若由表中数据得到经验回归方程为=0.8x+,则当x=10时的残差为    (注:观测值减去预测值所得的差称为残差).  【答案】-0.1 【解析】=8, =5, 则=5-0.8×8=-1.4, 所以=0.8x-1.4,当x=10时,=6.6, 所以当x=10时的残差为6.5-6.6=-0.1. 【解题技巧】 1.经验回归直线过点(,). 2.求时,常用公式. 3.回归分析和独立性检验都是基于成对样本观测数据进行估计或推断,得出的结论都可能犯错误. 【必练核心题型】 题型一 成对数据的相关性 【典例】1.(多选)(2025·绵阳模拟)下列说法正确的是(  ) A.回归分析中,样本相关系数r的取值范围为(-1,1) B.回归分析中,残差图中残差比较均匀地分布在以取值为0的横轴为对称轴的水平带状区域内,且宽度越窄表示拟合效果越好 C.回归分析中,决定系数R2越大,说明残差平方和越小,拟合效果越好 D.两个随机变量的线性相关性越强,样本相关系数的绝对值越接近于0 【答案】BC 【解析】回归分析中,样本相关系数r的取值范围为[-1,1],故选项A错误; 因为在残差的散点图中,残差分布的水平带状区域的宽度越窄,表明数据越集中,模型的拟合效果越好,故选项B正确; 因为决定系数R2越大,表示残差平方和越小,数据就越集中,即模型的拟合效果越好,故选项C正确; 两个随机变量的线性相关性越强,样本相关系数的绝对值越接近于1,故D错误. 【典例】2.已知变量x与变量y线性相关,x与y的样本相关系数为-0.8,且由观测数据算得样本平均数=5,=6,则由该观测数据算得的经验回归方程可能是(  ) A.=0.8x+2 B.=x+1 C.=-0.8x+9 D.=-x+11 【答案】D 【解析】因为x与y的样本相关系数为-0.8<0,可知x与y为负相关,故A,B错误; 又因为经验回归直线过点(5,6),对于=-0.8x+9,-0.8×5+9=5≠6,故C错误; 对于=-x+11,-5+11=6,故D正确. 【解题技巧】判定两个变量相关性的方法 (1)画散点图:若点的分布从左下角到右上角,则两个变量正相关;若点的分布从左上角到右下角,则两个变量负相关. (2)样本相关系数:当r>0时,正相关;当r<0时,负相关;|r|越接近1,线性相关性越强. (3)经验回归方程:当>0时,正相关;当<0时,负相关. 【变式训练】 变式1.(多选)下列有关回归分析的结论中,正确的有(  ) A.若经验回归方程为=5+2x,则变量y与x正相关 B.运用最小二乘法求得的经验回归直线一定经过点(,) C.决定系数R2的值越接近于1,表示回归模型的拟合效果越好 D.若散点图中所有点都在直线y=0.93x-3.6上,则样本相关系数r=0.93 【答案】ABC 【解析】因为经验回归方程为=5+2x,可知2>0,所以变量y与x正相关,故A正确; 由经验回归方程的性质可知,经验回归直线一定经过点(,),故B正确; 决定系数R2的值越接近于1,表示回归模型的拟合效果越好,故C正确; 散点图中所有点都在直线y=0.93x-3.6上,则|r|=1,且0.93>0,所以变量y与x正相关,即r>0,可知r=1,故D错误. 题型二 回归模型 命题点1 一元线性回归模型 【典例】1.氮氧化物是一种常见的大气污染物,如图为我国2014年至2022年氮氧化物排放量(单位:万吨)的折线图,其中年份代码1~9分别对应年份2014~2022. 已知yi≈12 000,≈1 100,≈7.7,tiyi≈51 800. (1)可否用一元线性回归模型拟合y与t的关系?请分别根据折线图和样本相关系数加以说明; (2)若根据所给数据建立经验回归方程=-138t+2 025,可否用此方程来预测2025年和2035年我国的氮氧化物排放量?请说明理由. 附:样本相关系数r=. 【解析】 (1)从折线图看,各点落在一条直线附近,因而可以用线性回归模型拟合y与t的关系, 由题意知×(1+2+3+4+5+6+7+8+9)=5, 样本相关系数r=≈=-≈-0.97. 故可以用线性回归模型拟合y与t的关系. (2)可以预测2025年的氮氧化物排放量,但不可以预测2035年的氮氧化物排放量. 理由如下: ①2025年与所给数据的年份较接近,因而可以认为短期内氮氧化物排放量将延续该趋势,故可以用此模型进行预测; ②2035年与所给数据的年份相距过远,而影响氮氧化物排放量的因素有很多,这些因素在短期内可能保持不变,但从长期看很有可能会变化,因而用此模型预测可能是不准确的. 命题点2 非线性回归模型 【典例】2.某大型现代化农场在种植某种大棚有机无公害的蔬菜时,为创造更大价值,提高亩产量,积极开展技术创新活动.该农场采用了延长光照时间的方案,该农场选取了20间大棚(每间一亩)进行试点,得到各间大棚产量数据并绘制成散点图.光照时长为x(单位:小时),大棚蔬菜产量为y(单位:吨/亩),记w=ln x. 参考数据: xi yi wi xiyi wiyi 290 102.4 52 4 870 540.28 137 1 578.2 272.1 参考公式:y关于x的经验回归方程x+中,,. (1)根据散点图判断,y=a+bx与y=c+dln x哪一个适宜作为大棚蔬菜产量y关于光照时长x的经验回归方程类型(给出判断即可,不必说明理由); (2)根据(1)的判断结果及表中数据,建立y关于x的经验回归方程(结果保留小数点后两位); (3)根据实际种植情况,发现上述回归方程在光照时长位于6~14小时内拟合程度良好,利用(2)中所求方程估计当光照时长为e2小时时(e为自然对数的底数),大棚蔬菜的亩产量. 【解析】 (1)根据散点图,开始的点在某条直线旁,但后面的点会越来越偏离这条直线,因此y=c+dln x更适宜作为大棚蔬菜产量y关于光照时长x的经验回归方程类型. (2)w=ln x,则y=c+dln x,即y=c+dw, =5.12,=2.6, ≈3.26, ≈5.12-3.26×2.6≈-3.36, 所以=3.26w-3.36, 即=3.26ln x-3.36. (3)当x=e2时,=3.26ln e2-3.36=3.16. 即大棚蔬菜亩产量约为3.16吨. 【解题技巧】求经验回归方程的步骤 【变式训练】红蜘蛛是柚子的主要害虫之一,能对柚子树造成严重伤害,每只红蜘蛛的平均产卵数y(个)和平均温度x(摄氏度)有关,现收集了以往某地的7组数据,得到下面的散点图及一些统计量的值. 参考数据(z=ln y): xiyi xizi 5 215 17 713 714 27 81.3 3.6 (1)根据散点图判断,y=bx+a与y=cedx(其中e=2.718…为自然对数的底数)哪一个更适合作为平均产卵数y(个)关于平均温度x(摄氏度)的经验回归方程类型?(给出判断即可,不必说明理由) (2)由(1)的判断结果及表中数据,求出y关于x的经验回归方程. 附:x+中,,. 【解析】 (1)由散点图可以判断,随温度升高,平均产卵数增长速度变快,符合指数函数模型的增长特点, 所以y=cedx更适宜作为平均产卵数y关于平均温度x的经验回归方程类型. (2)将y=cedx两边同时取自然对数,可得ln y=ln c+dx,即z=ln c+dx, 由题中的数据可得, xizi-7=33.6, -7=112, 所以=0.3,则ln =3.6-0.3×27=-4.5, 所以z关于x的经验回归方程为=0.3x-4.5,故y关于x的经验回归方程为=e0.3x-4.5. 题型三 列联表与独立性检验 【典例】1.(2025·八省联考)为考察某种药物A对预防疾病B的效果,进行了动物(单位:只)试验,得到如下列联表: 药物 疾病 合计 未患病 患病 未服用 100 80 s 服用 150 70 220 合计 250 t 400 (1)求s,t; (2)记未服用药物A的动物患疾病B的概率为p,给出p的估计值; (3)根据小概率值α=0.01的独立性检验,能否认为药物A对预防疾病B有效? 附:χ2=. α 0.05 0.01 0.001 xα 3.841 6.635 10.828 【解析】 (1)s=100+80=180,t=80+70=150. (2)∵=,∴p的估计值为. (3)零假设H0:药物A对预防疾病B无效. 根据列联表中的数据可得 χ2==≈6.734>6.635=x0.01. 根据小概率值α=0.01的独立性检验,推断H0不成立,即认为药物A对预防疾病B有效. 【解题技巧】独立性检验的一般步骤 (1)根据样本数据制成2×2列联表. (2)根据公式χ2=计算. (3)比较χ2与临界值的大小关系,作统计推断. 【变式训练】(2025·绵阳诊断)近年来,随着深入贯彻新时代强军思想,越来越多的优秀青年学子献身国防,投身军营,高考结束后,很多高考毕业生报考了军事类院校.从某地区学校的高三年级中随机抽取了900名学生,其中男生500人,女生400人,通过调查,有报考军事类院校意向的男生、女生各100名. (1)完成给出的列联表,并分别估计该地区高三男、女学生有报考军事类院校意向的概率; 有报考意向 无报考意向 合计 男学生 女学生 合计 (2)根据小概率值α=0.10的独立性检验,能否认为学生有报考军事类院校的意向与性别有关? 参考公式及数据:χ2=,n=a+b+c+d. α 0.10 0.05 0.010 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 【解析】 (1)根据已知条件,填写2×2列联表如下. 有报考意向 无报考意向 合计 男学生 100 400 500 女学生 100 300 400 合计 200 700 900 故估计该地区高三男生有报考军事类院校意向的概率为, 女生有报考军事类院校意向的概率为. (2)零假设为H0:学生有报考军事类院校意向与性别无关, χ2=≈3.214>2.706=x0.10, 所以根据小概率值α=0.10的独立性检验,我们推断H0不成立,即认为学生有报考军事类院校的意向与性别有关. 【限时训练】(限时:60分钟) 一、单项选择题(每小题5分,共30分) 1.下列两个变量中,成正相关的两个变量是(  ) A.汽车自身的重量与行驶每公里的耗油量 B.正方形的面积与边长 C.花费在体育活动上的时间与期末考试数学成绩 D.期末考试随机编排的准考证号与期末考试成绩总分 【答案】A 【解析】一般情况下,汽车越重,则每公里耗油量越多,成正相关,故A正确; 正方形的面积与边长是函数关系,故B错误; 一般情况下,若花费在体育活动上的时间越长,则期末考试数学成绩可能会降低,故不为正相关,故C错误; 期末考试随机编排的准考证号与期末考试成绩总分没有相关关系,故D错误. 2.为了研究性别与对乡村音乐态度(喜欢和不喜欢两种态度)的关系,运用2×2列联表进行独立性检验,经计算χ2=8.01,则“性别与喜欢乡村音乐有关系”这个推断犯错误的概率不超过(参考数据:x0.005=7.879,x0.001=10.828)(  ) A.0.1% B.0.5% C.99.5% D.99.9% 【答案】B 【解析】因为χ2=8.01>7.879=x0.005,所以“性别与喜欢乡村音乐有关系”这个推断犯错误的概率不超过0.5%. 3.下表为2018年—2023年的中国数字经济规模(单位:万亿元): 年份 2018 2019 2020 2021 2022 2023 年份代码x 1 2 3 4 5 6 中国数字经济规模y 31.3 35.8 39.2 45.5 50.2 53.9 则下列所给函数模型中比较适合这一组数据关系的是(  ) A.y=2x+30 B.y=30+log2(x+1) C.y=28× D.y=2x+30 【答案】C 【解析】对于y=2x+30,当x=6时,y=42,与53.9相差较大; 对于y=30+log2(x+1),当x=6时,y<33,与53.9相差较大; 对于y=2x+30,当x=6时,y=94,与53.9相差较大; 对于y=28×,当x=1,2,3,4,5,6时,与所给数据相差不大,比较适合这一组数据的关系. 4.学校开设了游泳选修课.某教练为了解学生对游泳运动的喜好和性别是否有关,在全校学生中随机选取了男、女生各n人进行调查,并绘制了如图所示的等高堆积条形图.则(  ) 参考公式及数据:χ2=,其中n=a+b+c+d. α 0.1 0.01 0.001 xα 2.706 6.635 10.828 A.参与调查的女生中喜欢游泳运动的人数比不喜欢游泳运动的人数多 B.全校学生中喜欢游泳运动的男生人数比喜欢游泳运动的女生人数多 C.若n=50,依据α=0.01的独立性检验,可以认为游泳运动的喜好和性别有关 D.若n=100,依据α=0.01的独立性检验,可以认为游泳运动的喜好和性别有关 【答案】D 【解析】由等高堆积条形图可知,参与调查的女生中喜欢游泳运动的人数比不喜欢游泳运动的人数少,故A错误; 全校学生中男生和女生人数比不确定,故不能确定全校学生中喜欢游泳运动的男生人数比喜欢游泳运动的女生人数多,故B错误; 结合等高堆积条形图可得: 性别 游泳 合计 喜欢 不喜欢 男生 0.6n 0.4n n 女生 0.4n 0.6n n 合计 n n 2n 故χ2==0.08n,若n=50,则χ2=0.08n=4<6.635,故依据α=0.01的独立性检验,不可以认为游泳运动的喜好和性别有关,故C错误; 若n=100,则χ2=0.08n=8>6.635,依据α=0.01的独立性检验,可以认为游泳运动的喜好和性别有关,故D正确. 5.为了研究y关于x的线性相关关系,收集了5组样本数据(见下表): x 1 2 3 4 5 y 0.5 0.9 1 1.1 1.5 若已求得经验回归方程为x+0.34,则下列选项中正确的是(  ) 附:样本相关系数r=. A.=0.21 B.当x=8时,y的预测值为2.2 C.样本数据y的第40百分位数为1 D.去掉样本点(3,1)后,x与y的样本相关系数r不会改变 【答案】D 【解析】=3,=1,将(3,1)代入x+0.34得3+0.34=1,解得=0.22,故A错误; 当x=8时,y的预测值为=0.22×8+0.34=2.1,故B错误; 5×40%=2,则样本数据y的第40百分位数为=0.95,故C错误; 去掉样本点(3,1)后,新样本数据的平均值没有变化,即=3,=1仍然成立,不妨设(3,1)为第5组数据,即x5=3,y5=1,则x5-=0,y5-=0,其余数据没有变化.则由样本相关系数公式r=可知,新样本数据x与y的样本相关系数与原数据的样本相关系数相等,即x与y的样本相关系数r不会改变,故D正确. 6.某学校数学兴趣小组在探究姜撞奶随着时间变化的降温及凝固情况的数学建模活动中,将时间x(分钟)与温度y(摄氏度)的关系用模型y=c1(其中e为自然对数的底数)拟合.设z=ln y,变换后得到一组数据: x 2 2.5 3 3.5 4 z 4.04 4.01 3.98 3.96 3.91 由上表可得经验回归方程=-0.062x+,则c1等于(  ) A.-4 B.e-4 C.4.166 D.e4.166 【答案】D 【解析】由表格中数据,得=3,=3.98, 则3.98=-0.062×3+, 解得=4.166,因此=-0.062x+4.166, 由y=c1两边取对数,得ln y=c2x+ln c1, 又z=ln y,所以c2=-0.062,ln c1=4.166, 即c1=e4.166. 二、多项选择题(每小题6分,共12分) 7.(2025·长春模拟)暑假结束后,为了解假期中学生锻炼身体情况,学生处对所有在校学生做问卷调查,并随机抽取了180人的调查问卷,其中男生比女生少20人,并将调查结果绘制得到等高堆积条形图.在被调查者中,下列说法正确的是(  ) 参考公式及数据:χ2=,其中n=a+b+c+d. α 0.1 0.05 0.01 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 A.男生中不经常锻炼的人数比女生中经常锻炼的人数多 B.男生中经常锻炼的人数比女生中经常锻炼的人多8人 C.经常锻炼者中男生的频率是不经常锻炼者中男生的频率的2倍 D.根据小概率值α=0.01的独立性检验,可以认为假期是否经常锻炼与性别有关 【答案】BD 【解析】设男生人数为x,则女生人数为x+20, 由题意得x+x+20=180, 解得x=80,即在被调查者中,男生、女生人数分别为80,100,可得到如下2×2列联表, 性别 锻炼情况 合计 经常锻炼 不经常锻炼 男 48 32 80 女 40 60 100 合计 88 92 180 由表可知,A显然错误; 男生中经常锻炼的人数比女生中经常锻炼的人数多48-40=8,B正确; 在经常锻炼者中是男生的频率为≈0.545 5,在不经常锻炼者中是男生的频率为≈0.347 8,≈1.6,C错误; 零假设H0:是否经常锻炼与性别无关,则χ2=≈7.115>6.635=x0.01,根据小概率值α=0.01的独立性检验,我们推断H0不成立,即认为假期是否经常锻炼与性别有关,D正确. 8.某科技公司统计了一款APP最近5个月的下载量,如表所示,若y与x线性相关,且经验回归方程为=-0.6x+,则(  ) 月份编号x 1 2 3 4 5 下载量y(万次) 5 4.5 4 3.5 2.5 A.y与x负相关 B.=5.6 C.预测第6个月的下载量约为2.1万次 D.残差绝对值的最大值为0.2 【答案】ACD 【解析】因为-0.6<0,所以变量y与x负相关,故A正确; ×(1+2+3+4+5)=3,×(5+4.5+4+3.5+2.5)=3.9,=-0.6x+,则-0.6×3+=3.9,解得=5.7,故B错误; 当x=6时,=-0.6×6+5.7=2.1,故可以预测第6个月的下载量约为2.1万次,故C正确; 当x=1时,=-0.6×1+5.7=5.1,|y1-|=0.1;当x=2时,=-0.6×2+5.7=4.5,|y2-|=0;当x=3时,=-0.6×3+5.7=3.9,|y3-|=0.1;当x=4时,=-0.6×4+5.7=3.3,|y4-|=0.2;当x=5时,=-0.6×5+5.7=2.7,|y5-|=0.2,故残差绝对值的最大值为0.2,故D正确. 三、填空题(每小题5分,共10分) 9.(2025·汉中模拟)奶茶店老板对本店在12月份出售热饮的杯数y与当天的平均气温x(℃)进行线性回归分析,随机收集了该月某4天的相关数据(如表),并由最小二乘法求得经验回归方程为=45-2x.表中有一个数据看不清楚,请你推断出该数据的值为      .  气温x(℃) 10 6 2 -2 售出热饮的杯数y 24 ■ 42 48 【答案】34 【解析】设看不清楚的这个数据为m,则=4,,由于经验回归直线必过点,所以=45-2×4,解得m=34. 10.在某病毒疫苗的研发过程中,需要利用基因编辑小鼠进行动物实验.现随机抽取100只基因编辑小鼠对该病毒疫苗进行实验,得到如下2×2列联表(部分数据缺失): 被某病毒感染 未被某病毒感染 合计 注射疫苗 10 50 未注射疫苗 30 50 合计 30 100 计算可知,根据小概率值α=    的独立性检验,认为 “给基因编辑小鼠注射该种疫苗能起到预防该病毒感染的效果”.  附:χ2=,其中n=a+b+c+d. α 0.1 0.05 0.01 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 【答案】0.05 【解析】完善2×2列联表如下: 被某病毒感染 未被某病毒感染 合计 注射疫苗 10 40 50 未注射疫苗 20 30 50 合计 30 70 100 零假设为H0:给基因编辑小鼠注射该种疫苗不能起到预防该病毒感染的效果. 因为χ2=≈4.762, 4.762>3.841, 所以根据小概率值α=0.05的独立性检验,推断H0不成立,即认为“给基因编辑小鼠注射该种疫苗能起到预防该病毒感染的效果”. 四、解答题(共27分) 11.(13分)甲、乙两台机床生产同种产品,产品按质量分为一级品和二级品,为了比较两台机床产品的质量,分别用两台机床各生产了200件产品,产品的质量情况统计如表: 一级品 二级品 合计 甲机床 150 50 200 乙机床 120 80 200 合计 270 130 400 (1)甲机床、乙机床生产的产品中一级品的频率分别是多少?(6分) (2)依据小概率值α=0.01的独立性检验,能否认为甲机床的产品质量与乙机床的产品质量有差异?(7分) 附:χ2=,n=a+b+c+d. α 0.05 0.01 0.001 xα 3.841 6.635 10.828 【解析】 (1)根据题表中数据知,甲机床生产的产品中一级品的频率是=0.75,乙机床生产的产品中一级品的频率是=0.6. (2)零假设为H0:甲机床的产品质量与乙机床的产品质量无差异,根据题表中的数据可得 χ2= =≈10.256>6.635=x0.01, 所以依据小概率值α=0.01的独立性检验,推断H0不成立,即认为甲机床的产品质量与乙机床的产品质量有差异. 12.(14分)为了了解高中学生课后自主学习数学时间x(分钟/天)和他们的数学成绩y(分)的关系,某实验小组做了调查,得到一些数据,如表所示. 编号 1 2 3 4 5 学习时间x(分钟/天) 30 40 50 60 70 数学成绩y(分) 65 78 85 99 108 (1)求数学成绩y与学习时间x的样本相关系数(精确到0.001);(5分) (2)请用样本相关系数说明该组数据中y与x之间的关系可用线性回归模型进行拟合,并求出y关于x的经验回归方程,并由此预测每天课后自主学习数学时间为100分钟时的数学成绩;(5分) (3)基于上述调查,某校提倡学生周末在校自主学习.经过一学期的实施后,抽样调查了220位学生.按照是否参与周末在校自主学习以及成绩是否有进步统计,得到2×2列联表.依据表中数据及小概率值α=0.001的独立性检验,分析“周末在校自主学习与成绩进步”是否有关.(4分) 没有进步 有进步 合计 参与周末在校自主学习 35 130 165 未参与周末在校自主学习 25 30 55 合计 60 160 220 参考数据:xiyi=22 820, yi=435,=38 999,≈107.4,xi的方差为200. 方差:s2=, 样本相关系数:r=. 经验回归方程x+中斜率和截距的最小二乘估计公式分别为,,χ2=. α 0.10 0.05 0.010 0.005 0.001 xα 2.706 3.841 6.635 7.879 10.828 【解析】 (1)=50, =87, 又xi(i=1,2,3,…,5)的方差为 =200, =(65-87)2+(78-87)2+(85-87)2+(99-87)2+(108-87)2=484+81+4+144+441=1 154, r=≈ ≈0.996. (2)由(1)知r≈0.996接近1,故y与x之间具有极强的线性相关关系,可用线性回归模型进行拟合, ==1.07, =87-1.07×50=33.5, 故=1.07x+33.5. 当x=100时,=140.5, 故预测每天课后自主学习数学时间达到100分钟时的数学成绩为140.5分. (3)零假设H0:周末在校自主学习与成绩进步无关, 根据数据,计算得到 χ2=≈12.22, 因为12.22>10.828=x0.001, 所以依据小概率值α=0.001的独立性检验,推断H0不成立,即可以认为“周末在校自主学习与成绩进步”有关. 【尖子拔高训练】13题5分,14题6分,共11分 13.某课外兴趣小组为研究数学成绩优秀是否与性别有关,通过随机抽样调查,得到成对样本观测数据的分类统计结果,并计算得出χ2≈6.816,经查阅χ2独立性检验的小概率值和相应的临界值,知x0.01=6.635,则下列判断正确的是(  ) A.若某人数学成绩优秀,那么他为男生的概率是0.010 B.每100个数学成绩优秀的人中就会有1名是女生 C.数学成绩优秀与性别有关,此推断犯错误的概率不大于0.01 D.在犯错误的概率不超过1%的前提下认为数学成绩优秀与性别无关 【答案】C 【解析】因为χ2≈6.816>6.635=x0.01,所以数学成绩优秀与性别有关,此推断犯错误的概率不大于0.01,即在犯错误的概率不超过1%的前提下认为“数学成绩优秀与性别有关”,故C正确,D错误; 若某人数学成绩优秀,由已知数据不能判断他为男生的概率,故A错误; 每100个数学成绩优秀的人中可能没有女生,也有可能有多名女生,由已知数据不能确定结论,故B错误. 14.(多选)某地新开了一条夜市街,每晚平均客流量为2万人,每晚最多能接纳的客流量为10万人,主办公司决定通过微信公众号和其他APP进行广告宣传提高营销效果.通过调研,公司发现另一处同等规模的夜市街投入的广告费x(单位:万元)与每晚增加的客流量y(单位:千人)存在如下关系: x/万元 1 2 3 4 5 6 y/千人 5 6 8 9 12 20 现用曲线C:×2x拟合变量x与y的相关关系,并利用一元线性回归模型求参数,(精确到0.01),以所求经验回归方程C为预测依据,则(  ) 参考数据:=10,xiyi=257,=91, 2i=126,=5 460, 2iyi=1 906. 附:一元线性回归模型参数的最小二乘估计公式:,. A.=5.82 B.曲线C经过点(log221,10) C.广告费每增加1万元,每晚客流量平均增加3 000人 D.若广告费超过9万元,则每晚客流量会超过夜市街的接纳能力 【答案】BD 【解析】由题知,2iyi=1 906,=10, 2i=×126=21,=5 460, 所以≈0.23,≈10-0.23×21=5.17,A错误; 所以=5.17+0.23×2x, 令x=log221,求得=10,B正确; 由上式可知,x每增加1万元,y不是平均增加的,C错误; 若x>9,则>122.93,而每晚最多能接纳的客流量为10万人,故D正确. 学科网(北京)股份有限公司 $$

资源预览图

第九章 §9.3 成对数据的统计分析(新高考通用)-【2026年高考数学一轮备考·学霸专练】
1
第九章 §9.3 成对数据的统计分析(新高考通用)-【2026年高考数学一轮备考·学霸专练】
2
第九章 §9.3 成对数据的统计分析(新高考通用)-【2026年高考数学一轮备考·学霸专练】
3
所属专辑
相关资源
示范课
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。