9.2 成对数据的统计分析-【衡中学案】2025年高考数学一轮总复习学案(新教材)

2024-12-13
| 2份
| 11页
| 153人阅读
| 6人下载
教辅
河北万卷文化有限公司
进店逛逛

内容正文:

则下列结论正确的是 ABC [解析]从折线图能看出世界人口的总量随着 A.从折线图能看出世界人口的总量随着年份的年份的增加而增加,故A正确:从扇形图中能够明显地 增加而增加 看出2050年亚洲人口将比其他各洲人口的总和还要 B.2050年亚洲人口将比其他各洲人口的总和还 多,故B正确:从条形图中能够明显地看出2050年南 要多 美洲及大洋洲人口之和将与欧洲人口基本持平,故C C.2050年南美洲及大洋洲人口之和将与欧洲人 正确;由题中三幅统计图并不能得出从1957年到2050 口基本持平 年中哪个洲人口增长速度最慢,故D错误.故选ABC D.1957年到2050年各洲中北美洲人口增长速度 最慢 温馨提示:复习至此,请完成练案[61 第二讲 成对数据的统计分析 知识梳理·双基自测 知识梳理 a之间的随机误差 2.经验回归方程 知识点一 变量的相关关系 1.相关关系 记x=,y=含,因此当a,6的取值为 n n 两个变量有关系,但又没有确切到可由其中的一 另一个的程度,这种关系称为相关关系。 三(--) 个 246 2.散点图 每一个序号下的成对样本数据都可用直角坐标系 中的 表示出来,由这些点组成的统计图称为 a=y-bx. 2p25 散点图 (x,y)称为样本点的中心 年 3.正相关、负相关 我们将 称为Y关于x的经验回归方程,也 度 如果从整体上看,当一个变量的值增加时,另一个变 称经验回归函数或经验回归公式,其图形称为 新 量的相应值也呈现 的趋势,我们就称这两个变量 ,这种求经验回归方程的方法叫做 ,求得 计 正相关:如果当一个变量的值增加时,另一个变量的相应 的6,a叫做b,a的 值呈现 的趋势,则称这两个变量负相关 注:经验回归直线必过样本点中心 中 4.变量的线性相关 3.残差分析 学 如果两个变量的取值呈现 (1)对于响应变量Y,通过观测得到的数据称为 而且散点落在 附近,我们就称这两个变量线 ,通过经验回归方程得到的氵称为 性相关.一般地,如果两个变量具有相关性,但不是线观测值减去预测值称为 ·残差是随机误差的 性相关,那么我们就称这两个变量 估计结果,通过对残差的分析可以判断模型刻画数据 的效果,以及判断原始数据中是否存在可疑数据等,这 5.样本相关系数 方面工作称为 称r= 为变量x和变 (2)残差的散点图 量y的相关系数 残差比较均匀地集中分布在以横轴为对称轴的水 r∈[-1,1],当r>0时,成对样本数据 平带状区域内,则满足一元线性回归模型对随机误差 当r<0时,成对样本数据 的假设, 当11接近1时,成对样本数据的线性相关程度 (3)决定系数R=1 当1r接近0时,成对样本数据的线性相关程度 含- 知识点二一元线性回归模型 在R表达式中,名(:-)与经验回归方程无 1.一元线性回归模型 关,残差平方和 与经验回归方程有关.因此 [Y= R越大,意味着残差平方和越 ,即模型的拟 lE(e)= 我们称上式 ,D(e)= 合效果越 :R越小,表示残差平方和越 为Y关于x的一元线性回归模型.其中,Y称为 ,即模型的拟合效果越 在线性回归模型 ,x称为 ;a和b为模型的未知中,R表示解释变量对响应变量的贡献率,R越接近 参数,a称为截距参数,b称为斜率参数:e是Y与bx+1,拟合效果越好. 知识点三独立性检验 3.独立性检验是对两个变量的关系的可信程度的判 1.分类变量:用以区别不同的现象或性质的随机 断,而不是对其是否有关系的判断.根据X的值可 变量 以判断两个分类变量有关的可信程度,并用来指导 2.2×2列联表 科研和实际生活. 设X,Y为两个分类变量,它们的取值分别为x1, x2}和{y,2,其样本频数列联表(2×2列联表) 双基自测 如下: 题组一走出误区 总计 1.判断下列结论是否正确(请在括号中打“√”或 6 “×”) c+d (1)“名师出高徒”可以解释为教师的教学水平与学 总计 a+e 生的水平成正相关关系, ()】 3.独立性检验 (2)两个随机变量的线性相关性越强,相关系数的 (1)零假设(或原假设》 绝对值越接近于0. 以?为样本空间的古典概型.设X和Y为定义在 (3)只有两个变量有相关关系,所得到的回归模型 2上,取值于0,1的成对分类变量. 才有预测价值。 Ho: 称为零假设。 (4)某同学研究卖出的热饮杯数y与气温x(℃)之 (2)临界值 间的关系,得回归方程y=-2.352x+147.767, x2= 则气温为2℃时,一定可卖出143杯热饮 对于任何小概率值,可以找到相应的正实数x。, 使得下面关系成立:P(X≥x。)=心.称x。为α的 (5)事件x,y关系越密切,则由观测数据计算得到的 ,这个临界值就可作为判断X大小的标准.概率 ×的观测值越大. ( 值α越小,临界值x。越大 (6)由独立性检验可知,在犯错误的概率不超过1% (3)独立性检验 的前提下认为物理成绩优秀与数学成绩有关, 基于小概率值α的检验规则是: 某人数学成绩优秀,则他有99%的可能物理优 当X≥x。时,我们就推断H。不成立,即认为X和 秀 总 ,该推断犯错误的概率不 题组二走进教材 复 当X2<x。时,我们没有充分证据推断H。不成立, 2.(多选题)(选择性必修3P3T5)对变量y和x的一 可以认为X和Y 组样本数据(x1),(2,2),…,(x,y)进行回归 数 这种利用×的取值推断分类变量X和Y是否独 立的方法称为×独立性检验,读作“卡方独立性检 分析,建立回归模型,则 验”,简称独立性检验 A.残差平方和越大,模型的拟合效果越好 247 4.独立性检验解决实际问题的一般步骤 B.若由样本数据得到经验回归直线y=x+a,则其 (1)提出零假设H。:X与Y相互独立,并给出在问 必过点(x,y) 题中的解释. C.用决定系数R来刻画回归效果,R越小,说明模 (2)根据抽样数据整理出2×2列联表,计算X 型的拟合效果越好 值,并与临界值x。比较。 D.若y和x的样本相关系数r=-0.95,则y和x之 (3)根据经验规则得出推断结论 间具有很强的负线性相关关系 (4)在X和y不独立的情况下,根据需要,通过比3.(选择性必修3Pm例3)某儿童医院用甲,乙两种疗 较相应的频率,分析X和Y间的影响规律, 法治疗小儿消化不良,采用有放回简单随机抽样的 归纳拓展 方法对治疗情况进行检查,得到了如下数据:抽到接 受甲种疗法的患儿67名,其中未治愈15名、治愈52 1.回归分析是对具有相关关系的两个变量进行统计分 名:抽到接受乙种疗法的患儿69名,其中未治愈6 析的方法,只有在散点图大致呈线性分布时,求出的 名,治愈63名.试根据小概率值α=0.005的独立性 经验回归方程才有实际意义,否则,求出的经验回归 检验,分析甲,乙两种疗法的效果,结论为 方程毫无意义,根据经验回归方程进行预报,仅是 个预报值,而不是真实发生的值, 附: 2xy:-可 2.相关系数r= 0.1 0.05 0.01 0.005 0.001 2.706 3.841 6.635 7.879 10.828 题组三走向高考 能否有90%的把握认为甲、乙两城之间的长途客车 4.(2023·高考天津卷)调查某种群花萼长度和花瓣长 是否准点与客车所属公司有关? 度,所得数据如图所示,其中相关系数r=0.8245,下 n(ad-be)2 列说法正确的是 附:X=(a+b)(c+0(a+c)(b+d) P(X2≥x.) 0.100 0.050 0.010 ◆花梁长度 2.706 3.841 6.635 女 花尊长漫 A.花瓣长度和花萼长度没有相关性 B.花瓣长度和花尊长度呈现负相关 C.花瓣长度和花尊长度呈现正相关 D.若从样本中抽取一部分,则这部分的相关系数一 定是0.8245 5.(2022·全国高考甲卷(节选))甲、乙两城之间的长 途客车均由A和B两家公司运营,为了解这两家公 248 司长途客车的运行情况,随机调查了甲、乙两城之间 的500个班次,得到下面列联表: 225 准点班次数 未淮点班次数 年 240 20 度 B 210 30 设 考点突破·互动探究 衡 学 2.(多选题)(2023·河北邯郸期末)对两组数据 案 夸点 相关关系的判断一 自主练透 进行统计后得到的散点图如图,关于其线性相关系数 例1.(2024·湖南名校联考联合体联考)某校数学兴 的结论正确的 () 趣小组在某座山测得海拔高度x(单位:千米)与 气压y(单位:千帕)的六组数据(x,y)(i=1,2,…,6) 16 16 绘制成如下散点图,分析研究发现B点相关数据不符 12 合实际,删除B点后重新进行回归分析,则下列说法正 确的是 012345x 012345x 线性相关系数: 线性相关系数, D.E A.r<0 B.r3>1 C.51+2>0 D.Irl>Irl 0 t 名师点拨:判断两个变量正、负相关性的方法 A.删除点B后,样本数据的两变量x,y正相关 1.画散点图:点的分布从左下角到右上角,两个变 B.删除点B后,相关系数r的绝对值更接近于1 量正相关:点的分布从左上角到右下角,两个变量负 相关 C.删除点B后,新样本的残差平方和变大 2.相关系数:r>0时,正相关:r<0时,负相关 D.删除点B后,解释变量x与响应变量y相关性 变弱 3.线性回归直线方程中:6>0时,正相关:6<0时 负相关。 【变式训练】 (2023·高考上海卷)根据所示的散点图,下列说法 参考公式:相关系数r= 24-0- 正确的是 V含4-02(x- 90 在回归方程y=t+a中,斜率和截距的最小二乘 法估计公式分别为 80 70 4-0(%- 就-nr 8a- 50 40 30 150 1和 10 牙高 A.身高越大,体重越大 B.身高越大,体重越小 C.身高和体重成正相关 D.身高和体重成负相关 专点2 回归分析 多维探究 角度!一元线性回归模型 例1.(2024:河北邢台名校联盟期中)某商店的某款 商品近5个月的月销售量y(单位:千瓶)如下表: 第x个月 1 2 3 4 5 月销售量y2.532 44.85.5 若变量y和x之间具有线性相关关系,用最小二乘法 轮总复习 建立的经验回归方程为下=0.76x+a,则下列说法正确 的是 ()》 A.点(3.4)一定在经验回归直线分=0.76x+a上 名师点拨:一元回归模型问题的解法 B.a=1.72 1.求经验回归方程: C.相关系数r<0 (1)利用公式,求最小二乘估计6,a 249 D.预计该款商品第6个月的销售量为7800瓶 (2)待定系数法:利用经验直线过样本点中心求 2.(2023·河南安阳开学考)2022年6月某一周, 系数 “东方甄选”直播间的交易额共计3.5亿元,数据统计 2.利用经验回归方程进行预测: 如下表: 把经验回归直线方程看作一次函数,求函数值, 第1天 2 3 3.利用经验回归直线判断正、负相关: 456 7 交易额y/千万元为为y为 决定正相关还是负相关的是最小二乘估计, 【变式训练】 (1)通过分析,发现可用线性回归模型拟合交易 额y与1的关系,请用相关系数(系数精确到0.01)加 1.(多选题)(2024·辽宁十校联合体调研)对于变量x 以说明: 和变量y,通过随机抽样获得10个样本数据(x,y,) (i=1,2,3,…,10),变量x和变量y具有较强的线 (2)利用最小二乘法建立y关于:的经验回归方 性相关并利用最小二乘法获得回归方程为y=-2x 程(系数精确到0.1),并预测下一周的第一天(即第8 +a,且样本中心点为(6,9.3),则下列说法正确的 天)的交易额。 是 () 参考数据:(4-)(-y)=42.1, A.变量x和变量y呈正相关 √(x-)2=81w7=2.65. B.变量x和变量y的相关系数r<0 C.a=21.3 D.样本数据(5,12)比(7,5)的残差绝对值大 2.(2024·山东济南摸底)随若科技的发展,网购成了 人们购物的重要选择,并对实体经济产生了一定影 表中:=n(-25).=号名 响.为了解实体经济的现状,某研究机构统计了一个 (1)根据散点图判断,①y=a+br与②y=d·c+ 大商场2018一2022年的线下销售额如下: 25哪一个更适宜作为该茶水温度y关于时间x的回归 方程类型?(给出判断即可,不必说明理由) 年份编号x 2 3 5 (2)根据(1)的判断结果及表中数据,建立该茶水 年份 20182019 202020212022 温度y关于时间x的回归方程: 销售额y(单位:万元)1513146512021060860 (3)已知该茶水温度降至60℃口感最佳,根据 (1)由表中数据可以看出,可用线性回归模型拟合 (2)中的回归方程,求在相同条件下冲泡的茶水,大约 销售额y与年份编号x的关系,请用相关系数加 需要放置多长时间才能达到最佳饮用口感? 以说明: 附:①对于一组数据(山1,,),(山,2),,(“。 (2)建立y关于x的回归方程,并预测2023年该商 ),其回归直线=a+Bu的斜率和截距的最小二乘 场的线下销售额 2(4,-)(- xy:-y 估计分别为B= ,&=m-Bu:②参考 参考公式及数据:r= (u-a)2 √(-m)(2-) 数据:eaw=0.92.e4=60,ln7=l.9,ln3=L.1,ln2 ✉0.7. a=y-a,2,=6100. 250 含=16589,√-5)-5) 1736. 2025 创 设 衡 角度2一元非线性回归模型 例(2024:重庆七校开学考试)中国茶文化博大精 名师点拨: 深,饮茶深受大众喜爱.茶水的口感与茶叶类型和 非线性相关问题一般通过换元法转化为线性相关 水的温度有关某数学建模小组为了获得茶水温度 (线性回归分析)问题解决 y℃关于时间x(min)的回归方程模型,通过实验做初 非线性经验回归方程转化为线性经验回归方程常 步处理得到如图所示散点图。 用方法 度℃ (1)若y=a+b,x,设1=压,则=a+bd 90 (2)若y=a+blnx,设t=lnx,则y=a+t. (3)若y=e,两边取自然对数得lny=lne1+ c2x,设=lny,a=lnc1,d=e1,则=a+ix 【变式训练】 50 (2024·南京师大苏州实验学校调研)2020年9月1 日至23日(日代码分别为1,2,…,23),某餐馆在区 域M内投放广告单数量y(万张)与日代码x的数据 符合回归方程分=心a““,则b= (精确到 三(属-0(-) 含(-)(- 小数点后两位)· 73.5 3.85 -95 -2.24 参考数据:y·乃·y=e7,x=12. 点 女 10 独立性检验一师生共研 例1.(多选题)(2024·重庆质检)千百年米,我国劳 总计 动人民在生产实践中根据云的形状、走向、速度 附:X2= n(ad-be)? 厚度、颜色等的变化,总结了丰富的“看云识天气”的 a+b)(c+d)(a+c)(b+其中n=a +b+c+d. 经验,并将这些经验编成谚语,如“天上钩钩云,地上雨 0.10 0.050.025 0.0100.005 0.001 淋淋”“日落云里走,雨在半夜后”…小波同学为了 2.706 3.841 5.024 6.635 7.879 10.828 验证“日落云里走,雨在半夜后”,观察了A地区的100 天日落和夜晚天气,得到如下2×2列联表,并计算得 到x=19.05,下列小波对A地区天气的判断正确的是 夜晚天气 日落云里走 下雨 未下雨 出现 25 5 未出现 25 5 4夜晚下雨的概率约为) B未出现~日落云里走,夜晚下雨的概率约为2 C.依据α=0.005的独立性检验,认为“日落云里 名师点拨:解独立性检验的应用问题的关注点 走”是否出现与夜晚天气有关 1.两个明确: D.依据α=0.005的独立性检验,若出现“日落云 (1)明确两类主体.(2)明确研究的两个间题。 里走”,则认为夜晚一定会下雨 2.两个关键: 2.(2024·河北秦皇岛部分学校检测)某市电视 (2)准确列出2×2列联表.(2)准确理解X2 轮总复习 台为了解一档节目收视情况,随机抽取了该市n对夫 注意:查表时不是查最大允许值,而是先根据题目 妻进行调查,根据调查得到每人日均收看该节目的时 要求的百分比找到第一行对应的数值,再将该数值对 间绘制成如图所示的频率分布直方图,收视时间不低 应的x。值与求得的X相比较.另外,表中第一行数据 25 于40分钟的观众称为“热心观众”,收视时间低于40 表示两个变量没有关联的可能性P,所以其有关联的可 分钟的观众称为“非热心观众”,已知抽取样本中收视 能性为1-. 时间低于10分钟的有10人 【变式训练】 (2024·湖北武汉部分学校调研)近期世界地震、洪 E 水,森林大火等自然灾害频繁出现,紧急避险知识越 23 来越引起人们的重视.某校为考察学生对紧急避险 0.022 0.020 0.018 知识的掌握情况,从全校学生中选取200名学生进 行紧急避险知识测试,其中男生110名,女生90名. 0.005 所有学生的测试成绩都在区间[50,100]范围内,由 010230)4050(0 测试成绩数据作出如图所示的频率分布直方图. 饥 (1)求n,p: 0.04 (2)根据已知条件完成下面2×2列联表,试根据 003 小概率值α=0.05的独立性检验,分析“热心观众”是 0.025 0.02 否与性别有关 11 非热心观众 热心观众 总计 男 0V5060708090100筑 (1)若从频率分布直方图中估计出样本的平均数与 0.1 0.05 0.01 中位数相等,求图中m的值: 2.706 3.841 6.635 (2)规定测试成绩不低于80分为优秀,已知共有45 名男生成绩优秀,完成下面的列联表,并根据小 概率值α=0.05的独立性检验,能否推断男生和 女生的测试成绩优秀率有差异? 测试成绩 性别 合计 优秀 不优秀 男生 45 女生 合计 参考公式与数据X=(a+b)(c+d)(a+c)(b+d) n(ad-be)2 名师讲坛·素美提升 重温高考 例1.(2021,全国高考乙卷)某厂研制了一种生产高-10.3)2+(10.5-10.3)1=0.04, 252 精产品的设备,为检验新设备生产产品的某项指 (2)由(1)知y-x=10.3-10=0.3,2 居+国 标有无提高,用一台旧设备和一台新设备各生产了10 W10 2p25 件产品,得到各件产品该项指标数据如下: 0.036+0.04 年 旧设备9.810.310.010.29.99.810.010.110.29.7 10 =2√0.0076, 新设备10.110.410.110.010.110.310.610.510.410.5 则0.3=√0.09>20.0076=√0.0304, 新 旧设备和新设备生产产品的该项指标的样本平均 所以可判断新设备生产产品的该项指标的均值较 计 数分别记为x和y,样本方差分别记为和号, 旧设备有显著提高. (1)求x,y,,s: 2.(2021·全国高考)甲、乙两台机床生产同种产 (2)判断新设备生产产品的该项指标的均值较旧 品,产品按质量分为一级品和二级品,为了比较两台机 + 床产品的质量,分别用两台机床各生产了200件产品, 设备是否有显著提高(如果y-x≥2, 10 ,则认为 产品的质量情况统计如下表: 新设备生产产品的该项指标的均值较旧设备有显著提 级品 二级品 合计 高,否则不认为有显著提高)。 甲机床 150 50 200 [解析](1)由题中数据可得 x=98+103+10+102+9.9+9.8+10+10.1+10.2+9.7 乙机床 120 80 200 10 合计 270 130 400 =10 y=10.1+10.4+10.1+10+10.1+10.3+10.6+10.5+10.4+10.5 (1)甲机床,乙机床生产的产品中一级品的频率 10 分别是多少? =10.3. (2)能否有99%的把握认为甲机床的产品质量与 =(9.8-1002+(10.3-10.02+(10.0 乙机床的产品质量有差异? n(ad-be)2 -10.0)2+(10.2-10.0)2+(9.9-10.0)2+(9.8- 附:X=(a+b)(c+d)(a+c)(b+d西 10.0)2+(10.0-10.0)2+(10.1-10.0)2+(10.2 P(x2≥x.) 0.050 0.010 0.001 10.0)2+(9.7-10.0)2]=0.036. 3.841 6.635 10.828 号=(101-10.3)2+(10.4-10.3+(10.1 [解析](1)甲机床生产的产品中的一级品的频 -10.3)2+(10.0-10.3)2+(10.1-10.3)2+(10.3 ,3)2+(10.6-10.3)2+10s。22/104率为 =75%, 乙机床生产的产品中的一级品的颜率为)02(2020·高考课标Ⅱ卷)某沙漠地区经过治理,生态 200 系统得到很大改善,野生动物数量有所增加。为调查 =60% 该地区某种野生动物的数量,将其分成面积相近的 (2)X2.400x50×80-120x50y.400 10> 200个地块,从这些地块中用简单随机抽样的方法 270×130×200×200 39 抽取20个作为样区,调查得到样本数据(x,y,)(i= 6.635=xa0, 1,2,…,20),其中x:和y:分别表示第i个样区的植 故能有99%的把握认为甲机床的产品与乙机宋 物覆盖面积(单位:公顷)和这种野生动物的数量, 的产品质量有差异。 【变式训练】 并计算得京=60,名=120.名(-02=0, 1.(2020·新高考I)为加强环境保护,治理空气污 含(-列=900.2(-0(-)=800 染,环境监测部门对某市空气质量进行调研,随机抽 (1)求该地区这种野生动物数量的估计值(这种野 查了100天空气中的PM2.5和S02浓度(单位: 生动物数量的估计值等于样区这种野生动物数 ug/m3),得下表: 量的平均数乘以地块数): S03 (2)求样本(x,y,)(i=1,2,…,20)的相关系数(精 [0.50] 50.150 (150.475 PM2.5 确到0.01): [0,35] 32 18 (3)根据现有统计资料,各地块间植物覆盖面积差 异很大.为提高样本的代表性以获得该地区这 (35,75] 6 8 12 种野生动物数量更准确的估计,请给出一种你 (75,115 2 7 9 认为更合理的抽样方法,并说明理由。 (1)估计事件“该市一天空气中PM2.5浓度不超过 75,且S02浓度不超过150”的概率: 附:相关系数r= 含--列 =,2 (2)根据所给数据,完成下面的2×2列联表: √含(-y- s0 1.414 [0.150 (150,475 PM2.5 [0,75] 轮总复习 (75,115 (3)根据(2)中的列联表,判断是否有99%的把握认 为该市一天空气中PM2.5浓度与S0浓度 有关 253 n(ad-be)2 附:X=(a+b(c+)(a+c)(b+d P(X≥x。) 0.050 0.010 0.001 3.841 6.635 10.828 温馨提示:复习至此,请完成练案[620.07×5×52.5+0.06×5×57.5+0.04×5×62.5+0.02×5× 67.5=57.25,所以D错误.故选D. 放B错误:被抽取的学生每天的读书时间的平均数为铝×27 9.ABC可求甲乙平均数为x,=x2=7,中位数均为7,故A,B正 +忍x31+测×3.3=3(小时),故C正确:被抽取的学生每 30 100 确:甲的极差为6,乙的极差为4,故C正确:甲的方差为:7× 1 天的读书时同的方差为想×1+(27-3)1+品×2+ (1+4+4+9+4+9+9)=号.乙的方差为:7×4+4+1+1 +1+山)=号,故D箭误 (31-3门+0×3+3.3-3)门=196估计全体学生 每天的读书时间的方差为s2=1.966,故D正确.故选ACD. 10.AC从0个个体中随机抽取一个容量为10的样本,则每个 3.BD名,,的平均数不一定等于x,,…,x。的平均数, 个体被抽到的既华都是品=025,故A正确:已知-一组数据, A错误考,离的中位数等于产,,,的中位 2,m,6,7的平均数为4,则m=4×5-(1+2+6+7)=4,这组 数等于产,B正确:设样本数据,…,为0,1,2,8,9。 数据的方差为5×(1-4)2+(2-4)产+(4-4)2+(6-4) 2 10,可知,,…,6的平均数是5,2,x3,,的平均数是5, +(7-4]-,故B错误:这组数据从小到大排列为:山, ,…6的方差=右×[(0-5)2+(1-52+(2-5)2+ 14,15.17.19,23,26,31,共8个,故其50%分位数为第4个数 17和第5个数19的平均数,为18.故C正确:若样本数据x (8-5P+(9-5列+(0-5门=号西的方差号= 名,…,×,的标淮差为4,则方差为16,故数据2x1+1,22+1, …,2x。+1的方差为16×22=64,标准差为8.故D错误故 4x[1-5)产+2-52+(8-5+(9-501=2 >. 选AC 六>,C错误:6>,2>无,n-需>-,D正确.故 11,BCD根据平均数的性质可知x=x'不一定成立,例如九个数 选BD. 一个90,其他都是80,显然该等式不成立,因此A不正确:根据 4.B根据条形图可知,2017~2021年全国居民人均可支配收人 中位数的定义可知这九个数据从小到大排列,中间的一个数 逐年递增,A错误.根据扇形图可知,2021年全国居民人均消费 据是中位数,去掉最高和最低不影响中间的数据,所以B正 支出为:5641+1419+7178+569+2115+2599+3156+ 确:根据标准差的意义可知去掉最高和最低分,数据有可能会 1423=24100元,B正确.根据条形图可知,.2020年全国居民人 更集中,所以选项C正确:因为去掉最高和最低分,极差有可 均可支配收人较前一年上升,C错误.2021年全国居民人均消 能减小,所以选项D正确,故选BCD. 费支出构成中食品纲酒和居住占比.7178+5641×100%一 12.BD根据样本的抽样比等于各层的抽样比,样本容量为9÷ 24100 3 3+i+2=18,故选项A错误;样本数据落在区间[114.5, 53.2%<60%,D错误,故选B. 5.[解桥1().5+533+551+5边+575+54+54+58+%+548 124.5]内的有120,122,116,120共4个,所以样本数据落在区 =552.3, 间[14.5,1245]内的频率为=0.4,故选项B正确:甲,乙 )=536+527+543+530+560+533+522+50+576+536. 两队的人数之比为1:3,则甲队队员在所有队员中所占权重 10 为中有子,乙队队员在所有队员中所古权重为,=子则 3 541.3. 2=x-y=552.3-541.3=11,=x-y的值分别为:9.6,8. 甲,乙两队全部队员体重的平均数为:子×60+子×68= -8,15,11.19.18.20,12, 66,故选项C错误:将该组数据从小到大排列为:1,2,2,2,3,3 =0x[(9-12+6-)产+(8-12+(-8-2+ 3.4,5.6,由10×85%=8.5.则该组数据的85%分位数是第9 (15-11)2+0+(19-11)2+(18-11)2+(20-11)2+(12 个数,该数为5,故选项D正确. 11)2]=61. 13.ACD2023年1月至6月的月销售额的极差为8.故A正确: 因为6×60%=3.6,所以2023年1月至6月的月销售额的第 (2)由(1)知:=1山,2√0 =26.1=/24.4,做有a≥ 60百分位数为11.故B错误:2023年1月至6月的月销售额的 中位数为9.5.故C正确:设2022年5月的月销售额为x万元 2√0,所以认为甲工艺处理后的橡胶产品的伸缩事较乙工艺 则-x100%=10%,解得x=10,故D正确.故选ACD. 处理后的橡胶产品的伸缩率有显著提高 14,2.5由题意知1++3…+0=4×10=40,又2= (1-4)2+(3-4)2+(53-4)2+…+(xm-4)2 第二讲成对数据的统计分析 10 写+号+写+…+-8(1+为十石“+xm)+16×10 知识梳理·双基自测 10 知识梳理 185-8×40+16×10=18.5-32+16=2.5. 知识点一 10 1,去精确地决定 15.①②a=0.1-(0.005+0.01+0.02+0.035)=0.03.①正2.点 确.平均身高:105×0.05+115×0.35+125×0.3+135×0.23.增加减小 +145×0.1=124.5(m),2正确.由(x-120)×0.03=0.1得 4,正相关或负相关一条直线非线性相关或曲线相关 x=123.3(cm),③错.身高的众数为115cm.④猎.故填①2 B组能力提升 (x,-x)(-) 5 1C由题意得生=冬×(13-)加9放选C 5 正相关负相关越强 -·√- 2,ACD根据分层抽样,分别从高一学生,高二学生,高三学生中 越弱 抽取40人,30人,30人,故A正确:抽取的高二年级每天的总读 知识点二 书时间为x:×30=93,抽取的高一年级每天的总读书时间为x 1.br+a+e02因变量或响应变量自变量或解释变量 ×40=108.高二年级每天的总读书时间比高一年级少15小时,:2.于=x+4经验回归直线最小二乘法最小二乘估计 630 3.观测值预测值残差残差分析三(-)户小好 例2:[解析] (10因为1=4,(4-02=28 大是 知识点三 84-0g-0=42.1√0-=81. 2.a+bb+d a+h+e+d 3.P(Y=11X=0)=P(Y=IIX=1) 所以r= 含4-0(y- 42.1 n(ad-bc)2 2×2.65×8.7=0.98. (a+b)(c+d)(a+c)(b+d) 临界值不独立超过: (4-)2Σ(y-y)2 独立 固为交易颜y与1的相关系数近似为0.98,说明交易额y与1 双基自测 具有很强的正线性相关关系, 1.(1)V(2)×(3)V(4)X(5)V(6)× 从而可用线性回归模型报合交易额y与·的关系。 2.BD 2)图为y==5,24,-102=28。 3.两种疗法效果没有差异由题意的两种疗法数据的列联表 疗效 疗法 合计 所以i含4-Dx- 421e1.5 未治愈 治愈 £4,- 28 甲 15 52 67 a=y-M≈5-1.5×4=-1,所以y关于1的回归方程为 1.51-1. 6 63 69 将‘=8代入回归方程得y=1.5×8-1=11(千万元)=1.1 合计 21 115 136 (亿元), 根据列联表中的数据,经计算得到 所以顶测下一周的第一天的交易额为1.1亿元 X=136x15x63-52×6 变式训练 67×69×21×115 年4.881<7.879=xnm5 1.BC由于回归方程中x的系数为-2,故变量x和变量y呈负相 根据小概率值=0.005的独立性检验 关,且相关系数r<0,因此A选项措误,B选项正确:将(6,9.3》 认为两种疗法效果没有差异。 代入回归方程,解得a=21.3,故C选项正确:矿=-2x+21.3样 4.C根据散点的集中程度可知,花瓣长度和花萼长度有相关性 本数据(5,12)的残差为e,=12-(-2×5+21.3)=0.7,样本 A选项错误:散点的分布是从左下到右上,从而花瓣长度和花萼 数据(7,5)的残差为c=5-(-2×7+21.3)=-2.3,故1e, 长度呈现正相关性,B选项错误,C选项正确:由于r=0.8245 <|I,因此D选项错误,故选BC 是全部数据的相关系数,取出来一部分数据,相关性可能变强,2.[解析】(1)由已知数据可得,x=3, 可能变端,即取出的数据的相关系数不一定是0.8245,D选项 错误.故选C 5.[解析] 根据已知数据得到列联表如下: 5 5 公司准点班次数 未准点班次数 合计 所以三-50=16589-5×3×1220=-1711, A 240 20 260 所以,r= 手-5 -1711-0.9856 少 210 30 240 /(2-5x2)(27-57) 1736 合计 450 50 500 因为1非常接近I,所以可用线性回归模型拟企销售额y与年 n(ad-be)? 份编号x的关系 X=(a+b(c+i)(a+cb+西 (2)由已知数揭可得,=P+2+3+4+5=5, _500×240x30-210×202=3.205>2.706. 260×240×450×50 Σ-5y 所以有90%的把握就为甲,乙两城之间的长途客车是否准点与 所以6- 16589-5x3×1220=-171.1. 55-5×3 客车所属公司有关 -5 考点突破·互动探究 a=y-bx=1220-(-171.1)×3=1733.3, 考点1 所以,y关于x的回归方程为了=-17L.1x+1733.3, 例1:B从散点图中可知.删除点B后,样本数据的两变量x,y负 令x=6,则y=-171,1×6+1733.3=706.7(万元) 相关,所以A错误:由于B点较其他点偏离程度大,故去掉B 所以预浦2023年该商场的线下销售额为706.7万元 点后,回归效果更好,从而相关系数「的绝对值更接近于1,角度2 所以B正确:同理决定系数R越接近于1,所以新样本的残例:[解析】(1)根据散点图,更适合的回归方程为y=d·c 差平方和变小,所以C错误:从而解释变量x与响应变量y +25. 相关性增强,所以D错误.故选B (2)由y=d·e+25,可得y-25=d·e° 例2:AC由散点图可知,线性相关系数r,的图象表示y与x成负 两边取自然对数,得ln(y-25)=nd+x·lmc, 相关,故-1<,<0,故A正确:线性相关系数2的图象表示 令w=ln(y-25).则w=lnd+x·lne, y与x正相关,做1>>0,故B错误:线性相关系数53的 点较线性相关系数的点密集,故12>|11,故1+3>0. 计算,得=名=3,(属-)=28 故C正确,D错误.故选AC 变式训练 则1立-x)(-0)=-224=-0.08. C根据散点图的分布可得:身高和体重成正相关.故选C (x-x) 28 考点2 角度1 则c=e0.92, 阙1:B=5×1+2+3+4+5)=3,=写×(25+3.2*4 由lnd=w-x·lnc=3.85-3×(-0.08)=4.09 则d=e+m=60, +4.8+5.5)=4,样本点中心(3,4)一定在经验回归直线上 即茶水温度y关于时间x的回归方程为了=60×0.92”+25 即4=0.76×3+4.则a=1,72,A、B正确:变量x与y成正相 (3)在25℃室温下,茶水温度降至60℃口感最佳, 关,相关系数r>0,C错误:当x=6时,y=0.76×6+1.72= 6.28,预计该款商品第6个月的销售量为6280瓶,D错误, 即=60时.0.92°=60-25.Z 60=12 631 7 可得r…l血0.92=n2=lh7-2h2-血3=-0.6, 女生 25 65 90 期060-15 合计 70 130 200 于是X的观测值为 故在室湿下,刚泡好的茶水大约需要放置7.5mm才能达到最 佳引用口感, X.20x45x6525x65260-3.752<a.841. 110×90×70×130 693 变式调练 0.29对方=eaw+取对数,得lny=bc+0.38,所以ny与x为 所以根据小概率值a=0.05的独立性检验,认为男生和女生的 测试成绩优秀率没有差异 线性相关关系。因为加(为·为·为…)=89.7,所以 n+n为+n5+…+ln拉=3.9,所以3.9=126+0.38,所 名师讲坛·素养提升 23 变式训练 以b=0.29 1.[解析](1)根据抽查数据,该市100天的空气中PM2.5浓度 考点3 不超过75,且S0,浓度不超过150的天数为32+18+6+8= 例1:ABC根据列联表可知,100天中有50天下雨,50天未下雨。 64,因此,该市一天空气中P2.5浓度不超过75,且S0浓度不 因此仪晚下雨的概率约为治:宁A正确:未出现~日落云 短址150的授率的估计值为 =0.64. 25 5 里走“,夜晚下雨的概率约为25十5子,B正确状=19.05 (2)根据抽查数据,可得2×2列联表: >7.879=,因此依据a=0.005的独立性检验,认为“日 sO: [0.150] (150.475] 落云里走”是否出现与夜晚天气有关,C正确:依据a=0.005 PM2.5 的独立性检验,可判断“日落云里走,雨在半夜后”的说法犯 错误的概率小于0.005.但不代表一定会下雨,D错误.故 [0.75 64 16 选ABC (75,1151 10 10 例2:[解析](1)收视时间在0-10分钟组的频率为1-(0.018 +0.022+0.025+0.020+0.005)×10=0.1. (3)根据(2)的列联来得 ÷p=0=0.01. X=100x(64x10-16x102 7.484 10 80×20×74×26 又:收视时何低于10分钟的有10人, 由千7.484>6.635=.m,故有99%的把握认为该市一天空气 2=号=0 中PM2.5浓度与S0泼度有关。 (2).n=50. 〔解析]山)样区野生动物平均数为0=0×1200=6 .“热心观众"有2×50×(0.020+0.005)×10=25人, 地块数为200,该地区这种野生动物的估计值为200×60= 则2×2列联表如下所示: 12000. 非热心观众 热心观众 总计 (2)样本(x,出)(i=1,2,…,20)的相关系数为r= 35 15 50 4--列 800 220.94 √80×90003 女 40 10 50 V(-x)Σ-) 总计 75 25 100 (3)更合理的抽样方法是分层抽样。根据植物覆盖面积的大小 对地块分层,再对200个地块进行分层抽样,由(2)知各样区的 零假设瓜:“热心观众”与性别无关联 这种野生动物的数量与植物覆盖面积有很强的正相关性, 将2×2列联表数据代入公式计算得:X 由于各地块回植物履蒌面积差异很大,从而各地块间这种野生 100×(35×10-40×15) 动物的数量差异很大, 50×50×75×25 -=1.333<3.841 采用分层抽样的方法较好地保持了样本结构与总体结构得以 根据小概率值:=005的独立性检验,浸有充分证据证明 执行,提高了样本的代表性。 H。不成立, 从而可以获得该地区这种野生动物数量更准确的估计 因此可认为H。咸立,即认为“热心死众”与性别无关联」 变式调练 练案[62] [解析](1)依题意,顿率分布直方图中左起第一个小短形的 高为:0.1-m-0.04-0.025-0.01=0.025-m. A组基础巩固 样本平均数的估计值为: L.C画出散点图,易知选C 10×[(0.025-m)×55+m×65+0.04×75+0.025×85+0.01 2.D从图中可以看出D(10.2)较其他点,偏离直线远,故去掉 ×95]=74.5+100m,显然数据落在区问[80,100]的频率为 D(10,2)后,回归效果更好,相关系数1r1越接近于1,模型的拟 0.25+0.1=0.35,落在[70,100]的频率为0.4+0.35=0.75, 合效果越好,若去掉D(10.2)后.相关系数r变大,故A错误:决 因此样本中位数在区间(70,80)内,其估计值为:70+10× 定系数R越接近于1,模型的拟合效果越好,若去掉D(10,2】 0.05-0.025=76.25 后,决定系数R变大,故B错误:残差平方和越小,模型的拟合 0.04 效果越好,若去掉D(10,2)后,残差平方和变小,故C错误:若 则74.5+100m-76.25,解得m=0.0175, 去掉D(10,2)后,解释变量与预报变量y的相关性变强,且是 所以m=0.0175. 正相关,故D正确 (2)总的成绩优秀人数为:200×10×(0.025+0.01)=70, 得到列联表为: 3.D由题意.得=5(20+30+40+50+60)=40.7= (25+ 测试成绩 27.5+29+32.5+36)=30,则k=y-0.25x=30-0.25×40= 性别 合计 优秀 不优秀 20,故A正确:由线性回归方程可知,6=0.25>0,变量x,y呈正 相关关系,故B正确:若x的值增加1,则y的值约增加0.25,故 男生 45 65 110 C正确:当x=52时,y=0.25×52+20=33,故D错误.故选D. 632

资源预览图

9.2 成对数据的统计分析-【衡中学案】2025年高考数学一轮总复习学案(新教材)
1
9.2 成对数据的统计分析-【衡中学案】2025年高考数学一轮总复习学案(新教材)
2
9.2 成对数据的统计分析-【衡中学案】2025年高考数学一轮总复习学案(新教材)
3
9.2 成对数据的统计分析-【衡中学案】2025年高考数学一轮总复习学案(新教材)
4
所属专辑
相关资源
示范课
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。