重难点培优02统计解答题全题型归纳(培优讲义)(全国通用)2027年高考数学一轮复习高效培优系列
2026-08-12
|
2份
|
98页
|
549人阅读
|
7人下载
精品
摘要:
该高中数学高考复习讲义聚焦统计解答题核心考点,涵盖频率分布直方图、线性回归、非线性建模、残差分析、独立性检验及统计新定义等题型,按知识精讲、题型深研、分层训练逻辑架构,通过考点梳理、方法指导、真题演练环节,帮助学生构建统计问题解题体系。
资料以“数学思维”“数据观念”为导向,创新设计非线性回归换元转化、残差图分析等解题策略,设置巩固过关与创新提升分层练习,精准对接高考命题规律,助力学生高效突破统计难点,为教师把控复习节奏、提升学生应考能力提供系统教学支持。
内容正文:
重难点培优02 统计解答题全题型归纳内容导航
知识精讲·重难聚焦讲技巧 1
题型深研·通法变式提能力 5
题型1 频率分布直方图 5
题型2 一元线性回归方程 8
题型3 非线性回归建模 12
题型4 残差分析与决定系数 17
题型5 卡方独立性检验 21
题型6 统计新定义综合 24
分层进阶·双阶训练验成效 28
巩固过关 28
创新提升 36
知识精讲·重难聚焦讲技巧
知识点1 频率分布直方图
1.频率分布直方图的特点
(1)横轴:数据分组区间,每组区间长度称为组距;纵轴:,矩形面积代表该组对应频率。
(2)全部小矩形面积之和恒等于 1,代表样本全部数据的总频率。
(3)频数、频率、样本总量关系:单组频数 = 样本总数 × 该组矩形面积;单组频率 = 。
2.频率分布表与频率分布直方图的制作步骤
与画频数分布直方图类似,我们可以按以下步骤制作频率分布表、画频率分布直方图.
第一步,求极差
极差为一组数据中最大值与最小值的差.
第二步,决定组距与组数
第三步,将数据分组
通常对组内数据取_左闭右开区间,最后一组数据取闭区间.
第四步,列频率分布表
计算各小组的频率,例如第一小组的频率是,作出频率分布表,
第五步,画频率分布直方图
画图时,以横轴表示分组,纵轴(小长方形的高度)表示.
3. 从频率分布直方图中估计数字特征
众数:最高矩形底边中点的横坐标.
中位数:使直方图左、右两边面积相等的分界线与横轴交点的横坐标;估计中位数时必须保证两侧面积之和恰好为0.5,不可直接取最高矩形中点.
平均数:每一组区间中点数值乘以本组频率,全部乘积相加得到整体均值,即每个小矩形的面积 × 小矩形底边中点的横坐标之和.
4. 百分位数计算
(1)第百分位数(p%分位数)的定义:一般地,一组数据的p%()分位数是这样一个值,它使得这组数据中至少有的数据不大于该值,且至少有的数据不小于该值.
(2)利用直方图求解百分位数的步骤:
第1步,按从小到大排列原始数据.
第2步,计算
第3步,若不是整数,而大于的比邻整数为,则第百分位数为第项数据;若是整数,则第百分位数为第项与第项数据的平均数
知识点2 样本相关系数
1.样本相关系数:设由变量x和y获得的两组数据分别为和(i=1,2,…,n),其对应关系如下表所示:
变量x
…
变量y
…
两组数据和的线性相关系数是度量两个变量x与y之间线性相关程度的统计量,
其计算公式为,
其中,,,它们分别是这两组数据的算术平均数.
2.相关系数r与相关程度
(1)当时,称成对样本数据正相关;
当时,成对样本数据负相关;
当时,成对样本数据间没有线性相关关系;
(2)样本相关系数r的取值范围为[-1,1];
当越接近1时,成对样本数据的线性相关程度越强;
当越接近0时,成对样本数据的线性相关程度越弱.
知识点3 一元线性回归模型
1.模型
为关于的一元线性回归模型。是因变量(响应变量),是自变量(解释变量);为截距参数,为斜率参数;代表随机误差。若,与满足确定一次函数关系。
2.最小二乘估计
称作经验回归方程,对应直线为经验回归直线,回归直线必过样本中心点。
通过最小二乘法求解,二者分别是参数的最小二乘估计,斜率用来衡量自变量每增加 1 个单位,因变量预测值的平均变化量;截距表示自变量取 0 时的预测基准值,无实际物理意义时仅作计算参数。
配套对应计算公式,其中
最小二乘法是通过使全部样本观测值与预测值差值的平方总和达到最小,以此确定。
知识点4 非线性回归模型
1. 非线性建模步骤:
(1)绘制两组变量对应散点图,根据散点分布升降增速判断适配曲线模型;
(2) 构造全新替换变量,完成非线性表达式向线性表达式的转化;
(3) 依据线性回归公式计算转换后模型的斜率与截距;
(4) 将替换变量回代原式,书写原始变量对应的非线性回归解析式。
2.常见可线性化模型换元方法
(1)幂型函数 (其中,)
对等式 的两侧同时取常用对数,可得:。
令 ,原式即可改写为 ,式中 均为常数,此时 与 满足线性函数关系。
(2)指数型函数 ( 且 )
对 两侧同时取常用对数,得到:。
令 ,原式转化为 ,其中 为常数。
此时 和 构成线性函数关系;和幂函数变换方式区分:自变量保持不变,使用的常用对数替换原有因变量。
(3)反比例函数
令 ,可得关系式 , 与 呈线性函数关系。
(4)二次函数
令 ,原函数化为 , 与 构成线性函数关系。
(5)对数型函数
令 ,原函数能够简化为 , 与 满足线性函数关系。
知识点5 残差、残差图与决定系数R2
1.残差
响应变量实际测量得到的数值为观测值,代入回归方程算出的数值为预测值;观测值减去预测值的结果叫做残差,即
2.残差图
作图时纵坐标为残差,横坐标可以选为样本编号,或身高数据,或体重估计值等,这样作出的图形称为残差图.若残差点比较均匀地落在水平的带状区域内,带状区域越窄,则说明拟合效果越好.
3.残差分析
残差可以估算随机误差,借助残差能够判断回归模型贴合数据的效果,同时排查原始数据里的异常可疑值,整套分析流程为残差分析。
残差点均匀落在水平带状区域内,则模型拟合效果良好;决定系数,数值越靠近 1,模型拟合效果越好。
4.残差平方和
残差平方和独立性检验中几个常用的小概率值和相应的临界值
0. 1
0. 05
0. 01
0. 005
0. 001
2. 706
3. 841
6. 635
7. 879
10. 828
越大,即拟合效果越好,越小,模型拟合效果越差.
知识点6 独立性检验
1.关于分类变量X和Y的抽样数据的2×2列联表:
X
Y
合计
Y=0
Y=1
X=0
a
b
a+b
X=1
c
d
c+d
合计
a+c
b+d
n=a+b+c+d
2.独立性检验
(1)定义:借助卡方统计量判断两个分类变量是否相互独立,该方法叫独立性检验;
(2)卡方公式:,总样本量;
3.标准临界数值对照表
0. 1
0. 05
0. 01
0. 005
0. 001
2. 706
3. 841
6. 635
7. 879
10. 828
4.基于小概率值的检验规则是:
当时,我们就推断不成立,即认为和不独立,该推断犯错误的概率不超过;
当时,我们没有充分证据推断不成立,可以认为和独立.
5.独立性检验步骤
(1)提出零假设:变量相互独立,结合题意说明含义;
(2)根据统计数据搭建2×2列联表,计算数值,和给定临界值对比;
(3)对照检验标准,给出独立性相关推断结论;
(4)若判定变量不独立,可对比各组频率,分析变量间的影响规律。
题型深研·通法变式提能力
题型1 频率分布直方图
【典例1-1】(25-26高一下·四川乐山·期末)从某小区抽取100户居民进行月用电量调查,发现他们的用电量都在之间,进行适当分组后(每组为左闭右开的区间),画出如图所示的频率分布直方图.
(1)计算直方图中的值.
(2)在被调查的用户中,用电量落在以上的户数为多少?
(3)为引导居民节约用电,电力公司拟采用分层定价策略:设定一个月用电量参考值,使小区约半数用户用电量低于该值、半数高于该值,并据此对低于者执行基础电价、高于者执行阶梯加价.请根据频率分布直方图估计该参考值(精确到0.01).
【典例1-2】(25-26高三下·河南周口·阶段检测)某市为提高市民对文明城市创建的认识,举办了“创建文明城市”知识竞赛,从所有答卷中随机抽取100份作为样本,将样本的成绩分成,,,,这五组,得到如图所示的频率分布直方图.
(1)估计样本成绩的平均数及方差;(同一组中的数据用该组区间的中点值作为代表)
(2)已知落在内的平均成绩是80分,方差是4分,落在内的平均成绩是88分,方差是6分,求两组成绩合并后的平均数和方差.
附:设两组数据的样本量、样本平均数和样本方差分别为m,,;n,,,记两组数据总体的样本平均数为,则总体样本方差.
方法技巧
利用矩形总面积恒等于1的条件求解直方图未知纵轴参数;依次计算样本众数、平均数、百分位数;结合分层抽样比例计算分层抽取样本数量;利用样本频率估算总体对应样本容量;搭配古典概型求解分层抽样后随机抽取对应事件发生概率。
【变式1-1】(25-26高一下·吉林长春·期末)中国AI大模型正处于一个技术进步迅速、市场规模快速增长的爆发式发展阶段.为了了解中国AI大模型用户的年龄分布,A公司调查了500名中国AI大模型用户,统计他们的年龄(都在内),按照,,,,进行分组,得到如图所示的频率分布直方图.
(1)求这500名中国AI大模型用户的年龄在内的人数;
(2)估计这500名中国AI大模型用户年龄的平均数(各组数据以该组区间的中点值作代表).
【变式1-2】(25-26高一下·全国·课堂例题)下表给出了某校500名12岁男孩中用随机抽样得出的120人的身高资料(单位:cm):
区间界限
人数
5
8
10
22
33
区间界限
人数
20
11
6
5
(1)列出样本的频率分布表(频率保留两位小数);
(2)画出频率分布直方图;
(3)估计身高低于134cm的人数占总人数的百分比.
题型2 一元线性回归方程
【典例2-1】(25-26高二下·辽宁朝阳·期末)对于变量x和变量y,设获得的成对数据为,,…,,其中,.在某实验过程中,随机抽样获得了如下成对样本数据:
表1:
x
100
110
120
130
140
150
160
170
180
190
y
40
47
56
61
66
72
74
78
83
86
对表1中数据作变换,得到了如下表2:
表2:
序号
1
2
3
4
5
6
7
8
9
10
u
-5
-4
-3
-2
-1
0
1
2
3
4
-5
v
-30
-23
-14
-9
-4
2
4
8
13
16
-37
150
92
42
18
4
0
4
16
39
64
429
设样本相关系数为r,当时,表明两个变量的线性相关程度较强,当时,表明两个变量的线性相关程度很强.
参考公式:;,.
参考数据:,,,,,,,,.
(1)证明:
(2)分别求表1中的两个变量x,y的样本相关系数r,并推断相关程度;
(3)设y关于x的经验回归方程为,反之,x关于y的经验回归方程为.由实验数据,利用参考数据求经验回归方程和(计算结果精确到0.01);
【典例2-2】(25-26高二下·吉林长春·期中)我国全面二孩政策已正式实施,这次人口与生育政策的历史性调整,使得“要不要再生一个”,“生二孩能休多久产假”等问题成为千千万万个家庭在生育决策上避不开的话题.为了解针对产假的不同安排方案形成的生育意愿,某调查机构随机抽取了200户有生育二胎能力的适龄家庭进行问卷调查,得到如下数据:
产假安排(单位:周)
14
15
16
17
18
有生育意愿家庭数(单位:户)
4
8
16
20
26
(1)建立变量关于的一元线性回归模型;
(2)用(1)中所求的经验回归方程来拟合这组成对数据,当样本数据的残差的绝对值大于1时,称该对数据为一个“次数据”,现从这5个成对数据中任取3个做残差分析,求取到的数据中“次数据”个数的数学期望.
附:经验回归直线的斜率和截距的最小二乘估计公式分别为,
参考数据:.
方法技巧
1.分别计算两组变量样本均值,所有、;
2.代入公式计算相关系数,根据大小说明线性相关强弱;
3.计算斜率,再利用求截距;
4.写出回归直线,根据正负判断增减;
5.将给定代入解析式,得到预测值,文字说明预测结论。
【变式2-1】(2026·河南·模拟预测)为研究新能源汽车的销售量变化情况,现统计了某市2025年第二、第三季度每个月的销售量(单位:万辆)如下表所示.
月份
4月
5月
6月
7月
8月
9月
月份代号x
1
2
3
4
5
6
销售量y
1.5
2.3
2.8
3.2
3.7
4.5
(1)求这6个月销售量数据的平均数和80%分位数;
(2)已知该市销售量y与月份代号x具有很强的线性相关关系,求y关于x的经验回归方程,并预测2025年12月份的销售量.
附:经验回归方程的斜率与截距的最小二乘估计公式分别为,,,.
【变式2-2】(2026高三·全国·专题练习)某厂为比较甲,乙两种工艺对橡胶产品伸缩率的处理效应,进行10次配对试验,每次配对试验选用材质相同的两个橡胶产品,随机地选其中一个用甲工艺处理,另一个用乙工艺处理,测量处理后的橡胶产品的伸缩率.甲,乙两种工艺处理后的橡胶产品的伸缩率分别记为,试验结果如下:
试验序号
1
2
3
4
5
6
7
8
9
10
伸缩率
545
533
551
522
575
544
541
568
596
548
伸缩率
536
527
543
530
560
533
522
550
576
536
记,记的样本平均数为,样本方差为.
(1)求;
(2)判断甲工艺处理后的橡胶产品的伸缩率较乙工艺处理后的橡胶产品的伸缩率是否有显著提高,(如果,则认为甲工艺处理后的橡胶产品的伸缩率较乙工艺处理后的橡胶产品的伸缩率有显著提高,否则不认为有显著提高).
题型3 非线性回归建模
【典例3-1】(25-26高二下·山西运城·期末)蝗虫会对农作物造成严重伤害,每只蝗虫的平均产卵数和平均温度有关.现收集到一只蝗虫的产卵数y(单位:个)和温度x(单位:℃)的8组观测数据,制成图1所示的散点图.现用两种模型:①,②分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图.
整理收集到的数据,得到下表:
24
2.9
646
168
422688
50.4
70308
表中,,,.
(1)根据残差图,选择哪个模型的拟合效果更好?说明理由.根据所选的模型,利用上表中的数据,求出y关于x的回归方程;
(2)据统计,该地每年平均温度达到30℃以上时蝗虫会对农作物造成严重伤害,需要人工防治,其他情况均不需要人工防治.若该地每年平均温度达到30℃以上的概率为,设该地今后5年需要人工防治的年数为,求的均值和方差.
附:对于一组数据,,…,,其回归直线的斜率和截距的最小二乘估计分别为,.
【典例3-2】(2026·辽宁沈阳·三模)某农业技术站研究化肥施用量对大棚青菜产量的影响.在一定范围内,施肥量(单位kg/亩)越大,青菜产量(单位kg/亩)越高.实验测得具体数据如下表:
施肥量
2
3
4
5
6
青菜产量
4200
4300
4350
4380
4400
根据散点数据特征,研究人员分析得出产量与施肥量近似满足的关系,取,经计算可知,,,,
(1)请根据上述数据,计算得出产量y关于施肥量x的回归方程,并结合常识描述的实际意义,为简化计算,计算过程中、均精确到个位数.
(2)若青菜的收购价格为2元/kg,化肥的采购价格为12元/kg,请从利润最大的角度给出大棚的最优施肥量.
参考公式:,.
方法技巧
1.观察散点图升降增速匹配适配非线性函数模型
2.通过对数、倒数、平方换元构造全新变量,将非线性表达式转化为线性回归形式
3.计算转换后两组变量均值,求解转换模型回归系数
4.将替换变量回代原始函数,书写原始变量非线性回归解析式
5.代入指定自变量数值完成数值预测;对比不同模型相关系数,选取拟合效果最优模型。
【变式3-1】(2026·山西临汾·一模)水体富营养化导致藻类大量繁殖,以2017年中国太湖蓝藻爆发为例:5月初监测发现湖体中蓝藻细胞密度为每升50万个,随着气温升高至25-30℃且氮磷营养盐浓度超标(总磷浓度达),蓝藻进入增长期.5月10日细胞密度增至每升200万个,5月15日突破每升800万个,5月20日达到每升3200万个,形成面积超150平方公里的绿色水华带.此次爆发导致湖区溶解氧骤降至以下,大量鱼类死亡,自来水厂被迫停产、所以对水资源的保护刻不容缓,现对某区域的藻类面积y(单位:平方公里)与时间x(单位:年)的关系,进行监测,得到如下数据:
x/年
1
2
3
4
5
6
7
y/平方公里
6
11
21
34
66
101
196
根据以上数据,绘制成如图所示的散点图:
观察散点图,两个变量不具有线性相关关系,现考虑用对数函数模型和指数函数模型分别对两个变量的关系进行拟合.
(1)根据散点图判断与(a,b,c,d均为常数)哪一个更适合作为藻类面积y(单位:平方公里)与时间x(单位:年)的关系的回归方程类型(给出判断即可,不必说明理由);
(2)根据(1)的判断结果及表中的数据,求出y关于x的回归方程;
(3)若不及时保护水质,当第八年检测时,请估计藻类面积为多少平方公里.
参考数据:
62.14
1.54
2535
50.12
3.47
其中,
参考公式:对于一组数据,,…,其回归直线的斜率和截距的最小二乘估计公式分别为,.
【变式3-2】(2026·上海奉贤·二模)某工厂生产的某种产品的月产量(单位:千件)与单位成本(单位:元/件)的数据如下:
月份
产量(千件)
单位成本(元/件)
1
2
73
2
3
72
3
4
71
4
3
73
5
4
69
6
5
68
(1)计算产量与单位成本的相关系数(无需过程);
(2)建立产量与单位成本的回归方程(写出必要的过程):
(3)若该工厂计划7月份生产7千件该产品,则单位成本预计是多少?
附:相关系数的计算公式:;
回归系数计算公式:,
题型4 残差分析与决定系数
【典例4-1】(2026·湖北武汉·一模)某医药研究所为了评估一种新药的疗效,开展了临床试验.研究人员记录了14名志愿者服用不同剂量的药物后,血液中某关键生化指标(单位:)随给药剂量(单位:mg)的变化情况.为了寻找最合适的预测模型,研究人员分别利用模型一和模型二对这14组数据进行了拟合,并绘制了相应的残差图(如图所示,图中纵轴为残差,横轴为给药剂量).
(1)观察残差图,判断哪个模型的拟合效果更好;
(2)设这14组数据得到的经验回归方程为.
(ⅰ)已知样本中的某位志愿者的给药剂量为,生化指标为.若该样本点在拟合效果更优的模型中的残差对应于图中标注的四点之一,请指出该点并说明理由;
(ⅱ)若在这14组数据中,给药剂量的标准差为,生化指标的标准差为,求生化指标与给药剂量的相关系数.(结果精确到)
参考公式:相关系数;经验回归方程中斜率和截距的最小二乘估计公式分别为,.
【典例4-2】(25-26高二下·广东湛江·期末)某款电动汽车由于其优异的性价比,逐渐在市场获得认可,订购数量日渐增多.根据统计数据,该款电动汽车某区域店过去周的订单数如下:
时间(周)
1
2
3
4
5
订单数(辆)
13
21
45
55
66
为了进一步了解订单数的变化情况,两个数学学习小组分别进行了研究,
(1)小组决定用线性回归模型进行拟合,求此时关于的线性回归方程;
(2)小组采用非线性回归模型进行拟合,求得关于的非线性回归方程为,并计算出决定系数.
①请计算小组线性回归方程的决定系数,并说明哪个小组的模型拟合效果更好;
②用①中选择的模型预测该区域第10周的订单数.
附:,;决定系数,
参考数据:,.
方法技巧
1.利用回归方程算出每组预测值;
2.依据残差,逐个计算每组样本残差
3.将全部残差取平方后累加得到残差平方和;
4.计算总离差平方和,代入公式求决定系数;
5.比较两个模型大小,更大的模型拟合效果更好;
6.根据残差正负分布分析模型是否存在系统性偏差。
【变式4-1】(2026·陕西榆林·模拟预测)某果树种植基地为了调研A品种橘子树的结果情况,随机采摘了100个橘子,称重后得到的数据分成六组,分别为,(单位:克),得到如图所示的频率分布直方图.
(1)估算样本的中位数;
(2)已知上的平均重量是65克,方差是6,上的平均重量为75克,方差是3,求两组重量的总方差.
【变式4-2】(25-26高三·全国·二轮复习)某汽车研发公司的工程师为了解一款新型汽车在不同行驶速度x(km/h)下油耗y(L/100km)的变化规律,进行了相关实验,记录不同速度下的油耗数据的散点图如下:
(1)根据散点图求y关于x的经验回归方程(精确到0.01);
(2)根据线性回归方程,绘制残差图,并分析线性回归方程的拟合效果(若残差的平方和小于0.775,则说明拟合效果良好,否则拟合效果较差).
附:,.
题型5 卡方独立性检验
【典例5-1】(2026·山东聊城·一模)工厂的早班和晚班生产同种产品,且两个班次生产的产品数量相同.为探究工厂生产班次与产品质量之间是否存在关联,采用分层随机抽样的方法,从该厂当日生产的产品中随机抽取出100个进行质量检测,得到如下列联表:
优秀品
合格品
合计
早班
20
30
50
晚班
10
40
50
合计
30
70
100
(1)根据小概率值的独立性检验,分析工厂生产班次与产品质量是否有关;
(2)用样本的频率估计概率,从工厂当日生产的产品中随机抽取2个做进一步检测,记其中优秀品的个数为X,早班产品的个数为Y.求出X的分布列与期望,并判断与的大小关系(直接写出结论,无需证明).
附:
0.100
0.050
0.010
k
2.706
3.841
6.635
【典例5-2】(25-26高二下·内蒙古巴彦淖尔·期末)为了研究学生参加校园社团与抗压能力强弱的关系,某调查中心随机抽取了120名学生进行调研,所得数据如下表所示:
校园社团
抗压能力
合计
弱
强
参加
20
40
60
不参加
35
25
60
合计
55
65
120
(1)依据小概率值的独立性检验,能否认为学生参加校园社团与抗压能力强弱有关?
(2)从参加校园社团的学生中按抗压能力强弱采用分层随机抽样的方法抽取6名学生,再从这6名学生中随机抽取3名学生,记这3名学生中抗压能力弱的人数为,求的分布列与数学期望.
附:,其中.
0.05
0.01
3.841
6.635
方法技巧
1.结合样本总容量、行合计、列合计补齐列联表空白数值;
2.出原假设:两个分类变量相互独立;
3.代入卡方公式计算;
4.对比题目给定小概率对应的临界值;
5.若临界值,拒绝原假设,说明有对应把握判定变量有关;反之无充分证据证明相关。
【变式5-1】(2026·重庆·模拟预测)为了解某大型企业员工的性别、年龄构成,对该企业员工按性别、年龄比例抽取500人作为样本,其中女员工有200人,女员工年龄结构的频率分布直方图如下,已知这200名女员工年龄的样本中位数为38.5岁.
(1)求频率分布直方图中a的值;
(2)已知35岁以下为青年员工,35岁以上为资深员工,根据等高堆积条形图和频率分布直方图数据,完善列联表. 依据小概率值的独立性检验,能否认为样本中员工的年龄构成与性别有关联?
男
女
合计
资深员工
青年员工
合计
200
500
,其中.
临界值表:
0.010
0.005
0.001
6.635
7.879
10.828
【变式5-2】(25-26高二下·天津·期末)台灯是夜晚学习的好搭档,台灯照射的光通常为两类:白光和黄光.白光的亮度通常高于黄光,而黄光能够有效地保护视力.某校对学生的近视情况与夜晚台灯光照的颜色进行问卷调查,得到下表:
白光
黄光
近视
80
60
不近视
40
60
(1)根据小概率值的独立性检验,分析学生的近视情况是否与夜晚台灯光照的颜色有关;
(2)用频率估计概率,从使用发出白光的台灯的学生中抽取3名,求他们中近视人数为2的概率.
附:,
0.05
0.01
0.001
3.841
6.635
10.828
题型6 统计新定义综合
【典例6-1】(2026·上海嘉定·一模)A校抽取66名高一年级学生测量身高,因某种原因原始数据遗失.已知该样本是按照分层随机抽样的方法抽取的,其中男生34名,身高平均数为173cm;女生32名,身高平均数为161cm.该66名学生身高的方差为60,其频率分布直方图如下:
(1)求该66名学生中身高在(单位:cm)内的人数;
(2)试用已知数据估计A校高一年级全体学生身高的平均数;(结果精确到0.1cm)
(3)若一组数据落在(是平均数,是标准差)内的频率不小于92%,则称这组数据满足“常态”.试判断这66个身高数据是否满足“常态”,并说明理由.
【典例6-2】(2026·上海杨浦·模拟预测)某区连续几年的GDP(国内生产总值)情况,如下表所示:
年份
第1年
第2年
第3年
第4年
第5年
GDP(百亿元)
10.0
11.0
12.4
13.5
■
(1)表中前4年数据的极差为_________,方差为_________,第20百分位数为_________;
(2)我们将这些数据,在平面直角坐标系内,用坐标形式表示出来,它们分别为点:、、、.如果运用函数与统计等知识预测该区下一年的GDP,可以尝试选择直线AB、直线AC等函数模型来进行分析.
假设经济发展环境和条件不变,要预测该区第五年的GDP情况,可以参考方差等相关知识,分析选用哪一函数模型进行预测较为合适.
(说明:在计算与绘图时,当实际数据绘制的点与模型上对应的点位置越接近时,模型越适宜,这是数学建模中拟合函数的思想.我们可通过计算一组GDP所有实际值偏离图像上对应点纵坐标值的程度,即拟合误差,来进行模型分析,一般拟合误差越小越适宜.)
例如,分析直线AB,即上的点:可知,求得拟合误差.
①:请依据以上方式,求出关于直线的拟合方差值:______;
②:请你在直线与直线进行预测的两个方案中选择合适的那个预估,预估该区第五年的GDP.
方法技巧
1.逐句拆解题干新定义的计算公式、判定标准;
2.提取样本数据,先完成基础统计量(均值、频率、回归系数)计算;
3.将基础结果代入全新定义公式分步运算;
4.对比数值大小给出结论,结合现实场景文字阐述意义
【变式6-1】(2026·安徽合肥·模拟预测)某中学举办校园文化节,设置了“数智达人”和“英语秀达人”两项特色活动,两项活动前10名得分统计如下:
数智达人前10名分数
148,146,144,142,140,140,138,136,134,132
英语秀达人前10名分数
144,143,142,141,140,140,139,138,137,136
(1)求出数智达人前10名分数的平均数、标准差;
(2)经检查发现:有一名同学的数智达人与英语秀达人得分均在前10名,但是老师却将其数智达人与英语秀达人得分统计反了,已知正确的数智达人前10名分数的平均分为141,标准差为.
①求该生正确的数智达人得分是多少?并说明理由;
②为了便于成绩分析,对数智达人前10名的正确分数进行“分数”转换,要求如下:转化前后名次不变,且10个“分数”的平均分为50、标准差为10.请你给出一个满足要求的线性转换公式:(其中,表示数智达人分数,表示数智达人分数对应的“分数”,,为常数),并证明.
(参考公式:)
【变式6-2】(2026·湖南长沙·模拟预测)为研究某疾病与超声波检查结果的关系,从做过超声波检查的人群中随机调查了人,得到如下列联表:
正常
不正常
合计
患该疾病
未患该疾病
合计
(1)记超声波检查结果不正常者患该疾病的概率为,求的估计值;
(2)根据所选择的个人的数据,能否有的把握认为超声波检查结果与是否患该疾病有关?
附: ,
分层进阶·双阶训练验成效
巩固过关
1.(2026·江西新余·二模)在某高校举行的一次国际学术与文化交流会上,对外国留学生举行了“中华文化知多少”的知识竞赛.某数学兴趣小组从中随机抽取部分学生的成绩,整理后分成五段:,绘制了如下的频率分布直方图.
(1)求的值;
(2)若参赛学生共有2000名,估计其中成绩小于70分的人数;
2.(25-26高二下·浙江宁波·期末)某市名学生在某次数学竞赛中的成绩的频率分布直方图如下:
(1)求频率分布直方图中的值;
(2)估计这次数学竞赛成绩的中位数和平均数;(精确到0.1)
(3)估计这次数学竞赛中63分以上的人数.
3.(2026·江苏·一模)某兴趣小组研究昼夜温差大小与患感冒人数多少之间的关系,他们到气象局和医院抄录了1~7月份每月5日的昼夜温差情况与因患感冒而就诊的人数,得到如下资料:
日期
1月5日
2月5日
3月5日
4月5日
5月5日
6月5日
7月5日
昼夜温差
10
11
13
12
8
7
6
感冒人数
23
25
29
26
16
13
9
该兴趣小组确定的研究方案是:先从这7组数据中选取2组,用剩下的5组数据求经验回归方程,再用被选取的2组数据进行检验.
(1)求选取的2组数据是不相邻的两个月的概率;
(2)若该小组选取的是1月与6月的两组数据,请根据剩下5个月份的数据:
①求出关于的经验回归方程;
②若由经验回归方程得到的估计数据与所选出的检验数据的误差均不超过2人,则认为得到的经验回归方程是理想的,问:该小组所得经验回归方程是否理想?说明理由.
附:
4.(25-26高三下·甘肃武威·阶段检测)某新能源汽车公司为研究电池容量对续航里程的影响,随机选取了10辆不同配置的车进行测试,测量每辆车的电池容量(单位:)和续航里程(单位:),得到如下数据:
样本号
1
2
3
4
5
6
7
8
9
10
总和
电池容量
35
40
45
50
55
65
70
75
80
85
600
续航里程
330
350
390
410
480
520
560
620
640
700
5000
并计算得.
(1)估计这10辆车的平均电池容量与平均续航里程;
(2)求电池容量与续航里程的样本相关系数;(精确到0.001)
(3)现该公司计划推出新款车型,电池容量为,已知续航里程与电池容量近似成正比,利用以上数据给出新款车型续航里程的估计值.(精确到1)
附:相关系数.
5.(2026高三·全国·专题练习)水体富营养化导致藻类大量繁殖,以2017年中国太湖蓝藻爆发为例:5月初监测发现湖体中蓝藻细胞密度为每升50万个,随着气温升高至25-30℃且氮磷营养盐浓度超标(总磷浓度达),蓝藻进入增长期.5月10日细胞密度增至每升200万个,5月15日突破每升800万个,5月20日达到每升3200万个,形成面积超150平方公里的绿色水华带.此次爆发导致湖区溶解氧骤降至以下,大量鱼类死亡,自来水厂被迫停产,所以对水资源的保护刻不容缓.现对某区域的藻类面积y(单位:平方公里)与时间x(单位:年)的关系,进行监测,得到如下数据:
x/年
1
2
3
4
5
6
7
y/平方公里
6
11
21
34
66
101
196
根据以上数据,绘制成如图所示的散点图:
观察散点图,两个变量不具有线性相关关系,现考虑用对数函数模型和指数函数模型分别对两个变量的关系进行拟合.
(1)根据散点图判断与(a,b,c,d均为常数)哪一个更适合作为藻类面积y(单位:平方公里)与时间x(单位:年)的关系的回归方程类型(给出判断即可,不必说明理由);
(2)根据(1)的判断结果及表中的数据,求出y关于x的回归方程.
参考数据:
62.14
1.54
2535
50.12
3.47
其中,
参考公式:对于一组数据,,…,其回归直线的斜率和截距的最小二乘估计公式分别为,.
6.(25-26高三上·湖南长沙·阶段检测)海水稻的灌溉是将海水稀释后进行灌溉.某试验基地为了研究海水浓度x(‰)对亩产量y(吨)的影响,通过在试验田的种植实验,测得了某种海水稻的亩产量与海水浓度的数据如表.绘制散点图发现,可用线性回归模型拟合亩产量y与海水浓度x之间的相关关系,用最小二乘法计算得y与x之间的经验回归方程为.
海水浓度(‰)
3
4
5
6
7
亩产量 (吨)
0.62
0.58
0.49
0.4
0.31
残差
(1)请你估计:当浇灌海水浓度为8‰时,该品种海水稻的亩产量;
(2)(i)完成上述残差表;
(ii)在统计学中,常用决定系数来刻画回归效果,越大,模型拟合效果越好,并用它来说明响应变量与解释变量的相关性.你能否利用以上表格中的数据,计算决定系数,并判断模型的拟合效果.(计算中数据精确到0.01)
(附:残差,决定系数)
7.(2026·山东日照·模拟预测)机器人技术的迅猛发展,已成为我国现代科技发展的标志性成就,现对100名青年(男青年50名,女青年50名)进行调研.统计结果显示:有60%的男青年希望拥有一个机器人助手,有30%的女青年希望拥有一个机器人助手,整理得到如下列联表.
拥有一个机器人助手意愿
性别
合计
男青年
女青年
希望拥有一个机器人助手
不希望拥有一个机器人助手
合计
50
50
100
(1)求,的值;
(2)根据小概率值的独立性检验,分析拥有一个机器人助手的意愿是否与性别有关.
附:,其中.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
8.(25-26高二下·吉林·期末)为了解使用手机是否对学生的学习有影响,某校随机抽取50名学生,对学习成绩和使用手机情况进行了调查,统计数据如表所示:
使用手机
不使用手机
总计
学习成绩优秀
5
20
25
学习成绩一般
15
10
25
总计
20
30
50
(1)根据表格数据计算是否有99.9%的把握认为学生的学习成绩与使用手机有关;
(2)现从上表不使用手机的学生中按学习成绩是否优秀分层抽样选出9人,再从这9人中随机抽取3人,记这3人中“学习成绩优秀”的人数为X,试求X的分布列与数学期望.
参考公式:,其中.
参考数据:
0.050
0.010
0.001
3.841
6.635
10.828
9.(2026·河南·模拟预测)某农业科研团队为探究大棚蔬菜的光照时长对产量的影响,选取5组不同的光照时长方案,在相同种植条件下开展试验,统计对应时长下的蔬菜合格采收量,得到如下数据:
每日光照时长
14
15
16
17
18
合格采收量
4
8
16
20
26
(1)求变量与的样本相关系数,判断是否适合线性回归模型拟合,如果适合,求关于的经验回归方程;
(2)当样本数据的残差绝对值大于1时,称该组数据为异常拟合数据,现从这5组数据中任取3组做残差分析,求取到异常拟合数据的组数的分布列和数学期望.
附:①样本相关系数,当时,相关性较强,当时,相关性一般;
②经验回归方程中斜率和截距的最小二乘估计公式分别为,;
③,,.
创新提升
1.(25-26高二上·广东中山·阶段检测)2023年10月22日,汉江生态城2023襄阳马拉松在湖北省襄阳市成功举行,志愿者的服务工作是马拉松成功举办的重要保障,襄阳市新时代文明实践中心承办了志愿者选拔的面试工作.现随机抽取了100名候选者的面试成绩,并分成五组:第一组,第二组,第三组,第四组,第五组,绘制成如图所示的频率分布直方图.已知第一、二组的频率之和为0.3,第一组和第五组的频率相同.
(1)估计这100名候选者面试成绩的下四分位数和平均数;
(2)在这100名候选者用分层随机抽样的方法从第四组和第五组面试者内抽取10人,再从这10名面试者中随机抽取两名,求两名面试者成绩都在第五组的概率.
(3)现从以上各组中用分层随机抽样的方法选取20人,担任本市的宣传者.若本市宣传者中第二组面试者的面试成绩的平均数和方差分别为62和40,第四组面试者的面试成绩的平均数和方差分别为80和70,据此估计这次第二组和第四组所有面试者的面试成绩的方差.
2.(25-26高三下·山东聊城·阶段检测)芯片产业对于国家的科技安全与经济发展具有不可估量的战略意义,近些年来,国家和企业纷纷加大对芯片的投入力度.国内某芯片公司为制订下一年的研发投入计划,需了解年研发资金投入量x(单位:亿元,下同)对年销售额y(单位:亿元,下同)的影响,该公司收集了最近10年的年研发资金投入量和年销售额()的数据:已知第1年的研发资金投入量为2亿元,每年的年研发资金投入量比上一年增长4亿元,随着年研发资金投入量的增长,公司的年销售额也在增长.公司对数据进行了初步处理,得到如下数据(其中,);,,.公司甲、乙两个研究团队用年研发资金投入量x为解释变量,年销售额y为响应变量建立经验回归方程.已知甲研究团队用函数模型①(为常数,e为随机误差)得到的经验回归方程为乙研究团队用函数模型②(为常数,为随机误差).
(1)求乙研究团队建立的一元非线性经验回归方程(精确到);
(2)现已知第11年公司投入研发资金40亿元,公司的年销售收入为91亿元.根据以上信息,请你对这两个团队的模型优劣进行比较,并说明理由;
(3)研究发现,这两个模型均满足:对于每一个解释变量t,得到响应变量为u,且年研发资金投入为t亿元时,年销售额y服从正态分布,公司为了保证有97.725%的把握获得年销售额100亿,请你根据你得到的较好模型,问公司预计至少需要投入研发资金约为多少亿元?(保留到0.01)
参考公式与数据:
①成对数据()的经验回归直线方程为,其系数为,.②参考数据:假设,则,.③.④,,,.
3.(2026·湖南长沙·一模)某医药研究所为了评估一种新药的疗效,开展了临床试验.研究人员记录了14名志愿者服用不同剂量的药物后,血液中某关键生化指标y(单位:)随给药剂量x(单位:mg)的变化情况.为了寻找最合适的预测模型,研究人员分别利用模型一和模型二对这14组数据进行了拟合,并绘制了相应的残差图(如图所示,图中纵轴为残差,横轴为给药剂量).
(1)观察残差图,判断哪个模型的拟合效果更好,并说明理由;
(2)设这14组数据得到的经验回归方程为.
(ⅰ)已知样本中的某位志愿者的给药剂量为,生化指标为.若该样本点在拟合效果更优的模型中的残差对应于图中标注的四点之一,请指出该点并说明理由;
(ⅱ)若在这14组数据中,给药剂量的标准差为,生化指标的标准差为,求生化指标与给药剂量的相关系数.(结果精确到0.01)
参考公式:相关系数;经验回归方程中斜率和截距的最小二乘估计公式分别为,.
4.(2026·上海·模拟预测)小新为调查学生数学建模能力的总体水平,随机抽取了100名高中生参加数学建模能力竞赛活动,其中男生40名,女生60名.根据竞赛成绩,将参赛学生数学建模能力分为“优秀”与“合格”两级.
(1)若男生和女生中分别有25名和35名被评为“优秀”,是否有95%的把握认为该地区高中生的数学建模能力优秀与否和性别有关?
(2)经统计,男生成绩的均值为80,方差为49;女生成绩的均值为75,方差为64,求全体参赛学生成绩的均值及方差.
(3)在(2)的条件下,若所有参赛学生的成绩服从正态分布,试估计成绩在范围内的学生人数(四舍五入精确到个位).
参考:①,其中;;
②、、.
5.(2026·广东广州·二模)某公司为了了解A商品销售收入(单位:万元)与广告支出(单位:万元)之间的关系,现收集的5组样本数据如下表所示,且经验回归方程为.
2
5
6
8
9
16
20
21
28
10.96
19.24
22
27.52
30.28
(1)求的值;
(2)现从这5组数据的残差中抽取2组进行分析(观测值减去预测值称为残差),记X表示抽到数据的残差为负的组数,求X的分布列和期望;
(3)已知,且当时,回归方程的拟合效果良好,试结合数据,判断经验回归方程的拟合效果是否良好.
8 / 8
学科网(北京)股份有限公司
$
重难点培优02 统计解答题全题型归纳内容导航
知识精讲·重难聚焦讲技巧 1
题型深研·通法变式提能力 5
题型1 频率分布直方图 5
题型2 一元线性回归方程 10
题型3 非线性回归建模 16
题型4 残差分析与决定系数 22
题型5 卡方独立性检验 27
题型6 统计新定义综合 33
分层进阶·双阶训练验成效 38
巩固过关 38
创新提升 50
知识精讲·重难聚焦讲技巧
知识点1 频率分布直方图
1.频率分布直方图的特点
(1)横轴:数据分组区间,每组区间长度称为组距;纵轴:,矩形面积代表该组对应频率。
(2)全部小矩形面积之和恒等于 1,代表样本全部数据的总频率。
(3)频数、频率、样本总量关系:单组频数 = 样本总数 × 该组矩形面积;单组频率 = 。
2.频率分布表与频率分布直方图的制作步骤
与画频数分布直方图类似,我们可以按以下步骤制作频率分布表、画频率分布直方图.
第一步,求极差
极差为一组数据中最大值与最小值的差.
第二步,决定组距与组数
第三步,将数据分组
通常对组内数据取_左闭右开区间,最后一组数据取闭区间.
第四步,列频率分布表
计算各小组的频率,例如第一小组的频率是,作出频率分布表,
第五步,画频率分布直方图
画图时,以横轴表示分组,纵轴(小长方形的高度)表示.
3. 从频率分布直方图中估计数字特征
众数:最高矩形底边中点的横坐标.
中位数:使直方图左、右两边面积相等的分界线与横轴交点的横坐标;估计中位数时必须保证两侧面积之和恰好为0.5,不可直接取最高矩形中点.
平均数:每一组区间中点数值乘以本组频率,全部乘积相加得到整体均值,即每个小矩形的面积 × 小矩形底边中点的横坐标之和.
4. 百分位数计算
(1)第百分位数(p%分位数)的定义:一般地,一组数据的p%()分位数是这样一个值,它使得这组数据中至少有的数据不大于该值,且至少有的数据不小于该值.
(2)利用直方图求解百分位数的步骤:
第1步,按从小到大排列原始数据.
第2步,计算
第3步,若不是整数,而大于的比邻整数为,则第百分位数为第项数据;若是整数,则第百分位数为第项与第项数据的平均数
知识点2 样本相关系数
1.样本相关系数:设由变量x和y获得的两组数据分别为和(i=1,2,…,n),其对应关系如下表所示:
变量x
…
变量y
…
两组数据和的线性相关系数是度量两个变量x与y之间线性相关程度的统计量,
其计算公式为,
其中,,,它们分别是这两组数据的算术平均数.
2.相关系数r与相关程度
(1)当时,称成对样本数据正相关;
当时,成对样本数据负相关;
当时,成对样本数据间没有线性相关关系;
(2)样本相关系数r的取值范围为[-1,1];
当越接近1时,成对样本数据的线性相关程度越强;
当越接近0时,成对样本数据的线性相关程度越弱.
知识点3 一元线性回归模型
1.模型
为关于的一元线性回归模型。是因变量(响应变量),是自变量(解释变量);为截距参数,为斜率参数;代表随机误差。若,与满足确定一次函数关系。
2.最小二乘估计
称作经验回归方程,对应直线为经验回归直线,回归直线必过样本中心点。
通过最小二乘法求解,二者分别是参数的最小二乘估计,斜率用来衡量自变量每增加 1 个单位,因变量预测值的平均变化量;截距表示自变量取 0 时的预测基准值,无实际物理意义时仅作计算参数。
配套对应计算公式,其中
最小二乘法是通过使全部样本观测值与预测值差值的平方总和达到最小,以此确定。
知识点4 非线性回归模型
1. 非线性建模步骤:
(1)绘制两组变量对应散点图,根据散点分布升降增速判断适配曲线模型;
(2) 构造全新替换变量,完成非线性表达式向线性表达式的转化;
(3) 依据线性回归公式计算转换后模型的斜率与截距;
(4) 将替换变量回代原式,书写原始变量对应的非线性回归解析式。
2.常见可线性化模型换元方法
(1)幂型函数 (其中,)
对等式 的两侧同时取常用对数,可得:。
令 ,原式即可改写为 ,式中 均为常数,此时 与 满足线性函数关系。
(2)指数型函数 ( 且 )
对 两侧同时取常用对数,得到:。
令 ,原式转化为 ,其中 为常数。
此时 和 构成线性函数关系;和幂函数变换方式区分:自变量保持不变,使用的常用对数替换原有因变量。
(3)反比例函数
令 ,可得关系式 , 与 呈线性函数关系。
(4)二次函数
令 ,原函数化为 , 与 构成线性函数关系。
(5)对数型函数
令 ,原函数能够简化为 , 与 满足线性函数关系。
知识点5 残差、残差图与决定系数R2
1.残差
响应变量实际测量得到的数值为观测值,代入回归方程算出的数值为预测值;观测值减去预测值的结果叫做残差,即
2.残差图
作图时纵坐标为残差,横坐标可以选为样本编号,或身高数据,或体重估计值等,这样作出的图形称为残差图.若残差点比较均匀地落在水平的带状区域内,带状区域越窄,则说明拟合效果越好.
3.残差分析
残差可以估算随机误差,借助残差能够判断回归模型贴合数据的效果,同时排查原始数据里的异常可疑值,整套分析流程为残差分析。
残差点均匀落在水平带状区域内,则模型拟合效果良好;决定系数,数值越靠近 1,模型拟合效果越好。
4.残差平方和
残差平方和独立性检验中几个常用的小概率值和相应的临界值
0. 1
0. 05
0. 01
0. 005
0. 001
2. 706
3. 841
6. 635
7. 879
10. 828
越大,即拟合效果越好,越小,模型拟合效果越差.
知识点6 独立性检验
1.关于分类变量X和Y的抽样数据的2×2列联表:
X
Y
合计
Y=0
Y=1
X=0
a
b
a+b
X=1
c
d
c+d
合计
a+c
b+d
n=a+b+c+d
2.独立性检验
(1)定义:借助卡方统计量判断两个分类变量是否相互独立,该方法叫独立性检验;
(2)卡方公式:,总样本量;
3.标准临界数值对照表
0. 1
0. 05
0. 01
0. 005
0. 001
2. 706
3. 841
6. 635
7. 879
10. 828
4.基于小概率值的检验规则是:
当时,我们就推断不成立,即认为和不独立,该推断犯错误的概率不超过;
当时,我们没有充分证据推断不成立,可以认为和独立.
5.独立性检验步骤
(1)提出零假设:变量相互独立,结合题意说明含义;
(2)根据统计数据搭建2×2列联表,计算数值,和给定临界值对比;
(3)对照检验标准,给出独立性相关推断结论;
(4)若判定变量不独立,可对比各组频率,分析变量间的影响规律。
题型深研·通法变式提能力
题型1 频率分布直方图
【典例1-1】(25-26高一下·四川乐山·期末)从某小区抽取100户居民进行月用电量调查,发现他们的用电量都在之间,进行适当分组后(每组为左闭右开的区间),画出如图所示的频率分布直方图.
(1)计算直方图中的值.
(2)在被调查的用户中,用电量落在以上的户数为多少?
(3)为引导居民节约用电,电力公司拟采用分层定价策略:设定一个月用电量参考值,使小区约半数用户用电量低于该值、半数高于该值,并据此对低于者执行基础电价、高于者执行阶梯加价.请根据频率分布直方图估计该参考值(精确到0.01).
【答案】(1)
(2)40
(3)
【分析】(1)根据频率分布直方图中所有小矩形面积之和为1列式求参数即可;
(2)根据频率分布直方图可得后三组的频率为,即可得户数;
(3)由频率分布直方图可得中位数在第三组内,根据中位数的定义列式求解即可.
【详解】(1)因为频率分布直方图中所有小矩形面积之和为1,
可得,解得.
(2)用电量在以上的频率为:.
样本容量为100,则抽取的户数为.
(3)由频率分布直方图可知:
前两组的频率和为:;
前三组的频率和为:,
所有中位数在第三组内,
设中位数为,则,解得.
【典例1-2】(25-26高三下·河南周口·阶段检测)某市为提高市民对文明城市创建的认识,举办了“创建文明城市”知识竞赛,从所有答卷中随机抽取100份作为样本,将样本的成绩分成,,,,这五组,得到如图所示的频率分布直方图.
(1)估计样本成绩的平均数及方差;(同一组中的数据用该组区间的中点值作为代表)
(2)已知落在内的平均成绩是80分,方差是4分,落在内的平均成绩是88分,方差是6分,求两组成绩合并后的平均数和方差.
附:设两组数据的样本量、样本平均数和样本方差分别为m,,;n,,,记两组数据总体的样本平均数为,则总体样本方差.
【答案】(1)平均数100,方差104
(2),
【分析】(1)根据频率分布直方图中平均数与方差的求法,代入数据,即可得答案.
(2)根据条件,分别求出两组数据的样本容量,平均数和方差,代入公式,整理计算,即可得答案.
【详解】(1)由频率分布直方图得,
平均数,
方差
.
(2)第一组的样本容量,,
第二组的样本容量,,
所以合并后的平均数,
则.
方法技巧
利用矩形总面积恒等于1的条件求解直方图未知纵轴参数;依次计算样本众数、平均数、百分位数;结合分层抽样比例计算分层抽取样本数量;利用样本频率估算总体对应样本容量;搭配古典概型求解分层抽样后随机抽取对应事件发生概率。
【变式1-1】(25-26高一下·吉林长春·期末)中国AI大模型正处于一个技术进步迅速、市场规模快速增长的爆发式发展阶段.为了了解中国AI大模型用户的年龄分布,A公司调查了500名中国AI大模型用户,统计他们的年龄(都在内),按照,,,,进行分组,得到如图所示的频率分布直方图.
(1)求这500名中国AI大模型用户的年龄在内的人数;
(2)估计这500名中国AI大模型用户年龄的平均数(各组数据以该组区间的中点值作代表).
【答案】(1)200人
(2)37.5
【分析】(1)由年龄在内的频率计算求解;
(2)由频率分布直方图的平均数计算公式计算求解.
【详解】(1)由题可知组距为10,则,解得;
这500名中国AI大模型用户的年龄在内的频率为:,
所以这500名中国AI大模型用户的年龄在内的人数为:人;
(2)估计这500名中国AI大模型用户年龄的平均数如下,
为.
【变式1-2】(25-26高一下·全国·课堂例题)下表给出了某校500名12岁男孩中用随机抽样得出的120人的身高资料(单位:cm):
区间界限
人数
5
8
10
22
33
区间界限
人数
20
11
6
5
(1)列出样本的频率分布表(频率保留两位小数);
(2)画出频率分布直方图;
(3)估计身高低于134cm的人数占总人数的百分比.
【答案】(1)
分组
频数
频率
5
0.04
8
0.07
10
0.08
22
0.18
33
0.28
20
0.17
11
0.09
6
0.05
5
0.04
合计
120
1.00
(2)
(3)
【分析】(1)根据样本频率分布表的概念列表求解;
(2)根据频率分布直方图的定义作图即可;
(3)求出对应频率后即可求解.
【详解】(1)列出样本频率分布表:
分组
频数
频率
5
0.04
8
0.07
10
0.08
22
0.18
33
0.28
20
0.17
11
0.09
6
0.05
5
0.04
合计
120
1.00
(2)画出频率分布直方图,如图所示,
(3)因为样本中身高低于134cm的人数的频率为
所以估计身高低于134cm的人数约占总人数的.
题型2 一元线性回归方程
【典例2-1】(25-26高二下·辽宁朝阳·期末)对于变量x和变量y,设获得的成对数据为,,…,,其中,.在某实验过程中,随机抽样获得了如下成对样本数据:
表1:
x
100
110
120
130
140
150
160
170
180
190
y
40
47
56
61
66
72
74
78
83
86
对表1中数据作变换,得到了如下表2:
表2:
序号
1
2
3
4
5
6
7
8
9
10
u
-5
-4
-3
-2
-1
0
1
2
3
4
-5
v
-30
-23
-14
-9
-4
2
4
8
13
16
-37
150
92
42
18
4
0
4
16
39
64
429
设样本相关系数为r,当时,表明两个变量的线性相关程度较强,当时,表明两个变量的线性相关程度很强.
参考公式:;,.
参考数据:,,,,,,,,.
(1)证明:
(2)分别求表1中的两个变量x,y的样本相关系数r,并推断相关程度;
(3)设y关于x的经验回归方程为,反之,x关于y的经验回归方程为.由实验数据,利用参考数据求经验回归方程和(计算结果精确到0.01);
【答案】(1)证明:,
而因为,,所以
(2)0.9876,相关程度很强
(3)和
【分析】(1)利用多项式乘法和加法结合律即可得到证明;
(2)利用公式代入数据,即可得到相关系数;
(3)利用公式求解回归方程即可.
【详解】(1)略
(2)因为,,
所以,,
,
又因为,,所以,,
即,
,
,
则,
所以相关程度很强;
(3)因为,
,
所以,
因为,
,
所以,
故所求的经验回归方程为:和.
【典例2-2】(25-26高二下·吉林长春·期中)我国全面二孩政策已正式实施,这次人口与生育政策的历史性调整,使得“要不要再生一个”,“生二孩能休多久产假”等问题成为千千万万个家庭在生育决策上避不开的话题.为了解针对产假的不同安排方案形成的生育意愿,某调查机构随机抽取了200户有生育二胎能力的适龄家庭进行问卷调查,得到如下数据:
产假安排(单位:周)
14
15
16
17
18
有生育意愿家庭数(单位:户)
4
8
16
20
26
(1)建立变量关于的一元线性回归模型;
(2)用(1)中所求的经验回归方程来拟合这组成对数据,当样本数据的残差的绝对值大于1时,称该对数据为一个“次数据”,现从这5个成对数据中任取3个做残差分析,求取到的数据中“次数据”个数的数学期望.
附:经验回归直线的斜率和截距的最小二乘估计公式分别为,
参考数据:.
【答案】(1)
(2)
【分析】(1)由已知求出,,利用公式求出,,即可得到关于的线性回归方程;
(2)由回归方程求出预测值,可得残差的绝对值,判断是否为“次数据”,可得“次数据”和非“次数据”个数,“次数据”个数为,求出对应概率,即可列出分布列求出数学期望.
【详解】(1),,
所以,
则, ,
所以关于的一元线性回归方程为.
(2)由(1)回归方程为,样本数据的残差的绝对值大于1时,称该对数据为一个“次数据”,
由题意,列出下表,
产假安排(单位:周)
14
15
16
17
18
有生育意愿家庭数(单位:户)
4
8
16
20
26
预测值
3.6
9.2
14.8
20.4
26
残差的绝对值
0.4
1.2
1.2
0.4
0
是否为“次数据”
否
是
是
否
否
则“次数据”共有2个,非“次数据”共有3个,从这5个数据中任取三个,“次数据”个数为,
则,
,
,
分布列
0
1
2
所以,数学期望为
.
方法技巧
1.分别计算两组变量样本均值,所有、;
2.代入公式计算相关系数,根据大小说明线性相关强弱;
3.计算斜率,再利用求截距;
4.写出回归直线,根据正负判断增减;
5.将给定代入解析式,得到预测值,文字说明预测结论。
【变式2-1】(2026·河南·模拟预测)为研究新能源汽车的销售量变化情况,现统计了某市2025年第二、第三季度每个月的销售量(单位:万辆)如下表所示.
月份
4月
5月
6月
7月
8月
9月
月份代号x
1
2
3
4
5
6
销售量y
1.5
2.3
2.8
3.2
3.7
4.5
(1)求这6个月销售量数据的平均数和80%分位数;
(2)已知该市销售量y与月份代号x具有很强的线性相关关系,求y关于x的经验回归方程,并预测2025年12月份的销售量.
附:经验回归方程的斜率与截距的最小二乘估计公式分别为,,,.
【答案】(1)平均数为3;80%分位数为3.7
(2),约为6.08万辆
【分析】(1)利用平均数和分位数的计算方法,根据给定销售量数据分别计算.
(2)先算出和,再用公式求得到回归方程,最后代入预测销售量.
【详解】(1)由题意可得,6个月销售量从小到大排列为: ,
所以平均数为.
因为,所以这6个月销售量数据的80%分位数为从小到大排列后的第5个数:3.7.
(2)由(1)可知:, ,
,
,
所以 ,当时,(万辆),
即预测2025年12月份的销售量约为6.08万辆.
【变式2-2】(2026高三·全国·专题练习)某厂为比较甲,乙两种工艺对橡胶产品伸缩率的处理效应,进行10次配对试验,每次配对试验选用材质相同的两个橡胶产品,随机地选其中一个用甲工艺处理,另一个用乙工艺处理,测量处理后的橡胶产品的伸缩率.甲,乙两种工艺处理后的橡胶产品的伸缩率分别记为,试验结果如下:
试验序号
1
2
3
4
5
6
7
8
9
10
伸缩率
545
533
551
522
575
544
541
568
596
548
伸缩率
536
527
543
530
560
533
522
550
576
536
记,记的样本平均数为,样本方差为.
(1)求;
(2)判断甲工艺处理后的橡胶产品的伸缩率较乙工艺处理后的橡胶产品的伸缩率是否有显著提高,(如果,则认为甲工艺处理后的橡胶产品的伸缩率较乙工艺处理后的橡胶产品的伸缩率有显著提高,否则不认为有显著提高).
【答案】(1),;
(2)认为甲工艺处理后的橡胶产品的伸缩率较乙工艺处理后的橡胶产品的伸缩率有显著提高.
【分析】(1)根据已知表格数据得到所有的值,最后计算出均值、方差即可;
(2)根据公式计算出的值,和比较大小即可得结论.
【详解】(1)计数如下表:
试验序号
1
2
3
4
5
6
7
8
9
10
9
6
8
15
11
19
18
20
12
则,
.
(2)由(1)知,,故有,
所以认为甲工艺处理后的橡胶产品的伸缩率较乙工艺处理后的橡胶产品的伸缩率有显著提高.
题型3 非线性回归建模
【典例3-1】(25-26高二下·山西运城·期末)蝗虫会对农作物造成严重伤害,每只蝗虫的平均产卵数和平均温度有关.现收集到一只蝗虫的产卵数y(单位:个)和温度x(单位:℃)的8组观测数据,制成图1所示的散点图.现用两种模型:①,②分别进行拟合,由此得到相应的回归方程并进行残差分析,进一步得到图2所示的残差图.
整理收集到的数据,得到下表:
24
2.9
646
168
422688
50.4
70308
表中,,,.
(1)根据残差图,选择哪个模型的拟合效果更好?说明理由.根据所选的模型,利用上表中的数据,求出y关于x的回归方程;
(2)据统计,该地每年平均温度达到30℃以上时蝗虫会对农作物造成严重伤害,需要人工防治,其他情况均不需要人工防治.若该地每年平均温度达到30℃以上的概率为,设该地今后5年需要人工防治的年数为,求的均值和方差.
附:对于一组数据,,…,,其回归直线的斜率和截距的最小二乘估计分别为,.
【答案】(1)①拟合效果更好.理由如下:模型①残差点比较均匀地落在水平的带状区域中,且带状区域的宽度比模型②带状区域宽度窄,所以模型①的拟合效果更好.
(2),
【详解】(1)①拟合效果更好.
理由如下:模型①残差点比较均匀地落在水平的带状区域中,且带状区域的宽度比模型②带状区域宽度窄,所以模型①的拟合效果更好.
令,则,,
所以,
因此z关于x的线性回归方程为,
所以产卵数y关于温度x的回归方程为.
(2)每年需要人工防治的概率为,且.
所以,.
【典例3-2】(2026·辽宁沈阳·三模)某农业技术站研究化肥施用量对大棚青菜产量的影响.在一定范围内,施肥量(单位kg/亩)越大,青菜产量(单位kg/亩)越高.实验测得具体数据如下表:
施肥量
2
3
4
5
6
青菜产量
4200
4300
4350
4380
4400
根据散点数据特征,研究人员分析得出产量与施肥量近似满足的关系,取,经计算可知,,,,
(1)请根据上述数据,计算得出产量y关于施肥量x的回归方程,并结合常识描述的实际意义,为简化计算,计算过程中、均精确到个位数.
(2)若青菜的收购价格为2元/kg,化肥的采购价格为12元/kg,请从利润最大的角度给出大棚的最优施肥量.
参考公式:,.
【答案】(1),实际意义是当化肥使用量无限增加时,青菜产量的理论上限为/亩
(2)当施肥量为10kg/亩时利润最大
【分析】(1)根据题意,利用回归系数的公式,求得,进而得出回归直线方程,结合的值,得出的实际意义;
(2)由利润为,结合基本不等式,即可求解.
【详解】(1)根据题意,可得,
又由,
所以产量y关于施肥量x的回归方程为,
其中的实际意义是当化肥使用量无限增加时,青菜产量的理论上限为/亩.
(2)设利润为元/亩,
当且仅当kg/亩时取等,即当施肥量为10kg/亩时利润最大.
方法技巧
1.观察散点图升降增速匹配适配非线性函数模型
2.通过对数、倒数、平方换元构造全新变量,将非线性表达式转化为线性回归形式
3.计算转换后两组变量均值,求解转换模型回归系数
4.将替换变量回代原始函数,书写原始变量非线性回归解析式
5.代入指定自变量数值完成数值预测;对比不同模型相关系数,选取拟合效果最优模型。
【变式3-1】(2026·山西临汾·一模)水体富营养化导致藻类大量繁殖,以2017年中国太湖蓝藻爆发为例:5月初监测发现湖体中蓝藻细胞密度为每升50万个,随着气温升高至25-30℃且氮磷营养盐浓度超标(总磷浓度达),蓝藻进入增长期.5月10日细胞密度增至每升200万个,5月15日突破每升800万个,5月20日达到每升3200万个,形成面积超150平方公里的绿色水华带.此次爆发导致湖区溶解氧骤降至以下,大量鱼类死亡,自来水厂被迫停产、所以对水资源的保护刻不容缓,现对某区域的藻类面积y(单位:平方公里)与时间x(单位:年)的关系,进行监测,得到如下数据:
x/年
1
2
3
4
5
6
7
y/平方公里
6
11
21
34
66
101
196
根据以上数据,绘制成如图所示的散点图:
观察散点图,两个变量不具有线性相关关系,现考虑用对数函数模型和指数函数模型分别对两个变量的关系进行拟合.
(1)根据散点图判断与(a,b,c,d均为常数)哪一个更适合作为藻类面积y(单位:平方公里)与时间x(单位:年)的关系的回归方程类型(给出判断即可,不必说明理由);
(2)根据(1)的判断结果及表中的数据,求出y关于x的回归方程;
(3)若不及时保护水质,当第八年检测时,请估计藻类面积为多少平方公里.
参考数据:
62.14
1.54
2535
50.12
3.47
其中,
参考公式:对于一组数据,,…,其回归直线的斜率和截距的最小二乘估计公式分别为,.
【答案】(1)更适宜
(2)
(3)347
【分析】(1)根据散点图的特征确定回归方程类型.
(2)利用非线性回归及最小二乘法求出回归方程.
(3)利用(2)的结论进行数据估计.
【详解】(1)由散点图得,藻类面积随时间的增加其增长速度越来越快,
所以更适宜作为藻类面积y与时间x的关系的回归方程类型.
(2)由,两边同时取常用对数得,
设,,,则,
由,,得,
则,因此,,
所以y关于x的回归方程为.
(3)当时,(平方公里)
所以若不加治理,第8次检测时,藻类面积约为347平方公里.
【变式3-2】(2026·上海奉贤·二模)某工厂生产的某种产品的月产量(单位:千件)与单位成本(单位:元/件)的数据如下:
月份
产量(千件)
单位成本(元/件)
1
2
73
2
3
72
3
4
71
4
3
73
5
4
69
6
5
68
(1)计算产量与单位成本的相关系数(无需过程);
(2)建立产量与单位成本的回归方程(写出必要的过程):
(3)若该工厂计划7月份生产7千件该产品,则单位成本预计是多少?
附:相关系数的计算公式:;
回归系数计算公式:,
【答案】(1)
(2)
(3)元/件
【详解】(1)根据相关系数的公式,
由表格数据可得,,,
,,
于是.
(2)设回归直线方程为,
根据公式可得,
,
故回归直线方程为;
(3)根据(2)可知,,
当时,,
所以预计成本是元/件.
题型4 残差分析与决定系数
【典例4-1】(2026·湖北武汉·一模)某医药研究所为了评估一种新药的疗效,开展了临床试验.研究人员记录了14名志愿者服用不同剂量的药物后,血液中某关键生化指标(单位:)随给药剂量(单位:mg)的变化情况.为了寻找最合适的预测模型,研究人员分别利用模型一和模型二对这14组数据进行了拟合,并绘制了相应的残差图(如图所示,图中纵轴为残差,横轴为给药剂量).
(1)观察残差图,判断哪个模型的拟合效果更好;
(2)设这14组数据得到的经验回归方程为.
(ⅰ)已知样本中的某位志愿者的给药剂量为,生化指标为.若该样本点在拟合效果更优的模型中的残差对应于图中标注的四点之一,请指出该点并说明理由;
(ⅱ)若在这14组数据中,给药剂量的标准差为,生化指标的标准差为,求生化指标与给药剂量的相关系数.(结果精确到)
参考公式:相关系数;经验回归方程中斜率和截距的最小二乘估计公式分别为,.
【答案】(1)模型一的拟合效果更好
(2)
(ⅰ)点,理由如下:
因为模型一的拟合效果更好,经验回归方程为,
所以该方程相应于点的残差为,故选点;
(ⅱ)
【分析】(1)根据残差图,比较带状区域的宽度即可得出判断;
(2)(ⅰ)计算出残差即可求解;(ⅱ)根据相关系数公式及经验回归方程计算即可.
【详解】(1)模型一的拟合效果更好.
理由如下:模型一残差点比较均匀地落在水平的带状区域中,且带状区域的宽度比模型二的带状宽度窄,所以模型一的拟合精度更高,经验回归方程的预报精度相应就越高.
(2)(ⅰ)略
(ⅱ)由题可知,,
所以,
由,,
所以
.
【典例4-2】(25-26高二下·广东湛江·期末)某款电动汽车由于其优异的性价比,逐渐在市场获得认可,订购数量日渐增多.根据统计数据,该款电动汽车某区域店过去周的订单数如下:
时间(周)
1
2
3
4
5
订单数(辆)
13
21
45
55
66
为了进一步了解订单数的变化情况,两个数学学习小组分别进行了研究,
(1)小组决定用线性回归模型进行拟合,求此时关于的线性回归方程;
(2)小组采用非线性回归模型进行拟合,求得关于的非线性回归方程为,并计算出决定系数.
①请计算小组线性回归方程的决定系数,并说明哪个小组的模型拟合效果更好;
②用①中选择的模型预测该区域第10周的订单数.
附:,;决定系数,
参考数据:,.
【答案】(1)关于的线性回归方程为
(2)①,小组的模型拟合效果更好;
②用①中选择的模型预测该区域第10周的订单数约辆.
【分析】(1)先算出,再代入公式计算分子与分母得到斜率,再用求出截距,写出回归直线.
(2)①先将各代入线性方程得到对应,算出残差平方和,结合已知总偏差平方和,代入公式算出,对比大小,数值越大拟合效果越好;
②选择决定系数更大的非线性模型,将代入二次回归方程,化简计算得到第周订单预测值.
【详解】(1),,
,
,
所以,,
所以关于的线性回归方程为;
(2)①时,,,
时,,,
时,,,
时,,,
时,,,
所以,
,
所以,
因为,所以,说明小组的模型拟合效果更好;
②用小组的模型预测,
时,,
所以用①中选择的模型预测该区域第10周的订单数约辆.
方法技巧
1.利用回归方程算出每组预测值;
2.依据残差,逐个计算每组样本残差
3.将全部残差取平方后累加得到残差平方和;
4.计算总离差平方和,代入公式求决定系数;
5.比较两个模型大小,更大的模型拟合效果更好;
6.根据残差正负分布分析模型是否存在系统性偏差。
【变式4-1】(2026·陕西榆林·模拟预测)某果树种植基地为了调研A品种橘子树的结果情况,随机采摘了100个橘子,称重后得到的数据分成六组,分别为,(单位:克),得到如图所示的频率分布直方图.
(1)估算样本的中位数;
(2)已知上的平均重量是65克,方差是6,上的平均重量为75克,方差是3,求两组重量的总方差.
【答案】(1)75
(2)28.2
【分析】(1)利用频率分布直方图各小矩形面积和为1求出,再估算出样本的中位数.
(2)利用分层抽样的方差公式计算即得.
【详解】(1)由频率分布直方图,得,解得,
数据在的频率为,在的频率为,
所以样本的中位数约为.
(2)由(1)知数据在上与上的频率之比为,
因此样本数据的总平均重量(克),
所以总方差.
【变式4-2】(25-26高三·全国·二轮复习)某汽车研发公司的工程师为了解一款新型汽车在不同行驶速度x(km/h)下油耗y(L/100km)的变化规律,进行了相关实验,记录不同速度下的油耗数据的散点图如下:
(1)根据散点图求y关于x的经验回归方程(精确到0.01);
(2)根据线性回归方程,绘制残差图,并分析线性回归方程的拟合效果(若残差的平方和小于0.775,则说明拟合效果良好,否则拟合效果较差).
附:,.
【答案】(1)
(2)作图见解析,拟合效果较好
【分析】(1)由图算出和的值,代入最小二乘法公式,得到回归方程;
(2)结合(1)的回归方程,求解出对应数据,列表画图,计算残差,算出其平方和,最后比大小即可.
【详解】(1)由图得,,
则,
故,
则y关于x的经验回归方程为.
(2)结合(1),计算得残差如下表:
行驶速度
60
70
80
90
100
110
油耗实际值
7.5
6.8
6.2
5.7
5.4
5
油耗估计值
7.35
6.85
6.35
5.85
5.35
4.85
残差
0.15
0.05
0.15
因此残差分布图如下:
因为,
所以经验回归方程的拟合效果较好.
题型5 卡方独立性检验
【典例5-1】(2026·山东聊城·一模)工厂的早班和晚班生产同种产品,且两个班次生产的产品数量相同.为探究工厂生产班次与产品质量之间是否存在关联,采用分层随机抽样的方法,从该厂当日生产的产品中随机抽取出100个进行质量检测,得到如下列联表:
优秀品
合格品
合计
早班
20
30
50
晚班
10
40
50
合计
30
70
100
(1)根据小概率值的独立性检验,分析工厂生产班次与产品质量是否有关;
(2)用样本的频率估计概率,从工厂当日生产的产品中随机抽取2个做进一步检测,记其中优秀品的个数为X,早班产品的个数为Y.求出X的分布列与期望,并判断与的大小关系(直接写出结论,无需证明).
附:
0.100
0.050
0.010
k
2.706
3.841
6.635
【答案】(1)工厂生产班次与产品质量有关
(2)
0
1
2
;
【详解】(1)设零假设:工厂生产班次与产品质量无关,
由列联表,得,
所以根据小概率值的独立性检验,推断不成立,即工厂生产班次与产品质量有关,该推断犯错误的概率不超过0.05.
(2)依题意,从全部产品中随机抽取出一个优秀品的概率为,
从全部产品中随机抽取出一个早班产品的概率为,
由已知的可能取值有,
故随机变量,
,,
,
则的分布列为
0
1
2
.
由列联表可得,
所以.
【典例5-2】(25-26高二下·内蒙古巴彦淖尔·期末)为了研究学生参加校园社团与抗压能力强弱的关系,某调查中心随机抽取了120名学生进行调研,所得数据如下表所示:
校园社团
抗压能力
合计
弱
强
参加
20
40
60
不参加
35
25
60
合计
55
65
120
(1)依据小概率值的独立性检验,能否认为学生参加校园社团与抗压能力强弱有关?
(2)从参加校园社团的学生中按抗压能力强弱采用分层随机抽样的方法抽取6名学生,再从这6名学生中随机抽取3名学生,记这3名学生中抗压能力弱的人数为,求的分布列与数学期望.
附:,其中.
0.05
0.01
3.841
6.635
【答案】(1)认为学生参加校园社团与抗压能力强弱有关;
(2)分布列为
0
1
2
【分析】(1)求出的值,根据独立性检验的意义即可得答案;
(2)由题意可知的所有可能取值为,,,求出对应的概率,即可得分布列,再由期望公式求解即可.
【详解】(1)零假设为:学生参加校园社团与抗压能力强弱无关.
根据表中的数据,可得.
依据小概率值的独立性检验,我们推断不成立,
即认为学生参加校园社团与抗压能力强弱有关.
(2)这6名学生中抗压能力弱的有人,抗压能力强的有人,
则的所有可能取值为,,.
,
,
,
则的分布列为
0
1
2
故.
方法技巧
1.结合样本总容量、行合计、列合计补齐列联表空白数值;
2.出原假设:两个分类变量相互独立;
3.代入卡方公式计算;
4.对比题目给定小概率对应的临界值;
5.若临界值,拒绝原假设,说明有对应把握判定变量有关;反之无充分证据证明相关。
【变式5-1】(2026·重庆·模拟预测)为了解某大型企业员工的性别、年龄构成,对该企业员工按性别、年龄比例抽取500人作为样本,其中女员工有200人,女员工年龄结构的频率分布直方图如下,已知这200名女员工年龄的样本中位数为38.5岁.
(1)求频率分布直方图中a的值;
(2)已知35岁以下为青年员工,35岁以上为资深员工,根据等高堆积条形图和频率分布直方图数据,完善列联表. 依据小概率值的独立性检验,能否认为样本中员工的年龄构成与性别有关联?
男
女
合计
资深员工
青年员工
合计
200
500
,其中.
临界值表:
0.010
0.005
0.001
6.635
7.879
10.828
【答案】(1)
(2)
男
女
合计
资深员工
165
135
300
青年员工
135
65
200
合计
300
200
500
不能
【分析】(1)先判断出中位数落在内,再根据中位数左侧的面积之和应等于 列出方程,求解即可;
(2)根据频率分布直方图和等高堆积条形图得出相关数据,即可完善列联表,然后计算,对照临界值表即可判断是否有关联
【详解】(1)女员工样本中位数为,落在内,结合频率分布直方图可得
,解得.
(2)已知抽取了200名女员工 ,则有300名男员工,由频率分布直方图可得
青年女员工有名 ,
则女资深员工有名,
由等高堆积条形图可得青年男员工有 名 ,
则男资深员工有名,依此可画出列联表.
因为 ,
所以依据小概率值的独立性检验,
不能认为样本中员工的年龄构成与性别有关联.
【变式5-2】(25-26高二下·天津·期末)台灯是夜晚学习的好搭档,台灯照射的光通常为两类:白光和黄光.白光的亮度通常高于黄光,而黄光能够有效地保护视力.某校对学生的近视情况与夜晚台灯光照的颜色进行问卷调查,得到下表:
白光
黄光
近视
80
60
不近视
40
60
(1)根据小概率值的独立性检验,分析学生的近视情况是否与夜晚台灯光照的颜色有关;
(2)用频率估计概率,从使用发出白光的台灯的学生中抽取3名,求他们中近视人数为2的概率.
附:,
0.05
0.01
0.001
3.841
6.635
10.828
【答案】(1)学生的近视情况与夜晚台灯光照颜色有关
(2)
【分析】(1)计算出卡方,并与临界值比较大小,结合独立性检验思想分析判断即可.
(2)利用二项分布的概率公式计算即可求解.
【详解】(1)零假设:学生的近视情况与夜晚台灯光照颜色无关,
,
根据小概率值的独立性检验,推断不成立,
即认为学生的近视情况与夜晚台灯光照颜色有关.
(2)使用发射白光的台灯的学生患近视的概率为,
记近视人数为,显然该类学生近视情况服从二项分布,
可得.
题型6 统计新定义综合
【典例6-1】(2026·上海嘉定·一模)A校抽取66名高一年级学生测量身高,因某种原因原始数据遗失.已知该样本是按照分层随机抽样的方法抽取的,其中男生34名,身高平均数为173cm;女生32名,身高平均数为161cm.该66名学生身高的方差为60,其频率分布直方图如下:
(1)求该66名学生中身高在(单位:cm)内的人数;
(2)试用已知数据估计A校高一年级全体学生身高的平均数;(结果精确到0.1cm)
(3)若一组数据落在(是平均数,是标准差)内的频率不小于92%,则称这组数据满足“常态”.试判断这66个身高数据是否满足“常态”,并说明理由.
【答案】(1)
(2)
(3)满足,理由:
由(2)知,所以约为,
数据落在内的频率为,
因为,所以数据落在内的频率不小于,
所以这66个身高数据满足“常态”.
【分析】(1)根据频率分布直方图,求出身高在的频率,再求出频数即可得到答案;
(2)求出66名学生的身高平均数,用样本估计总体即可得到结果;
(3)根据题目数据求出约为,再根据频率分布直方图求出数据落在的频率,根据即可进行判断.
【详解】(1)由频率分布直方图可知,身高在的频率为,
,所以该66名学生中身高在(单位:cm)内的人数为人.
(2)这66名高一年级学生身高平均数为,
因为该样本是按照分层随机抽样的方法抽取的,所以估计校高一年级全体学生身高的平均数为.
(3)略
【典例6-2】(2026·上海杨浦·模拟预测)某区连续几年的GDP(国内生产总值)情况,如下表所示:
年份
第1年
第2年
第3年
第4年
第5年
GDP(百亿元)
10.0
11.0
12.4
13.5
■
(1)表中前4年数据的极差为_________,方差为_________,第20百分位数为_________;
(2)我们将这些数据,在平面直角坐标系内,用坐标形式表示出来,它们分别为点:、、、.如果运用函数与统计等知识预测该区下一年的GDP,可以尝试选择直线AB、直线AC等函数模型来进行分析.
假设经济发展环境和条件不变,要预测该区第五年的GDP情况,可以参考方差等相关知识,分析选用哪一函数模型进行预测较为合适.
(说明:在计算与绘图时,当实际数据绘制的点与模型上对应的点位置越接近时,模型越适宜,这是数学建模中拟合函数的思想.我们可通过计算一组GDP所有实际值偏离图像上对应点纵坐标值的程度,即拟合误差,来进行模型分析,一般拟合误差越小越适宜.)
例如,分析直线AB,即上的点:可知,求得拟合误差.
①:请依据以上方式,求出关于直线的拟合方差值:______;
②:请你在直线与直线进行预测的两个方案中选择合适的那个预估,预估该区第五年的GDP.
【答案】(1)3.5;1.776875;10.0
(2)①0.0125;②直线更合适,14.8百亿元
【详解】(1)这组数据的极差为,
平均数为,
故方差为,
,故从小到大,选取第1个数作为20分位数,即10.0;
(2)①:设直线的表达式为,
根据题意,解得,
直线的表达式为,
分析直线,拟合误差,
②:,
直线更合适,
当时,,即第五年的GDP约为14.8百亿元
方法技巧
1.逐句拆解题干新定义的计算公式、判定标准;
2.提取样本数据,先完成基础统计量(均值、频率、回归系数)计算;
3.将基础结果代入全新定义公式分步运算;
4.对比数值大小给出结论,结合现实场景文字阐述意义
【变式6-1】(2026·安徽合肥·模拟预测)某中学举办校园文化节,设置了“数智达人”和“英语秀达人”两项特色活动,两项活动前10名得分统计如下:
数智达人前10名分数
148,146,144,142,140,140,138,136,134,132
英语秀达人前10名分数
144,143,142,141,140,140,139,138,137,136
(1)求出数智达人前10名分数的平均数、标准差;
(2)经检查发现:有一名同学的数智达人与英语秀达人得分均在前10名,但是老师却将其数智达人与英语秀达人得分统计反了,已知正确的数智达人前10名分数的平均分为141,标准差为.
①求该生正确的数智达人得分是多少?并说明理由;
②为了便于成绩分析,对数智达人前10名的正确分数进行“分数”转换,要求如下:转化前后名次不变,且10个“分数”的平均分为50、标准差为10.请你给出一个满足要求的线性转换公式:(其中,表示数智达人分数,表示数智达人分数对应的“分数”,,为常数),并证明.
(参考公式:)
【答案】(1)平均数为140,标准差为;
(2)①142分,理由见解析;②,证明见解析
【分析】(1)利用平均数和标准差公式代入计算即可;
(2)①根据平均分多1分,可得实际分数比统计的多10分,再结合标准差为分析两种情况;②分别代入并验证即可.
【详解】(1)设数智达人前10名学生分数的平均分为,标准差为,
则,
;
(2)①正确的数智达人前10名分数的平均分为141,比原平均分140高1分,故10名同学的总分增加了分.
设被错误统计在“数智达人”名单中的分数为,该生正确的“数智达人”分数为,则.
核对两个成绩单,有两种可能:1. 错误记录的分数,正确分数;2. 错误记录的分数,正确分数.
若, ,则:
;
若, ,则:
;
所以, ,即:正确的数智达人得分为142分.
②设转换公式为,则 ,
所以,将 代入,
得,所以,,
即满足要求的线性转换公式为,
证明:因为“分数”转换之前的10个正确分数的平均分是,
标准差为,则转换后的平均分.
因为,
所以转换后的标准差 ,
即转换公式,满足条件得证.
【变式6-2】(2026·湖南长沙·模拟预测)为研究某疾病与超声波检查结果的关系,从做过超声波检查的人群中随机调查了人,得到如下列联表:
正常
不正常
合计
患该疾病
未患该疾病
合计
(1)记超声波检查结果不正常者患该疾病的概率为,求的估计值;
(2)根据所选择的个人的数据,能否有的把握认为超声波检查结果与是否患该疾病有关?
附: ,
【答案】(1)
(2)有的把握认为超声波检查结果与是否患该疾病有关.
【分析】(1)根据古典概型计算求解即可,
(2)设出零假设,计算出卡方,与临界值比较即可判断.
【详解】(1)由题可知,超声波检查结果不正常者有人,这人中患该疾病的有人,
则,所以的估计值为.
(2)假设:超声波检查结果与是否患该疾病无关,
根据列联表中的数据,则,
因为当成立时,,而,
所以我们有的把握认为超声波检查结果与是否患该疾病有关.
分层进阶·双阶训练验成效
巩固过关
1.(2026·江西新余·二模)在某高校举行的一次国际学术与文化交流会上,对外国留学生举行了“中华文化知多少”的知识竞赛.某数学兴趣小组从中随机抽取部分学生的成绩,整理后分成五段:,绘制了如下的频率分布直方图.
(1)求的值;
(2)若参赛学生共有2000名,估计其中成绩小于70分的人数;
【答案】(1)
(2)
【分析】(1)根据频率分布直方图中,所有小矩形面积和为1,即可求得答案.
(2)先求出成绩小于70分的频率,根据总人数,即可得答案.
【详解】(1)由频率分布直方图中,所有小矩形面积和为1,
可得,解得.
(2)由图象可得,成绩小于70分的频率为,
则成绩小于70分的人数为.
2.(25-26高二下·浙江宁波·期末)某市名学生在某次数学竞赛中的成绩的频率分布直方图如下:
(1)求频率分布直方图中的值;
(2)估计这次数学竞赛成绩的中位数和平均数;(精确到0.1)
(3)估计这次数学竞赛中63分以上的人数.
【答案】(1)
(2)估计中位数为77.1,平均数为76.5
(3)855人
【分析】(1)根据频率分布直方图中各小矩形的面积和为1列方程求解;
(2)根据频率分布直方图中中位数左右两侧的矩形面积相等,均为,区间中点乘以相应组的频率可估计平均数,即可求解;
(3)首先求出63分以上的频率,进而可得63分以上的人数.
【详解】(1)由题意得,解得;
(2)由(1)得成绩落在的频率为,落在的频率为,落在的频率为,落在的频率为,落在的频率为,
因为,所以中位数落在上,
则可估计中位数为,
平均数为;
(3)设为63分以上的频率,为63分以上的人数,
则,所以,
故63分以上的人数估计为855人.
3.(2026·江苏·一模)某兴趣小组研究昼夜温差大小与患感冒人数多少之间的关系,他们到气象局和医院抄录了1~7月份每月5日的昼夜温差情况与因患感冒而就诊的人数,得到如下资料:
日期
1月5日
2月5日
3月5日
4月5日
5月5日
6月5日
7月5日
昼夜温差
10
11
13
12
8
7
6
感冒人数
23
25
29
26
16
13
9
该兴趣小组确定的研究方案是:先从这7组数据中选取2组,用剩下的5组数据求经验回归方程,再用被选取的2组数据进行检验.
(1)求选取的2组数据是不相邻的两个月的概率;
(2)若该小组选取的是1月与6月的两组数据,请根据剩下5个月份的数据:
①求出关于的经验回归方程;
②若由经验回归方程得到的估计数据与所选出的检验数据的误差均不超过2人,则认为得到的经验回归方程是理想的,问:该小组所得经验回归方程是否理想?说明理由.
附:
【答案】(1)
(2)①;②当时,;
当时,.
所以该小组所得经验回归方程是理想的.
【分析】(1)利用组合数和对立事件概率公式直接求解即可;
(2)①利用最小二乘法直接求解即可;
②分别将和代入回归直线方程,由此可得预估值,与检验数据之差的绝对值均不超过2可确定结论.
【详解】(1)记事件为“选取的2组数据是不相邻的两个月”,
则
(2)①由题意,,.
1
3
2
4
8
5
则,
即,
所以关于的经验回归方程为.
②略
4.(25-26高三下·甘肃武威·阶段检测)某新能源汽车公司为研究电池容量对续航里程的影响,随机选取了10辆不同配置的车进行测试,测量每辆车的电池容量(单位:)和续航里程(单位:),得到如下数据:
样本号
1
2
3
4
5
6
7
8
9
10
总和
电池容量
35
40
45
50
55
65
70
75
80
85
600
续航里程
330
350
390
410
480
520
560
620
640
700
5000
并计算得.
(1)估计这10辆车的平均电池容量与平均续航里程;
(2)求电池容量与续航里程的样本相关系数;(精确到0.001)
(3)现该公司计划推出新款车型,电池容量为,已知续航里程与电池容量近似成正比,利用以上数据给出新款车型续航里程的估计值.(精确到1)
附:相关系数.
【答案】(1)平均电池容量,平均续航里程.
(2)0.995
(3)
【详解】(1)平均电池容量,
平均续航里程.
(2)
(3)由样本数据,可知续航里程与电池容量的比值约为,
故新款车型续航里程的估计值为.
5.(2026高三·全国·专题练习)水体富营养化导致藻类大量繁殖,以2017年中国太湖蓝藻爆发为例:5月初监测发现湖体中蓝藻细胞密度为每升50万个,随着气温升高至25-30℃且氮磷营养盐浓度超标(总磷浓度达),蓝藻进入增长期.5月10日细胞密度增至每升200万个,5月15日突破每升800万个,5月20日达到每升3200万个,形成面积超150平方公里的绿色水华带.此次爆发导致湖区溶解氧骤降至以下,大量鱼类死亡,自来水厂被迫停产,所以对水资源的保护刻不容缓.现对某区域的藻类面积y(单位:平方公里)与时间x(单位:年)的关系,进行监测,得到如下数据:
x/年
1
2
3
4
5
6
7
y/平方公里
6
11
21
34
66
101
196
根据以上数据,绘制成如图所示的散点图:
观察散点图,两个变量不具有线性相关关系,现考虑用对数函数模型和指数函数模型分别对两个变量的关系进行拟合.
(1)根据散点图判断与(a,b,c,d均为常数)哪一个更适合作为藻类面积y(单位:平方公里)与时间x(单位:年)的关系的回归方程类型(给出判断即可,不必说明理由);
(2)根据(1)的判断结果及表中的数据,求出y关于x的回归方程.
参考数据:
62.14
1.54
2535
50.12
3.47
其中,
参考公式:对于一组数据,,…,其回归直线的斜率和截距的最小二乘估计公式分别为,.
【答案】(1)更适合;
(2).
【分析】(1)由散点图的递增趋势选择更适宜的模型;
(2)先根据所取模型进行线性变换,再代入公式求解回归模型.
【详解】(1)由散点图得,藻类面积随时间的增加其增长速度越来越快,
所以更适宜作为藻类面积y与时间x的关系的回归方程类型.
(2)由,两边同时取常用对数得,
设,,,则,
由,,
得,
则,
因此,即
,
所以y关于x的回归方程为.
6.(25-26高三上·湖南长沙·阶段检测)海水稻的灌溉是将海水稀释后进行灌溉.某试验基地为了研究海水浓度x(‰)对亩产量y(吨)的影响,通过在试验田的种植实验,测得了某种海水稻的亩产量与海水浓度的数据如表.绘制散点图发现,可用线性回归模型拟合亩产量y与海水浓度x之间的相关关系,用最小二乘法计算得y与x之间的经验回归方程为.
海水浓度(‰)
3
4
5
6
7
亩产量 (吨)
0.62
0.58
0.49
0.4
0.31
残差
(1)请你估计:当浇灌海水浓度为8‰时,该品种海水稻的亩产量;
(2)(i)完成上述残差表;
(ii)在统计学中,常用决定系数来刻画回归效果,越大,模型拟合效果越好,并用它来说明响应变量与解释变量的相关性.你能否利用以上表格中的数据,计算决定系数,并判断模型的拟合效果.(计算中数据精确到0.01)
(附:残差,决定系数)
【答案】(1)吨.
(2)(i)
海水浓度(‰)
3
4
5
6
7
亩产量 (吨)
0.62
0.58
0.49
0.4
0.31
残差
(ii),拟合效果较好.
【分析】(1)先求出平均数,代入经验回归方程即可求出b,从而求解.
(2)(i)根据经验回归方程求解,从而可得;
(ii)根据公式求出决定系数,进而判断.
【详解】(1)根据题中数据可知,,
将样本中心点的坐标代入经验回归方程得
,解得,
所以经验回归方程为.
当时,,
即当浇灌海水浓度为8‰时,该品种海水稻的亩产量为吨.
(2)(i)由经验回归方程可得
,;
,;
,;
,;
,.
所以残差表如下:
海水浓度(‰)
3
4
5
6
7
亩产量 (吨)
0.62
0.58
0.49
0.4
0.31
残差
(ii)由上数据可知,
,
所以决定系数,与1比较接近,
所以拟合效果较好.
7.(2026·山东日照·模拟预测)机器人技术的迅猛发展,已成为我国现代科技发展的标志性成就,现对100名青年(男青年50名,女青年50名)进行调研.统计结果显示:有60%的男青年希望拥有一个机器人助手,有30%的女青年希望拥有一个机器人助手,整理得到如下列联表.
拥有一个机器人助手意愿
性别
合计
男青年
女青年
希望拥有一个机器人助手
不希望拥有一个机器人助手
合计
50
50
100
(1)求,的值;
(2)根据小概率值的独立性检验,分析拥有一个机器人助手的意愿是否与性别有关.
附:,其中.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【答案】(1),
(2)有关
【分析】(1)根据列联表数值和题意可得,的值;
(2)计算,与临界值比较可得.
【详解】(1)因为有60%的男青年希望拥有一个机器人助手,
所以,.
因为有30%的女青年希望拥有一个机器人助手,
所以,.
所以 , ,如图,
(2)由题意完成列联表:
拥有一个机器人助手意愿
性别
合计
男青年
女青年
希望拥有一个机器人助手
30
15
45
不希望拥有一个机器人助手
20
35
55
合计
50
50
100
零假设为:拥有一个机器人助手的意愿与性别无关.
由(1)可得,,,,.
根据列联表中的数据,经计算得到
.
根据小概率值的独立性检验,可以推断不成立,即认为拥有一个机器人助手的意愿与性别有关.
8.(25-26高二下·吉林·期末)为了解使用手机是否对学生的学习有影响,某校随机抽取50名学生,对学习成绩和使用手机情况进行了调查,统计数据如表所示:
使用手机
不使用手机
总计
学习成绩优秀
5
20
25
学习成绩一般
15
10
25
总计
20
30
50
(1)根据表格数据计算是否有99.9%的把握认为学生的学习成绩与使用手机有关;
(2)现从上表不使用手机的学生中按学习成绩是否优秀分层抽样选出9人,再从这9人中随机抽取3人,记这3人中“学习成绩优秀”的人数为X,试求X的分布列与数学期望.
参考公式:,其中.
参考数据:
0.050
0.010
0.001
3.841
6.635
10.828
【答案】(1)没有99.9%的把握认为学生的学习成绩与使用手机有关
(2)
【分析】(1)根据表格中数据和题中信息可完善列联表,计算出的观测值,结合临界值表可得出结论;
(2)由题意可知,随机变量的可能取值有、、、,计算出随机变量在不同取值下的概率,可得出随机变量的分布列,进而可求得随机变量的数学期望值.
【详解】(1)零假设:学生的学习成绩与使用手机无关,
因,
所以,没有的把握认为学生的学习成绩与使用手机有关;
(2)人中学习成绩优秀的人有人,学习成绩一般的有人,
可能的取值有、、、,
,,,.
所以,随机变量的分布列为
.
【点睛】求解随机变量分布列的基本步骤:
(1)明确随机变量的可能取值,并确定随机变量服从何种概率分布;
(2)求出每一个随机变量取值的概率;
(3)列成表格,对于抽样问题,要特别注意放回与不放回的区别,一般地,不放回抽样由排列、组合数公式求随机变量在不同取值下的概率,放回抽样由分步乘法计数原理求随机变量在不同取值下的概率.
9.(2026·河南·模拟预测)某农业科研团队为探究大棚蔬菜的光照时长对产量的影响,选取5组不同的光照时长方案,在相同种植条件下开展试验,统计对应时长下的蔬菜合格采收量,得到如下数据:
每日光照时长
14
15
16
17
18
合格采收量
4
8
16
20
26
(1)求变量与的样本相关系数,判断是否适合线性回归模型拟合,如果适合,求关于的经验回归方程;
(2)当样本数据的残差绝对值大于1时,称该组数据为异常拟合数据,现从这5组数据中任取3组做残差分析,求取到异常拟合数据的组数的分布列和数学期望.
附:①样本相关系数,当时,相关性较强,当时,相关性一般;
②经验回归方程中斜率和截距的最小二乘估计公式分别为,;
③,,.
【答案】(1)适合,
(2)
0
1
2
【分析】(1)根据公式先求得,可得与的线性相关性很强,适合线性回归模型拟合,进而结合公式求解即可;
(2)计算可得异常拟合数据有2组,非异常拟合数据有3组,进而可得的所有可能取值为0,1,2,分别求出每一个对应的概率,再根据数学期望的公式求解即可.
【详解】(1)由已知,得,
,
所以,
所以.
因为,说明与的线性相关性很强,所以适合线性回归模型拟合.
因为,
,
所以关于的经验回归方程为.
(2)由(1)知,.
因为样本数据的残差绝对值大于1时,称该组数据为异常拟合数据,
所以5组数据的残差绝对值及数据状态如下表所示.
每日光照时长
14
15
16
17
18
合格采收量
4
8
16
20
26
预测值
3.6
9.2
14.8
20.4
26
残差的绝对值
0.4
1.2
1.2
0.4
0
是否为异常拟合数据
否
是
是
否
否
由表可知,异常拟合数据有2组,非异常拟合数据有3组,
所以从这5组数据中任取3组,异常拟合数据的组数的所有可能取值为0,1,2.
则,,,
所以的分布列为:
0
1
2
则的数学期望.
创新提升
1.(25-26高二上·广东中山·阶段检测)2023年10月22日,汉江生态城2023襄阳马拉松在湖北省襄阳市成功举行,志愿者的服务工作是马拉松成功举办的重要保障,襄阳市新时代文明实践中心承办了志愿者选拔的面试工作.现随机抽取了100名候选者的面试成绩,并分成五组:第一组,第二组,第三组,第四组,第五组,绘制成如图所示的频率分布直方图.已知第一、二组的频率之和为0.3,第一组和第五组的频率相同.
(1)估计这100名候选者面试成绩的下四分位数和平均数;
(2)在这100名候选者用分层随机抽样的方法从第四组和第五组面试者内抽取10人,再从这10名面试者中随机抽取两名,求两名面试者成绩都在第五组的概率.
(3)现从以上各组中用分层随机抽样的方法选取20人,担任本市的宣传者.若本市宣传者中第二组面试者的面试成绩的平均数和方差分别为62和40,第四组面试者的面试成绩的平均数和方差分别为80和70,据此估计这次第二组和第四组所有面试者的面试成绩的方差.
【答案】(1)63,
(2);
(3)
【分析】(1)由题意先求出,进一步结合平均数公式、百分位数的定义即可列式求解;
(2)由列举法求解古典概型概率即可;
(3)由分层抽样方差公式计算即可.
【详解】(1)由题意可知:,解得,
可知每组的频率依次为:0.05,0.25,0.45,0.2,0.05,
因为,
设下四分位数即第25百分位数为,则,
则,解得,故下四分位数为63.
平均数为,
(2)因为第四组和第五组频率为0.2和0.05,所以10人中,第四组为8人.第五组为2人,
记第四组的人的编号为1到8,第五组的人的编号为9和10,
则样本空间
共45个样本点,
记两名面试者成绩都在第五组为事件A, 则事件,故;
(3)设第二组、第四组面试者的面试成绩的平均数与方差分别为,
且两组频率之比为,则第二组和第四组所有面试者的面试成绩的平均数,
第二组和第四组所有面试者的面试成绩的方差
.
所以估计第二组和第四组所有面试者的面试成绩的方差是.
2.(25-26高三下·山东聊城·阶段检测)芯片产业对于国家的科技安全与经济发展具有不可估量的战略意义,近些年来,国家和企业纷纷加大对芯片的投入力度.国内某芯片公司为制订下一年的研发投入计划,需了解年研发资金投入量x(单位:亿元,下同)对年销售额y(单位:亿元,下同)的影响,该公司收集了最近10年的年研发资金投入量和年销售额()的数据:已知第1年的研发资金投入量为2亿元,每年的年研发资金投入量比上一年增长4亿元,随着年研发资金投入量的增长,公司的年销售额也在增长.公司对数据进行了初步处理,得到如下数据(其中,);,,.公司甲、乙两个研究团队用年研发资金投入量x为解释变量,年销售额y为响应变量建立经验回归方程.已知甲研究团队用函数模型①(为常数,e为随机误差)得到的经验回归方程为乙研究团队用函数模型②(为常数,为随机误差).
(1)求乙研究团队建立的一元非线性经验回归方程(精确到);
(2)现已知第11年公司投入研发资金40亿元,公司的年销售收入为91亿元.根据以上信息,请你对这两个团队的模型优劣进行比较,并说明理由;
(3)研究发现,这两个模型均满足:对于每一个解释变量t,得到响应变量为u,且年研发资金投入为t亿元时,年销售额y服从正态分布,公司为了保证有97.725%的把握获得年销售额100亿,请你根据你得到的较好模型,问公司预计至少需要投入研发资金约为多少亿元?(保留到0.01)
参考公式与数据:
①成对数据()的经验回归直线方程为,其系数为,.②参考数据:假设,则,.③.④,,,.
【答案】(1);
(2)乙团队的模型更优,答案见解析
(3)(亿元).
【详解】(1)已知是首项为2、公差为4的等差数列,,
则由等差数列前n项和公式得,
,
故,对于模型,
令,转化为线性回归.
根据线性回归系数公式:,,
因此,乙团队回归方程为;
(2)甲团队(线性模型):当时,,残差的绝对值;
乙团队(非线性模型):当时,,残差的绝对值,
因为乙团队模型预测值与实际值的残差的绝对值更小,
所以乙团队的模型更优,能更好地拟合数据,反映年研发资金投入量与年销售额的关系;
(3)已知,要保证97.725%把握(对应分位数),
需.代入乙模型,,
得:,解得,
即(亿元).
预计至少需要投入研发资金约为亿元.
3.(2026·湖南长沙·一模)某医药研究所为了评估一种新药的疗效,开展了临床试验.研究人员记录了14名志愿者服用不同剂量的药物后,血液中某关键生化指标y(单位:)随给药剂量x(单位:mg)的变化情况.为了寻找最合适的预测模型,研究人员分别利用模型一和模型二对这14组数据进行了拟合,并绘制了相应的残差图(如图所示,图中纵轴为残差,横轴为给药剂量).
(1)观察残差图,判断哪个模型的拟合效果更好,并说明理由;
(2)设这14组数据得到的经验回归方程为.
(ⅰ)已知样本中的某位志愿者的给药剂量为,生化指标为.若该样本点在拟合效果更优的模型中的残差对应于图中标注的四点之一,请指出该点并说明理由;
(ⅱ)若在这14组数据中,给药剂量的标准差为,生化指标的标准差为,求生化指标与给药剂量的相关系数.(结果精确到0.01)
参考公式:相关系数;经验回归方程中斜率和截距的最小二乘估计公式分别为,.
【答案】(1)模型一的拟合效果更好,理由如下:
模型一残差点比较均匀地落在水平的带状区域中,且带状区域的宽度比模型二的带状宽度窄,所以模型一的拟合精度更高,经验回归方程的预报精度相应就越高.
(2)(ⅰ)点,理由如下:
因为模型一的拟合效果更好,经验回归方程为,
所以该方程相应于点的残差为,故选点;
(ⅱ)
【分析】(1)根据残差图,比较带状区域的宽度即可得出判断;
(2)(ⅰ)计算出残差即可求解;(ⅱ)根据相关系数公式及经验回归方程计算即可.
【详解】(1)略
(2)(ⅰ)略
(ⅱ)由题可知,,
所以,
由,,
所以
.
4.(2026·上海·模拟预测)小新为调查学生数学建模能力的总体水平,随机抽取了100名高中生参加数学建模能力竞赛活动,其中男生40名,女生60名.根据竞赛成绩,将参赛学生数学建模能力分为“优秀”与“合格”两级.
(1)若男生和女生中分别有25名和35名被评为“优秀”,是否有95%的把握认为该地区高中生的数学建模能力优秀与否和性别有关?
(2)经统计,男生成绩的均值为80,方差为49;女生成绩的均值为75,方差为64,求全体参赛学生成绩的均值及方差.
(3)在(2)的条件下,若所有参赛学生的成绩服从正态分布,试估计成绩在范围内的学生人数(四舍五入精确到个位).
参考:①,其中;;
②、、.
【答案】(1)没有;
(2),;
(3)82人
【分析】(1)由公式求得,得到,即可求解;
(2)由均值和方差的计算公式即可求解;
(3)转换成标准正态分布,进而可求解.
【详解】(1)提出零假设:该地区高中生的数学建模能力优秀与否和性别无关,
显著性水平,
计算,
因为,所以接受原假设,
即没有95%的把握认为该地区高中生的数学建模能力优秀与否和性别有关;
(2),
故;
(3)由(2),得,
设,则,
故,
故成绩在范围内的学生约为82人.
5.(2026·广东广州·二模)某公司为了了解A商品销售收入(单位:万元)与广告支出(单位:万元)之间的关系,现收集的5组样本数据如下表所示,且经验回归方程为.
2
5
6
8
9
16
20
21
28
10.96
19.24
22
27.52
30.28
(1)求的值;
(2)现从这5组数据的残差中抽取2组进行分析(观测值减去预测值称为残差),记X表示抽到数据的残差为负的组数,求X的分布列和期望;
(3)已知,且当时,回归方程的拟合效果良好,试结合数据,判断经验回归方程的拟合效果是否良好.
【答案】(1)
(2)
0
1
2
(3)经验回归方程的拟合效果不良好
【分析】(1)求出根据回归直线必过样本中心点求解即可;
(2)可能取值为,求出对应概率,进而得到分布列和期望;
(3)求出代入公式,即可得到答案.
【详解】(1),
,
因为,即,
解得.
(2)5组数据中,两组数据残差为正值,三组数据残差为负值,
所以可能取值为,
,
,
,
所以X的分布列为
0
1
2
期望.
(3),
,
所以经验回归方程的拟合效果是不良好.
8 / 8
学科网(北京)股份有限公司
$
相关资源
示范课
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。