第9章 统计(知识清单+5大易错点)数学苏教版选择性必修第二册
2026-05-25
|
2份
|
55页
|
219人阅读
|
5人下载
精品
摘要:
该高中数学统计单元知识清单系统梳理了线性回归方程与独立性检验核心内容,涵盖变量相关关系、回归模型构建、拟合效果判断、独立性检验四大知识范畴,搭建了从概念理解到模型应用再到易错点辨析的递进式学习支架。
清单以“知识点-具体内容-易错点”三级结构呈现知识体系,重点标注线性回归方程参数计算等核心要点,通过“易错01-05”专栏分析概念混淆(如相关系数与决定系数)等典型问题,配套练习题强化应用,培养学生数据观念与模型观念,助力学生自主高效复习,教师可据此优化教学策略。
内容正文:
第9章 统计
知识点
具体内容
线性回归方程
1.变量的相关关系
相关关系
两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度
正相关与负相关
如果从整体上看,
当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势,则称这两个变量正相关;
当一个变量的值增加时,另一个变量的相应值呈现减少的趋势,则称这两个变量负相关
线性相关
如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们称这两个变量线性相关
非线性相关
如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量非线性相关
2.样本相关系数
①样本相关系数r的计算公式:.
②样本相关系数r的性质:
当r>0时,表明两个变量正相关;当r<0时,表明两个变量负相关
|r|越接近于1,表明两个变量的线性相关性越强;|r|越接近于0,表明两个变量的线性相关性越弱.
通常|r|大于0.75时,认为两个变量有很强的线性相关关系
3.一元线性回归模型
①最小二乘法:即使得样本数据的点到回归直线的距离的平方和最小.
若变量x与y具有线性相关关系,有n个样本数据,则回归方程中,.
其中,称为样本点的中心.
②线性回归模型,其中称为随机误差,自变量称为解释变量,因变量称为预报变量
4.判断回归模型的拟合效果
方法
决定系数法
残差图
残差平方和
公式
称为相应于点的残差,
刻画效果
越接近于1,表示回归的效果越好
残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,其中这样的带状区域的宽度越窄,说明模型拟合精确度越高.
残差平方和越小,模型的拟合效果越好
5.建立非线性回归模型的基本步骤:
①确定研究对象,明确哪个是解释变量,哪个是预报变量;
②画出确定好的解释变量和预报变量的散点图,观察它们之间的关系(是否存在非线性关系);
③由经验确定非线性回归方程的类型(如我们观察到数据呈非线性关系,一般选用反比例函数、指数函数、对数函数模型等);
④通过换元,将非线性回归方程模型转化为线性回归方程模型;
⑤按照公式计算线性回归方程中的参数(如最小二乘法),得到线性回归方程;
⑥消去新元,得到非线性回归方程;
⑦得出结果后分析残差图是否有异常.若存在异常,则检查数据是否有误,或模型是否合适等.
常见的非线性回归方程的转化:
曲线方程
变换公式
变换后的线性关系式
独立性检验
1.2×2列联表
设X,Y为两个变量,它们的取值分别为和,其样本频数列联表(列联表)如下:
总计
a
b
a+b
c
d
c+d
总计
a+c
b+d
2.独立性检验
①利用随机变量(也可表示为)(其中为样本容量)来判断“两个变量有关系”的方法称为独立性检验;
②基于小概率值的检验规则:
当时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过;
当时,我们没有充分证据推断H0不成立,可以认为X和Y独立
易错01混淆相关系数和决定系数
注意:注意区分两者含义与范围:相关系数,用于判断线性相关方向与强弱;决定系数,用于判断回归模型拟合效果。不可混用符号、范围与作用,答题时看清题目要求,避免概念混淆。
1.观察下列散点图,其中图1两个变量的相关关系为,图2两个变量的相关关系为 则判断一定正确的是( )
A. B. C. D.
【答案】A
【详解】①分析图1的相关系数观察图1,散点图中的点大致分布在从左上到右下的带状区域内;
随着的增大,总体呈减小趋势,根据相关系数的定义,
两个变量呈负相关,故;
②分析图2的相关系数观察图2,散点图中的点大致分布在从左下到右上的带状区域内;
随着的增大,总体呈增大趋势;
根据相关系数的定义,两个变量呈正相关,故;
此外,观察图2中点的分布比图1更紧密地围绕在一条直线附近,
说明图2的线性相关性更强,即
选项,已知且,且,故 成立;
选项,因为且,所以,故选项B错误;
选项,因为且,则,选项C错误;
选项,因为且,则,显然不可能大于1,故选项D错误.
2.(多选)下列命题正确的是( )
A.线性回归直线必然过样本中心点
B.在刻画回归模型的拟合效果时,决定系数的值越大,说明拟合的效果越好
C.已知两个变量线性相关,若它们的相关性越强,则相关系数r越接近于1
D.正态曲线当一定时,越小,这条曲线越“瘦高”;越大,正态曲线越“矮胖”
【答案】ABD
【详解】对于A,线性回归直线必然经过样本中心点,这是线性回归的基本性质,故A正确;
对于B,决定系数是衡量回归模型拟合效果的重要指标,其值越大(越接近),说明模型解释因变量变异的能力越强,即拟合效果越好,故B正确;
对于C,相关系数的绝对值越接近,表示两个变量的线性相关性越强,故C错误;
对于D,正态分布中,当固定时,越小,曲线越“瘦高”,数据越集中;越大,曲线越“矮胖”,数据越分散;故D正确.
3.(多选)下列说法正确的是( )
A.样本相关系数r越大,则线性相关性越强
B.用决定系数刻画回归效果,越接近1,说明回归模型的拟合效果越好
C.在回归分析中,残差图中残差比较均匀地分布在以取值为0的横轴为对称轴的水平带状区域内,且宽度越窄表示拟合效果越好
D.在独立性检验中,零假设必须是“分类变量X与Y独立”,不能是“分类变量X与Y有关”
【答案】BCD
【详解】对于A,两个变量的样本相关系数为r,则越大,线性相关程度越强,故A错误;
对于B,决定系数越接近1,值越大,残差平方和越接近0,值越小,则该回归模型的拟合效果越好,故B正确;
对于C,因为在残差的散点图中,残差分布的水平带状区域的宽度越窄,表明数据越集中,模型的拟合效果越好,故C正确;
对于D,在独立性检验中,将“分类变量X与Y独立”作为零假设,是因为在此假设下可以计算出期望频数,从而构造检验统计量进行检验,故D正确.
4.(多选)DeepSeek的火爆源于其突破性AI技术的高效应用,充分展现了人工智能在驱动创新解决方案和满足广泛市场需求中的核心作用.某高中的数学社团以16至40岁人群使用DeepSeek频率为课题,分小组自主选题进行调查研究,下列说法错误的是( )
A.甲小组开展了DeepSeek每周使用频次与年龄的相关性研究,经计算样本相关系数,可以推断两个变量正线性相关,但相关程度很弱
B.乙小组利用最小二乘法得到DeepSeek每周使用频次y关于年龄x的经验回归方程为,可以推断年龄为30岁的群体每周使用频次可能为17次
C.丙小组研究性别因素是否影响DeepSeek使用频次,根据小概率值的独立性检验,计算得到,可以认为不同性别的DeepSeek使用频次没有差异
D.丁小组用决定系数来比较模型的拟合效果,经验回归方程①和②的分别约为0.733和0.998,因此经验回归方程②的刻画效果比经验回归方程①的好很多
【答案】AC
【详解】对于A,由的绝对值越接近1,相关性越强可得A错误,故A错误;
对于B,回归方程为给出的是预测值,实际值会有随机误差,所以年龄为30岁的群体每周使用频次不一定为17次,故B正确;
对于C,,可以认为不同性别的Deep Seek使用频次有差异,故C错误,
对于D,表示模型对因变量的解释比例,大说明经验回归方程②的刻画效果比经验回归方程①的好很多,故D正确;
故选:AC.
5.某医药研究所为了评估一种新药的疗效,开展了临床试验.研究人员记录了14名志愿者服用不同剂量的药物后,血液中某关键生化指标(单位:)随给药剂量(单位:)的变化情况.为了寻找最合适的预测模型,研究人员分别利用模型一和模型二对这14组数据进行了拟合,并绘制了相应的残差图(如图所示,图中纵轴为残差,横轴为给药剂量).
(1)观察残差图,判断哪个模型的拟合效果更好,并说明理由;
(2)设这14组数据得到的经验回归方程为.
(ⅰ)已知样本中的某位志愿者的给药剂量为,生化指标为.若该样本点在拟合效果更优的模型中的残差对应于图中标注的四点之一,请指出该点并说明理由;
(ii)若在这14组数据中,给药剂量的标准差为,生化指标的标准差为,求生化指标与给药剂量的相关系数.(结果精确到0.01)
参考公式:相关系数;
经验回归方程中斜率和截距的最小二乘估计公式分别为,
【答案】(1)模型一,理由见解析
(2)(i)A点,理由见解析;(ii)
【分析】
【详解】(1)模型一拟合效果好.
理由如下:
模型一的残差图中的点更集中地分布于以取值为0的横轴为中心的宽度更窄的水平带状区域内,
说明预测值与真实值偏差更小.
(2)(ⅰ)在中,代入,得,
于是残差为,因此对于模型一中的A点.
(ⅱ),,
.
易错02求回归直线方程计算错误
注意:计算回归系数与截距时,先准确计算、及求和式,分步代入公式避免算错。牢记,先算斜率再算截距,计算后带回检验,确保结果正确,防止因计算粗心失分。
6.某创业者计划开设一家咖啡店,他从本市已开业的15家规模相似的咖啡店中收集了以下数据:x表示周边一公里内日均人流量(千人);y表示日均销售额(百元).
x
4.2
5.2
5.2
6.2
6.2
6.2
5.2
7.2
9.2
8.2
8.2
8.2
9.2
9.2
10.2
y
34
38
40
40
46
52
42
52
54
47
58
69
64
74
70
经计算得
(1)求y关于x的线性回归方程;
(2)预测x=8时,y的估计值y₀;
(3)计算变量x和y的样本相关系数r.
附:最小二乘估计公式分别为:
样本相关系数
【答案】(1)
(2)
(3)
【分析】
【详解】(1) ,
因为样本中心点在回归直线上,所以 ,
所以关于的线性回归方程为 .
(2)当时,的估计值 .
(3).
7.“一人公司”是指个人借助工具,独立完成产品设计研发到市场投放的全链路商业闭环,某数字文化创意制作有限公司是“一人公司”,连续5个月的科技投入(万元)与利润额(万元)的数据如下:
第月
1
2
3
4
5
投入
2
2
4
5
7
利润额
3
7
10
15
20
(1)从这5个月的利润额中随机抽取3个数值,记大于9万元的数值个数为,求的分布列及均值:
(2)已知与线性相关,求关于的经验回归方程,并预测投入为10万元时的利润额.附:经验回归直线中斜率和截距的最小二乘估计公式分别为,.
【答案】(1)X的分布列为:
1
2
3
均值(或1.8)
(2)经验回归方程为,投入10万元时预测利润额为万元(或约29.33万元)
【分析】
【详解】(1)由题可知,5个利润额中大于9万元的共3个,不大于9万元的共2个,抽取3个数值时,的可能取值为1,2,3,服从参数为的超几何分布:
,
,
,
因此X的分布列为:
1
2
3
均值为:.
(2)首先计算样本均值:,
计算最小二乘估计所需的分子、分母:
,
,
所以,
因此经验回归方程为,
当时,,即投入10万元时预测利润额为万元.
8.某农业科研团队为探究大棚蔬菜的光照时长对产量的影响,选取5组不同的光照时长方案,在相同种植条件下开展试验,统计对应时长下的蔬菜合格采收量,得到如下数据:
每日光照时长
14
15
16
17
18
合格采收量
4
8
16
20
26
(1)求变量与的样本相关系数,判断是否适合线性回归模型拟合,如果适合,求关于的经验回归方程;
(2)当样本数据的残差绝对值大于1时,称该组数据为异常拟合数据,现从这5组数据中任取3组做残差分析,求取到异常拟合数据的组数的分布列和数学期望.
附:①样本相关系数,当时,相关性较强,当时,相关性一般;
②经验回归方程中斜率和截距的最小二乘估计公式分别为,;
③,,.
【答案】(1)适合,
(2)
0
1
2
【分析】
【详解】(1)由已知,得,
,
所以,
所以.
因为,说明与的线性相关性很强,所以适合线性回归模型拟合.
因为,
,
所以关于的经验回归方程为.
(2)由(1)知,.
因为样本数据的残差绝对值大于1时,称该组数据为异常拟合数据,
所以5组数据的残差绝对值及数据状态如下表所示.
每日光照时长
14
15
16
17
18
合格采收量
4
8
16
20
26
预测值
3.6
9.2
14.8
20.4
26
残差的绝对值
0.4
1.2
1.2
0.4
0
是否为异常拟合数据
否
是
是
否
否
由表可知,异常拟合数据有2组,非异常拟合数据有3组,
所以从这5组数据中任取3组,异常拟合数据的组数的所有可能取值为0,1,2.
则,,,
所以的分布列为:
0
1
2
则的数学期望.
9.某商场对商品售卖的情况进行统计,已知该商场共六层.
(1)当各楼层的商品种类相近时,得到该商场各楼层的销售额(单位:万元)的值:
楼层
1
2
3
4
5
6
销售额
700
500
400
200
100
100
记销售额与楼层之间的经验回归方程为.
(i)求(用分数表示);
(ii)求(用分数表示).
(2)由于网络热点的影响,销售利润(单位:万元)近似服从正态分布,求销售利润在的概率.
附:回归直线中斜率和截距的最小二乘估计公式分别为.
若,则,.
参考数据:.
【答案】(1)(i);(ii)
(2)0.8186
【分析】
【详解】(1)(i),,
,
所以.
(ii).
(2)注意到,
所以,
,
故销售利润在的概率为0.8186.
10.2026 年 3 月, 某市“山城邻里”社区团购平台在市中心商业区设立户外直播间, 推广本地特产晚熟春橙. 该社区团购平台共进行了5场户外直播销售,相应的直播时长与销售额数据经财务与运营双岗复核如下:
场次
1
2
3
4
5
时长(小时)
1
2
3
4
5
销售额(万元)
3.0
5.0
7.0
10.0
12.0
(1)求销售额关于直播时长的经验回归方程;
(2)从这5场直播中随机抽取2场复盘,记“销售额超过7万元”的场数为,求的分布列与数学期望.
附:回归直线的斜率和截距的最小二乘估计公式分别为: ,.
【答案】(1);
(2)的分布列为
数学期望.
【分析】
【详解】(1)首先计算均值:,,
计算所需求和项:
,
,
根据最小二乘公式计算系数:
,
,
因此,经验回归方程为.
(2)5场直播中,销售额超过7万元的共有2场,不超过7万元的共有3场,的所有可能取值为0,1,2,服从超几何分布.
计算概率:
,
,
.
因此的分布列为:
计算数学期望:.
易错03线性回归分析,误将“样本点中心”排除在回归直线外
注意:回归直线必过样本点中心,这是高频考点与检验依据。解题时可直接用该点快速求或验证方程,不可主观认为样本点不在直线上,避免违背基本性质导致思路错误。
11.“千年一面,中江挂面”,近年来,中江挂面村火遍全网.这不仅为中江带来了大量游客,还使中江手工挂面供不应求,销售额大幅提升.已知某手工挂面加工企业2024年10月—2025年2月销售额对应如下表.且用最小二乘法得到销售额关于月份序号的回归直线方程为,则2025年1月销售额( )
时间
2024年10月
2024年11月
2024年12月
2025年1月
2025年2月
月份序号
1
2
3
4
5
销售额(万元)
13.5
15.0
17.0
20.5
A.19.0(万元) B.18.8(万元) C.18.6(万元) D.18.4(万元)
【答案】A
【详解】,
由线性回归方程的性质可知,回归直线必过样本中心点,
将代入回归方程,得,
,
令,解得.
12.已知变量,具有线性相关关系,由样本数据(,2,3,4,5)得到关于的经验回归方程为,若,,则当时,的预测值为( )
A. B. C. D.
【答案】A
【详解】由,,得,,
点在回归直线上,故,解得,
,
故当时,.
13.用模型拟合一组数据,令,若根据样本数据计算可得,,且与的经验回归方程为,则( )(参考数据,)
A.1.2 B.0.92 C.0.3 D.0.4
【答案】D
【详解】由,,
则,解得,因此,
由两边取对数,得,又,
所以,又因为,所以.
14.现有10个样本数据,,…,,可得经验回归方程为,且,若去掉一个数据点后,可以得到新的经验回归方程为,则实数的值为( )
A.1 B. C. D.2
【答案】A
【详解】根据回归直线过样本中心点,代入得:
,所以原个样本的值总和为:,
去掉后,剩余个样本的值总和为:,值总和为:
因此新的样本中心点为:,
因为新的经验回归方程为,回归直线必过新的样本中心点,代入得:
,解得:.
15.某产品的广告投入(万元)与销售额(万元)的统计数据如下图所示:若关于的线性回归方程为,则__________.
2
3
5
6
20
35
50
55
【答案】6
【详解】由题意得,,
代入回归直线方程得,解得.
易错04非线性回归换元与还原出错
注意:非线性回归需先换元转化为线性模型,求解后必须还原得到原变量方程。注意指数、对数、幂函数型的不同变换方式,换元前后变量对应清晰,避免只转化不还原或还原错误。
16.某科技公司在人工智能领域逐年加大投入,根据近年来该公司对产品研发年投入额x(单位:百万元)与其年销售量y(单位:千件)的数据统计,得到散点图如图.用线性回归和指数型回归模型拟合y与x关系的决定系数分别为和,则根据参考数据,下列表达式中最适宜描述y与x之间关系的函数为( )
参考公式:用最小二乘法求经验回归直线方程的系数公式为.
参考数据:令
3
2.5
0.5
10
12
6
A. B. C. D.
【答案】D
【详解】由用线性回归和指数型回归模型拟合y与x关系的决定系数分别为和,
得,则指数型回归模型最适宜拟合y与x关系,排除AB;
设y与x之间关系的函数为,两边取对数得,设,则,
因此,,
即,,C错误,D正确.
故选:D
17.某地新开了一条夜市街,每晚最多能接纳10万人.主办公司计划通过广告宣传提高客流量.通过调研,发现投入的广告费x与每晚客流量y存在如下关系:
x/万元
1
2
3
4
5
y/千人
5
6
8.1
9
14.5
附,,,,
令,,,.
现用曲线拟合变量x与y的相关关系,并利用一元线性回归模型求参数,的最小二乘估计,依所求回归方程C为预测依据,则( )
A.曲线C经过点
B.
C.若投入广告费9万元,则每晚客流量会超过夜市接纳能力
D.广告费每增加1万元,每晚客流量增加3000人
【答案】BC
【详解】由题可知,令,,,
,
所以,
,故B正确;
所以,
令,,
所以曲线C不经过点,故A错误;
当时,千人,
所以若投入广告费9万元,则每晚客流量为万人,
因为每晚最多能接纳10万人,所以会超过夜市接纳能力,故C正确;
由可知,当时,,
所以当广告费从5万元增加到6万元,客流量增加千人,故D错误.
故选:BC
18.近期,某市公交公司分别推出支付宝和微信扫码支付乘车活动,活动设置了一段时间的推广期,由于推广期内优惠力度较大,吸引越来越多的人开始使用扫码支付.某线路公交车队统计了活动刚推出一周内每一天使用扫码支付的人次,用x表示活动推出的天数,y表示每天使用扫码支付的人次(单位:十人次),统计数据如表所示:
1
2
3
4
5
6
7
6
11
21
34
66
101
196
根据以上数据,绘制了散点图.
(1)根据散点图判断,在推广期内,与(均为大于零的常数)哪一个适宜作为扫码支付的人次关于活动推出天数的经验回归方程?(给出判断即可,不必说明理由)
(2)根据(1)的判断结果及表中的数据,建立关于的回归方程,并预测活动推出第8天使用扫码支付的人次.
[参考数据:,,,,,其中,]
【答案】(1)适宜
(2),347十人次
【分析】
【详解】(1)由散点图,得适宜作为扫码支付的人次y关于活动推出天数x的回归方程类型.
(2)由,两边同时取常用对数,得,
设,则,由,,
得,,
因此,即,则,
当时,得,
所以y关于x的回归方程为,活动推出第8天使用扫码支付的人次为347十人次.
19.某市某医疗器械公司转型升级,从9月1日开始投入呼吸机生产,该公司9月1日~9月9日连续9天的呼吸机日生产量为(单位:百台,,2,,9),数据作了初步处理,得到如图所示的散点图.
2.73
19
5
285
1095
注:图中日期代码1~9分别对应9月1日~9月9日;表中,.
(1)从9个样本点中任意选取2个,在2个样本点的生产量都不高于300台的条件下,求2个样本点都高于200台的概率;
(2)由散点图分析,样本点都集中在曲线的附近,求y关于t的方程,并估计该公司从生产之日起,需要多少天呼吸机日生产量可超过500台.
参考数据:.
【答案】(1)
(2),38天
【分析】
【详解】(1)由散点图知,不高于300台的样本点有5个,其中高于200台的样本点有4个,
则在2个样本点的生产量都不高于300台的条件下,2个样本点都高于200台的概率为
(2)
则由回归直线方程系数求解公式知,
,
,
故.
,
所以需要38天呼吸机日生产量可超过500台.
20.统计显示,我国在线直播生活购物用户规模近几年保持高速增长态势,下表为年—年我国在线直播生活购物用户规模(单位:亿人),其中年—年对应的代码依次为—.
年份代码
市场规模
,,,其中
参考公式:对于一组数据、、、,其经验回归直线的斜率和截距的最小二乘估计公式分别为,.
(1)由上表数据可知,若用函数模型拟合与的关系,请估计年我国在线直播生活购物用户的规模(结果精确到);
(2)已知我国在线直播生活购物用户选择在品牌官方直播间购物的概率,现从我国在线直播购物用户中随机抽取人,记这人中选择在品牌官方直播间购物的人数为,若,求的数学期望和方差.
【答案】(1)亿人
(2),
【分析】
【详解】(1)设,则,
因为,,,
所以,,
所以,与的拟合函数关系式为
当时,,
则估计年我国在线直播生活购物用户的规模为亿人.
(2)由题意知,所以,,
,
由,可得,
因为,解得,
所以,,.
易错05求解独立性检验问题对的值理解不准确
注意:是判断变量是否独立的统计量,计算时严格代入公式。越大越拒绝独立假设,需与临界值比较下结论,不可只看大小不对比临界值。
21.学校在一次调查“体育迷”的活动中,随机调查了100名同学,获得了如下数据:
性别
是否体育迷
男
女
合计
体育迷
45
非体育迷
10
合计
75
100
计算得,则下列结论正确的是( )
0.050
0.010
0.001
3.841
6.635
10.828
A.
B.是与的等差中项
C.任取1人为体育迷的概率为
D.没有的把握认为是否为体育迷与性别有关
【答案】ABD
【详解】由题知,,,,,
对于A,由上述计算知,,故A正确;
对于B,,因为,
所以是与的等差中项,故B正确;
对于C,由表可知,随机调查的100名同学中,45名同学为体育迷,
所以任取1人为体育迷的概率为,故C错误;
对于D,,则没有的把握认为是否为体育迷与性别有关,故D正确.
22.在独立性检验中,显著水平以及对应的分位数如下:
0.1
0.01
2.706
6.635
某社团就喜欢长跑与学生性别的关系进行了一个随机调查,根据男女生人数以及男女生是否喜欢长跑的人数,计算得,则( )(多选)
A.有的把握认为喜欢长跑与性别有关
B.“喜欢长跑”与“是女生”独立的概率不小于
C.在犯错误的概率不超过的前提下,可以认为是否喜欢长跑与性别无关
D.在犯错误的概率不超过的前提下,可以认为“喜欢长跑”与“是女生”不独立
【答案】AD
【详解】假设“喜欢长跑”与“是女生”独立,则我们就观察到了一个概率不超过的事件:
亦即在犯错误的概率不超过的前提下,可以认为“喜欢长跑”与“是女生”不独立
(也称为是否喜欢长跑与性别有关);或说有的把握认为是否喜欢长跑与性别有关,BC错误,AD正确.
23.(多选)某医疗机构通过抽样调查(样本容量),利用2×2列联表和统计量研究患肺癌是否与吸烟有关计算得,由小概率临界值表知,现给出四个结论,其中错误的是( )
A.根据小概率值的独立性检验,认为“患肺癌与吸烟无关”
B.在100个吸烟的人中约有99个人患肺癌
C.若老张吸烟,那么他有99%的可能性患肺癌
D.有99%的把握认为“患肺癌与吸烟有关”
【答案】ABC
【详解】由题,所以根据小概率值的独立性检验,认为“患肺癌与吸烟有关”,
即有的把握认为“患肺癌与吸烟有关”,故选项D正确,其余都是错误的.
故选:ABC.
24.(多选)炎炎夏日,许多城市发出高温预警,凉爽的某市成为众多游客旅游的热门选择.为了解来某市旅游的游客旅行方式与年龄是否有关,随机调查了100名游客,得到如下表格.零假设H0旅行方式与年龄没有关联,则下列说法中,正确的有( )
小于40岁
不小于40岁
自由行
38
19
跟团游
20
23
附:χ2=,其中.
α
0.1
0.05
0.01
xα
2.706
3.841
6.635
A.在选择自由行的游客中随机抽取一名,其小于40岁的概率为
B.在选择自由行的游客中按年龄分层随机抽样抽取6人,再从中随机选取2人做进一步的访谈,则2人中至少有1人不小于40岁的概率为
C.根据的独立性检验,推断旅行方式与年龄没有关联,且犯错误概率不超过0.01
D.根据的独立性检验,推断旅行方式与年龄有关联,且犯错误概率不超过0.05
【答案】BD
【详解】对于A,选择自由行的游客人数为,其小于40岁的概率是,故A错误;
对于B,选择自由行中小于40岁和不小于40岁的人数比为2:1,
则按年龄分层抽样抽取的6人中,有4人小于40岁,有2人不小于40岁,
设事件为“2人均小于40岁”,则2人中至少有1人不小于40岁的概率为,故B正确;
对于C,因为,
所以可推断旅行方式与年龄没有关联,但对零假设犯错误的概率是不可知的,故C错误;
对于D,因为,所以推断旅行方式与年龄有关联,且犯错误概率不超过0.05,故D正确.
故选:BD.
25.(多选)已知某地区成年男士的身高(单位:)服从正态分布,体重(单位:)服从正态分布.若从该地区随机选取成年男士100人,得到数据如下表,则
身高
体重
合计
大于
小于等于
大于
a
b
小于等于
d
总计
附:若,则.
,其中.
A.根据正态分布估计
B.根据正态分布估计
C.若,根据正态分布估计b,c,d的值,基于上述数值,根据小概率值的独立性检验,分析该地区成年男士身高超过与体重超过相关联
D.若,根据正态分布估计b,c,d的值,基于上述数值,根据小概率值的独立性检验,分析该地区成年男士身高超过与体重超过相互独立
【答案】ABC
【详解】因为该地区成年男士的身高(单位:)服从正态分布,
由正态分布可得,
若从该地区随机选取成年男士100人,则身高大于177的人数约为16人,
所以,故A正确;
因为体重(单位:)服从正态分布.
因为体重大于,
所以可得从该地区随机选取成年男士100人,体重大于73的数约为16人,
所以体重小于等于73的数约为84人,故,故B正确;
若,则,
零假设:该地区成年男士身高超过与体重超过无关,
计算可得,
由小概率值的独立性检验,我们推断不成立,
所以该地区成年男士身高超过与体重超过相关联,故C正确;D错误.
故选:ABC.
1.(多选)为研究某城市二手房销售价格与建筑面积的关系,甲房产研究机构随机调查了80套该城市二手房的建筑面积(单位:平方米)和销售价格y(单位:万元)的数据,已知其中有一套房源的数据为点,且,根据数据求得的线性经验回归方程为,该线性回归方程对应的相关系数为r,对应的决定系数,则下列结论正确的是( )
A.
B.数据点P对应的残差的绝对值为5
C.该样本中二手房的平均建筑面积为95平方米
D.乙房产研究机构也对这组数据进行处理,得到非线性经验回归方程,其决定系数为,则甲机构选取的模型拟合效果更好
【答案】BCD
【分析】
【详解】A选项,因为,故房屋的建筑面积和销售价格y呈正相关,相关系数为,A错误;
B选项,代入,可得的预测值:,残差为:,故B正确;
C选项,,因为线性回归方程恒过点,故,
解得:,C正确;
D选项,决定系数越接近1,拟合效果越好,因为,故甲机构选取的模型拟合效果更好,D正确.
2.将某数学博主1—4月份的粉丝量y整理成如下表格,根据表中数据求出z关于x的经验回归方程为,则预测该数学博主6月末的粉丝量约为______.
月份x
1
2
3
4
粉丝量y
【答案】
【详解】因为,所以当时,,
所以,解得.
故预测该数学博主6月末的粉丝量约为
3.针对“中学生追星问题”,某校团委对“学生性别和中学生追星是否有关”作了一次调查,其中女生人数是男生人数的,男生追星的人数占男生人数的,女生追星的人数占女生人数的,若根据小概率值的独立性检验,判断中学生追星与性别有关,则男生至少有______人.
参考数据及公式如下:
0.050
0.010
0.001
3.841
6.635
10.828
参考公式:,其中.
【答案】30
【详解】设男生人数为,依题意可得列联表如下:
喜欢追星
不喜欢追星
总计
男生
女生
总计
根据小概率值的独立性检验,判断中学生追星与性别有关,
则,
由,解得,
由题知应为6的整数倍,
根据小概率值的独立性检验,判断中学生追星与性别有关,
则男生至少有30人,
故答案为:30.
4.为研究某池塘中水生植物覆盖水塘的面积(单位:)与水生植物的株数(单位:株)之间的相关关系,收集了4组数据,用模型去拟合与的关系.设,与的数据如表格所示,得到与的线性回归方程,则( )
3
4
6
7
2
2.5
4.5
7
A. B. C. D.
【答案】C
【详解】依题意,,
由与的线性回归方程,得,则,
即,因此,所以.
5.某人工智能研究实验室开发出一款全新的聊天机器人,该实验室对使用该款聊天机器人的120位用户进行调研,得到的调研数据如下表所示,则( )
年龄
周平均使用时间
超过4小时
不超过4小时
总计
不超过40岁
54
b
72
40岁以上
c
d
总计
72
120
附:,.
(1)当时,没有充分的证据判断变量A,B有关联,可以认为变量A,B是没有关联的;
(2)当时,有90%的把握判断变量A,B有关联;
(3)当时,有99%的把握判断变量A,B有关联;
(4)(多选)当时,有99.9%的把握判断变量A,B有关联.
A.
B.用样本估计总体,每位使用该款聊天机器人的用户周平均使用时间超过4小时的概率为
C.没有99.9%的把握判断使用该款聊天机器人的用户周平均使用时间是否超过4小时与年龄有关
D.有99.9%的把握判断使用该款聊天机器人的用户周平均使用时间是否超过4小时与年龄有关
【答案】BD
【详解】不超过40岁且周平均使用时间不超过4小时的;
40岁以上且周平均使用时间超过4小时的;
40岁以上的总计为,
故40岁以上且周平均使用时间不超过4小时的.
选项A:,A错误;
选项B:周平均使用时间超过4小时的样本数为72,
总样本数120,概率为,B正确;
年龄
周平均使用时间
超过4小时
不超过4小时
总计
不超过40岁
54
18
72
40岁以上
18
30
48
总计
72
48
120
,
因,
故有99.9%的把握判断使用该款聊天机器人的用户周平均使用时间是否超过4小时与年龄有关.
所以C选项错误,D选项正确.
故选:BD
6.某种产品的广告费用支出万元与销售额万元之间有如下的对应数据:
1
3
5
7
9
3
10
16
21
45
(1)根据上表提供的数据,求出关于的线性回归方程;
(2)据此估计广告费用为17万元时,所得的销售收入.
(参考数值:)
【答案】(1)
(2)76万元
【分析】
【详解】(1)由表格中的统计数据可得,
因为,所以,
则,
所以关于的回归直线方程为.
(2)由(1)知回归直线方程为,
当时,预报的值为,
所以当广告费用为万元时,所得的销售收入约为万元.
7.现有抽球游戏规则如下:盒子中初始装有2个白球和1个黑球,每次有放回的任取一个,连续取两次,将以上过程记为一轮.如果每一轮取到的两个球的颜色相同.则记该轮为成功,否则记为失败.在抽取过程中,如果某一轮成功,则停止游戏.否则,在盒子中再放入一个白球,然后接着进行下一轮抽球,如此不断继续下去,直至成功.
1
2
3
4
5
516
209
127
98
50
(1)某人进行该抽球游戏时,最多进行三轮,即使第三轮不成功,也停止游戏,记其进行抽球游戏的轮数为随机变量,求的分布列和期望;
(2)有数学爱好者统计了近1000名玩家进行该抽球游戏的数据,记表示成功时抽球游戏的轮数,表示对应的人数,部分统计数据如表,经计算发现,非线性回归模型的拟合效果优于线性回归模型,求出关于的非线性回归方程.
附:回归方程系数:,.
参考数据:设,,,,,,.
【答案】(1)分布列见解析,;
(2).
【分析】
【详解】(1)由题意可知:
第1轮:盒子中共有3个小球(2白1黑),
所以成功的概率为,所以失败的概率为;
第2轮:盒子中共有4个小球(3白1黑),
所以成功的概率为,所以失败的概率为;
第3轮:是否成功都会停止,且只有前两轮失败,就会进行第3轮;
所以,,,
所以的分布列如下:
所以
(2)设,则回归方程为,
因为,,,,,
且,
所以,
所以.
所以回归方程为,
又因为,
所以回归方程为.
8.中国共产党第二十次全国代表大会上的报告中提到,新时代十年我国经济实力实现历史性跃升,国内生产总值从54万亿元增长到114万亿元,我国经济总量稳居世界第二位.建立年份编号为解释变量,地区生产总值为响应变量的一元线性回归模型,现就2012—2016某市的地区生产总值统计如下:
年份
2012
2013
2014
2015
2016
年份编号
1
2
3
4
5
地区生产总值(亿元)
2.8
3.1
3.9
4.6
5.6
(1)求出经验回归方程,并计算2016年地区生产总值的残差;
(2)随着我国打赢了人类历史上规模最大的脱贫攻坚战,该市2017-2022的地区生产总值持续增长,现对这11年的数据有三种经验回归模型,,,它们的分别为和,请根据的数值选择最好的回归模型预测一下2024年该市的地区生产总值;
(3)若2012-2022该市的人口数(单位:百万)与年份编号的回归模型为,结合(2)问中的最佳模型,预测一下在2023年以后,该市人均地区生产总值的变化趋势.
参考公式:,.
【答案】(1),
(2)亿元
(3)逐年递增
【分析】
【详解】(1)由数据,,
,
而,,
所以,则,综上,经验回归方程为,
当时,,故2016年地区生产总值残差为;
(2)根据决定系数越大拟合越好,由于,故模型较好,
因2024年对应,则亿元;
(3)设该市人均地区生产总值为,
,
令,且,
若,所以,
而,,则0,故,
所以在上递增,则在上递增,
所以该市人均地区生产总值逐年递增.
1 / 6
学科网(北京)股份有限公司
$
第9章 统计
知识点
具体内容
线性回归方程
1.变量的相关关系
相关关系
两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度
正相关与负相关
如果从整体上看,
当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势,则称这两个变量________;
当一个变量的值增加时,另一个变量的相应值呈现减少的趋势,则称这两个变量________
线性相关
如果两个变量的取值呈现正相关或负相关,而且散点落在一条________附近,我们称这两个变量线性相关
非线性相关
如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量________
2.样本相关系数
①样本相关系数r的计算公式:.
②样本相关系数r的性质:
________
当r>0时,表明两个变量________;当r<0时,表明两个变量________
|r|越接近于1,表明两个变量的线性相关性越________;|r|越接近于0,表明两个变量的线性相关性越________
通常|r|大于________时,认为两个变量有很强的线性相关关系
3.一元线性回归模型
①最小二乘法:即使得样本数据的点到回归直线的距离的________最小.
若变量x与y具有线性相关关系,有n个样本数据,则回归方程中,.
其中________________,________称为样本点的中心.
②线性回归模型,其中称为随机________,自变量称为解释变量,因变量称为预报变量
4.判断回归模型的拟合效果
方法
决定系数法
残差图
残差平方和
公式
称为相应于点的残差,
刻画效果
越接近于________,表示回归的效果越好
残差点比较________地落在水平的带状区域中,说明选用的模型比较合适,其中这样的带状区域的宽度越________,说明模型拟合精确度越高.
残差平方和越________,模型的拟合效果越好
5.建立非线性回归模型的基本步骤:
①确定研究对象,明确哪个是解释变量,哪个是预报变量;
②画出确定好的解释变量和预报变量的散点图,观察它们之间的关系(是否存在非线性关系);
③由经验确定非线性回归方程的类型(如我们观察到数据呈非线性关系,一般选用反比例函数、指数函数、对数函数模型等);
④通过________,将非线性回归方程模型转化为________回归方程模型;
⑤按照公式计算线性回归方程中的参数(如最小二乘法),得到线性回归方程;
⑥消去________,得到非线性回归方程;
⑦得出结果后分析残差图是否有异常.若存在异常,则检查数据是否有误,或模型是否合适等.
常见的非线性回归方程的转化:
曲线方程
变换公式
变换后的线性关系式
________
________
独立性检验
1.2×2列联表
设X,Y为两个变量,它们的取值分别为和,其样本频数列联表(列联表)如下:
总计
a
b
a+b
c
d
c+d
总计
a+c
b+d
2.独立性检验
①利用随机变量(也可表示为)(其中为样本容量)来判断“两个变量有关系”的方法称为独立性检验;
②基于小概率值的检验规则:
当时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过;
当时,我们没有充分证据推断H0不成立,可以认为X和Y独立
易错01混淆相关系数和决定系数
注意:注意区分两者含义与范围:相关系数,用于判断线性相关方向与强弱;决定系数,用于判断回归模型拟合效果。不可混用符号、范围与作用,答题时看清题目要求,避免概念混淆。
1.观察下列散点图,其中图1两个变量的相关关系为,图2两个变量的相关关系为 则判断一定正确的是( )
A. B. C. D.
2.(多选)下列命题正确的是( )
A.线性回归直线必然过样本中心点
B.在刻画回归模型的拟合效果时,决定系数的值越大,说明拟合的效果越好
C.已知两个变量线性相关,若它们的相关性越强,则相关系数r越接近于1
D.正态曲线当一定时,越小,这条曲线越“瘦高”;越大,正态曲线越“矮胖”
3.(多选)下列说法正确的是( )
A.样本相关系数r越大,则线性相关性越强
B.用决定系数刻画回归效果,越接近1,说明回归模型的拟合效果越好
C.在回归分析中,残差图中残差比较均匀地分布在以取值为0的横轴为对称轴的水平带状区域内,且宽度越窄表示拟合效果越好
D.在独立性检验中,零假设必须是“分类变量X与Y独立”,不能是“分类变量X与Y有关”
4.(多选)DeepSeek的火爆源于其突破性AI技术的高效应用,充分展现了人工智能在驱动创新解决方案和满足广泛市场需求中的核心作用.某高中的数学社团以16至40岁人群使用DeepSeek频率为课题,分小组自主选题进行调查研究,下列说法错误的是( )
A.甲小组开展了DeepSeek每周使用频次与年龄的相关性研究,经计算样本相关系数,可以推断两个变量正线性相关,但相关程度很弱
B.乙小组利用最小二乘法得到DeepSeek每周使用频次y关于年龄x的经验回归方程为,可以推断年龄为30岁的群体每周使用频次可能为17次
C.丙小组研究性别因素是否影响DeepSeek使用频次,根据小概率值的独立性检验,计算得到,可以认为不同性别的DeepSeek使用频次没有差异
D.丁小组用决定系数来比较模型的拟合效果,经验回归方程①和②的分别约为0.733和0.998,因此经验回归方程②的刻画效果比经验回归方程①的好很多
5.某医药研究所为了评估一种新药的疗效,开展了临床试验.研究人员记录了14名志愿者服用不同剂量的药物后,血液中某关键生化指标(单位:)随给药剂量(单位:)的变化情况.为了寻找最合适的预测模型,研究人员分别利用模型一和模型二对这14组数据进行了拟合,并绘制了相应的残差图(如图所示,图中纵轴为残差,横轴为给药剂量).
(1)观察残差图,判断哪个模型的拟合效果更好,并说明理由;
(2)设这14组数据得到的经验回归方程为.
(ⅰ)已知样本中的某位志愿者的给药剂量为,生化指标为.若该样本点在拟合效果更优的模型中的残差对应于图中标注的四点之一,请指出该点并说明理由;
(ii)若在这14组数据中,给药剂量的标准差为,生化指标的标准差为,求生化指标与给药剂量的相关系数.(结果精确到0.01)
参考公式:相关系数;
经验回归方程中斜率和截距的最小二乘估计公式分别为,
易错02求回归直线方程计算错误
注意:计算回归系数与截距时,先准确计算、及求和式,分步代入公式避免算错。牢记,先算斜率再算截距,计算后带回检验,确保结果正确,防止因计算粗心失分。
6.某创业者计划开设一家咖啡店,他从本市已开业的15家规模相似的咖啡店中收集了以下数据:x表示周边一公里内日均人流量(千人);y表示日均销售额(百元).
x
4.2
5.2
5.2
6.2
6.2
6.2
5.2
7.2
9.2
8.2
8.2
8.2
9.2
9.2
10.2
y
34
38
40
40
46
52
42
52
54
47
58
69
64
74
70
经计算得
(1)求y关于x的线性回归方程;
(2)预测x=8时,y的估计值y₀;
(3)计算变量x和y的样本相关系数r.
附:最小二乘估计公式分别为:
样本相关系数
7.“一人公司”是指个人借助工具,独立完成产品设计研发到市场投放的全链路商业闭环,某数字文化创意制作有限公司是“一人公司”,连续5个月的科技投入(万元)与利润额(万元)的数据如下:
第月
1
2
3
4
5
投入
2
2
4
5
7
利润额
3
7
10
15
20
(1)从这5个月的利润额中随机抽取3个数值,记大于9万元的数值个数为,求的分布列及均值:
(2)已知与线性相关,求关于的经验回归方程,并预测投入为10万元时的利润额.附:经验回归直线中斜率和截距的最小二乘估计公式分别为,.
8.某农业科研团队为探究大棚蔬菜的光照时长对产量的影响,选取5组不同的光照时长方案,在相同种植条件下开展试验,统计对应时长下的蔬菜合格采收量,得到如下数据:
每日光照时长
14
15
16
17
18
合格采收量
4
8
16
20
26
(1)求变量与的样本相关系数,判断是否适合线性回归模型拟合,如果适合,求关于的经验回归方程;
(2)当样本数据的残差绝对值大于1时,称该组数据为异常拟合数据,现从这5组数据中任取3组做残差分析,求取到异常拟合数据的组数的分布列和数学期望.
附:①样本相关系数,当时,相关性较强,当时,相关性一般;
②经验回归方程中斜率和截距的最小二乘估计公式分别为,;
③,,.
9.某商场对商品售卖的情况进行统计,已知该商场共六层.
(1)当各楼层的商品种类相近时,得到该商场各楼层的销售额(单位:万元)的值:
楼层
1
2
3
4
5
6
销售额
700
500
400
200
100
100
记销售额与楼层之间的经验回归方程为.
(i)求(用分数表示);
(ii)求(用分数表示).
(2)由于网络热点的影响,销售利润(单位:万元)近似服从正态分布,求销售利润在的概率.
附:回归直线中斜率和截距的最小二乘估计公式分别为.
若,则,.
参考数据:.
10.2026 年 3 月, 某市“山城邻里”社区团购平台在市中心商业区设立户外直播间, 推广本地特产晚熟春橙. 该社区团购平台共进行了5场户外直播销售,相应的直播时长与销售额数据经财务与运营双岗复核如下:
场次
1
2
3
4
5
时长(小时)
1
2
3
4
5
销售额(万元)
3.0
5.0
7.0
10.0
12.0
(1)求销售额关于直播时长的经验回归方程;
(2)从这5场直播中随机抽取2场复盘,记“销售额超过7万元”的场数为,求的分布列与数学期望.
附:回归直线的斜率和截距的最小二乘估计公式分别为: ,.
易错03线性回归分析,误将“样本点中心”排除在回归直线外
注意:回归直线必过样本点中心,这是高频考点与检验依据。解题时可直接用该点快速求或验证方程,不可主观认为样本点不在直线上,避免违背基本性质导致思路错误。
11.“千年一面,中江挂面”,近年来,中江挂面村火遍全网.这不仅为中江带来了大量游客,还使中江手工挂面供不应求,销售额大幅提升.已知某手工挂面加工企业2024年10月—2025年2月销售额对应如下表.且用最小二乘法得到销售额关于月份序号的回归直线方程为,则2025年1月销售额( )
时间
2024年10月
2024年11月
2024年12月
2025年1月
2025年2月
月份序号
1
2
3
4
5
销售额(万元)
13.5
15.0
17.0
20.5
A.19.0(万元) B.18.8(万元) C.18.6(万元) D.18.4(万元)
12.已知变量,具有线性相关关系,由样本数据(,2,3,4,5)得到关于的经验回归方程为,若,,则当时,的预测值为( )
A. B. C. D.
13.用模型拟合一组数据,令,若根据样本数据计算可得,,且与的经验回归方程为,则( )(参考数据,)
A.1.2 B.0.92 C.0.3 D.0.4
14.现有10个样本数据,,…,,可得经验回归方程为,且,若去掉一个数据点后,可以得到新的经验回归方程为,则实数的值为( )
A.1 B. C. D.2
15.某产品的广告投入(万元)与销售额(万元)的统计数据如下图所示:若关于的线性回归方程为,则__________.
2
3
5
6
20
35
50
55
易错04非线性回归换元与还原出错
注意:非线性回归需先换元转化为线性模型,求解后必须还原得到原变量方程。注意指数、对数、幂函数型的不同变换方式,换元前后变量对应清晰,避免只转化不还原或还原错误。
16.某科技公司在人工智能领域逐年加大投入,根据近年来该公司对产品研发年投入额x(单位:百万元)与其年销售量y(单位:千件)的数据统计,得到散点图如图.用线性回归和指数型回归模型拟合y与x关系的决定系数分别为和,则根据参考数据,下列表达式中最适宜描述y与x之间关系的函数为( )
参考公式:用最小二乘法求经验回归直线方程的系数公式为.
参考数据:令
3
2.5
0.5
10
12
6
A. B. C. D.
17.某地新开了一条夜市街,每晚最多能接纳10万人.主办公司计划通过广告宣传提高客流量.通过调研,发现投入的广告费x与每晚客流量y存在如下关系:
x/万元
1
2
3
4
5
y/千人
5
6
8.1
9
14.5
附,,,,
令,,,.
现用曲线拟合变量x与y的相关关系,并利用一元线性回归模型求参数,的最小二乘估计,依所求回归方程C为预测依据,则( )
A.曲线C经过点
B.
C.若投入广告费9万元,则每晚客流量会超过夜市接纳能力
D.广告费每增加1万元,每晚客流量增加3000人
18.近期,某市公交公司分别推出支付宝和微信扫码支付乘车活动,活动设置了一段时间的推广期,由于推广期内优惠力度较大,吸引越来越多的人开始使用扫码支付.某线路公交车队统计了活动刚推出一周内每一天使用扫码支付的人次,用x表示活动推出的天数,y表示每天使用扫码支付的人次(单位:十人次),统计数据如表所示:
1
2
3
4
5
6
7
6
11
21
34
66
101
196
根据以上数据,绘制了散点图.
(1)根据散点图判断,在推广期内,与(均为大于零的常数)哪一个适宜作为扫码支付的人次关于活动推出天数的经验回归方程?(给出判断即可,不必说明理由)
(2)根据(1)的判断结果及表中的数据,建立关于的回归方程,并预测活动推出第8天使用扫码支付的人次.
[参考数据:,,,,,其中,]
19.某市某医疗器械公司转型升级,从9月1日开始投入呼吸机生产,该公司9月1日~9月9日连续9天的呼吸机日生产量为(单位:百台,,2,,9),数据作了初步处理,得到如图所示的散点图.
2.73
19
5
285
1095
注:图中日期代码1~9分别对应9月1日~9月9日;表中,.
(1)从9个样本点中任意选取2个,在2个样本点的生产量都不高于300台的条件下,求2个样本点都高于200台的概率;
(2)由散点图分析,样本点都集中在曲线的附近,求y关于t的方程,并估计该公司从生产之日起,需要多少天呼吸机日生产量可超过500台.
参考数据:.
20.统计显示,我国在线直播生活购物用户规模近几年保持高速增长态势,下表为年—年我国在线直播生活购物用户规模(单位:亿人),其中年—年对应的代码依次为—.
年份代码
市场规模
,,,其中
参考公式:对于一组数据、、、,其经验回归直线的斜率和截距的最小二乘估计公式分别为,.
(1)由上表数据可知,若用函数模型拟合与的关系,请估计年我国在线直播生活购物用户的规模(结果精确到);
(2)已知我国在线直播生活购物用户选择在品牌官方直播间购物的概率,现从我国在线直播购物用户中随机抽取人,记这人中选择在品牌官方直播间购物的人数为,若,求的数学期望和方差.
易错05求解独立性检验问题对的值理解不准确
注意:是判断变量是否独立的统计量,计算时严格代入公式。越大越拒绝独立假设,需与临界值比较下结论,不可只看大小不对比临界值。
21.学校在一次调查“体育迷”的活动中,随机调查了100名同学,获得了如下数据:
性别
是否体育迷
男
女
合计
体育迷
45
非体育迷
10
合计
75
100
计算得,则下列结论正确的是( )
0.050
0.010
0.001
3.841
6.635
10.828
A.
B.是与的等差中项
C.任取1人为体育迷的概率为
D.没有的把握认为是否为体育迷与性别有关
22.在独立性检验中,显著水平以及对应的分位数如下:
0.1
0.01
2.706
6.635
某社团就喜欢长跑与学生性别的关系进行了一个随机调查,根据男女生人数以及男女生是否喜欢长跑的人数,计算得,则( )(多选)
A.有的把握认为喜欢长跑与性别有关
B.“喜欢长跑”与“是女生”独立的概率不小于
C.在犯错误的概率不超过的前提下,可以认为是否喜欢长跑与性别无关
D.在犯错误的概率不超过的前提下,可以认为“喜欢长跑”与“是女生”不独立
23.(多选)某医疗机构通过抽样调查(样本容量),利用2×2列联表和统计量研究患肺癌是否与吸烟有关计算得,由小概率临界值表知,现给出四个结论,其中错误的是( )
A.根据小概率值的独立性检验,认为“患肺癌与吸烟无关”
B.在100个吸烟的人中约有99个人患肺癌
C.若老张吸烟,那么他有99%的可能性患肺癌
D.有99%的把握认为“患肺癌与吸烟有关”
24.(多选)炎炎夏日,许多城市发出高温预警,凉爽的某市成为众多游客旅游的热门选择.为了解来某市旅游的游客旅行方式与年龄是否有关,随机调查了100名游客,得到如下表格.零假设H0旅行方式与年龄没有关联,则下列说法中,正确的有( )
小于40岁
不小于40岁
自由行
38
19
跟团游
20
23
附:χ2=,其中.
α
0.1
0.05
0.01
xα
2.706
3.841
6.635
A.在选择自由行的游客中随机抽取一名,其小于40岁的概率为
B.在选择自由行的游客中按年龄分层随机抽样抽取6人,再从中随机选取2人做进一步的访谈,则2人中至少有1人不小于40岁的概率为
C.根据的独立性检验,推断旅行方式与年龄没有关联,且犯错误概率不超过0.01
D.根据的独立性检验,推断旅行方式与年龄有关联,且犯错误概率不超过0.05
25.(多选)已知某地区成年男士的身高(单位:)服从正态分布,体重(单位:)服从正态分布.若从该地区随机选取成年男士100人,得到数据如下表,则
身高
体重
合计
大于
小于等于
大于
a
b
小于等于
d
总计
附:若,则.
,其中.
A.根据正态分布估计
B.根据正态分布估计
C.若,根据正态分布估计b,c,d的值,基于上述数值,根据小概率值的独立性检验,分析该地区成年男士身高超过与体重超过相关联
D.若,根据正态分布估计b,c,d的值,基于上述数值,根据小概率值的独立性检验,分析该地区成年男士身高超过与体重超过相互独立
1.(多选)为研究某城市二手房销售价格与建筑面积的关系,甲房产研究机构随机调查了80套该城市二手房的建筑面积(单位:平方米)和销售价格y(单位:万元)的数据,已知其中有一套房源的数据为点,且,根据数据求得的线性经验回归方程为,该线性回归方程对应的相关系数为r,对应的决定系数,则下列结论正确的是( )
A.
B.数据点P对应的残差的绝对值为5
C.该样本中二手房的平均建筑面积为95平方米
D.乙房产研究机构也对这组数据进行处理,得到非线性经验回归方程,其决定系数为,则甲机构选取的模型拟合效果更好
2.将某数学博主1—4月份的粉丝量y整理成如下表格,根据表中数据求出z关于x的经验回归方程为,则预测该数学博主6月末的粉丝量约为______.
月份x
1
2
3
4
粉丝量y
3.针对“中学生追星问题”,某校团委对“学生性别和中学生追星是否有关”作了一次调查,其中女生人数是男生人数的,男生追星的人数占男生人数的,女生追星的人数占女生人数的,若根据小概率值的独立性检验,判断中学生追星与性别有关,则男生至少有______人.
参考数据及公式如下:
0.050
0.010
0.001
3.841
6.635
10.828
参考公式:,其中.
4.为研究某池塘中水生植物覆盖水塘的面积(单位:)与水生植物的株数(单位:株)之间的相关关系,收集了4组数据,用模型去拟合与的关系.设,与的数据如表格所示,得到与的线性回归方程,则( )
3
4
6
7
2
2.5
4.5
7
A. B. C. D.
5.某人工智能研究实验室开发出一款全新的聊天机器人,该实验室对使用该款聊天机器人的120位用户进行调研,得到的调研数据如下表所示,则( )
年龄
周平均使用时间
超过4小时
不超过4小时
总计
不超过40岁
54
b
72
40岁以上
c
d
总计
72
120
附:,.
(1)当时,没有充分的证据判断变量A,B有关联,可以认为变量A,B是没有关联的;
(2)当时,有90%的把握判断变量A,B有关联;
(3)当时,有99%的把握判断变量A,B有关联;
(4)(多选)当时,有99.9%的把握判断变量A,B有关联.
A.
B.用样本估计总体,每位使用该款聊天机器人的用户周平均使用时间超过4小时的概率为
C.没有99.9%的把握判断使用该款聊天机器人的用户周平均使用时间是否超过4小时与年龄有关
D.有99.9%的把握判断使用该款聊天机器人的用户周平均使用时间是否超过4小时与年龄有关
6.某种产品的广告费用支出万元与销售额万元之间有如下的对应数据:
1
3
5
7
9
3
10
16
21
45
(1)根据上表提供的数据,求出关于的线性回归方程;
(2)据此估计广告费用为17万元时,所得的销售收入.
(参考数值:)
7.现有抽球游戏规则如下:盒子中初始装有2个白球和1个黑球,每次有放回的任取一个,连续取两次,将以上过程记为一轮.如果每一轮取到的两个球的颜色相同.则记该轮为成功,否则记为失败.在抽取过程中,如果某一轮成功,则停止游戏.否则,在盒子中再放入一个白球,然后接着进行下一轮抽球,如此不断继续下去,直至成功.
1
2
3
4
5
516
209
127
98
50
(1)某人进行该抽球游戏时,最多进行三轮,即使第三轮不成功,也停止游戏,记其进行抽球游戏的轮数为随机变量,求的分布列和期望;
(2)有数学爱好者统计了近1000名玩家进行该抽球游戏的数据,记表示成功时抽球游戏的轮数,表示对应的人数,部分统计数据如表,经计算发现,非线性回归模型的拟合效果优于线性回归模型,求出关于的非线性回归方程.
附:回归方程系数:,.
参考数据:设,,,,,,.
8.中国共产党第二十次全国代表大会上的报告中提到,新时代十年我国经济实力实现历史性跃升,国内生产总值从54万亿元增长到114万亿元,我国经济总量稳居世界第二位.建立年份编号为解释变量,地区生产总值为响应变量的一元线性回归模型,现就2012—2016某市的地区生产总值统计如下:
年份
2012
2013
2014
2015
2016
年份编号
1
2
3
4
5
地区生产总值(亿元)
2.8
3.1
3.9
4.6
5.6
(1)求出经验回归方程,并计算2016年地区生产总值的残差;
(2)随着我国打赢了人类历史上规模最大的脱贫攻坚战,该市2017-2022的地区生产总值持续增长,现对这11年的数据有三种经验回归模型,,,它们的分别为和,请根据的数值选择最好的回归模型预测一下2024年该市的地区生产总值;
(3)若2012-2022该市的人口数(单位:百万)与年份编号的回归模型为,结合(2)问中的最佳模型,预测一下在2023年以后,该市人均地区生产总值的变化趋势.
参考公式:,.
1 / 6
学科网(北京)股份有限公司
$
相关资源
示范课
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。