第八章 成对数据的统计分析章末重点题型复习讲义-2025-2026学年高二下学期数学人教A版选择性必修第三册
2026-03-03
|
2份
|
71页
|
666人阅读
|
18人下载
普通
资源信息
| 学段 | 高中 |
| 学科 | 数学 |
| 教材版本 | 高中数学人教A版选择性必修 第三册 |
| 年级 | 高二 |
| 章节 | 小结 |
| 类型 | 教案-讲义 |
| 知识点 | - |
| 使用场景 | 同步教学-单元练习 |
| 学年 | 2026-2027 |
| 地区(省份) | 全国 |
| 地区(市) | - |
| 地区(区县) | - |
| 文件格式 | ZIP |
| 文件大小 | 4.87 MB |
| 发布时间 | 2026-03-03 |
| 更新时间 | 2026-03-03 |
| 作者 | 匿名 |
| 品牌系列 | - |
| 审核时间 | 2026-03-03 |
| 下载链接 | https://m.zxxk.com/soft/56643143.html |
| 价格 | 1.00储值(1储值=1元) |
| 来源 | 学科网 |
|---|
摘要:
该高中数学讲义围绕“成对数据的统计分析”单元,通过8大题型系统梳理知识体系,以目录框架呈现变量相关关系、回归分析、独立性检验等核心内容,结合数据表格和实际案例明晰重难点及内在联系。
讲义特色在于“情境化问题”驱动的练习设计,如零件耗材量计算、广阳岛鸟类数量估计等案例,培养数据观念与模型意识。题型从概念辨析到综合应用层层递进,基础题巩固方法,综合题提升分析能力,支持教师精准教学与学生自主复习。
内容正文:
第八章 成对数据的统计分析章末重点题型
目录
题型1:变量之间的相关关系辨析 2
题型2:相关系数的计算与应用 4
题型3:线性回归分析 9
题型4:非线性回归分析 15
题型5:残差与相关指数的应用 25
题型6:等高堆积条形图的应用 31
题型7:独立性检验的概念和辨析 36
题型8:独立性检验的应用 39
题型1:变量之间的相关关系辨析
【例1.1.】 下列两个变量之间,是相关关系的有( )
①角度与它的余弦值;②人的体重与视力;③正n边形的边数和它的内角度数之和;④圆心角的大小与所对的圆弧长;⑤光照时间和果树亩产量;⑥收入水平与购买能力;⑦正方体的棱长与体积.
A.①④⑥ B.②⑤⑥⑦ C.⑤⑥ D.③⑤⑦
【答案】C
【难度】0.94
【知识点】相关关系与函数关系的概念及辨析、判断两个变量是否有相关关系
【分析】根据相关关系的概念判断即可.
【详解】①③④⑦是函数关系;②没有关系;⑤⑥是相关关系.
故选:C
【例1.2.】 下列图形中具有相关关系的两个变量是( ).
A. B.
C. D.
【答案】C
【难度】0.85
【知识点】根据散点图判断是否线性相关
【分析】根据若样本点成带状分布,则两个变量具有相关关系,结合散点图即得.
【详解】根据散点图可知在C中,样本点成带状分布,则两个变量具有相关关系,
所以两个变量x、y具有相关关系的图是C.
A,B为函数关系,D无相关关系.
故选:C.
【例1.3.】
对某种动物的三项指标,,进行调查研究.现有这种动物若干只,设每只动物的这三项指标为.若与的散点图如图1和图2所示,那么关于的散点图最合理的为( )
A. B.
C. D.
【答案】A
【难度】0.85
【知识点】根据散点图判断是否线性相关、判断正、负相关
【分析】利用排除法,分析可知指标,满足负相关,结合图象指标的范围分析判断即可.
【详解】因为指标,满足正相关,指标,满足负相关,
可知指标,满足负相关,故C错误;
且,可知BD错误;
故选:A.
题型2:相关系数的计算与应用
【例2.1.】 以下散点图经过标准化后,相关系数最大的是( )
A. B.
C. D.
【答案】A
【难度】0.65
【知识点】相关系数的意义及辨析、判断正、负相关
【分析】利用散点图变化趋势,判断相关系数的正负,由散点的集中程度确定大小,即可得到答案.
【详解】对于,散点呈上升趋势,线性相关系数为正数,这些点紧密的聚集在一条直线的附近,线性相关性强;
对于,散点分布呈曲线趋势,线性相关程度比弱;
对于,散点呈下降趋势,线性相关系数为负数;
对于,散点分布比较分散,线性相关程度比弱;
所以相关系数最大的是.
故选:.
【例2.2.】
(多选)下列关于相关系数的说法正确的是( )
A.相关系数越大两个变量间相关性越强
B.相关系数的取值范围为
C.相关系数时两个变量正相关,时两个变量负相关
D.相关系数时,样本点在同一直线上
【答案】BCD
【难度】0.85
【知识点】相关系数的意义及辨析
【分析】根据相关系数的意义对每个结论进行分析、判断可得错误的结论.
【详解】对于相关系数,有以下结论:①当时,表明两个变量正相关;当时,表明两个变量负相关.
②的绝对值越接近于,表明两个变量的线性相关性越强;的绝对值越接近于,表明两个变量之间几乎不存在线性相关关系.
对于A,当时此结论不成立,所以A不正确.
对于B,由相关系数的性质可得,所以B正确.
对于C,由相关系数的性质可得正确.
对于D,由相关系数的性质可得正确.
故选:BCD.
【例2.3.】
(多选)通过随机抽样,得到变量和变量的7对数据,并绘制成散点图如图所示,已知变量和变量线性相关,且回归直线是图中直线,则下列说法正确的是( )
A.直线的斜率是负数
B.变量与变量正相关
C.相关系数
D.若去掉图中点后,剩余数据的相关系数变大
【答案】AC
【难度】0.85
【知识点】相关系数的意义及辨析、判断正、负相关
【分析】根据数据的散点图,结合相关性、相关系数的概念与定义,逐项判定,即可得解.
【详解】对于A、B、C:由图可知直线的斜率是负数,所以变量与变量负相关,相关系数,故A、C正确,B错误;
对于D:若去掉图中点后,剩余的数据会更集中,相关程度会更高,相关系数的绝对值变大,又,所以相关系数变小,故D错误.
故选:AC.
【例2.4.】
已知,,,,则相关系数______.(相关系数)
【答案】
【难度】0.85
【知识点】相关系数的计算
【分析】应用相关系数公式及已知数据求相关系数.
【详解】由题设,有.
故答案为:.
【例2.5.】
大学生刘铭去某工厂实习,实习结束时从自己制作的某种零件中随机选取了10个样品,测量每个零件的横截面积(单位:)和耗材量(单位:),得到如下数据:
样本号
1
2
3
4
5
6
7
8
9
10
总和
零件的横截面积
0.03
0.05
0.04
0.07
0.07
0.04
0.05
0.06
0.06
0.05
0.52
耗材量
0.24
0.40
0.23
0.55
0.50
0.34
0.35
0.45
0.43
0.41
3.9
并计算得.
(1)估算刘铭同学制作的这种零件平均每个零件的横截面积以及平均一个零件的耗材量;
(2)求刘铭同学制作的这种零件的横截面积和耗材量的样本相关系数(精确到0.01);
(3)刘铭同学测量了自己实习期制作的所有这种零件的横截面积,并得到所有这种零件的横截面积的和为,若这种零件的耗材量和其横截面积近似成正比,请帮刘铭计算一下他制作的零件的总耗材量的估计值.附:相关系数.
【答案】(1)平均每个零件的横截面积为,一个零件的耗材量
(2)
(3)
【难度】0.85
【知识点】相关系数的计算、用平均数的代表意义解决实际问题、计算几个数的平均数
【分析】(1)计算出样本中10个零件的横截面积的平均值和耗材量的平均值,得到答案;
(2)代入相关系数公式计算出答案.
(3)根据零件的耗材量和其横截面积近似成正比得到方程,求出答案.
【详解】(1)样本中10个这种零件的横截面积的平均值,
样本中10个这种零件的耗材量的平均值,
由此可估算刘铭同学制作的这种零件平均每个零件的横截面积为,
平均一个零件的耗材量为.
(2)
,
这种零件的横截面积和耗材量的样本相关系数为.
(3)设这种零件的总耗材量的估计值为,
又已知这种零件的耗材量和其横截面积近似成正比,
,解得,
故这种零件的总耗材量的估计值为.
【例2.6.】
广阳岛,作为长江上游最大的江心岛,其面积在枯水期约为10平方公里.自2017年起,重庆市开始对广阳岛进行系统的生态修复,摒弃了曾经的商业开发计划,转而建设“长江风景眼,重庆生态岛”.经过数年的努力,广阳岛的生态得到了显著的改善,不仅植被丰富,生物多样性也得到了极大的提升.据监测,岛上的鸟类从生态修复前的124种增加到213种,其中包括中华秋沙鸭、游隼、白琵鹭等珍稀鸟类.为调查广阳岛某种鸟的数量,将其分成面积相近的50个地块,从这些地块中用简单随机抽样的方法抽取5个作为样区,调查得到样本数据,其中和分别表示第个样区的植被覆盖面积(单位:平方公里)和这种鸟的数量.
1
2
3
4
5
0.171
0.152
0.192
0.189
0.196
12
10
16
14
18
(1)求广阳岛这种鸟数量的估计值(这种鸟数量的估计值等于样区这种鸟数量的平均数乘以地块数);
(2)求样本的相关系数(精确到0.01);
(3)根据统计资料,各地块间植物覆盖面积差异较大.为提高样本的代表性以获得广阳岛这种鸟数量更准确的估计,请给出一种你认为更合理的抽样方法,并说明理由.
附:相关系数,,.
【答案】(1)700
(2)0.94
(3)分层抽样:根据植物覆盖面积的大小对地块分层,再对50个地块进行分层抽样,理由见解析
【难度】0.65
【知识点】相关系数的计算、计算几个数的平均数、分层抽样的特征及适用条件
【分析】(1)求出样本平均数,再乘以地块数可得出结果;
(2)根据题中所给数据,代入,可得出结果;
(3)由(2)知知各样区的这种鸟数量与植物覆盖面积有很强的正相关,各地块间这种植物数量差异也很大,适合采用分层抽样.
【详解】(1)由已知得样本平均数,
从而广阳岛这种鸟数量的估计值为.
(2),
,
故样本的相关系数
(3)分层抽样:根据植物覆盖面积的大小对地块分层,再对50个地块进行分层抽样.
理由如下:由(2)知各样区的这种鸟数量与植物覆盖面积有很强的正相关,
由于各地块间植物覆盖面积差异很大,从而各地块间这种鸟数量差异也很大,
采用分层抽样的方法较好地保持了样本结构与总体结构的一致性,提高了样本的代表性,从而可以获得广阳岛这种鸟数量更准确的估计.
题型3:线性回归分析
【例3.1.】
(多选)某种细胞在培养正常的情况下,时刻(单位:分)与细胞数(单位:个)的部分数据如下表所示:
1
2
3
4
5
52
95
185
227
若与线性相关,由上表数据求得经验回归方程为,则下列说法正确的是( )
A.与正相关 B.
C.细胞数逐分增加,平均每分钟增加10个左右 D.预计10分钟后细胞数约为450个
【答案】ABD
【难度】0.65
【知识点】根据样本中心点求参数、根据回归方程求原数据中的值、用回归直线方程对总体进行估计、解释回归直线方程的意义
【分析】由回归方程中的系数大于0,可判断A;再根据线性回归方程过样本中心点,可求得的值,进而可判断BCD.
【详解】由回归方程中的系数大于0,可知与正相关,故A项正确;
由表中数据可知,又因为回归方程为,
把代入回归方程中,解得,所以,解得,故B项正确;
由经验回归方程知细胞数逐分增加,平均每分钟增加44个左右,故C项错误;
将代入回归方程中,得,故D项正确.
故选:ABD.
【例3.2.】
2025年11 月,搭载“祖冲之三号”同款芯片的超导量子计算机“天衍-287”完成搭建,该量子计算系统具备“量子计算优越性”能力.下表记录了8个团队在特定年度的研发资金投入x(单位:亿元)与芯片性能提升评估指数y,且
研发资金投入x/亿元
2
10
性能提升评估指数y
2
12
已知y与x具有较强的线性关系,通过最小二乘估计得到的经验回归方程为如果去掉样本点后,得到的新样本的经验回归方程为则( )
A.0.1 B.0.3 C.0.5 D.0.7
【答案】B
【难度】0.85
【知识点】计算样本的中心点、根据样本中心点求参数
【分析】根据给定条件,求出,进而求出新样本的中心点,再利用经验回归方程求得答案.
【详解】由及,得,
则在新样本中,,
所以.
故选:B
【例3.3.】
(多选)两个具有相关关系的变量,的一组数据为,,,,其经验回归方程为,记,,相关系数为;若将数据调整为,,,,其经验回归方程为,记,相关系数为,则( )
附:,
A. B.
C. D.
【答案】BD
【难度】0.65
【知识点】求回归直线方程、相关系数的计算、计算样本的中心点、根据样本中心点求参数
【分析】根据给定条件,可得,再结合最小二乘法、经验回归方程、相关系数计算判断即可.
【详解】对于A,,A错误;
对于B,,B正确;
对于C,,则,C错误;
对于D,,D正确.
故选:BD
【例3.4.】
某景点自从取消门票实行免费开放后,迅速成为网红打卡点,不仅带动了淡季的旅游,而且优化了旅游产业的结构.下表是该景点免费开放后前五个月的打卡人数y(万人)与第个月的数据:
1
2
3
4
5
1.3
1.7
2.2
2.8
3.5
已知与线性相关.
(1)求关于的线性回归方程;
(2)预测第7个月的打卡人数.
参考数据:.
参考公式:线性回归方程中斜率、截距的最小二乘法估计公式为.
【答案】(1)
(2)4.5万人
【难度】0.65
【知识点】求回归直线方程、用回归直线方程对总体进行估计
【分析】(1)由统计表格中的数据,取得回归系数,得到,即可得出回归方程;
(2)由(1)中的回归方程,令,求得,即可得到答案.
【详解】(1)解:由统计表格中的数据,可得,,
且,
则,
可得,
所以关于的线性回归方程为.
(2)解:由(1)知:线性回归方程为,
当时,可得.
由此预测第7个月的打卡人数为4.5万人.
【例3.5.】 某兴趣小组欲研究昼夜温差大小与患感冒人数多少之间的关系,他们分别到气象局与某医院抄录了1~6月份每月5日的昼夜温差情况与因患感冒而就诊的人数,得到如下资料:
日期
1月5日
2月5日
3月5日
4月5日
5月5日
6月5日
昼夜温差X/℃
10
11
13
12
8
6
就诊人数
23
25
29
26
16
13
该兴趣小组确定的研究方案是:先从这6组数据中选取2组,用剩下的4组数据求线性回归方程,再用被选取的2组数据进行检验.
(1)若选取的是1月与6月的两组数据,请根据2~5月份的数据,求出关于的线性回归方程;(参考数据:设2~5月份每月5日的昼夜温差的平均数为,就诊人数的平均数为,则,)
(2)若由线性回归方程得到的估计数据与所选出的检验数据的误差均不超过2,则认为得到的线性回归方程是理想的,问:该小组所得线性回归方程是否理想?
【答案】(1)
(2)得到的线性回归方程是理想的
【难度】0.65
【知识点】求回归直线方程、用回归直线方程对总体进行估计
【分析】(1)应用最小二乘法求回归方程的系数,写出关于的线性回归方程即可;
(2)根据理想线性回归方程定义,将对应代入求值,再与表格中对应值比较,即可判断是否理想.
【详解】(1)因为,,所以,,
可得,,
所以关于的线性回归方程为.
(2)由(1)可得,
当时,,且;
当时,,且.
可知由线性回归方程得到的估计数据与所选出的检验数据的误差均不超过2,
所以得到的线性回归方程是理想的.
【例3.6.】
某幼儿园雏鹰班的生活老师统计2024年上半年每个月的20日的昼夜差(单位:℃,)和患感冒的小朋友人数(单位:人)的数据如下:
8
11
14
20
23
26
其中,,.
(1)请用相关系数加以说明是否可用线性回归模型拟合与的关系;
(2)建立关于的经验回归方程(精确到0.01),预测当昼夜温差升高4℃时患感冒的小朋友的人数会有什么变化.(人数精确到整数,参考数据:)
【答案】(1)可用一元线性回归模型拟合与的关系.
(2),
【难度】0.65
【知识点】求回归直线方程、相关系数的计算、根据回归方程进行数据估计
【分析】(1)根据题意,利用公式,求得相关系数的值,即可得到结论;
(2)利用最小二乘法求得和的值,求得回归直线方程,结合回归方程,即可得到答案.
【详解】(1)由统计表格中的数据,可得,
,
且,,
所以,
所以可用一元线性回归模型拟合与的关系.
(2)由,可得,
则,
所以关于的经验回归方程为,
由回归方程知,昼夜温差每升高,患感冒的小朋友人数大约增加人,
所以当昼夜温差升高时,患感冒的小朋友的人数增加人.
题型4:非线性回归分析
【例4.1.】
用模型去拟合与的关系,令,得到关于的回归直线方程为,则( )
A.1 B.2 C.3 D.4
【答案】A
【难度】0.65
【知识点】指数式与对数式的互化、对数的运算、根据回归方程求原数据中的值
【分析】根据对数运算法则将表达式化简即可求出的值.
【详解】由模型可得,所以;
令,所以,可得;
又因为回归直线方程为,因此,可得.
故选:A
【例4.2.】
在研究两个变量的相关关系时,观察散点图发现样本点集中于某一条指数曲线的周围.令,求得经验回归方程为,则该模型的回归方程为________.
【答案】
【难度】0.65
【知识点】非线性回归
【分析】由回归直线方程可得:,解出即可求解.
【详解】因为,
所以.
故答案为:.
【例4.3.】 近期,某市公交公司分别推出支付宝和微信扫码支付乘车活动,活动设置了一段时间的推广期,由于推广期内优惠力度较大,吸引越来越多的人开始使用扫码支付.某线路公交车队统计了活动刚推出一周内每一天使用扫码支付的人次,用x表示活动推出的天数,y表示每天使用扫码支付的人次(单位:十人次),统计数据如表所示:
1
2
3
4
5
6
7
6
11
21
34
66
101
196
根据以上数据,绘制了散点图.
(1)根据散点图判断,在推广期内,与(均为大于零的常数)哪一个适宜作为扫码支付的人次关于活动推出天数的经验回归方程?(给出判断即可,不必说明理由)
(2)根据(1)的判断结果及表中的数据,建立关于的回归方程,并预测活动推出第8天使用扫码支付的人次.
[参考数据:,,,,,其中,]
【答案】(1)适宜
(2),347十人次
【难度】0.65
【知识点】根据散点图判断是否线性相关、求回归直线方程、非线性回归、根据回归方程进行数据估计
【分析】(1)根据散点图判断即可.
(2)对两边同时取常用对数,得,进而转化为线性关系,再根据已知数据计算回归方程,并代入数据检验即可.
【详解】(1)由散点图,得适宜作为扫码支付的人次y关于活动推出天数x的回归方程类型.
(2)由,两边同时取常用对数,得,
设,则,由,,
得,,
因此,即,则,
当时,得,
所以y关于x的回归方程为,活动推出第8天使用扫码支付的人次为347十人次.
【例4.4.】
某科技创新型企业自创建以来,不断加大研发投入,走科技创新之路,年利润得到较快增长,2021~2025连续五年的年利润y(单位:亿元)与年份序号x(,2,3,4,5,其中2021年记为1,2022年记为2,以此类推)满足某一元非线性回归方程,统计数据如下:
374
230
6.3
144
1.6
4
注:,.
(1)设和y的相关系数为,x和v的相关系数为,请从相关系数的角度,确定和(其中a,b,m,n均为常数,e为自然对数的底数)哪一个拟合程度更好;
(2)根据(1)的结论及表中数据,建立y关于x的回归方程.
附:①相关系数,回归直线中斜率和截距的最小二乘估计公式分别为, .
②参考数据:.
【答案】(1)模型的拟合程度更好
(2).
【难度】0.65
【知识点】求回归直线方程、相关系数的计算
【分析】(1)根据相关数据分别计算出和y的相关系数和x和v的相关系数,比较大小,即可得结论;
(2)根据最小二乘估计公式求出相关参数,即可得答案.
【详解】(1)令,则可化为,
,
令,则可化为,即,
因为,
所以,
则,因此从相关系数的角度来看,模型的拟合程度更好.
(2)由(1)知,用模型比较合适,
令,则可化为,即,
所以,
因为,,所以,
则关于的回归直线方程为,所以.
【例4.5.】 近年来,新能源汽车因其动力充沛、提速快、用车成本低等特点得到民众的追捧.某机构为研究汽油价格x(单位:元/升)与新能源汽车的月销售量y(单位:万辆)之间的关系,收集整理得到如下数据:
x
6
6.5
7
7.5
8
y
1.5
2
3
4.5
6.8
(1)若用模型模拟x与y之间关系,求出回归方程;
(2)根据建立的回归方程,预测当汽油价格上涨至9元/升时,新能源汽车的销量;
(3)假设当汽油价格为9元/升时,实际销量超过预测值的概率为0.6.现进行5次独立观测,记这5次观测中销量超过预测值的次数为,求的数学期望.
参考数据和公式:.,.
令,,,.
对于一组数据,其回归直线的斜率和截距的最小二乘估计分别为:,.
【答案】(1)
(2)约为万辆
(3)3
【难度】0.65
【知识点】非线性回归、二项分布的均值、根据回归方程进行数据估计
【分析】(1)先根据数据计算,再根据计算即可求出;
(2)将代入回归方程中即可;
(3)由题意可知,利用二项分布的期望公式计算即可.
【详解】(1)因为,则,
又,,
由得,,解得,
所以回归方程为.
(2)当时,代入回归方程可得
,
价格上涨至9元/升时,新能源汽车的销量约为万辆.
(3)
由题知,,所以,即的数学期望为3.
【例4.6.】
统计显示,我国在线直播生活购物用户规模近几年保持高速增长态势,下表为年—年我国在线直播生活购物用户规模(单位:亿人),其中年—年对应的代码依次为—.
年份代码
市场规模
,,,其中
参考公式:对于一组数据、、、,其经验回归直线的斜率和截距的最小二乘估计公式分别为,.
(1)由上表数据可知,若用函数模型拟合与的关系,请估计年我国在线直播生活购物用户的规模(结果精确到);
(2)已知我国在线直播生活购物用户选择在品牌官方直播间购物的概率,现从我国在线直播购物用户中随机抽取人,记这人中选择在品牌官方直播间购物的人数为,若,求的数学期望和方差.
【答案】(1)亿人
(2),
【难度】0.65
【知识点】二项分布的方差、二项分布的均值、独立重复试验的概率问题、非线性回归
【分析】(1)将题中数据代入最小二乘法公式,求出的值,即可得出与的拟合函数关系式,再将代入函数关系式,即可得出结论;
(2)由题意可知,,由结合独立重复试验的概率公式可求得的值,然后利用二项分布的期望和方差公式可求得结果.
【详解】(1)设,则,
因为,,,
所以,,
所以,与的拟合函数关系式为
当时,,
则估计年我国在线直播生活购物用户的规模为亿人.
(2)由题意知,所以,,
,
由,可得,
因为,解得,
所以,,.
【例4.7.】
随着中美关税战的不断升级,某企业大大加强科技研发投入的力度,为确定下一年对某产品进行科技升级的研发费用,需了解该产品年研发费用(单位:千万元)对年销售量(单位:千万件)的影响.根据市场调研与模拟,对收集的数据进行初步处理,得到散点图及一些统计量的值如
30.5
15
15
46.5
表中,.
(1)根据散点图判断,与哪一个更适合作为年销售量关于年研发费用的回归方程模型(给出判断即可,不必说明理由);
(2)根据(1)的判断结果及表中数据,建立关于的回归方程,并估计年研发费用为27千万元时年销售量的值;
(3)科技升级后,该产品的效率大幅提高,经试验统计得大致服从正态分布.企业对科技升级团队的奖励方案如下:若不超过50%,不予奖励;若超过50%,但不超过53%,每件产品奖励2元;若超过53%,每件产品奖励4元.记为每件产品获得的奖励,求(精确到0.01).
附:①对于一组数据,其回归直线的斜率和截距的最小二乘估计分别为,.
②若随机变量,则,.
③.
【答案】(1)更适合
(2),8.1千万件
(3)
【难度】0.65
【知识点】由散点图画求近似回归直线、求回归直线方程、求离散型随机变量的均值、指定区间的概率
【分析】(1)根据散点图可判断,更适合;
(2)对两边取对数可得,再结合表中数据,即可求解;
(3)由正态分布的概率公式代入计算,再由期望的计算公式即可得到结果.
【详解】(1)根据散点图可判断,更适合作为关于的回归方程模型.
(2)由得:,即,
由表中数据得:,
所以,
所以,所以,
所以关于的回归方程为.
当时,,即年研发费用为27千万元时年销售量为8.1千万件.
(3)因为,,
所以
,
所以,
所以(元).
【例4.8.】 人们用大数据来描述和定义信息时代产生的海量数据,并利用这些数据处理事务和做出决策,某公司通过大数据收集到该公司销售的某电子产品1月至5月的销售量如下表.
月份
1
2
3
4
5
销售量(万件)
4.9
5.8
6.8
8.3
10.2
该公司为了预测未来几个月的销售量,建立了关于的回归模型:.
(1)根据所给数据与回归模型,求关于的回归方程(的值精确到0.1);
(2)已知该公司的月利润(单位:万元)与,的关系为,根据(1)的结果,问该公司哪一个月的月利润预报值最大?
【答案】(1)
(2)第9个月的月利润预报值最大.
【难度】0.65
【知识点】非线性回归、由导数求函数的最值(不含参)
【分析】(1)将非线性回归方程问题转化线性回归方程问题,根据最小二乘法求解即可.
(2)先求得的表达式,然后利用导数来求得最值问题.
【详解】(1)令,则,
,
,,
所以关于的回归方程为.
(2)由(1)知,
,
令(),
(),
令,得,单调递增,
令,得,单调递减,
令,得,
所以()在处取得极大值,也是最大值,
所以,
所以第9个月的月利润预报值最大.
题型5:残差与相关指数的应用
【例5.1.】 (多选)小张同学收集了某商品销售收入y(单位:万元)与相应的广告支出x(单位:万元)共10组数据,绘制出散点图,如下图所示,并利用线性回归模型进行拟合.她将图中10个点中的A点去掉后再重新进行线性回归分析,则下列说法正确的是( ).
A.决定系数变大
B.残差平方和变大
C.相关系数r的值变大
D.去掉A点后,若所有散点都在一条直线上,则决定系数
【答案】ACD
【难度】0.85
【知识点】决定系数的计算及分析、残差的计算、相关系数的意义及辨析
【分析】根据散点图的特征可得点较其他点偏离直线更远,从而可得去掉点后,回归效果更好,故可判断ABC的正误,根据残差和为零可判断D的正误.
【详解】由散点图可知,点较其他点偏离直线更远,
去掉点后,回归效果更好,残差平方和变小,决定系数变大;
自变量与因变量的相关性变强,又与正相关,所以相关系数的值变大;
当所有散点都在一条直线上时,残差平方和为,决定系数,
故ACD正确,B错误.
故选:ACD.
【例5.2.】
一组样本数据.其中,,,求得其经验回归方程为:,残差为.对样本数据进行处理:,得到新的数据,求得其经验回归方程为:,其残差为. ,分布如图所示,且,则下列说法错误的是( )
A.样本负相关 B.
C. D.处理后的决定系数变大
【答案】C
【难度】0.85
【知识点】根据样本中心点求参数、决定系数的计算及分析、残差的计算
【分析】利用回归方程系数判断A;利用样本中心点计算判断B;利用图像的波动性判断CD.
【详解】对于A,经验回归方程中斜率,则样本负相关,A正确;
对于B,原样本均值:,
由,得,B正确:
对于C,由图1的数据波动较大可得比更集中,则,C错误;
对于D,由图1的残差平方和较图2的残差平方和大知,处理后拟合效果更好,决定系数变大,D正确.
故选:C.
【例5.3.】
(多选)为研究某种树的树高和胸径的关系,甲学习小组随机测量了100棵该品种树的胸径x(单位:cm)和树高y(单位:m)的数据,已知其中一组数据为点,且,求得线性经验回归方程为,其决定系数,并绘制了如下残差图.该小组研究发现,残差比较均匀地分布在以取值为0的横轴为对称轴的水平带状区域内,则下列结论正确的是( )
A.乙学习小组对这组数据进行分析,得到非线性经验回归方程,其决定系数为,则甲小组选取的模型拟合效果更好
B.数据点P对应的残差为0.9
C.该样本中树的平均树高为22.29m
D.删除数据点P后,重新求得的回归直线的斜率变小
【答案】AC
【难度】0.65
【知识点】根据样本中心点求参数、残差的计算、相关系数的意义及辨析、求回归直线方程
【分析】根据决定系数的含义、残差的定义、平均值以及回归方程等知识逐项计算判断即可.
【详解】对于A:决定系数越大,模型的拟合效果越好,,选项A正确;
对于B:计算数据对应的残差,当时,,
所以残差为,选项B错误;
对于C:已知,则样本中心点的横坐标:,
将代入回归方程,可得y=0.25×29.16+15=7.29+15=22.29,
所以样本中树的平均树高为,选项C正确;
对于D:删除数据后,
因为38.4大于样本中心点的横坐标29.16,且23.7小于通过回归方程计算出的38.4对应的预测值24.6,
所以删除该点后,剩下的数据整体上可能使得树高与胸径的正相关变强,
即重新求得的回归直线的斜率变大,选项D错误.
故选:AC.
【例5.4.】
已知变量和的成对样本数据的经验回归方程为,且,当增加1个样本数据后,重新得到的经验回归方程的斜率为,则在新的经验回归方程的估计下,样本数据所对应的残差为( )
A. B. C.1 D.2
【答案】B
【难度】0.85
【知识点】根据样本中心点求参数、计算样本的中心点、残差的计算、线性回归
【分析】先计算新的数据的平均值,后得到经验回归方程,再结合残差概念计算即可.
【详解】由,可得增加1个样本数据后的平均数为,
因为,所以,
则增加1个样本数据后的平均数为,
所以,解得,
所以新的经验回归方程为,
则当时,,
样本点的残差为.
故选:B.
【例5.5.】 下列是某商品2025年前5个月的平均价格与月份的统计数据:
月份代码
1
2
3
4
5
平均价格(单位:元)
17
16
20
18
19
用方程拟合上述数据,当残差平方和最小时,( )
A.0.1 B.0.2 C.0.4 D.0.6
【答案】D
【难度】0.65
【知识点】残差的计算、线性回归
【分析】根据题意可算出残差平方和,再根据二次函数性质,即可求解.
【详解】当时,,残差的平方为;
当时,,残差的平方为;
当时,,残差的平方为;
当时,,残差的平方为;
当时,,残差的平方为;
所以残差平方和
,
对于二次函数开口向上,故在对称轴时取到最小值,故D正确.
故选:D.
【例5.6.】
海水稻的灌溉是将海水稀释后进行灌溉.某试验基地为了研究海水浓度x(‰)对亩产量y(吨)的影响,通过在试验田的种植实验,测得了某种海水稻的亩产量与海水浓度的数据如表.绘制散点图发现,可用线性回归模型拟合亩产量y与海水浓度x之间的相关关系,用最小二乘法计算得y与x之间的经验回归方程为.
海水浓度(‰)
3
4
5
6
7
亩产量 (吨)
0.62
0.58
0.49
0.4
0.31
残差
(1)请你估计:当浇灌海水浓度为8‰时,该品种海水稻的亩产量;
(2)(i)完成上述残差表;
(ii)在统计学中,常用决定系数来刻画回归效果,越大,模型拟合效果越好,并用它来说明响应变量与解释变量的相关性.你能否利用以上表格中的数据,计算决定系数,并判断模型的拟合效果.(计算中数据精确到0.01)
(附:残差,决定系数)
【答案】(1)吨.
(2)残差表见解析;,拟合效果较好.
【难度】0.65
【知识点】根据回归方程进行数据估计、残差的计算、求回归直线方程
【分析】(1)先求出平均数,代入经验回归方程即可求出b,从而求解.
(2)(i)根据经验回归方程求解,从而可得;
(ii)根据公式求出决定系数,进而判断.
【详解】(1)根据题中数据可知,,
将样本中心点的坐标代入经验回归方程得
,解得,
所以经验回归方程为.
当时,,
即当浇灌海水浓度为8‰时,该品种海水稻的亩产量为吨.
(2)(i)由经验回归方程可得
,;
,;
,;
,;
,.
所以残差表如下:
海水浓度(‰)
3
4
5
6
7
亩产量 (吨)
0.62
0.58
0.49
0.4
0.31
残差
(ii)由上数据可知,
,
所以决定系数,与1比较接近,
所以拟合效果较好.
题型6:等高堆积条形图的应用
【例6.1.】
观察下图的等高条形图,其中最有把握认为两个分类变量,之间没有关系的是( )
A. B.
C. D.
【答案】B
【难度】0.94
【知识点】等高条形图
【分析】根据题意,由等高条形图的意义分析可得答案.
【详解】根据题意,在等高的条形图中,当,所占比例相差越大时,越有把握认为两个分类变量,之间有关系,
由选项可得:B选项中,,所占比例相差无几,所以最有把握认为两个分类变量,之间没有关系,
故选:B
【例6.2.】 如图是学校高二1、2班本期中考试数学成绩优秀率的等高堆积条形图,如果再从两个班中各随机抽6名学生的期中考试数学成绩统计,那么( )
A.两个班6名学生的数学成绩优秀率可能相等
B.1班6名学生的数学成绩优秀率一定高于2班
C.2班6名学生中数学成绩不优秀的一定多于优秀的
D.“两班学生的数学成绩优秀率存在差异”判断一定正确
【答案】A
【难度】0.94
【知识点】等高条形图
【分析】分析等高堆积条形图可直接得到答案.
【详解】原图是学校高二1、2班本期中期考试数学成绩优秀率的等高堆积条形图,
从两个班随机抽取的6名学生的期中考试数学成绩优秀率无法确定哪个班的比较高,2班6名学生数学成绩不优秀的和优秀的人数也不能确定,故A正确,BC错误;
两个班期中考试数学成绩的优秀率均在0.5左右,并不能直接确定“两班学生的数学成绩优秀率存在差异”,故D错误;
故选:A.
【例6.3.】 如图为对某高中学生是否对父母说过“我爱你”这样的话的统计结果,则下列统计分析中不正确的是:( ).
A.男性被调查者没有对父母说过“我爱你”这样的话的人数比例高于女性
B.无论男女对母亲说“我爱你”这类话的比例都高于对父亲所说
C.大部分调查者没有对父母说过“我爱你”这样的话
D.经常对父母说“我爱你”这样的话的人数总计比例较女生比例有所下降,说明这张统计图的结果可能存在错误
【答案】D
【难度】0.85
【知识点】等高条形图
【分析】根据统计图中的数据进行分析,判断每个选项的正确性.
【详解】对于A选项,观察统计图,比较男性和女性未对父母说过“我爱你”的比例,
发现男性未说的比例高于女性,所以A选项正确.
对于B选项,分别对比男女对母亲和对父亲说“我爱你”的比例,
能看出无论男女对母亲说的比例都高于对父亲说的比例,所以B选项正确.
对于C选项,从统计图整体来看,未说过“我爱你”的人数比例较大,
所以大部分调查者没有对父母说过“我爱你”这样的话,C选项正确.
对于D选项,经常对父母说“我爱你”的人数总计比例较女生比例有所下降,
并不能直接说明统计图结果存在错误,有可能是实际调查结果就是如此,所以D选项错误.
故选:D
【例6.4.】 (多选)如图是调查某地区男、女中学生喜欢数学的等高堆积条形图,阴影部分表示喜欢数学的百分比,从图可以看出( )
A.性别与喜欢数学无关 B.女生中喜欢数学的百分比为
C.男生比女生喜欢数学的可能性大些 D.男生不喜欢数学的百分比为
【答案】CD
【难度】0.94
【知识点】等高条形图
【分析】根据等高堆积条形图即可结合选项求解.
【详解】由图可知,女生喜欢数学的占,男生喜欢数学的占,男生不喜欢数学的百分比为,故B错误,D正确;
显然性别与喜欢数学有关,故A错误;男生比女生喜欢数学的可能性大些,故C正确.
故选:CD.
【例6.5.】 (多选)为了有针对性地提高学生体育锻炼的积极性,某中学需要了解性别因素是否对本校学生体育锻的经常性有影响,随机抽取了300名学生,对他们是否经常锻炼的情况进行了调查,调查发现经常锻炼人数是不经常锻炼人数的2倍,绘制其等高堆积条形图,如图所示,则( )
A.参与调查的男生中经常锻炼的人数比不经常锻炼的人数多
B.从参与调查的学生中任取一人,已知该生为女生,则该生经常锻炼的概率为
C.依据的独立性检验,认为性别因素影响学生体育锻炼的经常性,该推断犯错误的概率不超过0.1
D.假设调查人数为600人,经常锻炼人数与不经常锻炼人数的比例不变,统计得到的等高堆积条形图也不变,依据的独立性检验,认为性别因素影响学生体育锻炼的经常性,该推断犯错误的概率不超过0.05
附:,
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【答案】ABD
【难度】0.65
【知识点】计算古典概型问题的概率、独立性检验的基本思想、卡方的计算、等高条形图
【分析】由题意计算出男生中经常锻炼的人数以及不经常锻炼的人数,即可判断A;根据古典概型的概率公式可判断B;列出列联表,根据独立性检验的方法可判断C,D.
【详解】对于A,由题意知经常锻炼人数是不经常锻炼人数的2倍,
故经常锻炼人数为200人,不经常锻炼人数为100人,
故男生中经常锻炼的人数为人,不经常锻炼的人数为人,
故男生中经常锻炼的人数比不经常锻炼的人数多,A正确;
对于B,经常锻炼的女生人数为人,不经常锻炼的人数为人,
故从参与调查的学生中任取一人,已知该生为女生,则该生经常锻炼的概率为,B正确;
对于C,由题意结合男女生中经常锻炼和不经常锻炼的人数,可得列联表:
经常锻炼
不经常锻炼
合计
男
100
60
160
女
100
40
140
合计
200
100
300
则,
故依据的独立性检验,不能认为性别因素影响学生体育锻炼的经常性,该推断犯错误的概率不超过0.1,C错误;
对于D,由题意可得:
经常锻炼
不经常锻炼
合计
男
200
120
320
女
200
80
280
合计
400
200
600
则此时,
故依据的独立性检验,认为性别因素影响学生体育锻炼的经常性,该推断犯错误的概率不超过0.05,D正确,
故选:ABD
题型7:独立性检验的概念和辨析
【例7.1.】 下列实际问题不适合用独立性检验解决的是( )
A.不良的饮食习惯是否会导致肠胃疾病
B.某公司的营业额在过去5年逐年变化的情况
C.参加课外辅导能否提高学习成绩
D.男性和女性在职业选择偏好上是否有差异
【答案】B
【难度】0.94
【知识点】独立性检验的概念及辨析
【分析】根据独立性检验的基本思想,即可判断选项.
【详解】独立性检验是通过统计学方法来检验两个分类变量之间是否存在关联性,
ACD满足独立性检验的基本思想,B选项只是公司的营业额这一个变量在过去5年的变化情况,不满足独立性检验的基本思想.
故选:B
【例7.2.】
根据分类变量与的观测数据,计算得到,依据小概率值()的独立性检验,则( )
A.变量与不独立
B.变量与独立
C.变量与不独立,这个结论犯错误的概率不超过0.1
D.变量与独立,这个结论犯错误的概率不超过0.1
【答案】B
【难度】0.94
【知识点】独立性检验的基本思想、独立性检验的概念及辨析
【分析】根据独立性检验的概念可得正确的选项.
【详解】因为,所以在显著性水平下,
没有充分证据拒绝原假设,因此我们认为变量与是独立的,
故选:B
【例7.3.】
某医疗研究所为了检验某种血清能起到预防感冒的作用,把500名使用血清的人与另外500名未使用血清的人一年中的感冒记录作比较,利用列联表计算得的观测值.
附表:
0.15
0.10
0.05
0.025
0.010
2.072
2.706
3.841
5.024
6.635
则作出“这种血清能起到预防感冒的作用”出错的可能性不超过( )
A. B. C. D.
【答案】B
【难度】0.94
【知识点】独立性检验解决实际问题、独立性检验的概念及辨析
【分析】由独立性检验的原理的理解辨析可判断.
【详解】由题意知观测值,所以对照题中的附表可作出“这种血清能起到预防感冒的作用”出错的可能性不超过的结论.
故选:B
【例7.4.】 在性别与吃零食这两个分类变量的计算中,下列说法正确的是( )
①若的观测值为,我们有的把握认为吃零食与性别有关系,那么在100个吃零食的人中必有99人是女性;
②从独立性检验可知有的把握认为吃零食与性别有关系时,我们说某人吃零食,那么此人是女性的可能性为;
③若从统计量中求出有的把握认为吃零食与性别有关系,是指有的可能性使得出的判断出现错误.
A.①② B.①③ C.②③ D.③
【答案】D
【难度】0.85
【知识点】独立性检验解决实际问题、独立性检验的基本思想、独立性检验的概念及辨析
【分析】由独立性检验相关概念可得答案.
【详解】①若的观测值为,我们有的把握认为吃零食与性别有关系,那么在100个吃零食的人中必有99人是女性,故①不正确;
②独立性检验是用来考察两个分类变量是否具有关联性,并且能较精确地给出这种判断的可靠程度,
而不是给出事件的概率,故②不正确;
③若从统计量中求出有的把握认为吃零食与性别有关系,是指有的可能性使得出的判断出现错误,③正确。
故选:D
【例7.5.】
某单位对员工是否愿意被外派与年龄的关系进行了一次调查,根据独立性检验原理,处理所得数据之后发现,得到“是否愿意被外派与年龄有关”这个结论犯错误的概率大于0.001,而不大于0.01,则的值可能为( )
附表:
0.05
0.01
0.001
3.841
6.635
10.828
A.3.206 B.6.561 C.7.879 D.11.028
【答案】C
【难度】0.94
【知识点】独立性检验的概念及辨析
【分析】由题意,结合小概率表,可判断的值应位于与之间,得到答案.
【详解】由题意得的值应位于与之间,故C正确,ABD错误.
故选:C
【例7.6.】
在一项打鼾与患心脏病的调查中,共调查了1671人,经过计算,根据这一数据分析,有________的把握认为打鼾与患心脏病是________(填“有关”或“无关”)的.
【答案】 有关
【难度】0.85
【知识点】独立性检验的概念及辨析、独立性检验解决实际问题
【分析】根据题意,结合独立性检验的数据,即可得到答案.
【详解】由题意知,经过计算,可得,
所以有的把握认为打鼾与患心脏病是有关的.
故答案为:;有关.
题型8:独立性检验的应用
【例8.1.】
一款短视频手机应用最近在某校学生中流行起来,某校团委对“学生性别和喜欢该手机应用是否有关”做了一次调查,其中被调查的女生人数是男生人数的,男生喜欢该手机应用的人数占男生人数的,女生喜欢该手机应用的人数占女生人数的,若有的把握认为是否喜欢该手机应用和性别有关,则被调查的男生人数至少为( )
0.05
0.01
3.841
6.635
A.12 B.6 C.10 D.18
【答案】A
【难度】0.65
【知识点】完善列联表、卡方的计算、独立性检验解决实际问题
【分析】设被调查的男生人数为,则女生人数为,根据题意得到列联表,由计算公式,及独立性检验思想,得到关于的不等式,求解可得.
【详解】设被调查的男生人数为,则女生人数为,可得列联表如下:
喜欢
不喜欢
合计
男生
女生
合计
由公式算得,因为有的把握认为是否喜欢该手机应用和性别有关,所以,
则.而都是整数,所以的值至少为12.
故选:A.
【例8.2.】 根据下面的列联表判断患肝病与嗜酒有关系的把握有( )
肝病
酒性
合计
嗜酒
不嗜酒
患肝病
7775
42
7817
未患肝病
2099
49
2148
合计
9874
91
9965
A. B. C. D.
【答案】D
【难度】0.85
【知识点】卡方的计算、独立性检验解决实际问题
【分析】由列联表中的数据,求得,即可得到答案.
【详解】由列联表中的数据,计算得,
故有的把握认为患肝病与嗜酒有关系.
故选:D.
【例8.3.】 为研究某新药的疗效,给100名患者服用此药,跟踪调查后得下表中的数据:
患者性别
药效
合计
无效
有效
男
15
35
50
女
6
44
50
合计
21
79
100
设:服用此药的效果与患者的性别无关.则______(精确到小数点后3位),从而得出结论:服用此药的效果与患者的性别有关,这种判断出错的可能性为______.
【答案】 4.882 5%
【难度】0.85
【知识点】独立性检验解决实际问题
【分析】计算,再由独立性检验得出结论.
【详解】由公式计算得.
因为,所以我们有的把握认为服用此药的效果与患者的性别有关,从而出错的可能性为.
故答案为:4.882;5%
【例8.4.】
某航天材料实验室要对比两种新型高温合金材料的性能稳定性,现有合金部件样本900件,合金部件样本500件,采用分层抽样抽取140件做耐热疲劳测试,以部件能承受1000次热循环不失效为合格标准,得到以下部分列联表:
单位:件
材料配方类型
耐热疲劳性能
合计
测试合格
测试不合格
配方材料试样
75
配方材料试样
20
合计
140
(1)请完成上述列联表;
(2)依据的独立性检验,能否认为不同的材料配方与耐热疲劳性能有关联?
附:,其中.
附表:
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【答案】(1)列联表见解析
(2)有关联
【难度】0.85
【知识点】完善列联表、卡方的计算、独立性检验解决实际问题
【分析】(1)根据题干表格,完善列联表即可;
(2)计算出卡方,即可判断.
【详解】(1)由已知合金部件应抽取件,合金部件应抽取件,
由此可得列联表如下:
材料配方类型
耐热疲劳性能
合计
测试合格
测试不合格
配方材料试样
75
15
90
配方材料试样
30
20
50
合计
105
35
140
(2)零假设为:材料配方与耐热疲劳性能无关联,
根据列联表数据,经计算得,
根据小概率值的独立性检验,我们推断不成立,
即认为材料配方与耐热疲劳性能有关联,此推断犯错误的概率不大于.
【例8.5.】 为了了解心肺疾病是否与年龄相关,现随机抽取了40名市民,得到数据如下表:
年龄
心肺疾病
合计
患心肺疾病
不患心肺疾病
大于40岁
16
小于等于40岁
12
合计
40
已知在40人中随机抽取1人,抽到不患心肺疾病的市民的概率为.
(1)请将列联表补充完整;
(2)已知在大于40岁且患心肺疾病的市民中,有4名重症患者,专家建议以重症患者住院治疗,现从这16名患者中选出2人,记需住院治疗的人数为,求的分布列和数学期望;
(3)能否在犯错误的概率不超过0.01的前提下认为患心肺疾病与年龄有关?
【答案】(1)答案见解析
(2)分布列见解析,
(3)能在犯错误的概率不超过0.01的前提下认为患心肺疾病与年龄有关.
【难度】0.65
【知识点】完善列联表、卡方的计算、写出简单离散型随机变量分布列、求离散型随机变量的均值
【分析】(1)根据题意,求得抽到不患心肺疾病的市民的人数为人,进而完成列联表
(2)根据题意,得到需住院治疗的人数为可能取值为,利用超几何分布的概率公式,求得相应的概率,列出分布列,结合期望的公式,即可求解;
(3)由(1)中的列联表,求得,结合附表,即可得到结论.
【详解】(1)解:由题意知,在40人中随机抽取1人,抽到不患心肺疾病的市民的概率为,
所以抽到不患心肺疾病的市民的人数为人,
将列联表补充完整,如下表所示:
年龄
心肺疾病
合计
患心肺疾病
不患心肺疾病
大于40岁
16
4
20
小于等于40岁
8
12
20
合计
24
16
40
(2)解:由题意知,需住院治疗的人数为可能取值为,
可得,,,
所以随机变量的分布列为
0
1
2
所以随机变量的数学期望.
(3)解:零假设为:是否患心肺疾病与年龄无关,
由(1)中的列联表,可得,
所以能在犯错误的概率不超过0.01的前提下认为患心肺疾病与年龄有关.
【例8.6.】
某研究小组为探究给禾苗加化肥与禾苗生长情况的关系,将30株禾苗均分为两组:对照组(不加化肥)和实验组(加化肥).在其他条件均相同的情况下,实验结束后测得这30株禾苗的高度(单位:cm)如下:
对照组
18.5
18.8
19.1
19.5
20.3
22.3
23
23.6
24
24.8
25.5
26.7
27.7
28.5
39.8
实验组
19.7
20.1
22.6
23.5
24.8
25
25.2
25.6
26
27.1
28.3
29.5
29.6
31.4
31.4
当实验结束时,若禾苗的高度不低于25cm,则判断该禾苗生长良好;若禾苗的高度低于25cm,则判断该禾苗生长较差,将这30株禾苗高度的数据进行整理,得到如下列联表:
分组
禾苗的生长情况
生长良好
生长较差
合计
对照组
15
实验组
15
合计
30
(1)请完成列联表;
(2)判断是否有90%的把握认为给禾苗加化肥与该禾苗的生长情况有关.
附:,其中.
当时,没有充分的证据判断变量有关联,可以认为变量是没有关联的;当时,有90%的把握判断变量有关联.
【答案】(1)列联表见解析
(2)有90%的把握认为给禾苗加化肥与该禾苗的生长情况有关.
【难度】0.65
【知识点】独立性检验解决实际问题、卡方的计算、完善列联表
【分析】(1)根据统计表格中的数据:分别求得对照组和实验组中生长较差和生长良好的株数,进而得出的列联表;
(2)由的列联表中的数据,利用公式求得,集合附值,即可得到结论.
【详解】(1)解:根据统计表格中的数据:
对照组15株中,生长较差的有10株,生长良好有5株;
实验组15株中,生长较差的有5株,生长良好有10株;
所以的列联表为:
分组
禾苗的生长情况
生长良好
生长较差
合计
对照组
5
10
15
实验组
10
5
15
合计
15
15
30
(2)解:假设给禾苗加化肥与该禾苗的生长情况无关,
由的列联表中的数据,可得:
因为,所以有的把握判断变量有关联,所以拒绝假设,
所以有90%的把握认为给禾苗加化肥与该禾苗的生长情况有关.
【例8.7.】
目前,AI赋能语音识别技术已从实验室的“概念验证”发展为改变人类生活的基础设施,随着大模型和多模态技术的融合,英文识别将不再是单一功能,也是智能系统理解世界的“耳朵”和“眼睛”,推动人机交互从“命令执行”向“自然对话”演进.现甲、乙两名同学通过英文指令与某AI智能体人机交互共生成200篇文章.若生成的文章达到专业要求,不用进一步改良,视为合格.现已知甲同学生成的文章有80篇合格,占甲同学生成文章总数的,乙同学生成的文章有一半合格.
(1)请根据以上数据填写下面的列联表,并推断能否有95%的把握认为生成的文章是否合格与甲、乙(不同的)同学给出的指令有关?
生成的文章合格
生成的文章不合格
总计
甲同学
80
乙同学
总计
200
(2)经试验,若给出的指令够准确具体,该智能体生成文章合格的概率为,则在此条件下从该智能体生成的一批文章中随机调取3篇,请写出其中合格的篇数的分布列,并算出期望.
附:,其中(结果精确到0.001).
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【答案】(1)列联表见解析,有95%的把握;
(2)分布列见解析,
【难度】0.4
【知识点】完善列联表、独立性检验解决实际问题、写出简单离散型随机变量分布列、二项分布的均值
【分析】(1)根据题意,得出列联表,求得的值,结合附表,即可得到结论;
(2)根据题意,得到的可能取值,得出服从二项分布,求得相应的概率,得出分布列,求得数学期望.
【详解】(1)由题意得
生成文章合格
生成文章不合格
总计
甲同学
80
40
120
乙同学
40
40
80
总计
120
80
200
零假设生成的文章是否合格与甲、乙同学给出的指令无关,
,
∵,所以我们推断不成立,
所以有95%的把握认为生成文章是否合格与甲、乙(不同的)同学给出的指令有关;
(2)合格的篇数的所有可能取值为,,,
由题意, ,
故的分布列为
0
1
2
3
故期望.
(
1
)
学科网(北京)股份有限公司
$
第八章 成对数据的统计分析章末重点题型
目录
题型1:变量之间的相关关系辨析 2
题型2:相关系数的计算与应用 3
题型3:线性回归分析 5
题型4:非线性回归分析 8
题型5:残差与相关指数的应用 12
题型6:等高堆积条形图的应用 15
题型7:独立性检验的概念和辨析 17
题型8:独立性检验的应用 19
题型1:变量之间的相关关系辨析
【例1.1.】 下列两个变量之间,是相关关系的有( )
①角度与它的余弦值;②人的体重与视力;③正n边形的边数和它的内角度数之和;④圆心角的大小与所对的圆弧长;⑤光照时间和果树亩产量;⑥收入水平与购买能力;⑦正方体的棱长与体积.
A.①④⑥ B.②⑤⑥⑦ C.⑤⑥ D.③⑤⑦
【例1.2.】 下列图形中具有相关关系的两个变量是( ).
A. B.
C. D.
【例1.3.】
对某种动物的三项指标,,进行调查研究.现有这种动物若干只,设每只动物的这三项指标为.若与的散点图如图1和图2所示,那么关于的散点图最合理的为( )
A. B.
C. D.
题型2:相关系数的计算与应用
【例2.1.】 以下散点图经过标准化后,相关系数最大的是( )
A. B.
C. D.
【例2.2.】
(多选)下列关于相关系数的说法正确的是( )
A.相关系数越大两个变量间相关性越强
B.相关系数的取值范围为
C.相关系数时两个变量正相关,时两个变量负相关
D.相关系数时,样本点在同一直线上
【例2.3.】
(多选)通过随机抽样,得到变量和变量的7对数据,并绘制成散点图如图所示,已知变量和变量线性相关,且回归直线是图中直线,则下列说法正确的是( )
A.直线的斜率是负数
B.变量与变量正相关
C.相关系数
D.若去掉图中点后,剩余数据的相关系数变大
【例2.4.】
已知,,,,则相关系数______.(相关系数)
【例2.5.】
大学生刘铭去某工厂实习,实习结束时从自己制作的某种零件中随机选取了10个样品,测量每个零件的横截面积(单位:)和耗材量(单位:),得到如下数据:
样本号
1
2
3
4
5
6
7
8
9
10
总和
零件的横截面积
0.03
0.05
0.04
0.07
0.07
0.04
0.05
0.06
0.06
0.05
0.52
耗材量
0.24
0.40
0.23
0.55
0.50
0.34
0.35
0.45
0.43
0.41
3.9
并计算得.
(1)估算刘铭同学制作的这种零件平均每个零件的横截面积以及平均一个零件的耗材量;
(2)求刘铭同学制作的这种零件的横截面积和耗材量的样本相关系数(精确到0.01);
(3)刘铭同学测量了自己实习期制作的所有这种零件的横截面积,并得到所有这种零件的横截面积的和为,若这种零件的耗材量和其横截面积近似成正比,请帮刘铭计算一下他制作的零件的总耗材量的估计值.附:相关系数.
【例2.6.】
广阳岛,作为长江上游最大的江心岛,其面积在枯水期约为10平方公里.自2017年起,重庆市开始对广阳岛进行系统的生态修复,摒弃了曾经的商业开发计划,转而建设“长江风景眼,重庆生态岛”.经过数年的努力,广阳岛的生态得到了显著的改善,不仅植被丰富,生物多样性也得到了极大的提升.据监测,岛上的鸟类从生态修复前的124种增加到213种,其中包括中华秋沙鸭、游隼、白琵鹭等珍稀鸟类.为调查广阳岛某种鸟的数量,将其分成面积相近的50个地块,从这些地块中用简单随机抽样的方法抽取5个作为样区,调查得到样本数据,其中和分别表示第个样区的植被覆盖面积(单位:平方公里)和这种鸟的数量.
1
2
3
4
5
0.171
0.152
0.192
0.189
0.196
12
10
16
14
18
(1)求广阳岛这种鸟数量的估计值(这种鸟数量的估计值等于样区这种鸟数量的平均数乘以地块数);
(2)求样本的相关系数(精确到0.01);
(3)根据统计资料,各地块间植物覆盖面积差异较大.为提高样本的代表性以获得广阳岛这种鸟数量更准确的估计,请给出一种你认为更合理的抽样方法,并说明理由.
附:相关系数,,.
题型3:线性回归分析
【例3.1.】
(多选)某种细胞在培养正常的情况下,时刻(单位:分)与细胞数(单位:个)的部分数据如下表所示:
1
2
3
4
5
52
95
185
227
若与线性相关,由上表数据求得经验回归方程为,则下列说法正确的是( )
A.与正相关 B.
C.细胞数逐分增加,平均每分钟增加10个左右 D.预计10分钟后细胞数约为450个
【例3.2.】
2025年11 月,搭载“祖冲之三号”同款芯片的超导量子计算机“天衍-287”完成搭建,该量子计算系统具备“量子计算优越性”能力.下表记录了8个团队在特定年度的研发资金投入x(单位:亿元)与芯片性能提升评估指数y,且
研发资金投入x/亿元
2
10
性能提升评估指数y
2
12
已知y与x具有较强的线性关系,通过最小二乘估计得到的经验回归方程为如果去掉样本点后,得到的新样本的经验回归方程为则( )
A.0.1 B.0.3 C.0.5 D.0.7
【例3.3.】
(多选)两个具有相关关系的变量,的一组数据为,,,,其经验回归方程为,记,,相关系数为;若将数据调整为,,,,其经验回归方程为,记,相关系数为,则( )
附:,
A. B.
C. D.
【例3.4.】
某景点自从取消门票实行免费开放后,迅速成为网红打卡点,不仅带动了淡季的旅游,而且优化了旅游产业的结构.下表是该景点免费开放后前五个月的打卡人数y(万人)与第个月的数据:
1
2
3
4
5
1.3
1.7
2.2
2.8
3.5
已知与线性相关.
(1)求关于的线性回归方程;
(2)预测第7个月的打卡人数.
参考数据:.
参考公式:线性回归方程中斜率、截距的最小二乘法估计公式为.
【例3.5.】 某兴趣小组欲研究昼夜温差大小与患感冒人数多少之间的关系,他们分别到气象局与某医院抄录了1~6月份每月5日的昼夜温差情况与因患感冒而就诊的人数,得到如下资料:
日期
1月5日
2月5日
3月5日
4月5日
5月5日
6月5日
昼夜温差X/℃
10
11
13
12
8
6
就诊人数
23
25
29
26
16
13
该兴趣小组确定的研究方案是:先从这6组数据中选取2组,用剩下的4组数据求线性回归方程,再用被选取的2组数据进行检验.
(1)若选取的是1月与6月的两组数据,请根据2~5月份的数据,求出关于的线性回归方程;(参考数据:设2~5月份每月5日的昼夜温差的平均数为,就诊人数的平均数为,则,)
(2)若由线性回归方程得到的估计数据与所选出的检验数据的误差均不超过2,则认为得到的线性回归方程是理想的,问:该小组所得线性回归方程是否理想?
【例3.6.】
某幼儿园雏鹰班的生活老师统计2024年上半年每个月的20日的昼夜差(单位:℃,)和患感冒的小朋友人数(单位:人)的数据如下:
8
11
14
20
23
26
其中,,.
(1)请用相关系数加以说明是否可用线性回归模型拟合与的关系;
(2)建立关于的经验回归方程(精确到0.01),预测当昼夜温差升高4℃时患感冒的小朋友的人数会有什么变化.(人数精确到整数,参考数据:)
题型4:非线性回归分析
【例4.1.】
用模型去拟合与的关系,令,得到关于的回归直线方程为,则( )
A.1 B.2 C.3 D.4
【例4.2.】
在研究两个变量的相关关系时,观察散点图发现样本点集中于某一条指数曲线的周围.令,求得经验回归方程为,则该模型的回归方程为________.
【例4.3.】 近期,某市公交公司分别推出支付宝和微信扫码支付乘车活动,活动设置了一段时间的推广期,由于推广期内优惠力度较大,吸引越来越多的人开始使用扫码支付.某线路公交车队统计了活动刚推出一周内每一天使用扫码支付的人次,用x表示活动推出的天数,y表示每天使用扫码支付的人次(单位:十人次),统计数据如表所示:
1
2
3
4
5
6
7
6
11
21
34
66
101
196
根据以上数据,绘制了散点图.
(1)根据散点图判断,在推广期内,与(均为大于零的常数)哪一个适宜作为扫码支付的人次关于活动推出天数的经验回归方程?(给出判断即可,不必说明理由)
(2)根据(1)的判断结果及表中的数据,建立关于的回归方程,并预测活动推出第8天使用扫码支付的人次.
[参考数据:,,,,,其中,]
【例4.4.】
某科技创新型企业自创建以来,不断加大研发投入,走科技创新之路,年利润得到较快增长,2021~2025连续五年的年利润y(单位:亿元)与年份序号x(,2,3,4,5,其中2021年记为1,2022年记为2,以此类推)满足某一元非线性回归方程,统计数据如下:
374
230
6.3
144
1.6
4
注:,.
(1)设和y的相关系数为,x和v的相关系数为,请从相关系数的角度,确定和(其中a,b,m,n均为常数,e为自然对数的底数)哪一个拟合程度更好;
(2)根据(1)的结论及表中数据,建立y关于x的回归方程.
附:①相关系数,回归直线中斜率和截距的最小二乘估计公式分别为, .
②参考数据:.
【例4.5.】 近年来,新能源汽车因其动力充沛、提速快、用车成本低等特点得到民众的追捧.某机构为研究汽油价格x(单位:元/升)与新能源汽车的月销售量y(单位:万辆)之间的关系,收集整理得到如下数据:
x
6
6.5
7
7.5
8
y
1.5
2
3
4.5
6.8
(1)若用模型模拟x与y之间关系,求出回归方程;
(2)根据建立的回归方程,预测当汽油价格上涨至9元/升时,新能源汽车的销量;
(3)假设当汽油价格为9元/升时,实际销量超过预测值的概率为0.6.现进行5次独立观测,记这5次观测中销量超过预测值的次数为,求的数学期望.
参考数据和公式:.,.
令,,,.
对于一组数据,其回归直线的斜率和截距的最小二乘估计分别为:,.
【例4.6.】
统计显示,我国在线直播生活购物用户规模近几年保持高速增长态势,下表为年—年我国在线直播生活购物用户规模(单位:亿人),其中年—年对应的代码依次为—.
年份代码
市场规模
,,,其中
参考公式:对于一组数据、、、,其经验回归直线的斜率和截距的最小二乘估计公式分别为,.
(1)由上表数据可知,若用函数模型拟合与的关系,请估计年我国在线直播生活购物用户的规模(结果精确到);
(2)已知我国在线直播生活购物用户选择在品牌官方直播间购物的概率,现从我国在线直播购物用户中随机抽取人,记这人中选择在品牌官方直播间购物的人数为,若,求的数学期望和方差.
【例4.7.】
随着中美关税战的不断升级,某企业大大加强科技研发投入的力度,为确定下一年对某产品进行科技升级的研发费用,需了解该产品年研发费用(单位:千万元)对年销售量(单位:千万件)的影响.根据市场调研与模拟,对收集的数据进行初步处理,得到散点图及一些统计量的值如
30.5
15
15
46.5
表中,.
(1)根据散点图判断,与哪一个更适合作为年销售量关于年研发费用的回归方程模型(给出判断即可,不必说明理由);
(2)根据(1)的判断结果及表中数据,建立关于的回归方程,并估计年研发费用为27千万元时年销售量的值;
(3)科技升级后,该产品的效率大幅提高,经试验统计得大致服从正态分布.企业对科技升级团队的奖励方案如下:若不超过50%,不予奖励;若超过50%,但不超过53%,每件产品奖励2元;若超过53%,每件产品奖励4元.记为每件产品获得的奖励,求(精确到0.01).
附:①对于一组数据,其回归直线的斜率和截距的最小二乘估计分别为,.
②若随机变量,则,.
③.
【例4.8.】 人们用大数据来描述和定义信息时代产生的海量数据,并利用这些数据处理事务和做出决策,某公司通过大数据收集到该公司销售的某电子产品1月至5月的销售量如下表.
月份
1
2
3
4
5
销售量(万件)
4.9
5.8
6.8
8.3
10.2
该公司为了预测未来几个月的销售量,建立了关于的回归模型:.
(1)根据所给数据与回归模型,求关于的回归方程(的值精确到0.1);
(2)已知该公司的月利润(单位:万元)与,的关系为,根据(1)的结果,问该公司哪一个月的月利润预报值最大?
题型5:残差与相关指数的应用
【例5.1.】 (多选)小张同学收集了某商品销售收入y(单位:万元)与相应的广告支出x(单位:万元)共10组数据,绘制出散点图,如下图所示,并利用线性回归模型进行拟合.她将图中10个点中的A点去掉后再重新进行线性回归分析,则下列说法正确的是( ).
A.决定系数变大
B.残差平方和变大
C.相关系数r的值变大
D.去掉A点后,若所有散点都在一条直线上,则决定系数
【例5.2.】
一组样本数据.其中,,,求得其经验回归方程为:,残差为.对样本数据进行处理:,得到新的数据,求得其经验回归方程为:,其残差为. ,分布如图所示,且,则下列说法错误的是( )
A.样本负相关 B.
C. D.处理后的决定系数变大
【例5.3.】
(多选)为研究某种树的树高和胸径的关系,甲学习小组随机测量了100棵该品种树的胸径x(单位:cm)和树高y(单位:m)的数据,已知其中一组数据为点,且,求得线性经验回归方程为,其决定系数,并绘制了如下残差图.该小组研究发现,残差比较均匀地分布在以取值为0的横轴为对称轴的水平带状区域内,则下列结论正确的是( )
A.乙学习小组对这组数据进行分析,得到非线性经验回归方程,其决定系数为,则甲小组选取的模型拟合效果更好
B.数据点P对应的残差为0.9
C.该样本中树的平均树高为22.29m
D.删除数据点P后,重新求得的回归直线的斜率变小
【例5.4.】
已知变量和的成对样本数据的经验回归方程为,且,当增加1个样本数据后,重新得到的经验回归方程的斜率为,则在新的经验回归方程的估计下,样本数据所对应的残差为( )
A. B. C.1 D.2
【例5.5.】 下列是某商品2025年前5个月的平均价格与月份的统计数据:
月份代码
1
2
3
4
5
平均价格(单位:元)
17
16
20
18
19
用方程拟合上述数据,当残差平方和最小时,( )
A.0.1 B.0.2 C.0.4 D.0.6
【例5.6.】
海水稻的灌溉是将海水稀释后进行灌溉.某试验基地为了研究海水浓度x(‰)对亩产量y(吨)的影响,通过在试验田的种植实验,测得了某种海水稻的亩产量与海水浓度的数据如表.绘制散点图发现,可用线性回归模型拟合亩产量y与海水浓度x之间的相关关系,用最小二乘法计算得y与x之间的经验回归方程为.
海水浓度(‰)
3
4
5
6
7
亩产量 (吨)
0.62
0.58
0.49
0.4
0.31
残差
(1)请你估计:当浇灌海水浓度为8‰时,该品种海水稻的亩产量;
(2)(i)完成上述残差表;
(ii)在统计学中,常用决定系数来刻画回归效果,越大,模型拟合效果越好,并用它来说明响应变量与解释变量的相关性.你能否利用以上表格中的数据,计算决定系数,并判断模型的拟合效果.(计算中数据精确到0.01)
(附:残差,决定系数)
题型6:等高堆积条形图的应用
【例6.1.】
观察下图的等高条形图,其中最有把握认为两个分类变量,之间没有关系的是( )
A. B.
C. D.
【例6.2.】 如图是学校高二1、2班本期中考试数学成绩优秀率的等高堆积条形图,如果再从两个班中各随机抽6名学生的期中考试数学成绩统计,那么( )
A.两个班6名学生的数学成绩优秀率可能相等
B.1班6名学生的数学成绩优秀率一定高于2班
C.2班6名学生中数学成绩不优秀的一定多于优秀的
D.“两班学生的数学成绩优秀率存在差异”判断一定正确
【例6.3.】 如图为对某高中学生是否对父母说过“我爱你”这样的话的统计结果,则下列统计分析中不正确的是:( ).
A.男性被调查者没有对父母说过“我爱你”这样的话的人数比例高于女性
B.无论男女对母亲说“我爱你”这类话的比例都高于对父亲所说
C.大部分调查者没有对父母说过“我爱你”这样的话
D.经常对父母说“我爱你”这样的话的人数总计比例较女生比例有所下降,说明这张统计图的结果可能存在错误
【例6.4.】 (多选)如图是调查某地区男、女中学生喜欢数学的等高堆积条形图,阴影部分表示喜欢数学的百分比,从图可以看出( )
A.性别与喜欢数学无关 B.女生中喜欢数学的百分比为
C.男生比女生喜欢数学的可能性大些 D.男生不喜欢数学的百分比为
【例6.5.】 (多选)为了有针对性地提高学生体育锻炼的积极性,某中学需要了解性别因素是否对本校学生体育锻的经常性有影响,随机抽取了300名学生,对他们是否经常锻炼的情况进行了调查,调查发现经常锻炼人数是不经常锻炼人数的2倍,绘制其等高堆积条形图,如图所示,则( )
A.参与调查的男生中经常锻炼的人数比不经常锻炼的人数多
B.从参与调查的学生中任取一人,已知该生为女生,则该生经常锻炼的概率为
C.依据的独立性检验,认为性别因素影响学生体育锻炼的经常性,该推断犯错误的概率不超过0.1
D.假设调查人数为600人,经常锻炼人数与不经常锻炼人数的比例不变,统计得到的等高堆积条形图也不变,依据的独立性检验,认为性别因素影响学生体育锻炼的经常性,该推断犯错误的概率不超过0.05
附:,
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
题型7:独立性检验的概念和辨析
【例7.1.】 下列实际问题不适合用独立性检验解决的是( )
A.不良的饮食习惯是否会导致肠胃疾病
B.某公司的营业额在过去5年逐年变化的情况
C.参加课外辅导能否提高学习成绩
D.男性和女性在职业选择偏好上是否有差异
【例7.2.】
根据分类变量与的观测数据,计算得到,依据小概率值()的独立性检验,则( )
A.变量与不独立
B.变量与独立
C.变量与不独立,这个结论犯错误的概率不超过0.1
D.变量与独立,这个结论犯错误的概率不超过0.1
【例7.3.】
某医疗研究所为了检验某种血清能起到预防感冒的作用,把500名使用血清的人与另外500名未使用血清的人一年中的感冒记录作比较,利用列联表计算得的观测值.
附表:
0.15
0.10
0.05
0.025
0.010
2.072
2.706
3.841
5.024
6.635
则作出“这种血清能起到预防感冒的作用”出错的可能性不超过( )
A. B. C. D.
【例7.4.】 在性别与吃零食这两个分类变量的计算中,下列说法正确的是( )
①若的观测值为,我们有的把握认为吃零食与性别有关系,那么在100个吃零食的人中必有99人是女性;
②从独立性检验可知有的把握认为吃零食与性别有关系时,我们说某人吃零食,那么此人是女性的可能性为;
③若从统计量中求出有的把握认为吃零食与性别有关系,是指有的可能性使得出的判断出现错误.
A.①② B.①③ C.②③ D.③
【例7.5.】
某单位对员工是否愿意被外派与年龄的关系进行了一次调查,根据独立性检验原理,处理所得数据之后发现,得到“是否愿意被外派与年龄有关”这个结论犯错误的概率大于0.001,而不大于0.01,则的值可能为( )
附表:
0.05
0.01
0.001
3.841
6.635
10.828
A.3.206 B.6.561 C.7.879 D.11.028
【例7.6.】
在一项打鼾与患心脏病的调查中,共调查了1671人,经过计算,根据这一数据分析,有________的把握认为打鼾与患心脏病是________(填“有关”或“无关”)的.
题型8:独立性检验的应用
【例8.1.】
一款短视频手机应用最近在某校学生中流行起来,某校团委对“学生性别和喜欢该手机应用是否有关”做了一次调查,其中被调查的女生人数是男生人数的,男生喜欢该手机应用的人数占男生人数的,女生喜欢该手机应用的人数占女生人数的,若有的把握认为是否喜欢该手机应用和性别有关,则被调查的男生人数至少为( )
0.05
0.01
3.841
6.635
A.12 B.6 C.10 D.18
【例8.2.】 根据下面的列联表判断患肝病与嗜酒有关系的把握有( )
肝病
酒性
合计
嗜酒
不嗜酒
患肝病
7775
42
7817
未患肝病
2099
49
2148
合计
9874
91
9965
A. B. C. D.
【例8.3.】 为研究某新药的疗效,给100名患者服用此药,跟踪调查后得下表中的数据:
患者性别
药效
合计
无效
有效
男
15
35
50
女
6
44
50
合计
21
79
100
设:服用此药的效果与患者的性别无关.则______(精确到小数点后3位),从而得出结论:服用此药的效果与患者的性别有关,这种判断出错的可能性为______.
【例8.4.】
某航天材料实验室要对比两种新型高温合金材料的性能稳定性,现有合金部件样本900件,合金部件样本500件,采用分层抽样抽取140件做耐热疲劳测试,以部件能承受1000次热循环不失效为合格标准,得到以下部分列联表:
单位:件
材料配方类型
耐热疲劳性能
合计
测试合格
测试不合格
配方材料试样
75
配方材料试样
20
合计
140
(1)请完成上述列联表;
(2)依据的独立性检验,能否认为不同的材料配方与耐热疲劳性能有关联?
附:,其中.
附表:
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【例8.5.】 为了了解心肺疾病是否与年龄相关,现随机抽取了40名市民,得到数据如下表:
年龄
心肺疾病
合计
患心肺疾病
不患心肺疾病
大于40岁
16
小于等于40岁
12
合计
40
已知在40人中随机抽取1人,抽到不患心肺疾病的市民的概率为.
(1)请将列联表补充完整;
(2)已知在大于40岁且患心肺疾病的市民中,有4名重症患者,专家建议以重症患者住院治疗,现从这16名患者中选出2人,记需住院治疗的人数为,求的分布列和数学期望;
(3)能否在犯错误的概率不超过0.01的前提下认为患心肺疾病与年龄有关?
【例8.6.】
某研究小组为探究给禾苗加化肥与禾苗生长情况的关系,将30株禾苗均分为两组:对照组(不加化肥)和实验组(加化肥).在其他条件均相同的情况下,实验结束后测得这30株禾苗的高度(单位:cm)如下:
对照组
18.5
18.8
19.1
19.5
20.3
22.3
23
23.6
24
24.8
25.5
26.7
27.7
28.5
39.8
实验组
19.7
20.1
22.6
23.5
24.8
25
25.2
25.6
26
27.1
28.3
29.5
29.6
31.4
31.4
当实验结束时,若禾苗的高度不低于25cm,则判断该禾苗生长良好;若禾苗的高度低于25cm,则判断该禾苗生长较差,将这30株禾苗高度的数据进行整理,得到如下列联表:
分组
禾苗的生长情况
生长良好
生长较差
合计
对照组
15
实验组
15
合计
30
(1)请完成列联表;
(2)判断是否有90%的把握认为给禾苗加化肥与该禾苗的生长情况有关.
附:,其中.
当时,没有充分的证据判断变量有关联,可以认为变量是没有关联的;当时,有90%的把握判断变量有关联.
【例8.7.】
目前,AI赋能语音识别技术已从实验室的“概念验证”发展为改变人类生活的基础设施,随着大模型和多模态技术的融合,英文识别将不再是单一功能,也是智能系统理解世界的“耳朵”和“眼睛”,推动人机交互从“命令执行”向“自然对话”演进.现甲、乙两名同学通过英文指令与某AI智能体人机交互共生成200篇文章.若生成的文章达到专业要求,不用进一步改良,视为合格.现已知甲同学生成的文章有80篇合格,占甲同学生成文章总数的,乙同学生成的文章有一半合格.
(1)请根据以上数据填写下面的列联表,并推断能否有95%的把握认为生成的文章是否合格与甲、乙(不同的)同学给出的指令有关?
生成的文章合格
生成的文章不合格
总计
甲同学
80
乙同学
总计
200
(2)经试验,若给出的指令够准确具体,该智能体生成文章合格的概率为,则在此条件下从该智能体生成的一批文章中随机调取3篇,请写出其中合格的篇数的分布列,并算出期望.
附:,其中(结果精确到0.001).
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
(
1
)
学科网(北京)股份有限公司
$
相关资源
示范课
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。