内容正文:
随机抽样、统计图表
题型一 抽样方法
(1)现要用随机数法从总体容量为240(编号为001到240)的研究对象中挑选出50个样本,则在下列数表中按从左至右的方式抽取到的第四个对象的编号为( )
32451 74491 14562 16510 02456 89640
56816 55464 41630 85621 05214 84513
12541 02145
A.5 B.44
C.165 D.210
(2)为了调研某工业新区的空气质量状况,某课题组对甲、乙、丙3地的空气质量进行调查,按地域特点分别在三地设置空气质量观测点.已知甲、乙、丙三地区内观测点的个数分别为20,y,z,且依次构成等差数列,而20,y-10,z成等比数列,若用按比例分配的分层随机抽样的方法抽取30个观测点,则丙地应抽取观测点的个数为( )
A.18 B.16
C.10 D.4
(3)下列抽样方法是简单随机抽样的是( )
A.某医院从200名医生中,挑选出50名最优秀的医生去参加培训
B.从10部手机中逐个不放回地随机抽取2部进行质量检验
C.从空间直角坐标系中抽取10个点作为样本
D.饮料公司从仓库中的500箱饮料中一次性抽取前10箱进行质量检查
(4)(2024·驻马店模拟)某电影上映引发了电信诈骗问题的热议,也加大了各个社区反电信诈骗的宣传力度.已知某社区共有居民480人,其中老年人200人,中年人200人,青少年80人,若按年龄进行按比例分配的分层随机抽样,共抽取36人作为代表,则中年人比青少年多( )
A.6人 B.9人
C.12人 D.15人
题型二 统计图表
(1)(多选)根据不同年龄段学生身心发展特点,小学生每天睡眠时间应达到10小时,初中生应达到9小时,高中生应达到8小时.某机构调查了1万名学生睡眠及学习的时间,利用信息得出如图所示的折线图,则以下判断错误的有( )
A.高三年级学生平均学习时间最长
B.中小学生的平均睡眠时间都没有达到标准,其中高中生平均睡眠时间最接近标准
C.大多数年龄段学生平均睡眠时间长于学习时间
D.与高中生相比,大学生平均学习时间大幅下降,释放出的时间基本是在睡眠
(2)(多选)如图为某市2024年第二季度全市居民人均消费支出构成图.已知城镇居民人均消费支出7 924元,与上一年同比增长4.4%;农村居民人均消费支出4 388元,与上一年同比增长7.8%,则关于2024年第二季度该市居民人均消费支出,下列说法正确的是( )
A.2024年第二季度该市居民人均消费支出6 393元
B.居住及食品烟酒两项的人均消费支出总和超过了总人均消费支出的50%
C.城乡居民人均消费支出的差额与上一年同比在缩小
D.医疗保健与教育文化娱乐两项人均消费支出总和约占总人均消费支出的20.6%
(3)(多选)(2025·商洛模拟)如图,是某款新能源汽车在速度、稳定性、安全性、易用性、续航能力这五个方面的综合评分的雷达图,则下列结论正确的是( )
A.这款新能源汽车在速度方面的综合评分高于稳定性方面的综合评分
B.这款新能源汽车在稳定性和续航能力这两方面的综合评分相等
C.这款新能源汽车在安全性方面的综合评分最低
D.这款新能源汽车在速度方面的综合评分高于易用性方面的综合评分
(4)(多选)给出如图所示的三幅统计图,则下列命题中正确的有( )
A.从折线图能看出世界人口的变化情况
B.2050年非洲人口大约将达到13亿
C.2050年亚洲人口比其他各洲人口的总和还要多
D.从1957年到2050年各洲中北美洲人口增长速度最慢
题型三 频率分布直方图
1. 某中学随机抽取50名学生进行体能测试,其得分(满分100分)如下(单位:分):
48 64 52 86 71 48 64 41 86 79
71 68 82 84 68 64 62 68 81 57
90 52 74 73 56 78 47 66 55 64
56 88 69 40 73 97 68 56 67 59
70 52 79 44 55 69 62 58 32 58
根据上面的数据,回答下列问题:
(1)这次测试成绩的最高分和最低分分别是多少?
(2)将区间[30,100]平均分成7个小区间,试列出这50名学生体能测试成绩的频率分布表,进而画出频率分布直方图和频率分布折线图.
用样本估计总体
题型一 样本数字特征的估计
(1)(多选)(2024·郴州模拟)随机抽取8位同学对他们2024年数学新课标全国Ⅰ卷的平均分进行预估,得到一组样本数据:97,98,99,100,101,103,104,106,则下列关于该样本的说法正确的有( )
A.平均数为101 B.极差为9
C.方差为8 D.第60百分位数为101
(2)如图是2023年11月中国的10个城市地铁运营里程(单位:公里)及运营线路条数的统计图,下列判断正确的是( )
A.这10个城市中北京的地铁运营里程最长且运营线路条数最多
B.这10个城市地铁运营里程的中位数是516公里
C.这10个城市地铁运营线路条数的平均数为15.4
D.这10个城市地铁运营线路条数的极差是12
(3)(多选)某次比赛通过赛后数据记录得到其中一名选手的得分分别为7,12,13,17,18,20,32,则( )
A.该组数据的极差为25
B.该组数据的75%分位数为19
C.该组数据的平均数为17
D.若该组数据去掉一个数得到一组新数据,则这两组数据的平均数可能相等
(4)若某校高一年级10个班参加合唱比赛的得分分别为89,91,90,92,87,93,96,94,96,95,则这组数据的众数是 ;中位数是 .
题型二 总体集中趋势的估计
1.某考试机构举行了新高考适应性考试,在联考结束后,根据联考成绩,考生可了解自己的学习情况,作出升学规划,决定是否参加强基计划.在本次适应性考试中,某学校为了解高三学生的联考情况,随机抽取了100名学生的联考数学成绩作为样本,并按照分数段[50,70),[70,90),[90,110),[110,130),[130,150]分组,绘制了如图所示的频率分布直方图.
(1)求出图中a的值并估计本次考试的及格率(“及格率”指得分为90分及以上的学生所占的比例);
(2)估计该校学生联考数学成绩的第80百分位数;
(3)估计该校学生联考数学成绩的众数、平均数.
2 某高中为了解本校高二年级学生的体育锻炼情况,随机抽取100名学生,统计他们每天体育锻炼的时间,并以此作为样本,按照[40,50),[50,60),[60,70),[70,80),[80,90),[90,100]进行分组,得到如图所示的频率分布直方图.已知样本中体育锻炼时间在[50,60)内的学生有10人.
(1)求频率分布直方图中a和b的值;
(2)估计样本数据的中位数和平均数(求平均数时,同一组中的数据以该组区间的中点值为代表).
题型三 总体离散程度的估计
1 某厂为比较甲、乙两种工艺对橡胶产品伸缩率的处理效应,进行了10次配对试验,每次配对试验选用材质相同的两个橡胶产品,随机地选其中一个用甲工艺处理,另一个用乙工艺处理,测量处理后的橡胶产品的伸缩率,甲、乙两种工艺处理后的橡胶产品的伸缩率分别记为xi,yi(i=1,2,…,10).试验结果如下:
试验序号i
1
2
3
4
5
6
7
8
9
10
伸缩率xi
545
533
551
522
575
544
541
568
596
548
伸缩率yi
536
527
543
530
560
533
522
550
576
536
记zi=xi-yi(i=1,2,…,10),z1,z2,…,z10的样本平均数为,样本方差为s2.
(1)求,s2;
(2)判断甲工艺处理后的橡胶产品的伸缩率较乙工艺处理后的橡胶产品的伸缩率是否有显著提高(如果≥2,则认为甲工艺处理后的橡胶产品的伸缩率较乙工艺处理后的橡胶产品的伸缩率有显著提高,否则不认为有显著提高).
2某校随机抽取了100名学生参加“奥运会”知识竞赛,统计得到参加竞赛的每名学生的成绩(单位:分),然后按[40,50),[50,60),…,[90,100]分成6组,并绘制成如图所示的频率分布直方图,已知b+0.03=2a.
(1)求a,b的值,并估计参加竞赛的学生成绩的第30百分位数;
(2)已知成绩在[80,90)内所有学生的平均成绩为84分,方差为6,成绩在[90,100]内所有学生的平均成绩为98分,方差为10,求成绩在[80,100]内所有学生的平均成绩和方差s2.
成对数据的统计分析
题型一 成对数据的相关性
(1)(多选)(2025·绵阳模拟)下列说法正确的是( )
A.回归分析中,样本相关系数r的取值范围为(-1,1)
B.回归分析中,残差图中残差比较均匀地分布在以取值为0的横轴为对称轴的水平带状区域内,且宽度越窄表示拟合效果越好
C.回归分析中,决定系数R2越大,说明残差平方和越小,拟合效果越好
D.两个随机变量的线性相关性越强,样本相关系数的绝对值越接近于0
(2)已知变量x与变量y线性相关,x与y的样本相关系数为-0.8,且由观测数据算得样本平均数=5,=6,则由该观测数据算得的经验回归方程可能是( )
A.=0.8x+2 B.=x+1
C.=-0.8x+9 D.=-x+11
题型二 回归模型
1 (2024·新乡模拟)氮氧化物是一种常见的大气污染物,如图为我国2014年至2022年氮氧化物排放量(单位:万吨)的折线图,其中年份代码1~9分别对应年份2014~2022.
已知yi≈12 000,≈1 100,≈7.7,tiyi≈51 800.
(1)可否用一元线性回归模型拟合y与t的关系?请分别根据折线图和样本相关系数加以说明;
(2)若根据所给数据建立经验回归方程=-138t+2 025,可否用此方程来预测2025年和2035年我国的氮氧化物排放量?请说明理由.
附:样本相关系数r=.
2 某大型现代化农场在种植某种大棚有机无公害的蔬菜时,为创造更大价值,提高亩产量,积极开展技术创新活动.该农场采用了延长光照时间的方案,该农场选取了20间大棚(每间一亩)进行试点,得到各间大棚产量数据并绘制成散点图.光照时长为x(单位:小时),大棚蔬菜产量为y(单位:吨/亩),记w=ln x.
参考数据:
xi
yi
wi
xiyi
wiyi
290
102.4
52
4 870
540.28
137
1 578.2
272.1
参考公式:y关于x的经验回归方程x+中,,.
(1)根据散点图判断,y=a+bx与y=c+dln x哪一个适宜作为大棚蔬菜产量y关于光照时长x的经验回归方程类型(给出判断即可,不必说明理由);
(2)根据(1)的判断结果及表中数据,建立y关于x的经验回归方程(结果保留小数点后两位);
(3)根据实际种植情况,发现上述回归方程在光照时长位于6~14小时内拟合程度良好,利用(2)中所求方程估计当光照时长为e2小时时(e为自然对数的底数),大棚蔬菜的亩产量.
3红蜘蛛是柚子的主要害虫之一,能对柚子树造成严重伤害,每只红蜘蛛的平均产卵数y(个)和平均温度x(摄氏度)有关,现收集了以往某地的7组数据,得到下面的散点图及一些统计量的值.
参考数据(z=ln y):
xiyi
xizi
5 215
17 713
714
27
81.3
3.6
(1)根据散点图判断,y=bx+a与y=cedx(其中e=2.718…为自然对数的底数)哪一个更适合作为平均产卵数y(个)关于平均温度x(摄氏度)的经验回归方程类型?(给出判断即可,不必说明理由)
(2)由(1)的判断结果及表中数据,求出y关于x的经验回归方程.
附:x+中,,.
题型三 列联表与独立性检验
1 (2025·八省联考)为考察某种药物A对预防疾病B的效果,进行了动物(单位:只)试验,得到如下列联表:
药物
疾病
合计
未患病
患病
未服用
100
80
s
服用
150
70
220
合计
250
t
400
(1)求s,t;
(2)记未服用药物A的动物患疾病B的概率为p,给出p的估计值;
(3)根据小概率值α=0.01的独立性检验,能否认为药物A对预防疾病B有效?
附:χ2=.
α
0.05
0.01
0.001
xα
3.841
6.635
10.828
2 (2025·绵阳诊断)近年来,随着深入贯彻新时代强军思想,越来越多的优秀青年学子献身国防,投身军营,高考结束后,很多高考毕业生报考了军事类院校.从某地区学校的高三年级中随机抽取了900名学生,其中男生500人,女生400人,通过调查,有报考军事类院校意向的男生、女生各100名.
(1)完成给出的列联表,并分别估计该地区高三男、女学生有报考军事类院校意向的概率;
有报考意向
无报考意向
合计
男学生
女学生
合计
(2)根据小概率值α=0.10的独立性检验,能否认为学生有报考军事类院校的意向与性别有关?
参考公式及数据:χ2=,n=a+b+c+d.
α
0.10
0.05
0.010
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
统计与统计分析
1.某地用简单随机抽样的方法抽取15个村进行验收调查,调查得到一组样本数据(xi,yi)(i=1,2,…,15),其中xi和yi分别表示第i个村中村户的年平均收入(单位:万元)和产业资金投入数量(单位:万元),并计算得到xi=15,yi=750,=0.82,=1 670, (xi-)(yi-)=35.3.
(1)试估计该地被调查村的村户年平均收入;(3分)
(2)根据样本数据,求该地被调查村中村户年平均收入与产业资金投入数量的样本相关系数;(精确到0.01)(5分)
(3)根据现有统计资料,各被调查村产业资金投入差异很大.为了准确地进行验收,请给出一种你认为更合理的抽样方法,并说明理由.(5分)
2.某学校为提高学生对《红楼梦》的了解,举办了“我知红楼”知识竞赛,现从所有答卷卷面成绩中随机抽取100份作为样本,将样本数据(满分100分,成绩均为不低于40分的整数)分成六段:[40,50),[50,60),…,[90,100],并作出如图所示的频率分布直方图.
(1)求频率分布直方图中a的值;(3分)
(2)求样本数据的第62百分位数;(6分)
(3)已知样本数据落在[50,60)的平均数是52,方差是6;落在[60,70)的平均数是64,方差是3.求这两组数据的总平均数和总方差s2.(6分)
3.某校高一年级有男生200人,女生100人.为了解该校全体高一学生的身高信息,按性别比例进行分层随机抽样,抽取总样本量为30的样本,并观测样本的指标值(单位:cm),计算得男生样本的身高平均数为169,方差为39.下表是抽取的女生样本的数据:
抽取次序
1
2
3
4
5
6
7
8
9
10
身高
155
158
156
157
160
161
159
162
169
163
记抽取的第i个女生的身高为xi(i=1,2,3,…,10),样本平均数=160,方差s2=15.
参考数据:≈3.9,1592=25 281,1692=28 561.
(1)若用女生样本的身高频率分布情况代替该校高一女生总体的身高频率分布情况,试估计该校高一女生身高在[160,165]范围内的人数;(4分)
(2)用总样本的平均数和标准差分别估计该校高一学生总体身高的平均数μ和标准差σ,求μ,σ的值;(5分)
(3)如果女生样本数据在(-2s,+2s)之外的数据称为离群值,试剔除离群值后,计算剩余女生样本身高的平均数与方差.(6分)
4.西藏隆子县玉麦乡位于喜马拉雅山脉南麓,地处边疆,山陡路险,交通闭塞.党的十八大以来,该地区政府部门大力开发旅游等产业,建设幸福家园,实现农旅融合,以创建国家全域旅游示范区为牵引,构建“农业+文创+旅游”发展模式,真正把农村建设成为“望得见山、看得见水、记得住乡愁”的美丽乡村,在新政策的影响下,游客越来越多.当地旅游局统计了玉麦乡景区2023年1月份到5月份的接待游客人数y(单位:万人),统计结果如下:
月份x
1
2
3
4
5
接待游客人数y(单位:万人)
1.2
1.8
2.5
3.2
3.8
(1)求样本相关系数r的值,当r>0.75时,线性相关程度为较强,请说明月份x与接待游客人数y之间线性关系的强弱;若线性相关,求出y关于x的经验回归方程;(9分)
(2)为打造群众满意的旅游区,该地旅游部门对所推出的报团游和自助游项目进行了深入调查,下表是从接待游客中随机抽取的30位游客的满意度调查表,请将下述2×2列联表补充完整,并依据小概率值α=0.05的独立性检验,分析游客对本地景区的满意度是否与报团游或自助游有关联.(8分)
报团游
自助游
合计
满意
3
18
不满意
5
合计
10
30
附:经验回归方程x+的斜率及截距的最小二乘估计公式分别为,,样本相关系数r=,χ2=,参考数据:≈6.603.
附表:
α
0.10
0.05
0.010
0.001
xα
2.706
3.841
6.635
10.828
学科网(北京)股份有限公司
$$
随机抽样、统计图表
题型一 抽样方法
(1)现要用随机数法从总体容量为240(编号为001到240)的研究对象中挑选出50个样本,则在下列数表中按从左至右的方式抽取到的第四个对象的编号为( )
32451 74491 14562 16510 02456 89640
56816 55464 41630 85621 05214 84513
12541 02145
A.5 B.44
C.165 D.210
答案 D
解析 由随机数表抽样方法可知,以3个数字为单位抽取数字,数字不能大于240,且要去掉重复数字,据此第一个数字为114,第二个为165,第三个为100,第4个为210.
(2)为了调研某工业新区的空气质量状况,某课题组对甲、乙、丙3地的空气质量进行调查,按地域特点分别在三地设置空气质量观测点.已知甲、乙、丙三地区内观测点的个数分别为20,y,z,且依次构成等差数列,而20,y-10,z成等比数列,若用按比例分配的分层随机抽样的方法抽取30个观测点,则丙地应抽取观测点的个数为( )
A.18 B.16
C.10 D.4
答案 B
解析 依题意知,解得
所以丙地应抽取观测点的个数为×80=16.
(3)下列抽样方法是简单随机抽样的是( )
A.某医院从200名医生中,挑选出50名最优秀的医生去参加培训
B.从10部手机中逐个不放回地随机抽取2部进行质量检验
C.从空间直角坐标系中抽取10个点作为样本
D.饮料公司从仓库中的500箱饮料中一次性抽取前10箱进行质量检查
答案 B
解析 A选项中,挑选出50名最优秀的医生去参加培训,每个人被抽到的概率不相等,故A错误;
B选项中,从10部手机中逐个不放回地随机抽取2部进行质量检验,是简单随机抽样,故B正确;
C选项中,由于被抽取的样本总体的个数是无限的,所以不是简单随机抽样,故C错误;
D选项中,一次性抽取前10箱,每箱被抽到的概率不相等,所以不是简单随机抽样,故D错误.
(4)(2024·驻马店模拟)某电影上映引发了电信诈骗问题的热议,也加大了各个社区反电信诈骗的宣传力度.已知某社区共有居民480人,其中老年人200人,中年人200人,青少年80人,若按年龄进行按比例分配的分层随机抽样,共抽取36人作为代表,则中年人比青少年多( )
A.6人 B.9人
C.12人 D.15人
答案 B
解析 设中年人抽取x人,青少年抽取y人,由按比例分配的分层随机抽样可知,,解得x=15,y=6,故中年人比青少年多9人.
题型二 统计图表
(1)(多选)根据不同年龄段学生身心发展特点,小学生每天睡眠时间应达到10小时,初中生应达到9小时,高中生应达到8小时.某机构调查了1万名学生睡眠及学习的时间,利用信息得出如图所示的折线图,则以下判断错误的有( )
A.高三年级学生平均学习时间最长
B.中小学生的平均睡眠时间都没有达到标准,其中高中生平均睡眠时间最接近标准
C.大多数年龄段学生平均睡眠时间长于学习时间
D.与高中生相比,大学生平均学习时间大幅下降,释放出的时间基本是在睡眠
答案 AD
解析 根据图象可知,高三年级学生平均学习时间没有高二年级学生平均学习时间长,故A错误;
根据图象可知,中小学生的平均睡眠时间都没有达到标准,其中高中生平均睡眠时间最接近标准,故B正确;
根据图象可知,学习时间长于睡眠时间的有初二、初三、高一、高二、高三,占比为,睡眠时间长于学习时间的占比为,所以大多数年龄段学生平均睡眠时间长于学习时间,故C正确;
从高三到大学一年级,学习时间减少了9.65-5.71=3.94(小时/天),睡眠时间增加了8.52-7.91=0.61(小时/天),故D错误.
(2)(多选)如图为某市2024年第二季度全市居民人均消费支出构成图.已知城镇居民人均消费支出7 924元,与上一年同比增长4.4%;农村居民人均消费支出4 388元,与上一年同比增长7.8%,则关于2024年第二季度该市居民人均消费支出,下列说法正确的是( )
A.2024年第二季度该市居民人均消费支出6 393元
B.居住及食品烟酒两项的人均消费支出总和超过了总人均消费支出的50%
C.城乡居民人均消费支出的差额与上一年同比在缩小
D.医疗保健与教育文化娱乐两项人均消费支出总和约占总人均消费支出的20.6%
答案 ABD
解析 2024年第二季度全市居民人均消费支出为2 084+453+1 435+356+791+583+528+163=6 393(元),故A正确;
易知居住及食品烟酒两项的人均消费支出总和为2 084+1 435=3 519(元),占总人均消费支出的×100%≈55.0%>50%,故B正确;
依题意可得2023年第二季度城乡居民人均消费支出的差额为≈3 520(元),2024年第二季度城乡居民人均消费支出的差额为7 924-4 388=3 536(元),由于3 520<3 536,故C错误;
医疗保健与教育文化娱乐两项人均消费支出总和占总人均消费支出的×100%≈20.6%,故D正确.
(3)(多选)(2025·商洛模拟)如图,是某款新能源汽车在速度、稳定性、安全性、易用性、续航能力这五个方面的综合评分的雷达图,则下列结论正确的是( )
A.这款新能源汽车在速度方面的综合评分高于稳定性方面的综合评分
B.这款新能源汽车在稳定性和续航能力这两方面的综合评分相等
C.这款新能源汽车在安全性方面的综合评分最低
D.这款新能源汽车在速度方面的综合评分高于易用性方面的综合评分
答案 ABC
解析 由雷达图可知,这款新能源汽车在速度方面的综合评分在(8,10)内,在稳定性和续航能力这两方面的综合评分都是8分,在安全性方面的综合评分在(6,8)内,在易用性方面的综合评分是10分,故A,B,C正确,D错误.
(4)(多选)给出如图所示的三幅统计图,则下列命题中正确的有( )
A.从折线图能看出世界人口的变化情况
B.2050年非洲人口大约将达到13亿
C.2050年亚洲人口比其他各洲人口的总和还要多
D.从1957年到2050年各洲中北美洲人口增长速度最慢
答案 AC
解析 对于A,从折线图能看出世界人口的变化情况,所以是正确的;
对于B,从条形图中可得到,2050年非洲人口将达到大约18亿,所以是错误的;
对于C,从扇形图中能够明显的得到结论,2050年亚洲人口比其他各洲人口的总和还要多,所以是正确的;
对于D,由上述三幅统计图并不能得出从1957年到2050年中哪个洲人口增长速度最慢,所以是错误的.
题型三 频率分布直方图
1. 某中学随机抽取50名学生进行体能测试,其得分(满分100分)如下(单位:分):
48 64 52 86 71 48 64 41 86 79
71 68 82 84 68 64 62 68 81 57
90 52 74 73 56 78 47 66 55 64
56 88 69 40 73 97 68 56 67 59
70 52 79 44 55 69 62 58 32 58
根据上面的数据,回答下列问题:
(1)这次测试成绩的最高分和最低分分别是多少?
(2)将区间[30,100]平均分成7个小区间,试列出这50名学生体能测试成绩的频率分布表,进而画出频率分布直方图和频率分布折线图.
解 (1)这次测试成绩的最低分是32分,最高分是97分.
(2)根据题意,列出样本的频率分布表如下:
分组
频数
频率
[30,40)
1
0.02
[40,50)
6
0.12
[50,60)
12
0.24
[60,70)
14
0.28
[70,80)
9
0.18
[80,90)
6
0.12
[90,100]
2
0.04
合计
50
1.00
频率分布直方图和频率分布折线图如图所示.
用样本估计总体
题型一 样本数字特征的估计
(1)(多选)(2024·郴州模拟)随机抽取8位同学对他们2024年数学新课标全国Ⅰ卷的平均分进行预估,得到一组样本数据:97,98,99,100,101,103,104,106,则下列关于该样本的说法正确的有( )
A.平均数为101 B.极差为9
C.方差为8 D.第60百分位数为101
答案 ABD
解析 平均数为
=101,A正确;
极差为106-97=9,B正确;
方差为
==8.5,C错误;
因为60%×8=4.8,故第60百分位数为101,D正确.
(2)如图是2023年11月中国的10个城市地铁运营里程(单位:公里)及运营线路条数的统计图,下列判断正确的是( )
A.这10个城市中北京的地铁运营里程最长且运营线路条数最多
B.这10个城市地铁运营里程的中位数是516公里
C.这10个城市地铁运营线路条数的平均数为15.4
D.这10个城市地铁运营线路条数的极差是12
答案 C
解析 北京的地铁运营线路条数最多,而运营里程最长的是上海,A错误;
地铁运营里程的中位数是=537.3(公里),B错误;
地铁运营线路条数的平均数为=15.4,C正确;
地铁运营线路条数的极差是27-8=19,D错误.
(3)(多选)某次比赛通过赛后数据记录得到其中一名选手的得分分别为7,12,13,17,18,20,32,则( )
A.该组数据的极差为25
B.该组数据的75%分位数为19
C.该组数据的平均数为17
D.若该组数据去掉一个数得到一组新数据,则这两组数据的平均数可能相等
答案 ACD
解析 极差为32-7=25,故A正确;
7×75%=5.25,故75%分位数为20,故B错误;
平均数为=17,故C正确;
去掉17后,这两组数据的平均数相等,故D正确.
(4)若某校高一年级10个班参加合唱比赛的得分分别为89,91,90,92,87,93,96,94,96,95,则这组数据的众数是 ;中位数是 .
答案 96 92.5
解析 这组数据从小到大排列为87,89,90,91,92,93,94,95,96,96,其中96出现的次数最多,则这组数据的众数是96,中位数是=92.5.
题型二 总体集中趋势的估计
1.某考试机构举行了新高考适应性考试,在联考结束后,根据联考成绩,考生可了解自己的学习情况,作出升学规划,决定是否参加强基计划.在本次适应性考试中,某学校为了解高三学生的联考情况,随机抽取了100名学生的联考数学成绩作为样本,并按照分数段[50,70),[70,90),[90,110),[110,130),[130,150]分组,绘制了如图所示的频率分布直方图.
(1)求出图中a的值并估计本次考试的及格率(“及格率”指得分为90分及以上的学生所占的比例);
(2)估计该校学生联考数学成绩的第80百分位数;
(3)估计该校学生联考数学成绩的众数、平均数.
解 (1)由频率分布直方图的性质,可得(a+0.004+0.013+0.014+0.016)×20=1,
解得a=0.003.
本次考试的及格率约为(0.016+0.014+0.003)×20=0.66=66%.
(2)得分在110分以下的学生所占的比例为(0.004+0.013+0.016)×20=0.66,
得分在130分以下的学生所占的比例为0.66+0.014×20=0.94,
所以第80百分位数位于[110,130)内,
由110+20×=120,估计第80百分位数为120.
(3)由题图可得,众数的估计值为100.
平均数的估计值为0.08×60+0.26×80+0.32×100+0.28×120+0.06×140=99.6.
2 某高中为了解本校高二年级学生的体育锻炼情况,随机抽取100名学生,统计他们每天体育锻炼的时间,并以此作为样本,按照[40,50),[50,60),[60,70),[70,80),[80,90),[90,100]进行分组,得到如图所示的频率分布直方图.已知样本中体育锻炼时间在[50,60)内的学生有10人.
(1)求频率分布直方图中a和b的值;
(2)估计样本数据的中位数和平均数(求平均数时,同一组中的数据以该组区间的中点值为代表).
解 (1)由题意可知,学生每天体育锻炼的时间在[50,60)内的频率为=0.1,
则a==0.01,
由各组频率之和为1,可知(0.005+0.01+b+0.025×2+0.005)×10=1,
解得b=0.03.
(2)前3组的频率之和为(0.005+0.01+0.03)×10=0.45<0.5,
前4组的频率之和为0.45+0.025×10=0.7>0.5,
所以样本数据的中位数在第4组,设为x,
所以0.45+(x-70)×0.025=0.5,解得x=72,
估计样本数据的中位数是72,
估计平均数是(45+95)×0.05+55×0.1+65×0.3+(75+85)×0.25=72.
题型三 总体离散程度的估计
1 某厂为比较甲、乙两种工艺对橡胶产品伸缩率的处理效应,进行了10次配对试验,每次配对试验选用材质相同的两个橡胶产品,随机地选其中一个用甲工艺处理,另一个用乙工艺处理,测量处理后的橡胶产品的伸缩率,甲、乙两种工艺处理后的橡胶产品的伸缩率分别记为xi,yi(i=1,2,…,10).试验结果如下:
试验序号i
1
2
3
4
5
6
7
8
9
10
伸缩率xi
545
533
551
522
575
544
541
568
596
548
伸缩率yi
536
527
543
530
560
533
522
550
576
536
记zi=xi-yi(i=1,2,…,10),z1,z2,…,z10的样本平均数为,样本方差为s2.
(1)求,s2;
(2)判断甲工艺处理后的橡胶产品的伸缩率较乙工艺处理后的橡胶产品的伸缩率是否有显著提高(如果≥2,则认为甲工艺处理后的橡胶产品的伸缩率较乙工艺处理后的橡胶产品的伸缩率有显著提高,否则不认为有显著提高).
解 (1)由题意得zi=xi-yi 的值分别为9,6,8,-8,15,11,19,18,20,12,
则×(9+6+8-8+15+11+19+18+20+12)=11,
s2=×[(9-11)2+(6-11)2+(8-11)2+(-8-11)2+(15-11)2+0+(19-11)2+(18-11)2+(20-11)2+(12-11)2]=61.
(2)由(1)知,=11,2=2,
故有≥2,
所以认为甲工艺处理后的橡胶产品的伸缩率较乙工艺处理后的橡胶产品的伸缩率有显著提高.
2某校随机抽取了100名学生参加“奥运会”知识竞赛,统计得到参加竞赛的每名学生的成绩(单位:分),然后按[40,50),[50,60),…,[90,100]分成6组,并绘制成如图所示的频率分布直方图,已知b+0.03=2a.
(1)求a,b的值,并估计参加竞赛的学生成绩的第30百分位数;
(2)已知成绩在[80,90)内所有学生的平均成绩为84分,方差为6,成绩在[90,100]内所有学生的平均成绩为98分,方差为10,求成绩在[80,100]内所有学生的平均成绩和方差s2.
解 (1)因为在频率分布直方图中所有小矩形的面积之和为1,
所以(0.005+0.01+b+0.03+a+0.01)×10=1,所以a+b=0.045,
所以解得
因为(0.005+0.01)×10=0.15,(0.005+0.01+0.02)×10=0.35,
所以参加竞赛的学生成绩的第30百分位数在[60,70)内,设为x,
所以(0.005+0.01)×10+(x-60)×0.02=0.3,解得x=67.5.
(2)成绩在[80,90)和成绩在[90,100]内的学生人数之比为0.025∶0.01=5∶2,
所以=88,
s2=.
成对数据的统计分析
题型一 成对数据的相关性
(1)(多选)(2025·绵阳模拟)下列说法正确的是( )
A.回归分析中,样本相关系数r的取值范围为(-1,1)
B.回归分析中,残差图中残差比较均匀地分布在以取值为0的横轴为对称轴的水平带状区域内,且宽度越窄表示拟合效果越好
C.回归分析中,决定系数R2越大,说明残差平方和越小,拟合效果越好
D.两个随机变量的线性相关性越强,样本相关系数的绝对值越接近于0
答案 BC
解析 回归分析中,样本相关系数r的取值范围为[-1,1],故选项A错误;
因为在残差的散点图中,残差分布的水平带状区域的宽度越窄,表明数据越集中,模型的拟合效果越好,故选项B正确;
因为决定系数R2越大,表示残差平方和越小,数据就越集中,即模型的拟合效果越好,故选项C正确;
两个随机变量的线性相关性越强,样本相关系数的绝对值越接近于1,故D错误.
(2)已知变量x与变量y线性相关,x与y的样本相关系数为-0.8,且由观测数据算得样本平均数=5,=6,则由该观测数据算得的经验回归方程可能是( )
A.=0.8x+2 B.=x+1
C.=-0.8x+9 D.=-x+11
答案 D
解析 因为x与y的样本相关系数为-0.8<0,可知x与y为负相关,故A,B错误;
又因为经验回归直线过点(5,6),对于=-0.8x+9,-0.8×5+9=5≠6,故C错误;
对于=-x+11,-5+11=6,故D正确.
题型二 回归模型
1 (2024·新乡模拟)氮氧化物是一种常见的大气污染物,如图为我国2014年至2022年氮氧化物排放量(单位:万吨)的折线图,其中年份代码1~9分别对应年份2014~2022.
已知yi≈12 000,≈1 100,≈7.7,tiyi≈51 800.
(1)可否用一元线性回归模型拟合y与t的关系?请分别根据折线图和样本相关系数加以说明;
(2)若根据所给数据建立经验回归方程=-138t+2 025,可否用此方程来预测2025年和2035年我国的氮氧化物排放量?请说明理由.
附:样本相关系数r=.
解 (1)从折线图看,各点落在一条直线附近,因而可以用线性回归模型拟合y与t的关系,
由题意知×(1+2+3+4+5+6+7+8+9)=5,
样本相关系数r=≈=-≈-0.97.
故可以用线性回归模型拟合y与t的关系.
(2)可以预测2025年的氮氧化物排放量,但不可以预测2035年的氮氧化物排放量.
理由如下:
①2025年与所给数据的年份较接近,因而可以认为短期内氮氧化物排放量将延续该趋势,故可以用此模型进行预测;
②2035年与所给数据的年份相距过远,而影响氮氧化物排放量的因素有很多,这些因素在短期内可能保持不变,但从长期看很有可能会变化,因而用此模型预测可能是不准确的.
2 某大型现代化农场在种植某种大棚有机无公害的蔬菜时,为创造更大价值,提高亩产量,积极开展技术创新活动.该农场采用了延长光照时间的方案,该农场选取了20间大棚(每间一亩)进行试点,得到各间大棚产量数据并绘制成散点图.光照时长为x(单位:小时),大棚蔬菜产量为y(单位:吨/亩),记w=ln x.
参考数据:
xi
yi
wi
xiyi
wiyi
290
102.4
52
4 870
540.28
137
1 578.2
272.1
参考公式:y关于x的经验回归方程x+中,,.
(1)根据散点图判断,y=a+bx与y=c+dln x哪一个适宜作为大棚蔬菜产量y关于光照时长x的经验回归方程类型(给出判断即可,不必说明理由);
(2)根据(1)的判断结果及表中数据,建立y关于x的经验回归方程(结果保留小数点后两位);
(3)根据实际种植情况,发现上述回归方程在光照时长位于6~14小时内拟合程度良好,利用(2)中所求方程估计当光照时长为e2小时时(e为自然对数的底数),大棚蔬菜的亩产量.
解 (1)根据散点图,开始的点在某条直线旁,但后面的点会越来越偏离这条直线,因此y=c+dln x更适宜作为大棚蔬菜产量y关于光照时长x的经验回归方程类型.
(2)w=ln x,则y=c+dln x,即y=c+dw,
=5.12,=2.6,
≈3.26,
≈5.12-3.26×2.6≈-3.36,
所以=3.26w-3.36,
即=3.26ln x-3.36.
(3)当x=e2时,=3.26ln e2-3.36=3.16.
即大棚蔬菜亩产量约为3.16吨.
3红蜘蛛是柚子的主要害虫之一,能对柚子树造成严重伤害,每只红蜘蛛的平均产卵数y(个)和平均温度x(摄氏度)有关,现收集了以往某地的7组数据,得到下面的散点图及一些统计量的值.
参考数据(z=ln y):
xiyi
xizi
5 215
17 713
714
27
81.3
3.6
(1)根据散点图判断,y=bx+a与y=cedx(其中e=2.718…为自然对数的底数)哪一个更适合作为平均产卵数y(个)关于平均温度x(摄氏度)的经验回归方程类型?(给出判断即可,不必说明理由)
(2)由(1)的判断结果及表中数据,求出y关于x的经验回归方程.
附:x+中,,.
解 (1)由散点图可以判断,随温度升高,平均产卵数增长速度变快,符合指数函数模型的增长特点,
所以y=cedx更适宜作为平均产卵数y关于平均温度x的经验回归方程类型.
(2)将y=cedx两边同时取自然对数,可得ln y=ln c+dx,即z=ln c+dx,
由题中的数据可得, xizi-7=33.6,
-7=112,
所以=0.3,则ln =3.6-0.3×27=-4.5,
所以z关于x的经验回归方程为=0.3x-4.5,故y关于x的经验回归方程为=e0.3x-4.5.
题型三 列联表与独立性检验
1 (2025·八省联考)为考察某种药物A对预防疾病B的效果,进行了动物(单位:只)试验,得到如下列联表:
药物
疾病
合计
未患病
患病
未服用
100
80
s
服用
150
70
220
合计
250
t
400
(1)求s,t;
(2)记未服用药物A的动物患疾病B的概率为p,给出p的估计值;
(3)根据小概率值α=0.01的独立性检验,能否认为药物A对预防疾病B有效?
附:χ2=.
α
0.05
0.01
0.001
xα
3.841
6.635
10.828
解 (1)s=100+80=180,t=80+70=150.
(2)∵=,∴p的估计值为.
(3)零假设H0:药物A对预防疾病B无效.
根据列联表中的数据可得
χ2==≈6.734>6.635=x0.01.
根据小概率值α=0.01的独立性检验,推断H0不成立,即认为药物A对预防疾病B有效.
2 (2025·绵阳诊断)近年来,随着深入贯彻新时代强军思想,越来越多的优秀青年学子献身国防,投身军营,高考结束后,很多高考毕业生报考了军事类院校.从某地区学校的高三年级中随机抽取了900名学生,其中男生500人,女生400人,通过调查,有报考军事类院校意向的男生、女生各100名.
(1)完成给出的列联表,并分别估计该地区高三男、女学生有报考军事类院校意向的概率;
有报考意向
无报考意向
合计
男学生
女学生
合计
(2)根据小概率值α=0.10的独立性检验,能否认为学生有报考军事类院校的意向与性别有关?
参考公式及数据:χ2=,n=a+b+c+d.
α
0.10
0.05
0.010
0.005
0.001
xα
2.706
3.841
6.635
7.879
10.828
解 (1)根据已知条件,填写2×2列联表如下.
有报考意向
无报考意向
合计
男学生
100
400
500
女学生
100
300
400
合计
200
700
900
故估计该地区高三男生有报考军事类院校意向的概率为,
女生有报考军事类院校意向的概率为.
(2)零假设为H0:学生有报考军事类院校意向与性别无关,
χ2=≈3.214>2.706=x0.10,
所以根据小概率值α=0.10的独立性检验,我们推断H0不成立,即认为学生有报考军事类院校的意向与性别有关.
统计与统计分析
1.某地用简单随机抽样的方法抽取15个村进行验收调查,调查得到一组样本数据(xi,yi)(i=1,2,…,15),其中xi和yi分别表示第i个村中村户的年平均收入(单位:万元)和产业资金投入数量(单位:万元),并计算得到xi=15,yi=750,=0.82,=1 670, (xi-)(yi-)=35.3.
(1)试估计该地被调查村的村户年平均收入;(3分)
(2)根据样本数据,求该地被调查村中村户年平均收入与产业资金投入数量的样本相关系数;(精确到0.01)(5分)
(3)根据现有统计资料,各被调查村产业资金投入差异很大.为了准确地进行验收,请给出一种你认为更合理的抽样方法,并说明理由.(5分)
解 (1)该地被调查村的村户年平均收入的估计值为xi=×15=1(万元).
(2)样本相关系数为
r=≈≈0.95.
(3)采用按比例分配的分层随机抽样,理由如下:
由(2)知被调查村的村户年平均收入与该村的产业投入资金有很强的正相关性,
由于各被调查村产业资金投入差异很大,因此被调查村的村户年平均收入差异也很大,
所以采用按比例分配的分层随机抽样的方法较好地保持了样本结构与总体结构的一致性,提高了样本的代表性,从而可以获得该地更准确的验收估计.
2.某学校为提高学生对《红楼梦》的了解,举办了“我知红楼”知识竞赛,现从所有答卷卷面成绩中随机抽取100份作为样本,将样本数据(满分100分,成绩均为不低于40分的整数)分成六段:[40,50),[50,60),…,[90,100],并作出如图所示的频率分布直方图.
(1)求频率分布直方图中a的值;(3分)
(2)求样本数据的第62百分位数;(6分)
(3)已知样本数据落在[50,60)的平均数是52,方差是6;落在[60,70)的平均数是64,方差是3.求这两组数据的总平均数和总方差s2.(6分)
解 (1)由(0.005+0.010+0.020+a+0.025+0.010)×10=1,
解得a=0.030.
(2)因为(0.005+0.010+0.020)×10=0.35,
(0.005+0.010+0.020+0.030)×10=0.65,
所以样本数据的第62百分位数在[70,80)内,
可得70+×10=79,
所以样本数据的第62百分位数为79.
(3)样本数据落在[50,60)的个数为0.1×100=10,
落在[60,70)的个数为0.2×100=20,
总平均数×52+×64=60,
总方差s2=[6+(52-60)2]+[3+(64-60)2]=36.
3.某校高一年级有男生200人,女生100人.为了解该校全体高一学生的身高信息,按性别比例进行分层随机抽样,抽取总样本量为30的样本,并观测样本的指标值(单位:cm),计算得男生样本的身高平均数为169,方差为39.下表是抽取的女生样本的数据:
抽取次序
1
2
3
4
5
6
7
8
9
10
身高
155
158
156
157
160
161
159
162
169
163
记抽取的第i个女生的身高为xi(i=1,2,3,…,10),样本平均数=160,方差s2=15.
参考数据:≈3.9,1592=25 281,1692=28 561.
(1)若用女生样本的身高频率分布情况代替该校高一女生总体的身高频率分布情况,试估计该校高一女生身高在[160,165]范围内的人数;(4分)
(2)用总样本的平均数和标准差分别估计该校高一学生总体身高的平均数μ和标准差σ,求μ,σ的值;(5分)
(3)如果女生样本数据在(-2s,+2s)之外的数据称为离群值,试剔除离群值后,计算剩余女生样本身高的平均数与方差.(6分)
解 (1)因为女生样本中,身高在[160,165]范围内的频率为,
故该校高一女生身高在[160,165]范围内的人数估计为100×=40.
(2)记总样本的平均数为,标准差为S,
由题意,设男生样本(20人)的身高平均数为
=169,方差为=39,
女生样本(10人)的身高平均数为
=160,方差s2=15,
则=166,
S2=[39+(169-166)2]+[15+(160-166)2]
=×48+×51=49,
故μ≈166,σ≈=7.
(3)由=160,s=,则(-2s,+2s),
即(160-2,160+2),
约为(152.2,167.8),由样本数据知,169∉(160-2,160+2),为离群值,
剔除169后,女生样本(9人)的身高平均数为
'=(160×10-169)=159.
由s2=-10)=-256 000)=15可得,=256 150,
则剔除169后,女生样本(9人)的身高的方差为s'2=-1692-9'2)=(256 150-28 561-9×25 281)=.
4.西藏隆子县玉麦乡位于喜马拉雅山脉南麓,地处边疆,山陡路险,交通闭塞.党的十八大以来,该地区政府部门大力开发旅游等产业,建设幸福家园,实现农旅融合,以创建国家全域旅游示范区为牵引,构建“农业+文创+旅游”发展模式,真正把农村建设成为“望得见山、看得见水、记得住乡愁”的美丽乡村,在新政策的影响下,游客越来越多.当地旅游局统计了玉麦乡景区2023年1月份到5月份的接待游客人数y(单位:万人),统计结果如下:
月份x
1
2
3
4
5
接待游客人数y(单位:万人)
1.2
1.8
2.5
3.2
3.8
(1)求样本相关系数r的值,当r>0.75时,线性相关程度为较强,请说明月份x与接待游客人数y之间线性关系的强弱;若线性相关,求出y关于x的经验回归方程;(9分)
(2)为打造群众满意的旅游区,该地旅游部门对所推出的报团游和自助游项目进行了深入调查,下表是从接待游客中随机抽取的30位游客的满意度调查表,请将下述2×2列联表补充完整,并依据小概率值α=0.05的独立性检验,分析游客对本地景区的满意度是否与报团游或自助游有关联.(8分)
报团游
自助游
合计
满意
3
18
不满意
5
合计
10
30
附:经验回归方程x+的斜率及截距的最小二乘估计公式分别为,,样本相关系数r=,χ2=,参考数据:≈6.603.
附表:
α
0.10
0.05
0.010
0.001
xα
2.706
3.841
6.635
10.828
解 (1)由题中数据可得
=3,
=2.5,
∴(xi-)(yi-)=(-2)×(-1.3)+(-1)×(-0.7)+0+1×0.7+2×1.3=6.6,
又=10,=4.36,
r=≈≈1>0.75.
故月份x与接待游客人数y之间有较强的线性相关关系.
由上可知,=0.66,
∴=2.5-0.66×3=0.52,
∴y关于x的经验回归方程为=0.66x+0.52.
(2)依题意,完善表格如下:
报团游
自助游
合计
满意
15
3
18
不满意
5
7
12
合计
20
10
30
零假设为H0:游客对本地景区满意度与报团游或自助游无关联.
根据列联表中的数据,经计算得到χ2==5.625>3.841=x0.05,
根据小概率值α=0.05的独立性检验,推断H0不成立,即认为游客对本地景区满意度与报团游或自助游有关联.
学科网(北京)股份有限公司
$$