内容正文:
清单06 统计
(15个考点梳理+题型解读+提升训练)
【清单01】统计的相关概念
(1)普查
像人口普查这样,对每一个调查对象都进行调查的方法,称为全面调查,又称普查.
(2)总体、个体
在一个调查中,我们把调查对象的全体称为总体.组成总体的每一个调查对象称为个体.为了强调调查目的,也可以把调查对象的某些指标的全体作为总体,每一个调查对象的相应指标作为个体.
(3)抽样调查
根据一定目的,从总体中抽取一部分个体进行调查,并以此为依据对总体的情况作出估计和推断的调查方法,称为抽样调查.
(4)样本、样本量
我们把从总体中抽取的那部分个体称为样本,样本中包含的个体数称为样本量.
【清单02】简单随机抽样的方法
(1)抽签法:
把总体中的N个个体编号,把编号写在外观、质地等无差别的小纸片(也可以是卡片、小球等)上作为号签,将这些小纸片放在一个不透明的盒里,充分搅拌,最后从盒中不放回地逐个抽取号签,使与号签上的编号对应的个体进入样本,直到抽足样本所需的个数.
(2)随机数法:
用随机数工具产生编号范围内的整数随机数,把产生的随机数作为抽中的编号,使与编号对应的个体进入样本.重复上述过程,直到抽足样本所需的个数.
①用随机试验生成随机数;
②用信息技术生成随机数;
③用计算器生成随机数;
④用电子表格软件生成随机数;
⑤用R统计软件生成随机数.
【清单03】分层抽样的步骤
(1)根据已掌握的信息,将总体分成若干部分.
(2)根据总体中的个体数N和样本容量n计算出抽样比.
(3)根据抽样比k计算出各层中应抽取的个体数:(其中为第i层所包含的个体总数).
(4)按步骤3所确定的数在各层中随机抽取个体,并合在一起得到容量为n的样本.
【清单04】两种抽样方法的区别和联系
类别
共同点
各自特点
相互联系
适用范围
简单随机抽样
抽样过程中各个个体被抽到的机会相等,且都是不放回抽取
从总体中逐个抽取
最基本的抽样方法
总体容量较少
分层抽样
抽样过程中各个个体被抽到的机会相等,且都是不放回抽取
将总体分成几部分,每一部分按比例抽取
每层抽样时采用简单随机抽样
总体由差异明显的若干部分组成
【清单05】频率分布直方图
1、频率分布直方图绘制步骤
①求极差,即一组数据中的最大值与最小值的差.
②决定组距与组数.组距与组数的确定没有固定的标准,一般数据的个数越多,所分组数越多.当样本容量不超过100时,常分成5~12组.为方便起见,一般取等长组距,并且组距应力求“取整”.
③将数据分组.
④列频率分布表.计算各小组的频率,第i组的频率是.
⑤画频率分布直方图.其中横轴表示分组,纵轴表示,实际上就是频率分布直方图中各小长方形的高度,它反映了各组样本观测数据的疏密程度.
2、频率分布直方图意义:各个小长方形的面积表示相应各组的频率,频率分布直方图以面积的形式反映数据落在各个小组的频率的大小,各小长方形的面积的总和等于1.
3、总体取值规律的估计:我们可以用样本观测数据的频率分布估计总体的取值规律.
4、频率分布直方图的特征:当频率分布直方图的组数少、组距大时,容易从中看出数据整体的分布特点,但由于无法看出每组内的数据分布情况,损失了较多的原式数据信息;当频率分布直方图的组数多、组距小时,保留了较多的原始数据信息,但由于小长方形较多,有时图形会变得非常不规则,不容易从中看出总体数据的分布特点.
【清单06】常见的其他统计图:条形图、扇形图、折线图.
扇形图主要用于直观描述各类数据占总数的比例;
条形图和直方图主要用于直观描述不同类别或分组数据的频数和频率;
折线图主要用于描述数据随时间的变化趋势.
【清单07】第p百分位数的定义
一般地,一组数据的第p百分位数是这样一个值,它使得这组数据中至少有的数据小于或等于这个值,且至少有的数据大于或等于这个值.
【清单08】计算第百分位数的步骤
第1步:按从小到大排列原始数据.
第2步:计算.
第3步:若i不是整数,而大于i的比邻整数为j,则第p百分位数为第j项数据;若i是整数,则第p百分位数为第i项与第项数据的平均数.
【清单09】四分位数
常用的分位数有第25百分位数、第50百分位数、第75百分位数,这三个分位数把一组由小到大排列后的数据分成四等份,因此称为四分位数.其中第25百分位数也称为第一四分位数或下四分位数等,第75百分位数也称为第三四分位数或上四分位数等.
【清单10】众数、中位数、平均数定义
(1)众数:一组数据中重复出现次数最多的数.
(2)中位数:把一组数据按从小到大的顺序排列,处在中间位置(或中间两个数的平均数)的数叫做这组数据的中位数.
(3)平均数:如果个数,那么叫做这个数的平均数.
【清单11】频率分布直方图中的众数、中位数、平均数
①在频率分布直方图中,众数是最高矩形中点的横坐标;
②中位数左边和右边的直方图的面积应该相等;
③平均数的估计值等于频率分布直方图中每个小矩形的面积乘以小矩形底边中点的横坐标之和.
【清单12】方差、标准差的定义
一组数据,用表示这组数据的平均数,则这组数据的方差为,标准差为.
【清单13】总体方差、总体标准差的定义
如果总体中所有个体的变量值分别为,总体平均数为,则称为总体方差,为总体标准差.如果总体的个变量值中,不同的值共有个,记为,,其中出现的频数为,则总体方差为.
【清单14】样本方差、样本标准差的定义
如果一个样本中个体的变量值分别为,样本平均数为,则称为样本方差,为样本标准差.
【清单15】方差、标准差特征
标准差、方差刻画了数据的离散程度或波动幅度,标准差越大,数据的离散程度越大;标准差越小,数据的离散程度越小.在刻画数据的分散程度上,方差和标准差是一样的.但在解决实际问题中,一般多采用标准差.
【考点题型一】简单随机抽样
技巧:1、抽签法的应用条件及注意点:
(1)一个抽样试验能否用抽签法,关键看两点:一是制签是否方便;二是个体之间差异不明显.一般地,当样本容量和总体容量较小时,可用抽签法.
(2)应用抽签法时应注意以下几点:
①分段时,如果已有分段可不必重新分段;
②签要求大小、形状完全相同;
③号签要均匀搅拌;
④要逐一不放回的抽取.
2、 随机数法解题步骤;
第一步,编号.
第二步,生成随机数.
第三步,记录样本编号.
第四步,抽取样本.
【例1】甲乙两名同学参加羽毛球单打比赛,比赛规则是3局2胜制.现通过设计模拟实验估算概率,用1,3,5表示一局比赛甲获胜,用2,4表示一局比赛乙获胜.利用计算机产生20组随机数:
423 123 423 344 114 453 525 332 152 342
534 443 512 541 125 432 334 151 314 254
由此估计甲赢得比赛的概率为( )
A.0.6 B.0.65 C.0.7 D.0.75
【答案】B
【分析】先根据题中数据得甲获胜的场数为13场,进而可得甲赢得比赛的概率为.
【详解】由题中数据可知甲获胜的场数为13场,
故甲赢得比赛的概率为,
故选:B
【变式1-1】在对101个人进行一次抽样时,先采用抽签法从中剔除1个人,再在剩余的100个人中随机抽取10个人,那么下列说法正确的是( )
A.这种抽样方法对于被剔除的个体是不公平的,因为他们失去了被抽到的机会
B.每个人在整个抽样过程中被抽到的机会均等
C.由于采用了两步进行抽样,所以无法判断每个人被抽到的可能性是多少
D.每个人被抽到的可能性不相等
【答案】B
【分析】根据随机抽样的特征,即可判断出结果.
【详解】由于第一次剔除时采用抽签法,对每个人来说可能性相等,
然后随机抽取10人对每个人的机会也是均等的,
所以总的来说每个人的机会都是均等的,被抽到的可能性都是相等的.
故选:B.
【变式1-2】下列抽样方法中,属于简单随机抽样的是( )
A.某社团为调查本校学生的环保知识水平,向在图书馆某楼层自习的所有学生发放问卷,隔5分钟后回收;
B.某次科普讲座之前,主持人抽取座位尾号为1的听众进行提问;
C.一车间主任从堆放的100件产品中抽取了摆放在最上面的10件产品进行检查;
D.销售部经理将一个放有部门所有员工工号牌的箱子均匀摇晃后,从中抽取5个工号牌.
【答案】D
【分析】根据简单随机抽样的特点逐项判断即可.
【详解】对于A项,人数较多,且图书馆的学生不能代表本校全体学生,故A项错误;
对于B项,按照相同间隔抽取的方法,是系统抽样,不是简单抽样,故B项错误;
对于C项,抽取的产品不具有代表性,故C项错误;
对于D项,符合简单随机抽样的定义,故D项正确.
【变式1-3】采用简单随机抽样的方法,从含有20个个体的总体中抽取1个容量为4的样本,则某个个体被抽到的概率为( )
A. B. C. D.
【答案】B
【分析】依据总体中的每个个体被抽到的概率都是一样的,再结合容量为4,可以看成是抽4次,从而可求得概率.
【详解】由于每个个体被抽到的概率相等,
所以每个个体被抽到的概率是.
故选B.
【变式1-4】利用简单随机抽样的方法,从n个个体()中抽取13个个体,若从第二次抽取开始时,余下的每个个体被抽到的概率为,则在整个抽样过程中,每个个体被抽到的可能性为( ).
A. B. C. D.
【答案】B
【分析】根据已知条件,结合简单随机抽样的定义,即可求解.
【详解】解:从第二次开始抽取时,余下的每个个体被抽到的概率为,
则,
解得,
故在整个抽样过程中,每个个体被抽到的可能性为.
故选:B.
【考点题型二】分层抽样
技巧:分层抽样中每层抽取的个体数的确定方法:
(1)
已知总体容量、样本容量及各层的个体数时,首先确定抽样比,其中为总体容量,
为样本容量;然后确定每层抽取的个体的个数,其中为第层的个体数,为第层应抽取的个体数.
(2)
已知各层个体数之比为,样本容量为时,每层抽取的个体数为.
【例2】为了研究某种病毒与血型之间的关系,决定从被感染的人群中抽取样本进行调查,这些感染人群中O型血、A型血、B型血、AB型血的人数比为4:3:3:2,现用比例分配的分层随机抽样方法抽取一个样本量为的样本,已知样本中O型血的人数比AB型血的人数多20,则( )
A.100 B.120 C.200 D.240
【答案】B
【分析】由题知,再解方程即可得答案.
【详解】解:因为感染人群中O型血、A型血、B型血、AB型血的人数比为4:3:3:2,
所以,抽取样本量为的样本中,O型血的人数为, AB型血的人数为,
所以,,解得
故选:B
【变式2-1】一支田径队有田赛类运动员36人,径赛类运动员30人,用分层随机抽样的方法从该田径队中抽取一个容量为11的样本,则田赛类运动员被抽取的人数为( )
A.4 B.5 C.6 D.7
【答案】C
【分析】由分层抽样的方法,按比例可得答案.
【详解】由题意得,田赛类运动员被抽取的人数为.
故选:C
【变式2-2】某学校在校学生有2000人,为了增强学生的体质,学校举行了跑步和登山比赛,每人都参加且只参加其中一项比赛,高一、高二、高三年级参加跑步的人数分别为a,b,c,且,全校参加登山的人数占总人数的.为了了解学生对本次比赛的满意程度,按分层抽样的方法从中抽取一个容量为200的样本进行调查,则应从高三年级参加跑步的学生中抽取( )
A.15人 B.30人 C.40人 D.45人
【答案】D
【分析】由题知全校参加跑步的人数为,再根据分层抽样的方法求解即可得答案.
【详解】解:由题意,可知全校参加跑步的人数为,
所以.因为,所以.
因为按分层抽样的方法从中抽取一个容量为200的样本,
所以应从高三年级参加跑步的学生中抽取的人数为.
故选:D
【变式2-3】已知某地区有小学生12000人,初中生11000人,高中生9000人,现在要了解该地区学生的近视情况,准备抽取320人进行调查,则应该抽取小学生、初中生、高中生的人数分别是 .
【答案】120,110,90
【分析】先求出各层比例,根据分层抽样的定义建立式子计算即可得到结论..
【详解】小学生,初中生,高中生人数的比例为,
故抽取的小学生,初中生,高中生的人数分别为.
故答案为:120,110,90.
【变式2-4】以“塑造软件新生态,赋能发展新变革”为主题的第二十五届中国国际软件博览会于2023年8月31日在天津开幕.本次参会人员分不同区域落座,其中某个区域的男性参会人员有25人,女性参会人员有15人,现按性别比例进行分层抽样,若从该区域随机抽取16位参会人员,则女性参会人员应抽取的人数为 .
【答案】6
【分析】利用分层抽样的分层比直接计算即可.
【详解】由题意得分层比为,则女性参会人员应抽取的人数为.
故答案为:6
【考点题型三】扇形统计图
技巧:扇形统计图反映各组数据占总数的比例;
【例3】小李一周的总开支分布如图(1)所示,其中一周的食品开支如图(2)所示,则以下判断错误的是( )
A.小李这一周用于肉蛋奶的支出高于用于娱乐的支出
B.小李这一周用于食品中其他类的支出在总支出中是最少的
C.小李这一周用于主食的支出比用于通信的支出高
D.小李这一周用于主食和蔬菜的总支出比日常支出高
【答案】D
【分析】条形图各支出占食品支出的比例乘以即是条形图各支出占总支出的比例,由此关系即可逐一判断每一个选项.
【详解】对于A,肉蛋奶的支出占食品开支的,
从而小李这一周用于肉蛋奶的支出占比(总开支是单位1)与用于娱乐的支出占比(总开支是单位1)大小关系为,故A描述正确,不符合题意;
对于B,小李这一周用于食品中其他类的支出在总支出中占比为,
对比其他类型的支出占比可知,B描述正确,不符合题意;
对于C,小李这一周用于主食的支出占比(总开支是单位1)与通信的支出占比(总开支是单位1)的大小关系为,
,故C描述正确,不符合题意;
对于D,小李这一周用于主食和蔬菜的总支出占比(总开支是单位1)与日常支出占比(总开支是单位1)的大小关系为,
,故D描述错误,符合题意.
故选:D.
【变式3-1】南丁格尔玫瑰图是由近代护理学和护士教育创始人南丁格尔(Florence Nightingale1820-1910)设计的,图中每个扇形圆心角都相等,半径长短表示数量大小.某机构统计了近些年中国知识付费用户数量(单位:亿人次),并绘制成南丁格尔玫瑰图如下,根据此图,下列说法错误的是( )
A.2015年至2022年,知识付费用户数量逐年增加
B.2017年至2018年,知识付费用户数量增加量为近些年来最多
C.2022年知识付费用户数量超过2015年知识付费用户数量的10倍
D.2016年至2022年,知识付费用户数量的年增加量逐年递增
【答案】D
【分析】利用题中所给的南丁格尔玫瑰图逐一考查所给选项,即可得解.
【详解】对于A,由图可知,2015年至2022年,知识付费用户数量逐年增加,故A正确;
对于BD,知识付费用户数量的逐年增加量分别为:2016年,;
2017年,;2018年,;2019年,;
2020年,;2021年,;2022年,,
可知知识付费用户数量逐年增加量2018年最多,故B正确,D错误;
对于C,由,即2022年知识付费用户数量超过2015年知识付费用户数量的10倍,故C正确;
故选:D
【变式3-2】某居民小区户主人数和户主对住房户型结构的满意率分别如图1和图2所示,为了解该小区户主对户型结构的满意程度,用比例分配的分层随机抽样方法抽取的户主作为样本进行调查,则样本容量和抽取的户主对四居室满意的人数分别为( )
A.400,32 B.400,36 C.480,32 D.480,36
【答案】A
【分析】根据图(1)及分层抽样可得样本容量及抽取的四居室户主人数,再结合图(2)可得抽取的户主对四居室满意的人数.
【详解】由图(1)得该小区户主总人数为人,
所以样本容量为人,其中四居室户主有人,
由图(2)得抽取的户主中对四居室满意的有人,
故选:A.
【变式3-3】某校为了了解学生的身体素质,对2022届初三年级所有学生仰卧起坐一分钟的个数情况进行了数据统计,结果如下图所示.该校2023届初三学生人数较2022届初三学生人数上升了10%,则下列说法错误的是( )
A.该校2022届初三年级学生仰卧起坐一分钟的个数在内的学生人数占70%
B.该校2023届初三学生仰卧起坐一分钟的个数在内的学生人数比2022届初三学生仰卧起坐一分钟个数同个数段的学生人数的2倍还多
C.该校2023届初三学生仰卧起坐一分钟的个数和2022届初三学生仰卧起坐一分钟个数的中位数均在内
D.相比2022届初三学生仰卧起坐一分钟个数不小于50的人数,2023届初三学生仰卧起坐一分钟个数不小于50的人数占比增加
【答案】C
【分析】根据扇形统计图和条形图对四个选项逐个判断可得答案.
【详解】2022届初三年级学生仰卧起坐一分钟的个数在内的学生人数占比为
,A正确.
由于2023届初三学生人数较2022届上升了,
假设2022届初三学生人数为(),
则仰卧起坐一分钟的个数在内的学生人数为,
2023届初三学生仰卧起坐一分钟的个数在内的学生人数为
,,B正确.
2022届初三学生仰卧起坐一分钟个数的中位数在内,
2023届初三学生仰卧起坐一分钟个数的中位数在内,C错误.
2022届初三学生仰卧起坐一分钟个数不小于50的人数占,
2023届初三学生仰卧起坐一分钟个数不小于50的人数占,D正确.
故选: C.
【变式3-4】某中学组织三个年级的学生进行党史知识竞赛. 经统计,得到前名学生分布的扇形图(如图)和前名中高一学生排名分布的频率条形图(如图),则下列命题错误的是( )
A.成绩前名的学生中,高一人数比高二人数多人
B.成绩前名的学生中,高一人数不超过人
C.成绩前名的学生中,高三人数不超过人
D.成绩第名到第名的学生中,高二人数比高一人数多
【答案】D
【分析】根据饼状图和条形图提供的数据判断.
【详解】由饼状图,成绩前200名的200人中,高一人数比高二人数多,A正确;
由条形图知高一学生在前200名中,前100和后100人数相等,因此高一人数为,B正确;
成绩前50名的50人中,高一人数为,因此高三最多有32人,C正确;
第51到100名的50人中,高一人数为,故高二最多有23人,因此高二人数比高一少,D错误.
故选:D.
【考点题型四】折线统计图
技巧:折线统计图反映数据随时间的变化趋势.
【例4】据统计,我国牛、羊肉集贸市场价格在2019年波动幅度较大,2020年开始逐渐趋于稳定.如下图分别为2019年1月至2020年3月,我国牛肉、羊肉集贸市场月平均价格大致走势图,下列说法不正确的是( )
A.2019年1月至2020年3月,牛肉与羊肉月平均价格的涨跌情况基本一致
B.2019年3月开始至当年末,牛肉与羊肉的月平均价格都一直持续上涨
C.2019年7月至10月牛肉月平均价格的平均增量高于2020年1至2月的增量
D.同期相比,羊肉的月平均价格一定高于牛肉的月平均价格
【答案】D
【分析】根据图像数据分析即可求解.
【详解】根据图像的大致走势即可判断牛肉与羊肉月平均价格的涨跌情况基本一致,故选项A正确;
根据图像中的数据比较可知2019年3月开始至当年末,牛肉与羊肉的月平均价格,数据越来越大,都一直持续上涨,故选项B正确;
2019年7月至10月牛肉月平均价格的平均增量为,2020年1至2月牛肉增量为,故选项C正确;
2019年8月牛肉月平均价格为,2019年8月羊肉月平均价格为,所以同期相比,羊肉的月平均价格也可能会低于牛肉的月平均价格,故选项D错误.
故选:D.
【变式4-1】某地自2018年起实行湖长制,境内湖泊水质不断提升.为了解治理成效,环境监测部门每年在该地所有湖泊中随机选取80个进行水质调查,得到数据如下,并且五年来,该地通过退耕还湖,湖泊总量由160个增加至200个.下列说法不正确的是( )
A.该地水质差湖泊总量逐年递减 B.该地水质好湖泊总量逐年递增
C.该地平均每年新增10个湖泊 D.该地平均每年新增至少45个水质好湖泊
【答案】A
【分析】根据题设的三种折线图逐项判断后可得正确的选项.
【详解】根据图中湖泊总量折线图可得从2018年到2022年,该地平均每年新增的湖泊个数为,故C正确;
根据图中水质差的湖泊数的折线图可得该地水质差湖泊总量数前3年分别为:
,,,故A错误.
根据图中水质好的湖泊数的折线图可得该地水质好湖泊总量数分别为:
,,,,,
该地水质好湖泊总量数逐年递增,故B正确.
从2018年到2022年,该地平均每年新增水质好湖泊数量为,
故D正确.
故选:A.
【考点题型五】条形统计图
技巧:条形统计图反映各组数据的频数或频率;
【例5】新能源汽车是指采用非常规的车用燃料作为动力来源的汽车,包括纯电动汽车和其他类型车辆(如增程式电动汽车、混合动力汽车、燃料电池电动汽车等).具有环保、节能、效率高、使用成本低、噪音小等优势.近年来,我国新能源汽车市场飞速发展.如图所示为2015年至2021年H1(H1表示上半年)中国新能源汽车保有量统计情况,根据图中所给信息,以下说法错误的是( )
A.中国新能源汽车保有量在2017年首次突破百万辆
B.自2015年起至2021年H1,中国新能源汽车保有量每年都在增加
C.2016年纯电动汽车保有量增长率最大
D.相比2018年,2019年纯电动汽车保有量占新能源汽车保有量的比率降低了
【答案】D
【分析】结合表中数据,依次分析各选项即可得答案;
【详解】解:对于A选项,2015,2016,2017年中国新能源汽车保有量分别为42万辆,91万辆,153万辆,故A正确;
对于B选项,由表中数据可知,自2015年起,中国新能源汽车保有量每年都在增加,B正确;
对于C选项,由表中数据可知,2016年纯电动汽车保有量增长率大于100%,其他年份都小于100%,故C正确;
对于D选项,2019年纯电动汽车保有量占新能源汽车保有量的比率为,2018年为,计算得,故相比2018年,2019年纯电动汽车保有量占新能源汽车保有量的比率增加了.
故选:D.
【变式5-1】我国于2015年10月宣布实施普遍二孩政策,为了解户籍、性别对生育二胎选择倾向的影响,某地从育龄群体中随机抽取了容量为140的调查样本,其中城镇户籍与农村户籍各70人,男性60人,女性80人,绘制的不同群体中倾向选择生育二胎与倾向选择不生育二胎的人数比例如图所示,其中阴影部分表示倾向选择生育二胎的对应比例,则下列叙述正确的是( )
A.是否倾向选择生育二胎与户籍有关
B.是否倾向选择生育二胎与性别无关
C.调查样本里面倾向选择生育二胎的人群中,男性人数少于女性人数
D.倾向选择不生育二胎的人群中,农村户籍人数多于城镇户籍人数
【答案】A
【分析】根据题意、识图,将数据进行对比,通过观察和计算判断即可.
【详解】由不同群体中倾向选择生育二胎与倾向选择不生育二胎的人数比例图知,
A选项,城镇户籍倾向选择生育二胎的比例为,农村户籍倾向选择生育二胎的比例为,所以是否倾向选择生育二胎与户籍有关,故A正确;
B选项,男性倾向选择生育二胎的比例为,女性倾向选择生育二胎的比例为,所以是否倾向选择生育二胎与性别有关,故B错误;
C选项,男性倾向选择生育二胎的比例为,人数为人,女性倾向选择生育二胎的比例为,人数为人,所以倾向选择生育二胎的人员中,男性人数与女性人数相同,故C错误;
D选项,倾向选择不生育二胎的人员中,农村户籍人数为人,城镇户籍人数为人,所以倾向选择不生育二胎的人员中,农村户籍人数少于城镇户籍人数,故D错误.
故选:A.
【考点题型六】 频率分布直方图
技巧:计算规律:
1、 因为小长方形的面积=组距×=频率,所以各小长方形的面积表示相应各组的频率.这样,频率分布直方图就以面积的形式反映了数据落在各个小组内的频率大小.
2、在频率分布直方图中,各小长方形的面积之和等于1.
3、=样本量.
4、在频率分布直方图中,各长方形的面积之比等于频率之比,各长方形的高度之比也等于频率之比.
在频率分布直方图中求平均数、中位数、众数:
(1)众数:频率分布直方图中,最高矩形的底边中点的横坐标.
(2)中位数:在频率分布直方图中,把频率分布直方图划分为左右两个面积相等的部分的分界线与
x轴交点的横坐标称为中位数.
(3)平均数:平均数在频率分布直方图中等于每个小矩形底边中点的横坐标与小矩形的面积的乘积之和.
【例6】国家统计局发布的2018年至2022年我国居民消费水平情况如图所示,则下列说法正确的是(居民消费水平)( )
A.2018年至2022年我国居民消费水平逐年提高
B.2018年至2022年我国城镇居民消费水平逐年提高
C.2018年至2022年我国居民消费水平数据的极差为6463元
D.2022年我国城镇人口数比农村人口数的1.5倍还要多
【答案】D
【分析】对于AB选项,由统计图可得答案;对于C选项,结合题目数据可得答案;对于D选项,由统计图数据结合居民消费水平计算公式可得答案.
【详解】对于A,2019年的居民消费水平比2020年的居民消费水平高,故A错误;
对于B, 2018年至2022年我国城镇居民消费水平不是逐年提高,故B错误;
对于C,2018年至2022年我国居民消费水平数据的极差为6473元,故C错误;
对于D,设我国农村人口数为,城镇人口数为,
则,化简得,
所以2022年我国城镇人口数比农村人口数的1.5倍还要多,故D正确.
故选:D
【变式6-1】如图所示为某企业员工年龄(岁)的频率分布直方图,从左到右依次为第一组、第二组、……、第五组,若第五组的员工有80人,则第二组的员工人数为( )
A.140 B.240 C.280 D.320
【答案】C
【分析】根据频率分布直方图的性质,求得的值,进一步计算即可 .
【详解】由已知得,
所以,因为第五组的员工人数为80,
所以第二组的员工人数为.
故选:C.
【变式6-2】自1950年以来,每年于4月7日庆祝世界卫生日,旨在引起世界各国人民对卫生、健康工作的关注,提高人们对卫生领域的素质和认识,强调健康对于劳动创造和幸福生活的重要性.为了让大家了解更多的健康知识,某中学组织三个年级的学生进行日常卫生知识竞赛,经统计,得到前200名学生分布的饼状图(如图1)和前200名学生中高一学生排名分布的频率条形图(如图2),则下列说法错误的是( )
A.成绩在前200名的学生中,高一人数比高二人数多30
B.成绩在第1~50名的学生中,高三最多有32人
C.高一学生成绩在第101~150名的人数一定比高三学生成绩在第1~50名的人数多
D.成绩在第51~100名的学生中,高二人数比高一人数多
【答案】D
【分析】由饼状图可计算出高一年级共90人,高二年级共60人,高三年级共50人,再由高一学生排名分布的频率条形图可计算出各排名段中高一年级学生的人数,由此即可判断出答案.
【详解】由饼状图可知,成绩在前200名的学生中,高一人数比高二人数多,A正确;
成绩在第名的学生中,高一人数为,因此高三最多有32人,B正确;
由条形图知高一学生的成绩在第名的人数为,
而高三的学生成绩在第名的人数最多为人,
故高一学生的成绩在第名的人数一定比高三的学生成绩在第名的人数多,C正确;
成绩在第名的学生中,高一人数为,高二成绩在第名的人数最多为,
即成绩在第51~100名的学生中,高一的人数一定比高二的人数多,错误.
故选:D
【考点题型七】百分位数
技巧:1、计算一组n个数据的第p百分位数的步骤:
第1步,按从小到大排列原始数据.
第2步,计算.
第3步,若i不是整数,而大于i的比邻整数为j,则第p百分位数为第j项数据;若i是整数,
则第p百分位数为第i项与第(i+1)项数据的平均数.
2、频率直方图计算百分位数的规律:
求总体百分位数的估计,首先要从小到大排列数据,频率直方图看作数据均匀分布在直方图上,
然后计算出,当i不是整数要取整,频率直方图要计算出比例值.
【例7】掷一颗骰子10次,记录出现偶数点的比例.这样的试验共做了100次,所得数据如下表所示.
比例
0.1
0.2
0.3
0.4
0.5
0.6
0.7
0.8
0.9
1.0
频数
1
3
8
21
28
23
10
5
1
0
(1)绘制频率分布条形图;
(2)求偶数出现比例的平均值和标准差.
【答案】(1)答案见解析;
(2)0.512,0.1478.
【分析】(1)由题意绘制频率分布条形图;
(2)由所给的数据求偶数出现比例的平均值和标准差.
【详解】(1)如图所示:
(2)平均数:
标准差:.
所以,标准差
【变式7-1】某电商平台对某大型活动期间的10000名网络购物者的消费情况进行统计,发现消费金额(单位:万元)都在区间内,其频率分布直方图如图所示.
(1)求频率直方图中的的值;
(2)估计这10000名网络购物者在该活动期间消费的中位数和平均数(保留小数点后三位).
【答案】(1)
(2)中位数为0.533(万元),平均数0.537(万元)
【分析】(1)根据频率之和为求得的值;
(2)根据中位数和平均数的计算公式可得.
【详解】(1),解得.
(2)设中位数为t,
则,解得(万元),
平均数(万元).
【变式7-2】如图是根据某校学生在一次数学考试中的成绩画出的频率分布直方图,则该次数学成绩的50%分位数约为(采用四舍五入法精确到1)( )
A.79 B.78 C.77 D.76
【答案】C
【分析】先计算各区间的频率,确定50%分位数所在区间,然后使用线性插值法计算该分位数.
【详解】由频率分布直方图可知,组距为10.
区间的频率为;
区间的频率为;
区间的频率为;
区间的频率为;
区间[90,100]的频率为.
前两个区间和的频率之和为;
前三个区间、和的频率之和为.
因为,所以50%分位数在区间内.
设50%分位数为.
在区间内,频率为0.3,前两个区间累计频率为0.3,则从70开始到50%分位数位置的频率为.
根据线性关系可得,即.
交叉相乘可得,即.
移项可得,即.
解得.
故选:C.
【变式7-3】为了了解某小区居民月用电情况,供电部门从该小区随机抽取100户居民进行月用电量调查,统计他们的月用电量(单位:kW·h),将数据整理后绘制成如图所示的频率分布直方图(每组为左闭右开的区间).
用样本估计总体,则下列说法中正确的个数是( )
①本小区居民月用电量的分位数不小于200kW·h;②本小区居民月用电量的平均数位于中;③本小区居民月用电量的众数为225kW·h;④本小区居民月用电量的极差位于中.
A.1 B.2 C.3 D.4
【答案】C
【分析】通过计算各区间频率,利用频率和判断分位数范围,以组中值与对应频率乘积之和算平均数,根据最高矩形底边中点求众数,用第一组和最后一组区间端点来估计极差的范围,从而对各说法正误进行判断.
【详解】由题意各区间的频率分别为:.
计算前四个区间频率和为,
前三个区间频率和为,
则分位数在,即本小区居民月用电量的分位数不小于200kW·h,故①正确;
kW·h,故②正确;
由图可知,本小区居民月用电量的众数为kW·h,故③错误;
由,可知,本小区居民月用电量的极差位于中,故④正确;
故选:C
【变式7-4】某地举办了“防电信诈骗”知识竞赛,从所有答卷中随机抽取100份作为样本,将样本的成绩(满分100分,成绩均为不低于40分的整数)分成六段:,,…,,得到如图所示的频率分布直方图.
(1)求频率分布直方图中的值及样本成绩的第80百分位数;
(2)已知落在区间的样本平均成绩是57,方差是7,落在区间的样本平均成绩为66,方差是4,求两组样本成绩合并后的平均数和方差.
参考公式:若总体划分为2层,通过分层随机抽样,各层抽取的样本量、样本平均数和样本方差分别为:,,;,,记总的样本平均数为,样本方差为,则.
【答案】(1),第80百分位数为86
(2),总方差.
【分析】(1)根据百分位数定义利用频率分布直方图计算可得结果;
(2)代入由样本方差计算总体方差的公式计算可得结果.
【详解】(1)由题意知,解得;
成绩在的频率为0.65,成绩在的频率为0.9,
故第80百分位数在之间,则,
解得,
故第80百分位数为86;
(2)由频率分布直方图知,这100份答卷分数在的份数为,
分数在的份数为,
所以,
总方差.
【考点题型八】标准差与方差的应用
技巧:实际应用中标准差、方差的意义:
在实际问题中,仅靠平均数不能完全反映问题,还要研究方差,方差描述了数据相对平均数的离散程度,在平均数相同的情况下,方差越大,离散程度越大,数据波动性越大,稳定性越差;方差越小,数据越集中,稳定性越高.
【例8】已知样本的标准差为2,平均数为3,则值为( )
A.35 B.77 C.49 D.91
【答案】D
【分析】根据题意,利用数据的平均数和方差的计算公式,准确运算,即可求解.
【详解】由题意,,
所以,
又由,
所以,
解得,
故选:D
【变式8-1】已知一组统计数据,,满足:,,则这组数据的标准差等于( )
A. B.1 C. D.2
【答案】C
【分析】利用方差公式结合方差与标准差的关系求解即可.
【详解】设这组数据的平均数为,则,
,
设这组数据的方差为,标准差为,由方差公式得,
,得到,故C正确.
故选:C
【变式8-2】已知某个数的平均数为,方差为,现加入一个新数据,此时这个数的平均数为,标准差为,则( )
A. B. C. D.
【答案】A
【分析】利用平均数和方差公式计算即得解.
【详解】设个数为,
则平均数为,即,
方差为,
即,
加入新数据4之后,则这8个数的平均数为
,
方差为
所以标准差.
故选:A.
【变式8-3】已知一组统计数据满足:,,则这组数据的标准差等于( )
A. B.3 C.6 D.9
【答案】B
【分析】根据已知条件,可求得平均数,即可求出方差、标准差.
【详解】设这组数据的平均数为,
则
,
所以方差,所以标准差.
故选:B.
【变式8-4】如图所示的茎叶图记录了甲、乙两支篮球队各6名队员某场比赛的得分数据(单位:分).则下列说法正确的是 ( )
A.甲队数据的中位数大于乙队数据的中位数;
B.甲队数据的平均值小于乙队数据的平均值;
C.甲队数据的标准差大于乙队数据的标准差;
D.乙队数据的第75百分位数为27.
【答案】D
【分析】根据中位数、平均数、方程、百分位数等知识对选项进行分析,从而确定正确答案.
【详解】A选项,甲队的中位数是,乙队的中位数是,
两者相等,所以A选项错误.
B选项,甲队的平均数为,
乙队的平均数为,
两者相等,所以B选项错误.
C选项,甲队的标准差为:
,
乙队的标准差为:
,
所以甲队数据的标准差小于乙队数据的标准差,所以C选项错误.
D选项,乙队的数据为,,
所以乙队数据的第75百分位数为,D选项正确.
故选:D
【考点题型九】统计案例
技巧:(用样本的标准差、方差估计总体的方法)
(1) 用样本估计总体时,样本的平均数、标准差只是总体的平均数、标准差的近似.实际应用中,
当所得数据的平均数不相等时,需先分析平均水平,再计算标准差(方差)分析稳定情况.
(2)标准差、方差的取值范围是.
(3)因为标准差与原始数据的单位相同,且平方后可能夸大了偏差的程度,所以虽然方差与标准
差在刻画样本数据的离散程度上是一样的,但在解决实际问题时,一般多采用标准差.
【例9】甲、乙二人参加某体育项目训练,近期的八次测试得分情况如图,则下列结论正确的是( )
A.甲得分的极差大于乙得分的极差 B.甲得分的75%分位数大于乙得分的75%分位数
C.甲得分的平均数小于乙得分的平均数 D.甲得分的标准差小于乙得分的标准差
【答案】B
【解析】乙组数据最大值29,最小值5,极差24,甲组最大值小于29,最小值大于5,所以A选项说法错误;
甲得分的75%分位数是20,,乙得分的75%分位数17,所以B选项说法正确;
甲组具体数据不易看出,不能判断C选项;
乙组数据更集中,标准差更小,所以D选项错误.
故选:B
【变式9-1】为保障食品安全,某监管部门对辖区内一家食品企业进行检查,现从其生产的某种产品中随机抽取100件作为样本,并以产品的一项关键质量指标值为检测依据,整理得到如下的样本频率分布直方图.若质量指标值在内的产品为一等品,则该企业生产的产品为一等品的概率约为( )
A.0.38 B.0.61
C.0.122 D.0.75
【答案】B
【解析】根据频率分布直方图可知,质量指标值在内的概率
故选:B
【变式9-2】已知一个样本容量为7的样本的平均数为5,方差为2,现样本加入新数据4,5,6,此时样本容量为10,若此时平均数为,方差为,则( )
A., B.,
C., D.,
【答案】B
【解析】设这10个数据分别为:,根据题意,,
所以,.
故选:B.
【变式9-3】为了实施“精准扶贫”战略,农科院试种了甲、乙两个西红柿新品种,从这两个品种中各任选5株,测量其产量(单位:kg),得到如下数据:
甲
60
80
70
90
70
乙
80
60
70
80
75
利用上述数据,现从中选出一个品种推荐给农民种植,应该推荐哪个品种呢?
【解析】根据表格中的数据,可使用折线图描述数据,如图所示:
从折线图上可以看出甲品种的平均产量稍高,但其产量不稳定;
乙品种的产量稍低,但其产量较稳定.
甲品种的平均产量为,
乙品种的平均产量为,所以甲品种的平均产量稍高;
甲品种的方差是,
乙品种的方差是,
由于,所以乙品种的产量较稳定.
1 / 1
1 / 1
学科网(北京)股份有限公司
$$
清单06 统计
(15个考点梳理+题型解读+提升训练)
【清单01】统计的相关概念
(1)普查
像人口普查这样,对每一个调查对象都进行调查的方法,称为全面调查,又称普查.
(2)总体、个体
在一个调查中,我们把调查对象的全体称为总体.组成总体的每一个调查对象称为个体.为了强调调查目的,也可以把调查对象的某些指标的全体作为总体,每一个调查对象的相应指标作为个体.
(3)抽样调查
根据一定目的,从总体中抽取一部分个体进行调查,并以此为依据对总体的情况作出估计和推断的调查方法,称为抽样调查.
(4)样本、样本量
我们把从总体中抽取的那部分个体称为样本,样本中包含的个体数称为样本量.
【清单02】简单随机抽样的方法
(1)抽签法:
把总体中的N个个体编号,把编号写在外观、质地等无差别的小纸片(也可以是卡片、小球等)上作为号签,将这些小纸片放在一个不透明的盒里,充分搅拌,最后从盒中不放回地逐个抽取号签,使与号签上的编号对应的个体进入样本,直到抽足样本所需的个数.
(2)随机数法:
用随机数工具产生编号范围内的整数随机数,把产生的随机数作为抽中的编号,使与编号对应的个体进入样本.重复上述过程,直到抽足样本所需的个数.
①用随机试验生成随机数;
②用信息技术生成随机数;
③用计算器生成随机数;
④用电子表格软件生成随机数;
⑤用R统计软件生成随机数.
【清单03】分层抽样的步骤
(1)根据已掌握的信息,将总体分成若干部分.
(2)根据总体中的个体数N和样本容量n计算出抽样比.
(3)根据抽样比k计算出各层中应抽取的个体数:(其中为第i层所包含的个体总数).
(4)按步骤3所确定的数在各层中随机抽取个体,并合在一起得到容量为n的样本.
【清单04】两种抽样方法的区别和联系
类别
共同点
各自特点
相互联系
适用范围
简单随机抽样
抽样过程中各个个体被抽到的机会相等,且都是不放回抽取
从总体中逐个抽取
最基本的抽样方法
总体容量较少
分层抽样
抽样过程中各个个体被抽到的机会相等,且都是不放回抽取
将总体分成几部分,每一部分按比例抽取
每层抽样时采用简单随机抽样
总体由差异明显的若干部分组成
【清单05】频率分布直方图
1、频率分布直方图绘制步骤
①求极差,即一组数据中的最大值与最小值的差.
②决定组距与组数.组距与组数的确定没有固定的标准,一般数据的个数越多,所分组数越多.当样本容量不超过100时,常分成5~12组.为方便起见,一般取等长组距,并且组距应力求“取整”.
③将数据分组.
④列频率分布表.计算各小组的频率,第i组的频率是.
⑤画频率分布直方图.其中横轴表示分组,纵轴表示,实际上就是频率分布直方图中各小长方形的高度,它反映了各组样本观测数据的疏密程度.
2、频率分布直方图意义:各个小长方形的面积表示相应各组的频率,频率分布直方图以面积的形式反映数据落在各个小组的频率的大小,各小长方形的面积的总和等于1.
3、总体取值规律的估计:我们可以用样本观测数据的频率分布估计总体的取值规律.
4、频率分布直方图的特征:当频率分布直方图的组数少、组距大时,容易从中看出数据整体的分布特点,但由于无法看出每组内的数据分布情况,损失了较多的原式数据信息;当频率分布直方图的组数多、组距小时,保留了较多的原始数据信息,但由于小长方形较多,有时图形会变得非常不规则,不容易从中看出总体数据的分布特点.
【清单06】常见的其他统计图:条形图、扇形图、折线图.
扇形图主要用于直观描述各类数据占总数的比例;
条形图和直方图主要用于直观描述不同类别或分组数据的频数和频率;
折线图主要用于描述数据随时间的变化趋势.
【清单07】第p百分位数的定义
一般地,一组数据的第p百分位数是这样一个值,它使得这组数据中至少有的数据小于或等于这个值,且至少有的数据大于或等于这个值.
【清单08】计算第百分位数的步骤
第1步:按从小到大排列原始数据.
第2步:计算.
第3步:若i不是整数,而大于i的比邻整数为j,则第p百分位数为第j项数据;若i是整数,则第p百分位数为第i项与第项数据的平均数.
【清单09】四分位数
常用的分位数有第25百分位数、第50百分位数、第75百分位数,这三个分位数把一组由小到大排列后的数据分成四等份,因此称为四分位数.其中第25百分位数也称为第一四分位数或下四分位数等,第75百分位数也称为第三四分位数或上四分位数等.
【清单10】众数、中位数、平均数定义
(1)众数:一组数据中重复出现次数最多的数.
(2)中位数:把一组数据按从小到大的顺序排列,处在中间位置(或中间两个数的平均数)的数叫做这组数据的中位数.
(3)平均数:如果个数,那么叫做这个数的平均数.
【清单11】频率分布直方图中的众数、中位数、平均数
①在频率分布直方图中,众数是最高矩形中点的横坐标;
②中位数左边和右边的直方图的面积应该相等;
③平均数的估计值等于频率分布直方图中每个小矩形的面积乘以小矩形底边中点的横坐标之和.
【清单12】方差、标准差的定义
一组数据,用表示这组数据的平均数,则这组数据的方差为,标准差为.
【清单13】总体方差、总体标准差的定义
如果总体中所有个体的变量值分别为,总体平均数为,则称为总体方差,为总体标准差.如果总体的个变量值中,不同的值共有个,记为,,其中出现的频数为,则总体方差为.
【清单14】样本方差、样本标准差的定义
如果一个样本中个体的变量值分别为,样本平均数为,则称为样本方差,为样本标准差.
【清单15】方差、标准差特征
标准差、方差刻画了数据的离散程度或波动幅度,标准差越大,数据的离散程度越大;标准差越小,数据的离散程度越小.在刻画数据的分散程度上,方差和标准差是一样的.但在解决实际问题中,一般多采用标准差.
【考点题型一】简单随机抽样
技巧:1、抽签法的应用条件及注意点:
(1)一个抽样试验能否用抽签法,关键看两点:一是制签是否方便;二是个体之间差异不明显.一般地,当样本容量和总体容量较小时,可用抽签法.
(2)应用抽签法时应注意以下几点:
①分段时,如果已有分段可不必重新分段;
②签要求大小、形状完全相同;
③号签要均匀搅拌;
④要逐一不放回的抽取.
2、 随机数法解题步骤;
第一步,编号.
第二步,生成随机数.
第三步,记录样本编号.
第四步,抽取样本.
【例1】甲乙两名同学参加羽毛球单打比赛,比赛规则是3局2胜制.现通过设计模拟实验估算概率,用1,3,5表示一局比赛甲获胜,用2,4表示一局比赛乙获胜.利用计算机产生20组随机数:
423 123 423 344 114 453 525 332 152 342
534 443 512 541 125 432 334 151 314 254
由此估计甲赢得比赛的概率为( )
A.0.6 B.0.65 C.0.7 D.0.75
【变式1-1】在对101个人进行一次抽样时,先采用抽签法从中剔除1个人,再在剩余的100个人中随机抽取10个人,那么下列说法正确的是( )
A.这种抽样方法对于被剔除的个体是不公平的,因为他们失去了被抽到的机会
B.每个人在整个抽样过程中被抽到的机会均等
C.由于采用了两步进行抽样,所以无法判断每个人被抽到的可能性是多少
D.每个人被抽到的可能性不相等
【变式1-2】下列抽样方法中,属于简单随机抽样的是( )
A.某社团为调查本校学生的环保知识水平,向在图书馆某楼层自习的所有学生发放问卷,隔5分钟后回收;
B.某次科普讲座之前,主持人抽取座位尾号为1的听众进行提问;
C.一车间主任从堆放的100件产品中抽取了摆放在最上面的10件产品进行检查;
D.销售部经理将一个放有部门所有员工工号牌的箱子均匀摇晃后,从中抽取5个工号牌.
【变式1-3】采用简单随机抽样的方法,从含有20个个体的总体中抽取1个容量为4的样本,则某个个体被抽到的概率为( )
A. B. C. D.
【变式1-4】利用简单随机抽样的方法,从n个个体()中抽取13个个体,若从第二次抽取开始时,余下的每个个体被抽到的概率为,则在整个抽样过程中,每个个体被抽到的可能性为( ).
A. B. C. D.
【考点题型二】分层抽样
技巧:分层抽样中每层抽取的个体数的确定方法:
(1)
已知总体容量、样本容量及各层的个体数时,首先确定抽样比,其中为总体容量,
为样本容量;然后确定每层抽取的个体的个数,其中为第层的个体数,为第层应抽取的个体数.
(2)
已知各层个体数之比为,样本容量为时,每层抽取的个体数为.
【例2】为了研究某种病毒与血型之间的关系,决定从被感染的人群中抽取样本进行调查,这些感染人群中O型血、A型血、B型血、AB型血的人数比为4:3:3:2,现用比例分配的分层随机抽样方法抽取一个样本量为的样本,已知样本中O型血的人数比AB型血的人数多20,则( )
A.100 B.120 C.200 D.240
【变式2-1】一支田径队有田赛类运动员36人,径赛类运动员30人,用分层随机抽样的方法从该田径队中抽取一个容量为11的样本,则田赛类运动员被抽取的人数为( )
A.4 B.5 C.6 D.7
【变式2-2】某学校在校学生有2000人,为了增强学生的体质,学校举行了跑步和登山比赛,每人都参加且只参加其中一项比赛,高一、高二、高三年级参加跑步的人数分别为a,b,c,且,全校参加登山的人数占总人数的.为了了解学生对本次比赛的满意程度,按分层抽样的方法从中抽取一个容量为200的样本进行调查,则应从高三年级参加跑步的学生中抽取( )
A.15人 B.30人 C.40人 D.45人
【变式2-3】已知某地区有小学生12000人,初中生11000人,高中生9000人,现在要了解该地区学生的近视情况,准备抽取320人进行调查,则应该抽取小学生、初中生、高中生的人数分别是 .
【变式2-4】以“塑造软件新生态,赋能发展新变革”为主题的第二十五届中国国际软件博览会于2023年8月31日在天津开幕.本次参会人员分不同区域落座,其中某个区域的男性参会人员有25人,女性参会人员有15人,现按性别比例进行分层抽样,若从该区域随机抽取16位参会人员,则女性参会人员应抽取的人数为 .
【考点题型三】扇形统计图
技巧:扇形统计图反映各组数据占总数的比例;
【例3】小李一周的总开支分布如图(1)所示,其中一周的食品开支如图(2)所示,则以下判断错误的是( )
A.小李这一周用于肉蛋奶的支出高于用于娱乐的支出
B.小李这一周用于食品中其他类的支出在总支出中是最少的
C.小李这一周用于主食的支出比用于通信的支出高
D.小李这一周用于主食和蔬菜的总支出比日常支出高
【变式3-1】南丁格尔玫瑰图是由近代护理学和护士教育创始人南丁格尔(Florence Nightingale1820-1910)设计的,图中每个扇形圆心角都相等,半径长短表示数量大小.某机构统计了近些年中国知识付费用户数量(单位:亿人次),并绘制成南丁格尔玫瑰图如下,根据此图,下列说法错误的是( )
A.2015年至2022年,知识付费用户数量逐年增加
B.2017年至2018年,知识付费用户数量增加量为近些年来最多
C.2022年知识付费用户数量超过2015年知识付费用户数量的10倍
D.2016年至2022年,知识付费用户数量的年增加量逐年递增
【变式3-2】某居民小区户主人数和户主对住房户型结构的满意率分别如图1和图2所示,为了解该小区户主对户型结构的满意程度,用比例分配的分层随机抽样方法抽取的户主作为样本进行调查,则样本容量和抽取的户主对四居室满意的人数分别为( )
A.400,32 B.400,36 C.480,32 D.480,36
【变式3-3】某校为了了解学生的身体素质,对2022届初三年级所有学生仰卧起坐一分钟的个数情况进行了数据统计,结果如下图所示.该校2023届初三学生人数较2022届初三学生人数上升了10%,则下列说法错误的是( )
A.该校2022届初三年级学生仰卧起坐一分钟的个数在内的学生人数占70%
B.该校2023届初三学生仰卧起坐一分钟的个数在内的学生人数比2022届初三学生仰卧起坐一分钟个数同个数段的学生人数的2倍还多
C.该校2023届初三学生仰卧起坐一分钟的个数和2022届初三学生仰卧起坐一分钟个数的中位数均在内
D.相比2022届初三学生仰卧起坐一分钟个数不小于50的人数,2023届初三学生仰卧起坐一分钟个数不小于50的人数占比增加
【变式3-4】某中学组织三个年级的学生进行党史知识竞赛. 经统计,得到前名学生分布的扇形图(如图)和前名中高一学生排名分布的频率条形图(如图),则下列命题错误的是( )
A.成绩前名的学生中,高一人数比高二人数多人
B.成绩前名的学生中,高一人数不超过人
C.成绩前名的学生中,高三人数不超过人
D.成绩第名到第名的学生中,高二人数比高一人数多
【考点题型四】折线统计图
技巧:折线统计图反映数据随时间的变化趋势.
【例4】据统计,我国牛、羊肉集贸市场价格在2019年波动幅度较大,2020年开始逐渐趋于稳定.如下图分别为2019年1月至2020年3月,我国牛肉、羊肉集贸市场月平均价格大致走势图,下列说法不正确的是( )
A.2019年1月至2020年3月,牛肉与羊肉月平均价格的涨跌情况基本一致
B.2019年3月开始至当年末,牛肉与羊肉的月平均价格都一直持续上涨
C.2019年7月至10月牛肉月平均价格的平均增量高于2020年1至2月的增量
D.同期相比,羊肉的月平均价格一定高于牛肉的月平均价格
【变式4-1】某地自2018年起实行湖长制,境内湖泊水质不断提升.为了解治理成效,环境监测部门每年在该地所有湖泊中随机选取80个进行水质调查,得到数据如下,并且五年来,该地通过退耕还湖,湖泊总量由160个增加至200个.下列说法不正确的是( )
A.该地水质差湖泊总量逐年递减 B.该地水质好湖泊总量逐年递增
C.该地平均每年新增10个湖泊 D.该地平均每年新增至少45个水质好湖泊
【考点题型五】条形统计图
技巧:条形统计图反映各组数据的频数或频率;
【例5】新能源汽车是指采用非常规的车用燃料作为动力来源的汽车,包括纯电动汽车和其他类型车辆(如增程式电动汽车、混合动力汽车、燃料电池电动汽车等).具有环保、节能、效率高、使用成本低、噪音小等优势.近年来,我国新能源汽车市场飞速发展.如图所示为2015年至2021年H1(H1表示上半年)中国新能源汽车保有量统计情况,根据图中所给信息,以下说法错误的是( )
A.中国新能源汽车保有量在2017年首次突破百万辆
B.自2015年起至2021年H1,中国新能源汽车保有量每年都在增加
C.2016年纯电动汽车保有量增长率最大
D.相比2018年,2019年纯电动汽车保有量占新能源汽车保有量的比率降低了
【变式5-1】我国于2015年10月宣布实施普遍二孩政策,为了解户籍、性别对生育二胎选择倾向的影响,某地从育龄群体中随机抽取了容量为140的调查样本,其中城镇户籍与农村户籍各70人,男性60人,女性80人,绘制的不同群体中倾向选择生育二胎与倾向选择不生育二胎的人数比例如图所示,其中阴影部分表示倾向选择生育二胎的对应比例,则下列叙述正确的是( )
A.是否倾向选择生育二胎与户籍有关
B.是否倾向选择生育二胎与性别无关
C.调查样本里面倾向选择生育二胎的人群中,男性人数少于女性人数
D.倾向选择不生育二胎的人群中,农村户籍人数多于城镇户籍人数
【考点题型六】 频率分布直方图
技巧:计算规律:
1、 因为小长方形的面积=组距×=频率,所以各小长方形的面积表示相应各组的频率.这样,频率分布直方图就以面积的形式反映了数据落在各个小组内的频率大小.
2、在频率分布直方图中,各小长方形的面积之和等于1.
3、=样本量.
4、在频率分布直方图中,各长方形的面积之比等于频率之比,各长方形的高度之比也等于频率之比.
在频率分布直方图中求平均数、中位数、众数:
(1)众数:频率分布直方图中,最高矩形的底边中点的横坐标.
(2)中位数:在频率分布直方图中,把频率分布直方图划分为左右两个面积相等的部分的分界线与
x轴交点的横坐标称为中位数.
(3)平均数:平均数在频率分布直方图中等于每个小矩形底边中点的横坐标与小矩形的面积的乘积之和.
【例6】国家统计局发布的2018年至2022年我国居民消费水平情况如图所示,则下列说法正确的是(居民消费水平)( )
A.2018年至2022年我国居民消费水平逐年提高
B.2018年至2022年我国城镇居民消费水平逐年提高
C.2018年至2022年我国居民消费水平数据的极差为6463元
D.2022年我国城镇人口数比农村人口数的1.5倍还要多
【变式6-1】如图所示为某企业员工年龄(岁)的频率分布直方图,从左到右依次为第一组、第二组、……、第五组,若第五组的员工有80人,则第二组的员工人数为( )
A.140 B.240 C.280 D.320
【变式6-2】自1950年以来,每年于4月7日庆祝世界卫生日,旨在引起世界各国人民对卫生、健康工作的关注,提高人们对卫生领域的素质和认识,强调健康对于劳动创造和幸福生活的重要性.为了让大家了解更多的健康知识,某中学组织三个年级的学生进行日常卫生知识竞赛,经统计,得到前200名学生分布的饼状图(如图1)和前200名学生中高一学生排名分布的频率条形图(如图2),则下列说法错误的是( )
A.成绩在前200名的学生中,高一人数比高二人数多30
B.成绩在第1~50名的学生中,高三最多有32人
C.高一学生成绩在第101~150名的人数一定比高三学生成绩在第1~50名的人数多
D.成绩在第51~100名的学生中,高二人数比高一人数多
【考点题型七】百分位数
技巧:1、计算一组n个数据的第p百分位数的步骤:
第1步,按从小到大排列原始数据.
第2步,计算.
第3步,若i不是整数,而大于i的比邻整数为j,则第p百分位数为第j项数据;若i是整数,
则第p百分位数为第i项与第(i+1)项数据的平均数.
2、频率直方图计算百分位数的规律:
求总体百分位数的估计,首先要从小到大排列数据,频率直方图看作数据均匀分布在直方图上,
然后计算出,当i不是整数要取整,频率直方图要计算出比例值.
【例7】掷一颗骰子10次,记录出现偶数点的比例.这样的试验共做了100次,所得数据如下表所示.
比例
0.1
0.2
0.3
0.4
0.5
0.6
0.7
0.8
0.9
1.0
频数
1
3
8
21
28
23
10
5
1
0
(1)绘制频率分布条形图;
(2)求偶数出现比例的平均值和标准差.
【变式7-1】某电商平台对某大型活动期间的10000名网络购物者的消费情况进行统计,发现消费金额(单位:万元)都在区间内,其频率分布直方图如图所示.
(1)求频率直方图中的的值;
(2)估计这10000名网络购物者在该活动期间消费的中位数和平均数(保留小数点后三位).
【变式7-2】如图是根据某校学生在一次数学考试中的成绩画出的频率分布直方图,则该次数学成绩的50%分位数约为(采用四舍五入法精确到1)( )
A.79 B.78 C.77 D.76
【变式7-3】为了了解某小区居民月用电情况,供电部门从该小区随机抽取100户居民进行月用电量调查,统计他们的月用电量(单位:kW·h),将数据整理后绘制成如图所示的频率分布直方图(每组为左闭右开的区间).
用样本估计总体,则下列说法中正确的个数是( )
①本小区居民月用电量的分位数不小于200kW·h;②本小区居民月用电量的平均数位于中;③本小区居民月用电量的众数为225kW·h;④本小区居民月用电量的极差位于中.
A.1 B.2 C.3 D.4
【变式7-4】某地举办了“防电信诈骗”知识竞赛,从所有答卷中随机抽取100份作为样本,将样本的成绩(满分100分,成绩均为不低于40分的整数)分成六段:,,…,,得到如图所示的频率分布直方图.
(1)求频率分布直方图中的值及样本成绩的第80百分位数;
(2)已知落在区间的样本平均成绩是57,方差是7,落在区间的样本平均成绩为66,方差是4,求两组样本成绩合并后的平均数和方差.
参考公式:若总体划分为2层,通过分层随机抽样,各层抽取的样本量、样本平均数和样本方差分别为:,,;,,记总的样本平均数为,样本方差为,则.
【考点题型八】标准差与方差的应用
技巧:实际应用中标准差、方差的意义:
在实际问题中,仅靠平均数不能完全反映问题,还要研究方差,方差描述了数据相对平均数的离散程度,在平均数相同的情况下,方差越大,离散程度越大,数据波动性越大,稳定性越差;方差越小,数据越集中,稳定性越高.
【例8】已知样本的标准差为2,平均数为3,则值为( )
A.35 B.77 C.49 D.91
【变式8-1】已知一组统计数据,,满足:,,则这组数据的标准差等于( )
A. B.1 C. D.2
【变式8-2】已知某个数的平均数为,方差为,现加入一个新数据,此时这个数的平均数为,标准差为,则( )
A. B. C. D.
【变式8-3】已知一组统计数据满足:,,则这组数据的标准差等于( )
A. B.3 C.6 D.9
【变式8-4】如图所示的茎叶图记录了甲、乙两支篮球队各6名队员某场比赛的得分数据(单位:分).则下列说法正确的是 ( )
A.甲队数据的中位数大于乙队数据的中位数;
B.甲队数据的平均值小于乙队数据的平均值;
C.甲队数据的标准差大于乙队数据的标准差;
D.乙队数据的第75百分位数为27.
【考点题型九】统计案例
技巧:(用样本的标准差、方差估计总体的方法)
(1) 用样本估计总体时,样本的平均数、标准差只是总体的平均数、标准差的近似.实际应用中,
当所得数据的平均数不相等时,需先分析平均水平,再计算标准差(方差)分析稳定情况.
(2)标准差、方差的取值范围是.
(3)因为标准差与原始数据的单位相同,且平方后可能夸大了偏差的程度,所以虽然方差与标准
差在刻画样本数据的离散程度上是一样的,但在解决实际问题时,一般多采用标准差.
【例9】甲、乙二人参加某体育项目训练,近期的八次测试得分情况如图,则下列结论正确的是( )
A.甲得分的极差大于乙得分的极差 B.甲得分的75%分位数大于乙得分的75%分位数
C.甲得分的平均数小于乙得分的平均数 D.甲得分的标准差小于乙得分的标准差
【变式9-1】为保障食品安全,某监管部门对辖区内一家食品企业进行检查,现从其生产的某种产品中随机抽取100件作为样本,并以产品的一项关键质量指标值为检测依据,整理得到如下的样本频率分布直方图.若质量指标值在内的产品为一等品,则该企业生产的产品为一等品的概率约为( )
A.0.38 B.0.61
C.0.122 D.0.75
【变式9-2】已知一个样本容量为7的样本的平均数为5,方差为2,现样本加入新数据4,5,6,此时样本容量为10,若此时平均数为,方差为,则( )
A., B.,
C., D.,
【变式9-3】为了实施“精准扶贫”战略,农科院试种了甲、乙两个西红柿新品种,从这两个品种中各任选5株,测量其产量(单位:kg),得到如下数据:
甲
60
80
70
90
70
乙
80
60
70
80
75
利用上述数据,现从中选出一个品种推荐给农民种植,应该推荐哪个品种呢?
1 / 1
1 / 1
学科网(北京)股份有限公司
$$