内容正文:
9.2.3 总体集中趋势的估计
导学案
1. 理解平均数、中位数、众数的概念及区别联系,能准确表述三者的统计含义,达到直观想象核心素养水平一的要求。
2. 掌握利用频率分布直方图估计总体众数、中位数和平均数的方法,能规范完成相关计算,达到数学运算核心素养水平一的要求。
3. 能结合实际问题,选取恰当的样本数字特征估计总体集中趋势,作出合理判断与决策,达到逻辑推理核心素养水平二的要求。
4. 体验从样本数据到总体估计的过程,感受统计思想的实用性,提升数据分析素养,增强用数据说话的意识。
教学重点:
1.平均数、中位数、众数的概念辨析及计算;
2. 利用频率分布直方图估计总体的众数、中位数和平均数;
3. 结合实际问题选择恰当的样本数字特征估计总体。
教学难点:
1. 频率分布直方图中中位数和平均数的估计原理与计算;
2. 根据数据类型和分布特点选择合适的统计量,解决实际决策问题;
3. 理解样本估计总体的合理性和局限性。
知识点一 众数、中位数、平均数
1.众数:一组数据中出现次数 的数.
2.中位数:把一组数据按 的顺序排列,处在 位置的数(或中间两个数的 )叫做这组数据的中位数.
3.平均数:如果n个数x1,x2,…,xn,那么= 叫做这n个数的平均数.
知识点二 总体集中趋势的估计
1.平均数、中位数和众数等都是刻画“ ”的量,它们从不同角度刻画了一组数据的集中趋势.
2.一般地,对数值型数据(如用水量、身高、收入、产量等)集中趋势的描述,可以用 、 ;而对分类型数据(如校服规格、性别、产品质量等级等)集中趋势的描述,可以用 .
知识点三 频率分布直方图中平均数、中位数、众数的求法
1.样本平均数:可以用每个小矩形底边中点的 与小矩形的 的乘积之和近似代替.
2.在频率分布直方图中,中位数左边和右边的直方图的面积应该 .
3.将 小矩形所在的区间 作为众数的估计值.
导入新知1:手机续航时长的“真相”大揭秘
现在同学们几乎都有自己的手机,购买手机时,续航能力是大家重点关注的因素之一。网上有两款热门手机的续航宣传信息:A手机宣传平均续航12小时,B手机宣传中位数续航10小时,且多数用户反馈续航时长在9-11小时之间。从宣传数据来看,A手机的平均续航更长,看似更值得购买,但查看用户评价后会发现,A手机有少数用户反馈续航能达到30小时(如全程待机状态),而大部分用户实际使用时的续航只有8-10小时;B手机则几乎没有极端续航情况,用户的实际使用续航时长集中在9-11小时之间。这种宣传与实际体验的差距,源于不同统计量对数据的反映存在差异。平均数、中位数以及多数用户的续航时长,对手机真实续航水平的反映程度不同,要通过这些数据准确判断手机续航的总体实际情况,需要掌握相关的统计方法。本节课将学习“总体集中趋势的估计”,帮助大家理清不同统计量的作用,揭开数据“中心”的神秘面纱,学会用科学的统计量看清数据背后的真相。
1. A手机平均续航12小时高于B手机的中位数续航10小时,为什么实际使用体验却没有宣传的那么好?
2. 平均数、中位数、多数用户的续航时长,这三种数据表现形式,哪种更能真实反映手机的总体续航水平?请说明理由。
3. 结合两款手机的续航数据,我们该如何运用“总体集中趋势的估计”,准确判断手机续航的真实情况?
导入新知2:班级零食消费的“隐藏规律”
最近班长对本班30名同学一周的零食消费金额(单位:元)进行了调查,收集到的数据简化呈现为:5, 8, 10, 10, 10, 12, 15, ..., 20, ..., 50, 100。这些数据中,存在100元(可能是购买礼盒装零食)和50元的高消费情况,同时也有不少同学一周零食消费仅为5-10元,数据分布不均匀且包含极端值。我们在分析这些数据时,会面临如何判断班级同学一周零食消费“普遍水平”、极端消费是否会影响“普遍水平”判断、给学校小卖部提价格建议该参考什么数据等问题。这些问题都指向数据的“集中趋势”,平均数、中位数、众数是刻画这种“中心水平”的关键统计量。但面对有极端值、分布不均匀的数据,需选择合适的统计量才能准确估计总体情况,同时当仅拿到整理后的消费金额频率分布直方图时,也需要掌握对应的统计量计算方法。本节课将一起探索总体集中趋势的估计方法,帮助大家学会用数据说话,解决生活中的实际问题。
1. 本班30名同学一周的零食消费数据中,存在极端值和分布不均匀的情况,我们该如何判断同学们零食消费的“普遍水平”?这个“普遍水平”是否是大多数人都能接受的金额?
2. 数据中的极端消费(50元、100元)会影响我们对班级零食消费“普遍水平”的判断吗?为什么?
4. 若要给学校小卖部提建议,推荐适合同学们的零食价格区间,该用哪个统计量作为参考更合理?仅拿到频率分布直方图时,又该如何计算相关统计量?
为了了解总体的情况,前面我们研究了如何通过样本的分布规律估计总体的分布规 律.但有时候,我们可能不太关心总体的分布规律,而更关注总体取值在某一方面的特 征.例如,对于某县今年小麦的收成情况,我们可能会更关注该县今年小麦的总产量或平 均每公顷的产量,而不是产量的分布;对于一个国家国民的身高情况,我们可能会更关注 身高的平均数或中位数,而不是身高的分布;等等.
在初中的学习中我们已经了解到,平均数、中位数和众数等都是刻画“中心位置”的 量,它们从不同角度刻画了一组数据的集中趋势.下面我们通过具体实例进一步了解这些 量的意义,探究它们之间的联系与区别,并根据样本的集中趋势估计总体的集中趋势.
例4利用9.2.1节中100户居民用户的月均用水量的调査数据,计算样本数据的平均数和中位数,并据此估计全市居民用户月均用水量的平均数和中位数.假设某个居民小区有 2 000户,你能估计该小 区的月用水总量吗?
【变式】已知一组数据1,2,,,5,8的平均数和中位数均为4,其中,在去掉其中的一个最大数后,该组数据一定不变的是( )
A.平均数 B.众数 C.中位数 D.标准差
思考
小明用统计软件计算了 100户居民用水量的平均数和中位数.但在录入数据时, 不小心把一个数据7.7录成了77.请计算录入数据的平均数和中位数,并与真实的样本平均数和中位数作比较.哪个量的值变化更大?你能解释其中的原因吗
通过简单计算可以发现,平均数由原来的8. 79 t变为9. 483 t,中位数没有变化,还 是6.6t.
这是因为样本平均数与每一个样本数据有关,样本中的任何一个数据的改变都 会引起平均数的改变;但中位数只利用了样本数据中间位置的一个或两个值,并未利用其他数据,所以不是任何一个样本数据的改变都会引起中位数的改变.因此,与中位数比 较,平均数反映出样本数据中的更多信息,对样本中的极端值更加敏感.
平均数和中位数都描述了数据的集中趋势,它们的大小关系和数据分布的形态有关.在图9.2-8的三种分布形态中.平均数和中位数的大小存在什么关系?
探究
一般来说,对一个单峰的频率分布直方图来说,如果直方图的形状是对称的(图9. 2-8(1)),那么平均数和中位数应该大体上差不多;如果直方图在右边“拖尾"(图9. 2-8(2)),那么平均数大于中位数;如果直方图在左边“拖尾”(图9.2-8C3)),那么平均数小于中位数.也就是说,和中位数相比,平均数总是在“长尾巴”那边.
例5某学校要定制高一年级的校服,学生根据厂家提供的参考身高选择校服规格. 据统计,高一年级女生需要不同规格校服的频数如表9. 2-5所示.
表 9.2-5
校服规格
155
160
165
170
175
合计
频数
39
64
167
90
26
386
如果用一个量来代表该校高一年级女生所需校服的规格,那么在中位数、平均数和众数中,哪个量比较合适?试讨论用表9.2-5中的数据估计全国高一年级女生校服规格的合理性.
分析:虽然校服规格是用数字表示的,但它们事实上是几种不同的类别.对于这样的分类数据,用众数作为这组数据的代表比较合适.
【变式】在一次中学生田径运动会上,参加男子跳高的17名运动员的成绩如下:
成绩/m
1.50
1.60
1.65
1.70
1.75
1.80
1.85
1.90
人数
2
3
2
3
4
1
1
1
分别求这些运动员的成绩的众数、中位数、平均数(保留到小数点后两位),并分析这些数据的含义.
众数只利用了出现次数最多的那个值的信息.众数只能告诉我们它比其他值出现的次 数多,但并未告诉我们它比别的数值多的程度.因此,众数只能传递数据中的信息的很少 一部分,对极端值也不敏感.
一般地,对数值型数据(如用水量、身高、收入、产量等)集中趋势的描述,可以用平均数、中位数;而对分类型数据(如校服规格、性别、产品质量等级等)集中趋势的描述,可以用众数.
样本的平均数、中位数和众数可以分别作为总体的平均数、中位数和众数的估 计,但在某些情况下我们无法获知原始的样本数据.例如,我们在报纸、网络上获得 的往往是已经整理好的统计表或统计图.这时该如何估计样本的平均数、中位数和众数?你能以图9.2-1中频率分布直方图提供的信息为例,给出估计方法吗?
探究
在频率分布直方图中,我们无法知道每个组内的数据是如何分布的.此时,通常假设它们在组内均匀分布.这样就可以获得样本的平均数、中位数和众数的近似估计,进而估计总体的平均数、中位数和众数.
因为样本平均数可以表示为数据与它的频率的乘积之和,所以在频率分布直方图中, 样本平均数可以用每个小矩形底边中点的横坐标与小矩形的面积的乘积之和近似代替.如图9.2-10所示,可以测出图中每个小矩形的高度,于是平均数的近似值为
这个结果与根据原始数据计算的样本平均数8.79相差不大.
根据中位数的意义,在样本中,有50%的个体小于或等于中位数,也有50%的个体大于或等于中位数.因此,在频率分布直方图中,中位数左边和右边的直方图的面积应该相等.由于
,.
因此中位数落在区间[4.2, 7. 2)内.设中位数为z,由
,
得到.因此,中位数约为6.71,如图9.2-11所示.这个结果与根据原始数据求得的中位数6.6相差不大.
图 9.2-11
在频率分布直方图9. 2-1中,月均用水量在区间[4.2, 7. 2)内的居民最多,可以将这个区间的中点5.7作为众数的估计值,如图9.2-12所示.众数常用在描述分类型数据中,在这个实际问题中,众数“5.7”让我们知道月均用水量在区间[4.2, 7.2)内的居 民用户最多.这个信息具有实际意义.
图 9.2-12
以上我们讨论了平均数、中位数和众数等特征量在刻画一组数据的集中趋势时的各自特点,并研究了用样本的特征量估计总体的特征量的方法.需要注意的是,这些特征量有时也会被利用而产生误导.例如,假设你到人力市场去找工作,有一个企业老板告诉你,“我们企业员工的年平均收入是20万元”,你该如何理解这句话?
这句话是真实的,但它可能描述的是差异巨大的实际情况.例如,可能这个企业的工资水平普遍较高,也就是员工年收入的中位数、众数与平均数差不多;也可能是绝大多数 员工的年收入较低(如大多数是5万元左右),而少数员工的年收入很高,甚至达到100 万元,在这种情况下年收入的平均数就比中位数大得多.尽管在后一种情况下,用中位数 或众数比用平均数更合理些,但这个企业的老板为了招揽员工,却用了平均数.
所以,我们要强调“用数据说话",但同时又要防止被数据误导,这就需要掌握更多的统计知识和方法.
1.(25-26高三上·河南商丘·期末)数据3,4,5,6,7,8,9的中位数是( )
A.7 B.6 C.5.5 D.5
2.(25-26高三上·重庆沙坪坝·月考)已知四个正整数满足,且 的平均数和中位数都为5,则可能的取值情况总数是( )
A.7 B.9 C.10 D.12
3.(2026高二上·云南·学业考试)某校为纪念抗日战争胜利80周年举行了演讲比赛,8位评委对甲同学的演讲评分(单位:分)如下表:
评委1
评委2
评委3
评委4
评委5
评委6
评委7
评委8
7.5
7.8
7.8
8.0
8.0
8.2
8.2
9.9
将8位评委的评分去掉一个最低分和一个最高分之后,剩下6位评委评分的平均数为甲同学的最终得分,则甲同学的最终得分为( )
A.8.1 B.8.0 C.7.9 D.7.8
4.(2025高二上·贵州·学业考试)数据1,2,2,3,3,3,4,4的众数为( )
A.1 B.2 C.3 D.4
5.(23-24高二上·上海虹口·期中)下列说法错误的是( )
A.一组数据的平均数一定大于这组数据中的每个数据
B.在统计里,把所需考察对象的全体叫作总体
C.平均数、众数与中位数从不同的角度描述了一组数据的集中趋势
D.众数是一组数据中出现次数最多的数
6.(24-25高一下·山东泰安·月考)如图,下列频率分布直方图显示了三种不同的分布形态.图(1)称对称形态,图(2)称不规则形态,图(3)称“右拖尾”形态,根据图形作出以下判断,正确的是( )
A.图(1):平均数>中位数=众数 B.图(2):众数>平均数
C.图(3):众数<中位数<平均数 D.图(3):众数<平均数<中位数
7.(25-26高三上·江苏徐州·月考)已知一组数据为,则“”是“这组数据的中位数为4”的( )
A.必要不充分条件 B.充分不必要条件
C.充要条件 D.既不充分又不必要条件
8.(2025·云南·模拟预测)某地区对100名新入职教师技能测试的成绩进行了分析,成绩都在区间内,绘制频率分布直方图如图.则下列结论中不正确的是( )
A.成绩在的频数为10 B.所有小矩形面积之和为1
C.成绩中位数在区间内 D.成绩平均数在区间内
9.(2026·四川攀枝花·一模)某校300名学生参加国学知识竞赛,随机抽取了40名学生的竞赛成绩(单位:分),成绩的频率分布直方图如图所示,则下列说法中正确的是( )
A.a的值为
B.这40名学生竞赛成绩的平均数为75
C.这40名学生竞赛成绩的众数大于其平均数
D.这40名学生竞赛成绩的第80百分位数约为
10.(24-25高一下·河南郑州·期末)平均数、中位数和众数都是刻画一组数据的集中趋势的信息,它们的大小关系和数据分布的形态有关.在如图的分布形态中,分别对应这组数据的平均数、中位数和众数,则下列关系正确的是( )
A. B. C. D.
1.(25-26高三上·四川内江·月考)某学校为培养学生创新精神和实践能力,组织了一次“科技小发明”竞赛活动,并对200位参赛学生的综合表现进行评分,评分的频率分布直方图如图,根据图中数据,下列说法错误的是( )
A.
B.评分在的人数约为20
C.估计评分的第25百分位数为65
D.估计评分的平均数为76.5
2.(2025·天津和平·二模)某人工智能公司为优化新开发的语言模型,在其模型试用人群中开展满意度问卷调查,满意度采用计分制(满分100分),统计满意度并绘制成如下频率分布直方图,图中,则下列结论不正确的是( )
A.
B.满意度计分的众数约为75分
C.满意度计分的平均分约为79分
D.满意度计分的第25百分位数约为70分
3.(2024·四川自贡·三模)如图是2024年青年歌手大奖赛中,七位评委为甲、乙两名选手打出的分数的茎叶图(其中m、n均为数字中的一个),在去掉一个最高分和一个最低分后,下列说法正确的是( )
A.甲选手得分的方差与n的值无关
B.甲选手得分的中位数一定不大于乙选手得分的中位数
C.甲选手得分的众数与m的值无关
D.甲选手得分的平均数一定小于乙选手得分的平均数
4.(2025·陕西西安·三模)样本数据的中位数是( )
A.8 B.8.5 C.9 D.9.5
1.知识清单:
(1)核心概念:平均数、中位数、众数的定义、区别与联系;
(2)估计方法:利用频率分布直方图估计众数、中位数、平均数的原理和步骤;
(3)实际应用:根据数据类型(数值型、分类型)和分布特点选择合适的统计量估计总体集中趋势。
2.方法归纳:
(1)计算方法:众数找出现次数最多的数据,中位数需先排序再找中间值,平均数需计算加权平均;
(2)估计思路:频率分布直方图中,众数看最高矩形,中位数分面积相等,平均数算加权和;
(3)选择原则:无极端值选平均数,有极端值选中位数,分类数据选众数,重复数据多选众数。
3.常见误区:
(1)计算中位数时未先对数据排序,导致结果错误;
(2)利用频率分布直方图估计中位数时,未正确计算累计频率和组内区间长度;
(3)忽略数据类型和极端值影响,盲目选择平均数作为集中趋势的代表;
(4)样本不具有代表性时,仍用其数字特征估计总体,导致结论不可靠。
4.知识拓展:
(1)除了平均数、中位数、众数,还有其他刻画集中趋势的统计量,如几何平均数、调和平均数等,适用于不同的数据场景;
(2)样本估计总体时,样本的代表性和容量会影响估计结果的准确性,实际应用中需注意样本的选取方法。
教材第 208 页第 题.
学科网(北京)股份有限公司
学科网(北京)股份有限公司
$
9.2.3 总体集中趋势的估计
导学案
1. 理解平均数、中位数、众数的概念及区别联系,能准确表述三者的统计含义,达到直观想象核心素养水平一的要求。
2. 掌握利用频率分布直方图估计总体众数、中位数和平均数的方法,能规范完成相关计算,达到数学运算核心素养水平一的要求。
3. 能结合实际问题,选取恰当的样本数字特征估计总体集中趋势,作出合理判断与决策,达到逻辑推理核心素养水平二的要求。
4. 体验从样本数据到总体估计的过程,感受统计思想的实用性,提升数据分析素养,增强用数据说话的意识。
教学重点:
1.平均数、中位数、众数的概念辨析及计算;
2. 利用频率分布直方图估计总体的众数、中位数和平均数;
3. 结合实际问题选择恰当的样本数字特征估计总体。
教学难点:
1. 频率分布直方图中中位数和平均数的估计原理与计算;
2. 根据数据类型和分布特点选择合适的统计量,解决实际决策问题;
3. 理解样本估计总体的合理性和局限性。
知识点一 众数、中位数、平均数
1.众数:一组数据中出现次数最多的数.
2.中位数:把一组数据按从小到大(或从大到小)的顺序排列,处在中间位置的数(或中间两个数的平均数)叫做这组数据的中位数.
3.平均数:如果n个数x1,x2,…,xn,那么=(x1+x2+…+xn)叫做这n个数的平均数.
知识点二 总体集中趋势的估计
1.平均数、中位数和众数等都是刻画“中心位置”的量,它们从不同角度刻画了一组数据的集中趋势.
2.一般地,对数值型数据(如用水量、身高、收入、产量等)集中趋势的描述,可以用平均数、中位数;而对分类型数据(如校服规格、性别、产品质量等级等)集中趋势的描述,可以用众数.
知识点三 频率分布直方图中平均数、中位数、众数的求法
1.样本平均数:可以用每个小矩形底边中点的横坐标与小矩形的面积的乘积之和近似代替.
2.在频率分布直方图中,中位数左边和右边的直方图的面积应该相等.
3.将最高小矩形所在的区间中点作为众数的估计值.
导入新知1:手机续航时长的“真相”大揭秘
现在同学们几乎都有自己的手机,购买手机时,续航能力是大家重点关注的因素之一。网上有两款热门手机的续航宣传信息:A手机宣传平均续航12小时,B手机宣传中位数续航10小时,且多数用户反馈续航时长在9-11小时之间。从宣传数据来看,A手机的平均续航更长,看似更值得购买,但查看用户评价后会发现,A手机有少数用户反馈续航能达到30小时(如全程待机状态),而大部分用户实际使用时的续航只有8-10小时;B手机则几乎没有极端续航情况,用户的实际使用续航时长集中在9-11小时之间。这种宣传与实际体验的差距,源于不同统计量对数据的反映存在差异。平均数、中位数以及多数用户的续航时长,对手机真实续航水平的反映程度不同,要通过这些数据准确判断手机续航的总体实际情况,需要掌握相关的统计方法。本节课将学习“总体集中趋势的估计”,帮助大家理清不同统计量的作用,揭开数据“中心”的神秘面纱,学会用科学的统计量看清数据背后的真相。
1. A手机平均续航12小时高于B手机的中位数续航10小时,为什么实际使用体验却没有宣传的那么好?
2. 平均数、中位数、多数用户的续航时长,这三种数据表现形式,哪种更能真实反映手机的总体续航水平?请说明理由。
3. 结合两款手机的续航数据,我们该如何运用“总体集中趋势的估计”,准确判断手机续航的真实情况?
设计意图
1. 贴近生活实际:手机续航是学生日常密切关注的话题,能快速引发学生的共鸣和参与兴趣,让抽象的统计概念与生活场景直接挂钩。
1. 直击核心矛盾:通过两款手机续航数据的矛盾点,自然引出平均数、中位数、众数的差异,精准指向本节课“统计量辨析”的核心内容。
1. 激发求知欲:设置“该选哪款手机”的实际决策问题,让学生感受到掌握统计量选择方法的必要性,主动想要探究不同统计量的适用场景。
1. 统领整节课:围绕“如何通过样本数据(用户反馈)估计总体(手机真实续航)的集中趋势”展开,贯穿“概念辨析—直方图估计—实际应用”的全流程,让学生明确本节课的学习目标是解决实际决策中的数据解读问题。
导入新知2:班级零食消费的“隐藏规律”
最近班长对本班30名同学一周的零食消费金额(单位:元)进行了调查,收集到的数据简化呈现为:5, 8, 10, 10, 10, 12, 15, ..., 20, ..., 50, 100。这些数据中,存在100元(可能是购买礼盒装零食)和50元的高消费情况,同时也有不少同学一周零食消费仅为5-10元,数据分布不均匀且包含极端值。我们在分析这些数据时,会面临如何判断班级同学一周零食消费“普遍水平”、极端消费是否会影响“普遍水平”判断、给学校小卖部提价格建议该参考什么数据等问题。这些问题都指向数据的“集中趋势”,平均数、中位数、众数是刻画这种“中心水平”的关键统计量。但面对有极端值、分布不均匀的数据,需选择合适的统计量才能准确估计总体情况,同时当仅拿到整理后的消费金额频率分布直方图时,也需要掌握对应的统计量计算方法。本节课将一起探索总体集中趋势的估计方法,帮助大家学会用数据说话,解决生活中的实际问题。
1. 本班30名同学一周的零食消费数据中,存在极端值和分布不均匀的情况,我们该如何判断同学们零食消费的“普遍水平”?这个“普遍水平”是否是大多数人都能接受的金额?
2. 数据中的极端消费(50元、100元)会影响我们对班级零食消费“普遍水平”的判断吗?为什么?
4. 若要给学校小卖部提建议,推荐适合同学们的零食价格区间,该用哪个统计量作为参考更合理?仅拿到频率分布直方图时,又该如何计算相关统计量?
设计意图
1. 场景本土化:以班级同学的零食消费为切入点,数据贴近学生日常生活,让学生感受到统计知识就在身边,而非遥远的理论。
1. 问题层层递进:从“找普遍水平”到“极端值影响”再到“实际建议参考”,逐步引导学生思考统计量的选择逻辑,自然统领“概念辨析—极端值影响—直方图估计—实际应用”的核心内容。
1. 激发探究欲:通过班级真实数据(或模拟真实数据)的矛盾点,让学生意识到仅凭“感觉”判断数据中心是不够的,需要科学的统计方法,从而主动求知。
1. 强化应用意识:引入“给小卖部提建议”的实际任务,让学生明确本节课的学习价值的是解决实际问题,而非单纯掌握公式计算,培养统计思维和应用能力。
为了了解总体的情况,前面我们研究了如何通过样本的分布规律估计总体的分布规 律.但有时候,我们可能不太关心总体的分布规律,而更关注总体取值在某一方面的特 征.例如,对于某县今年小麦的收成情况,我们可能会更关注该县今年小麦的总产量或平 均每公顷的产量,而不是产量的分布;对于一个国家国民的身高情况,我们可能会更关注 身高的平均数或中位数,而不是身高的分布;等等.
在初中的学习中我们已经了解到,平均数、中位数和众数等都是刻画“中心位置”的 量,它们从不同角度刻画了一组数据的集中趋势.下面我们通过具体实例进一步了解这些 量的意义,探究它们之间的联系与区别,并根据样本的集中趋势估计总体的集中趋势.
例4利用9.2.1节中100户居民用户的月均用水量的调査数据,计算样本数据的平均数和中位数,并据此估计全市居民用户月均用水量的平均数和中位数.
解: 根据9. 2.1节中100户居民用户月均用水量的数据,由样本平均数的定义,可得
即100户居民的月均用水量的平均数为8. 79 t.
将样本数据按从小到大排序,得第50个数和第51个数分别 为6. 4, 6.8,由中位数的定义,可得
假设某个居民小区有 2 000户,你能估计该小 区的月用水总量吗?
即100户居民的月均用水量的中位数是6.6 t.
因为数据是抽自全市居民户的简单随机样本,所以我们可以据此估计全市居民用户的月均用水量约为8.79 t,其中 位数约为6. 6 t.
【变式】已知一组数据1,2,,,5,8的平均数和中位数均为4,其中,在去掉其中的一个最大数后,该组数据一定不变的是( )
A.平均数 B.众数 C.中位数 D.标准差
【答案】B
【知识点】计算几个数据的极差、方差、标准差、众数、平均数、中位数的比较
【分析】由题设得或,分别求出数据变化前后的平均数、众数、中位数、标准差,再确定对应值是否发生变化.
【详解】由题意,,可得,又中位数为4,则或,
当时,众数为5,标准差为;当时,众数为4,标准差为;
∴去掉其中的一个最大数后,数据为1,2,,,5,
当,平均数,众数为5,中位数为3,标准差为;
当时,平均数,众数为4,中位数为4,标准差为;
综上,数据变化前后一定不变的是众数.
故选:B
众数、中位数和平均数的含义及体现
特征量
含义
在频率分布直方图中的体现
众数
出现次数最多的数据
取最高的小长方形底边中点的横坐标
中位数
将数据按从大到小或从小到大的顺序依次排列,处在最中间位置的一个数据(或最中间两个数据的平均数).
把频率分布直方图划分为左右两个面积相等的部分,分界线与x轴交点的横坐标
平均数
样本数据的算术平均数
每个小长方形的面积乘以小长方形底边中点的横坐标之和
思考
小明用统计软件计算了 100户居民用水量的平均数和中位数.但在录入数据时, 不小心把一个数据7.7录成了77.请计算录入数据的平均数和中位数,并与真实的样本平均数和中位数作比较.哪个量的值变化更大?你能解释其中的原因吗
通过简单计算可以发现,平均数由原来的8. 79 t变为9. 483 t,中位数没有变化,还 是6.6t.这是因为样本平均数与每一个样本数据有关,样本中的任何一个数据的改变都 会引起平均数的改变;但中位数只利用了样本数据中间位置的一个或两个值,并未利用其他数据,所以不是任何一个样本数据的改变都会引起中位数的改变.因此,与中位数比 较,平均数反映出样本数据中的更多信息,对样本中的极端值更加敏感.
平均数和中位数都描述了数据的集中趋势,它们的大小关系和数据分布的形态有关.在图9.2-8的三种分布形态中.平均数和中位数的大小存在什么关系?
探究
一般来说,对一个单峰的频率分布直方图来说,如果直方图的形状是对称的(图9. 2-8(1)),那么平均数和中位数应该大体上差不多;如果直方图在右边“拖尾"(图9. 2-8(2)),那么平均数大于中位数;如果直方图在左边“拖尾”(图9.2-8C3)),那么平均数小于中位数.也就是说,和中位数相比,平均数总是在“长尾巴”那边.
例5某学校要定制高一年级的校服,学生根据厂家提供的参考身高选择校服规格. 据统计,高一年级女生需要不同规格校服的频数如表9. 2-5所示.
表 9.2-5
校服规格
155
160
165
170
175
合计
频数
39
64
167
90
26
386
如果用一个量来代表该校高一年级女生所需校服的规格,那么在中位数、平均数和众数中,哪个量比较合适?试讨论用表9.2-5中的数据估计全国高一年级女生校服规格的合理性.
分析:虽然校服规格是用数字表示的,但它们事实上是几种不同的类别.对于这样的分类数据,用众数作为这组数据的代表比较合适.
解:为了更直观地观察数据的特征,我们用条形图来表示表中的数据(图9.2-9). 可以发现,选择校服规格为“165”的女生的频数最高,所以用众数165作为该校高一年 级女生校服的规格比较合适.
由于全国各地的高一年级女生的身高存在一定的差异,所以用一个学校的数据估计全国高一年级女生的校服规格不合理.
【变式】在一次中学生田径运动会上,参加男子跳高的17名运动员的成绩如下:
成绩/m
1.50
1.60
1.65
1.70
1.75
1.80
1.85
1.90
人数
2
3
2
3
4
1
1
1
分别求这些运动员的成绩的众数、中位数、平均数(保留到小数点后两位),并分析这些数据的含义.
【答案】见解析
【知识点】用中位数的代表意义解决实际问题、计算几个数的中位数、用众数的代表意义解决实际问题、计算几个数的众数
【分析】按照平均数的定义:几个数相加求和,再除以总个数;众数即数据中出现次数最多的;中位数即最中间的一个或者两个数;按照以上定义得到各个数据即可.
【详解】在17个数据中,1.75出现了4次,次数最多,∴众数是1.75 m.
将数据按从小到大的顺序排列,易知中位数是1.70 m.
平均数=×(1.50×2+1.60×3+1.65×2+…+1.90×1)=≈1.69(m).
∴17名运动员的成绩的众数、中位数、平均数依次是1.75 m,1.70 m,1.69 m.
众数是1.75 m,说明跳1.75 m的人数最多;
中位数是1.70 m,说明1.70 m以下和1.70 m以上的人数相等;
平均数是1.69 m,说明所有参赛运动员的平均成绩是1.69 m.
【点睛】这个题目考查了中位数,众数,平均数的概念和计算,较为基础,众数即出现次数最多的数据,中位数即最中间的数据,平均数即将所有数据加到一起,除以数据个数.
【感悟提升】 1.众数、中位数、平均数的计算方法
(1)众数是出现次数最多的数;
(2)计算中位数时,可先将这组数据按从小到大或从大到小的顺序排列,再根据相关数据的总数是奇数还是偶数而定;
(3)平均数一般是根据公式来计算.
2.众数、中位数、平均数的意义
(1)样本的众数、中位数和平均数常用来表示样本数据的“中心值”,其中众数和中位数容易计算,不受少数几个极端值的影响,但只能表达样本数据中的少量信息,平均数代表了数据更多的信息,但受样本中每个数据的影响,越极端的数据对平均数的影响也越大.
(2)当一组数据中有不少数据重复出现时,其众数往往更能反映问题,当一组数据中个别数据较大或较小时,可用中位数描述其集中趋势.
众数只利用了出现次数最多的那个值的信息.众数只能告诉我们它比其他值出现的次 数多,但并未告诉我们它比别的数值多的程度.因此,众数只能传递数据中的信息的很少 一部分,对极端值也不敏感.
一般地,对数值型数据(如用水量、身高、收入、产量等)集中趋势的描述,可以用平均数、中位数;而对分类型数据(如校服规格、性别、产品质量等级等)集中趋势的描述,可以用众数.
样本的平均数、中位数和众数可以分别作为总体的平均数、中位数和众数的估 计,但在某些情况下我们无法获知原始的样本数据.例如,我们在报纸、网络上获得 的往往是已经整理好的统计表或统计图.这时该如何估计样本的平均数、中位数和众数?你能以图9.2-1中频率分布直方图提供的信息为例,给出估计方法吗?
探究
在频率分布直方图中,我们无法知道每个组内的数据是如何分布的.此时,通常假设它们在组内均匀分布.这样就可以获得样本的平均数、中位数和众数的近似估计,进而估计总体的平均数、中位数和众数.
因为样本平均数可以表示为数据与它的频率的乘积之和,所以在频率分布直方图中, 样本平均数可以用每个小矩形底边中点的横坐标与小矩形的面积的乘积之和近似代替.如图9.2-10所示,可以测出图中每个小矩形的高度,于是平均数的近似值为
这个结果与根据原始数据计算的样本平均数8.79相差不大.
根据中位数的意义,在样本中,有50%的个体小于或等于中位数,也有50%的个体大于或等于中位数.因此,在频率分布直方图中,中位数左边和右边的直方图的面积应该相等.由于
,.
因此中位数落在区间[4.2, 7. 2)内.设中位数为z,由
,
得到.因此,中位数约为6.71,如图9.2-11所示.这个结果与根据原始数据求得的中位数6.6相差不大.
图 9.2-11
在频率分布直方图9. 2-1中,月均用水量在区间[4.2, 7. 2)内的居民最多,可以将这个区间的中点5.7作为众数的估计值,如图9.2-12所示.众数常用在描述分类型数据中,在这个实际问题中,众数“5.7”让我们知道月均用水量在区间[4.2, 7.2)内的居 民用户最多.这个信息具有实际意义.
图 9.2-12
以上我们讨论了平均数、中位数和众数等特征量在刻画一组数据的集中趋势时的各自特点,并研究了用样本的特征量估计总体的特征量的方法.需要注意的是,这些特征量有时也会被利用而产生误导.例如,假设你到人力市场去找工作,有一个企业老板告诉你,“我们企业员工的年平均收入是20万元”,你该如何理解这句话?
这句话是真实的,但它可能描述的是差异巨大的实际情况.例如,可能这个企业的工资水平普遍较高,也就是员工年收入的中位数、众数与平均数差不多;也可能是绝大多数 员工的年收入较低(如大多数是5万元左右),而少数员工的年收入很高,甚至达到100 万元,在这种情况下年收入的平均数就比中位数大得多.尽管在后一种情况下,用中位数 或众数比用平均数更合理些,但这个企业的老板为了招揽员工,却用了平均数.
所以,我们要强调“用数据说话",但同时又要防止被数据误导,这就需要掌握更多的统计知识和方法.
1.(25-26高三上·河南商丘·期末)数据3,4,5,6,7,8,9的中位数是( )
A.7 B.6 C.5.5 D.5
【答案】B
【知识点】计算几个数的中位数
【分析】根据中位数的定义判断即可.
【详解】数据3,4,5,6,7,8,9的中位数是.
故选:B.
2.(25-26高三上·重庆沙坪坝·月考)已知四个正整数满足,且 的平均数和中位数都为5,则可能的取值情况总数是( )
A.7 B.9 C.10 D.12
【答案】C
【知识点】计算几个数的中位数、计算几个数的平均数
【分析】由平均数和中位数的定义可得,再列举情况即可求解.
【详解】由题意,,
则,且,
则可能的取值情况为:;;;;;
;;;;,共10种情况.
故选:C
3.(2026高二上·云南·学业考试)某校为纪念抗日战争胜利80周年举行了演讲比赛,8位评委对甲同学的演讲评分(单位:分)如下表:
评委1
评委2
评委3
评委4
评委5
评委6
评委7
评委8
7.5
7.8
7.8
8.0
8.0
8.2
8.2
9.9
将8位评委的评分去掉一个最低分和一个最高分之后,剩下6位评委评分的平均数为甲同学的最终得分,则甲同学的最终得分为( )
A.8.1 B.8.0 C.7.9 D.7.8
【答案】B
【知识点】计算几个数的平均数
【分析】首先去掉最低分和最高分,然后计算平均分.
【详解】在8位评委的评分中,最低分为7.5分,最高分为9.9分,去掉这两个分数后,
剩余的6个评分是:7.8、7.8、8.0、8.0、8.2、8.2,
.
故选:B
4.(2025高二上·贵州·学业考试)数据1,2,2,3,3,3,4,4的众数为( )
A.1 B.2 C.3 D.4
【答案】C
【知识点】计算几个数的众数
【分析】根据众数的定义判断即可.
【详解】3在该组数据中出现的次数最多,所以众数为3.
故选:C.
5.(23-24高二上·上海虹口·期中)下列说法错误的是( )
A.一组数据的平均数一定大于这组数据中的每个数据
B.在统计里,把所需考察对象的全体叫作总体
C.平均数、众数与中位数从不同的角度描述了一组数据的集中趋势
D.众数是一组数据中出现次数最多的数
【答案】A
【知识点】总体与样本、用众数的代表意义解决实际问题、计算几个数的平均数、众数、平均数、中位数的比较
【分析】A选项,可举出反例;B选项,根据总体的概念进行判断;CD选项,根据平均数,众数和中位数的概念进行判断.
【详解】A选项,例如一组数据为,平均数也为1,
故一组数据的平均数不一定大于这组数据中的每个数据,A错误;
B选项,在统计里,把所需考察对象的全体叫作总体,B正确;
C选项,平均数、众数与中位数从不同的角度描述了一组数据的集中趋势,C正确;
D选项,众数是一组数据中出现次数最多的数,D正确.
故选:A
6.(24-25高一下·山东泰安·月考)如图,下列频率分布直方图显示了三种不同的分布形态.图(1)称对称形态,图(2)称不规则形态,图(3)称“右拖尾”形态,根据图形作出以下判断,正确的是( )
A.图(1):平均数>中位数=众数 B.图(2):众数>平均数
C.图(3):众数<中位数<平均数 D.图(3):众数<平均数<中位数
【答案】C
【知识点】众数、平均数、中位数的比较
【分析】在频率分布直方图中,我们根据图形的形态特点来分析这三个统计量的大小关系。对于对称形态,平均数、中位数和众数大致相等;对于不规则形态,需根据图形具体分析;对于“右拖尾”形态,由于右侧有较大的极端值,会拉高平均数,从而使得众数、中位数和平均数有特定的大小关系。
【详解】A中应有平均数=中位数=众数;
B中众数<平均数;
C,D中,平均数易受极端值的影响,与中位数相比,平均数更接近“拖尾”的一边,所以平均数>中位数,而最高峰偏左,因此众数最小.
故选:C.
7.(25-26高三上·江苏徐州·月考)已知一组数据为,则“”是“这组数据的中位数为4”的( )
A.必要不充分条件 B.充分不必要条件
C.充要条件 D.既不充分又不必要条件
【答案】B
【知识点】判断命题的充分不必要条件、计算几个数的中位数
【分析】依次分析充分性和必要性即可得解.
【详解】“”,则题中数据从小到大排列为或,
中位数均为4,充分性成立,
“这组数据的中位数为4”,若,仍满足这组数据的中位数为4,必要性不成立,
所以“”是“这组数据的中位数为4”的充分不必要条件.
故选:B.
8.(2025·云南·模拟预测)某地区对100名新入职教师技能测试的成绩进行了分析,成绩都在区间内,绘制频率分布直方图如图.则下列结论中不正确的是( )
A.成绩在的频数为10 B.所有小矩形面积之和为1
C.成绩中位数在区间内 D.成绩平均数在区间内
【答案】D
【知识点】由频率分布直方图计算频率、频数、样本容量、总体容量、由频率分布直方图估计中位数、由频率分布直方图估计平均数
【分析】根据频率分布直方图的小矩形的面积之和为1先求出,根据频率分布直方图性质直接求每个选项即可.
【详解】根据频率分布直方图可知:,可得.所以B正确;
成绩在的频数为:,故A正确;
设成绩中位数为,
,
易得中位数在区间内,故C正确;
设成绩平均数为,
而,
平均数在区间内,故D错误.
故选:D.
9.(2026·四川攀枝花·一模)某校300名学生参加国学知识竞赛,随机抽取了40名学生的竞赛成绩(单位:分),成绩的频率分布直方图如图所示,则下列说法中正确的是( )
A.a的值为
B.这40名学生竞赛成绩的平均数为75
C.这40名学生竞赛成绩的众数大于其平均数
D.这40名学生竞赛成绩的第80百分位数约为
【答案】D
【知识点】由频率分布直方图估计平均数、总体百分位数的估计、根据频率分布直方图计算众数
【分析】利用所有小矩形的面积之和为,可求出,由此利用频率分布直方图结合选项即可逐一求解.
【详解】,故A错误
设这40名学生竞赛成绩的平均数为,则,故B错误
这40名学生竞赛成绩的众数为,,故C错误;
设这40名学生竞赛成绩的第80百分位数为,则,解得,故D正确.
故选:D
10.(24-25高一下·河南郑州·期末)平均数、中位数和众数都是刻画一组数据的集中趋势的信息,它们的大小关系和数据分布的形态有关.在如图的分布形态中,分别对应这组数据的平均数、中位数和众数,则下列关系正确的是( )
A. B. C. D.
【答案】D
【知识点】由频率分布直方图估计中位数、由频率分布直方图估计平均数、根据频率分布直方图计算众数
【分析】由频率分布直方图估计中位数、由频率分布直方图估计平均数、根据频率分布直方图计算众数
【详解】根据直方图矩形高低以及数据的分布趋势判断,可得出结论:
由数据分布图知,众数是最高矩形下底边的中点横坐标,因此众数为左起第二个矩形下底边的中点值,
直线左右两边矩形面积相等,而直线右边矩形面积大于左边矩形面积,则,
又数据分布图右拖尾,则平均数大于中位数,即,
因此有.
故选:D.
1.(25-26高三上·四川内江·月考)某学校为培养学生创新精神和实践能力,组织了一次“科技小发明”竞赛活动,并对200位参赛学生的综合表现进行评分,评分的频率分布直方图如图,根据图中数据,下列说法错误的是( )
A.
B.评分在的人数约为20
C.估计评分的第25百分位数为65
D.估计评分的平均数为76.5
【答案】C
【知识点】由频率分布直方图计算频率、频数、样本容量、总体容量、由频率分布直方图估计平均数、总体百分位数的估计
【分析】利用频率和为1求出判断A;利用频率求出频数判断B;求出下四分位数判断C;求出评分的平均数判断D.
【详解】对于A,由,得,故A正确;
对于B,评分在的频率为,评分在的人数约为,故B正确;
对于C,评分在的频率为,评分在的频率为,
则评分的第25百分位数在内,由,解得,故C错误;
对于D,评分的平均数,故D正确.
故选:C.
2.(2025·天津和平·二模)某人工智能公司为优化新开发的语言模型,在其模型试用人群中开展满意度问卷调查,满意度采用计分制(满分100分),统计满意度并绘制成如下频率分布直方图,图中,则下列结论不正确的是( )
A.
B.满意度计分的众数约为75分
C.满意度计分的平均分约为79分
D.满意度计分的第25百分位数约为70分
【答案】C
【知识点】补全频率分布直方图、由频率分布直方图估计平均数、总体百分位数的估计、根据频率分布直方图计算众数
【分析】由频率分布直方图的面积和为1可得A正确;由频率分布直方图计算众数,平均数,第25百分位数可得B正确,C错误,D正确.
【详解】对于A,由频率分布直方图可得,又,
解得,,故A正确;
对于B,满意度计分的众数为最高矩形底边中点横坐标75分,故B正确;
对于C,满意度计分的平均分约为,故C错误;
对于D,前两组的频率之和为,所以满意度计分的第25百分位数约为70分,故D正确.
故选:C.
3.(2024·四川自贡·三模)如图是2024年青年歌手大奖赛中,七位评委为甲、乙两名选手打出的分数的茎叶图(其中m、n均为数字中的一个),在去掉一个最高分和一个最低分后,下列说法正确的是( )
A.甲选手得分的方差与n的值无关
B.甲选手得分的中位数一定不大于乙选手得分的中位数
C.甲选手得分的众数与m的值无关
D.甲选手得分的平均数一定小于乙选手得分的平均数
【答案】A
【知识点】由茎叶图计算众数、由茎叶图计算中位数、由茎叶图计算平均数
【分析】去掉一个最高分和一个最低分后,根据茎叶图可以分别求出甲选手和乙选手得分的平均数、中位数、众数的值或表达式,再逐项判断可得答案.
【详解】对于A,甲选手去掉一个最高分和一个最低分后,只有,
所以甲选手得分的方差与n的值无关,故A正确;
对于B,甲选手去掉一个最高分和一个最低分,
乙选手去掉一个最高分和一个最低分后,甲选手得分的中位数是,
乙选手得分的中位数是,故B错误;
对于C,甲选手去掉一个最高分和一个最低分后,
当,甲选手得分的众数是,当,甲选手得分的众数是和,故C错误;
对于D,甲选手去掉一个最高分和一个最低分后,甲选手得分的平均数是
,乙选手去掉一个最高分和一个最低分后,
乙选手得分的平均数是,因为其中m为数字中的一个,
所以,故D错误.
故选:A.
4.(2025·陕西西安·三模)样本数据的中位数是( )
A.8 B.8.5 C.9 D.9.5
【答案】B
【知识点】计算几个数的中位数
【分析】从小到大排列后,取第四、五个数的平均数可得.
【详解】从小到大排列为,
共有8个数,所以中位数为.
故选:B.
1.知识清单:
(1)核心概念:平均数、中位数、众数的定义、区别与联系;
(2)估计方法:利用频率分布直方图估计众数、中位数、平均数的原理和步骤;
(3)实际应用:根据数据类型(数值型、分类型)和分布特点选择合适的统计量估计总体集中趋势。
2.方法归纳:
(1)计算方法:众数找出现次数最多的数据,中位数需先排序再找中间值,平均数需计算加权平均;
(2)估计思路:频率分布直方图中,众数看最高矩形,中位数分面积相等,平均数算加权和;
(3)选择原则:无极端值选平均数,有极端值选中位数,分类数据选众数,重复数据多选众数。
3.常见误区:
(1)计算中位数时未先对数据排序,导致结果错误;
(2)利用频率分布直方图估计中位数时,未正确计算累计频率和组内区间长度;
(3)忽略数据类型和极端值影响,盲目选择平均数作为集中趋势的代表;
(4)样本不具有代表性时,仍用其数字特征估计总体,导致结论不可靠。
4.知识拓展:
(1)除了平均数、中位数、众数,还有其他刻画集中趋势的统计量,如几何平均数、调和平均数等,适用于不同的数据场景;
(2)样本估计总体时,样本的代表性和容量会影响估计结果的准确性,实际应用中需注意样本的选取方法。
教材第 208 页第 题.
学科网(北京)股份有限公司
学科网(北京)股份有限公司
$