内容正文:
9.2.2 总体集中趋势的估计
授课人:张发松 学 校:昆明市呈贡区第一中学
1
学习目标
1.结合具体实例,理解样本平均数、中位数、众数的统计含义,掌握三类集中趋势统计量的求解方法,能用样本集中趋势估计总体集中趋势.
2.掌握利用频率分布直方图近似估计众数、中位数、平均数的方法,理解直方图估计的近似性与统计合理性.
3. 辨析平均数、中位数、众数的差异与适用场景,理解三者对极端值的敏感程度不同,能根据数据特征合理选择统计量分析数据、解决实际问题.
4.深化“用样本估计总体”的统计大概念,发展数据分析、数学运算、逻辑推理核心素养,形成科学的数据解读与决策思维。.
请注意:
1.正文标题为:黑体,30号字;
2.正文内容为:华文楷体,尽量不小于24号,特殊辅助性文字不低于18;根据文字量可适当调整。内容文字一行一般不能超过28个字,单页文字一般不能超过8行。
3.拍摄版本呈现内容务必与上传版本呈现的内容完全一致。
英文
1.正文标题为:以Times New Roman为主,可搭配使用Arial。字号为32—36号,特别强调可以用40号。
2.正文内容为:以Times New Roman为主,可搭配使用Arial。字号为24—28号,特别强调可用32号。
3.英文每行一般不能超过15个单词;单页文字一般不能超过8行。
2
内容解析
核心问题:“数据整体集中在哪里、主流水平如何”?如果我只给你们一张频率分布直方图,把原始数据藏起来,你们还能不能找到这堆数据的‘中心’?你们找到的那个‘中心’,我敢不敢放心地用它来代表全体?。从“数据形态刻画”走向“数据特征量化”的核心进阶课.
第一层——三种“中心”的数学定义及其内在差异。
平均数基于所有数据的数值大小计算,是数值的“重心”;
中位数基于所有数据的排序位置确定,是位置的“中点”;
众数基于数据出现频数确定,是频数的“顶峰”。
三者的数学定义分别对应了数据的三种基本属性——数值大小、顺序位置和出现频次。这三种定义方式的内在差异决定了它们对数据特征的敏感度完全不同:
平均数利用全部数据信息、对极端值高度敏感,
中位数反映数据中间水平、抗极端值干扰;
众数反映数据最密集的局部特征、不受极端值影响(可能不唯一甚至不存在)。
请注意:
1.正文标题为:黑体,30号字;
2.正文内容为:华文楷体,尽量不小于24号,特殊辅助性文字不低于18;根据文字量可适当调整。内容文字一行一般不能超过28个字,单页文字一般不能超过8行。
3.拍摄版本呈现内容务必与上传版本呈现的内容完全一致。
英文
1.正文标题为:以Times New Roman为主,可搭配使用Arial。字号为32—36号,特别强调可以用40号。
2.正文内容为:以Times New Roman为主,可搭配使用Arial。字号为24—28号,特别强调可用32号。
3.英文每行一般不能超过15个单词;单页文字一般不能超过8行。
3
内容解析
第二层——集中趋势度量的选择本质上是“代表性”标准的取舍。 什么是数据的“中心”?这个问题没有一个唯一正确的答案。不同的“中心”定义背后,是对“用什么代表一组数据”这一问题的不同回答。平均数用“总和均分”的逻辑定义代表性——每个个体贡献相等的数值份额;中位数用“半数分界”的逻辑定义代表性——一半的数据在它之下、一半在它之上;众数用“最多出现”的逻辑定义代表性——这是最可能观测到的值。这三种代表性标准各有其适用场景和局限,选择哪一种,取决于我们想从数据中“看到什么”。
第三层——统计量选择的背后是“数据价值观”的体现。 这一层次超越了数学操作,进入数据素养的核心:面对同一组数据,选择不同的集中趋势度量会得出完全不同的结论。薪酬报告中用中位数还是平均数,传递的是完全不同的信息;鞋厂最关心众数还是平均数,决定了完全不同的生产策略。统计量不是中立的计算工具,它们分别放大了数据的不同侧面、屏蔽了其他侧面。学会根据问题的实际背景和决策目标选择恰当的统计量,并意识到选择本身就已经是一种“用数据说话”的方式——这是数据分析素养的高阶体现。
请注意:
1.正文标题为:黑体,30号字;
2.正文内容为:华文楷体,尽量不小于24号,特殊辅助性文字不低于18;根据文字量可适当调整。内容文字一行一般不能超过28个字,单页文字一般不能超过8行。
3.拍摄版本呈现内容务必与上传版本呈现的内容完全一致。
英文
1.正文标题为:以Times New Roman为主,可搭配使用Arial。字号为32—36号,特别强调可以用40号。
2.正文内容为:以Times New Roman为主,可搭配使用Arial。字号为24—28号,特别强调可用32号。
3.英文每行一般不能超过15个单词;单页文字一般不能超过8行。
4
情景1:某科技公司员工年薪数据(共15人):
实习生(2人):4万元、4万元
普通员工(8人):8万元、8万元、9万元、9万元、10万元、10万元、11万元、12万元
部门经理(3人):25万元、28万元、30万元
副总经理(1人):60万元
总经理(1人):200万元
【环节一】情境导入——你的“工资”被平均了吗?
问题1:如果你是这家公司的HR,招聘时你会对外宣传“公司平均年薪是多少”?
问题2:如果你是工会代表,在谈判中你会强调哪个数字?
问题3:如果你是媒体记者,要客观报道这家公司的薪酬水平,你会用什么数字?
平均数(约28.53万元)
中位数(10万元)
平均数(约28.53万元)
中位数(10万元)
中数 4万、8万、9万、10万
思考:为什么同一个数据会有三个完全不同的“中心”?哪个是“正确”的?
情景1:某科技公司员工年薪数据(共15人):
实习生(2人):4万元、4万元
普通员工(8人):8万元、8万元、9万元、9万元、10万元、10万元、11万元、12万元
部门经理(3人):25万元、28万元、30万元
副总经理(1人):60万元
总经理(1人):200万元
众数:一组数据中出现次数最多的数据,反映数据最密集的主流水平;
中位数:排序后位于中间位置的数据,反映数据中等水平、中间位次;
平均数:所有数据的算术平均值,利用全部数据信息,反映数据整体平均水平。
面对同一组数据,有三种不同的“中心”。它们哪个“对”?哪个“更好”?
——关键不在于“对错”,而在于我们想从数据中看到什么、想让数据为谁“说话”。
【环节一】情境导入——你的“工资”被平均了吗?
名称 优点 缺点
众数 体现了样本数据的最大集中点 众数只能传递数据中的信息的很少一部分,对极端值不敏感.
中位数 不受少数几个极端值数据(即排序靠前或者靠后的数据)的影响. 对极端值不敏感.
平均数 与中位数相比,平均数反映出样本数据中的更多信息,对样本中的极端值更加敏感 任何一个数据的改变都会引起平均数的改变,数据越“离群”,对平均数的影响越大.
【环节一】情境导入——你的“工资”被平均了吗?
情景2:日常生活中,我们常说“平均分”“平均水平”,也用“中等水平”“中等收入”等说法。“平均”和“中等”是一回事吗?用数学的语言说——平均数和中位数是什么关系?
【环节二】概念深化——“平均”和“中等”是一回事吗?
当数据呈对称分布时,平均数≈中位数,两者的‘中心’指向同一位置
在右偏分布中,少数极大值将平均数“拖向”右侧尾部,而中位数不受影响,仍代表“半数分界”
在左偏分布中,少数极小值将平均数“拖向”左侧尾部,而中位数不受影响,仍代表“半数分界”
平均数大于中位数
平均数≈中位数
平均数小于中位数
结论:平均数总是在“长尾巴”那边
平均数和中位数都描述了数据的集中趋势,它们的大小关系和数据分布的形态有关,在图中的三种分布形态中,平均数和中位数的大小存在什么关系?
单峰对称
右拖尾
左拖尾
平均数大于中位数
平均数≈中位数
平均数小于中位数
结论:平均数总是在“长尾巴”那边
【环节二】概念深化——“平均”和“中等”是一回事吗?
【环节三】策略建构——什么时候用什么?
情景3:
(1)某制鞋厂统计了上个月所有顾客购买的鞋码数据,需要决定下个月各鞋码的生产数量。应当重点关注哪个集中趋势度量?
(2)某市政府要发布年度“居民收入水平报告”,既要反映整体收入状况,又要避免报告被少数超高收入者“绑架”。应当使用哪个集中趋势度量?为什么?
(3)某歌唱比赛中,7位评委对一位选手的评分分别为:9.2, 9.3, 9.1, 9.5, 9.4, 7.0, 9.3。组委会决定“去掉一个最高分和一个最低分,再计算平均分”。这种做法背后的统计道理是什么?
众数——它直接对应最可能发生的需求
政府发布的统计公报通常同时报告平均数和中位数,但中位数常被用作“典型收入”的代表。
既有平均数的信息综合优势,又有中位数的稳健性
【环节四】几何直观——规则重构
情景4:
样本的平均数、中位数和众数可以分别作为总体的平均数、中位数和众数的估计,但在某些情况下我们无法获知原始的样本数据,例如,我们在报纸、网络上获得的往往是已经整理好的统计表或统计图,这时该如何估计样本的平均数、中位数和众数?
0
0.02
0.04
0.06
0.08
0.1
频率/组距
0.077
0.107
0.043
0.030
0.030
0.017
0.010
0.013
0.007
1.2
4.2
7.2
10.2
13.2
16.2
19.2
22.2
25.2
28.2
月均用水量/t
一组数据中出现次数最多的数
众数:在样本数据的频率分布直方图中,最高矩形的中点的横坐标.
月均用水量在区间[4.2,7.2)内的居民最多, 可以将这个区间的中点5.7作为众数的估计值.
1.众数
频数
频率
【环节四】几何直观——规则重构
情景4:
从直方图中,众数落在哪里最显眼?
12
0
0.02
0.04
0.06
0.08
0.1
频率/组距
0.077
0.107
0.043
0.030
0.030
0.017
0.010
0.013
0.007
1.2
4.2
7.2
10.2
13.2
16.2
19.2
22.2
25.2
28.2
月均用水量/t
一组数据按大小顺序依次排序后,当数据个数是奇数时,处在最中间的数是中位数;当数据个数是偶数时,最中间两个数的平均数是中位数.
中位数:把频率分布直方图划分成左右两侧面积相等的分界线与x轴交点的横坐标.
50%
0.231
0.552
设中位数为 ,
解得
面积
2.中位数
【环节四】几何直观——规则重构
情景4:
13
0
0.02
0.04
0.06
0.08
0.1
频率/组距
0.077
0.107
0.043
0.030
0.030
0.017
0.010
0.013
0.007
1.2
4.2
7.2
10.2
13.2
16.2
19.2
22.2
25.2
28.2
月均用水量/t
3.平均数
平均数:等于各小矩形的面积乘以其底边中点的横坐标之和.
【环节四】几何直观——规则重构
情景4:
加权平均数
14
由频率分布直方图估计总体的集中趋势
众数:最高矩形的中点
中位数:中位数左边的直方图面积和右边的直方图面积相等
平均数:每个小矩形底边中点的横坐标与小矩形的面积的乘积之和
注:频率分布直方图损失了些样本数据,得到的是一估计值,且所得估值与数据分组有关,有随机性。
【环节四】几何直观——规则重构
情景4:
1、某校从参加高二年级学业水平测试的学生中抽出80名学生,其数学成绩(均为整数)的频率分布直方图如图所示.
(1)求这次测试数学成绩的众数;
(2)求这次测试数学成绩的中位数.
(3)求这次测试数学成绩的平均分.
解:(1)由图可知,这次测验数学成绩的众数为:
(2)∵前3组的频率为0.4,前4组的频率为0.7, ∴中位数一定在(内.
(法一)设中位数为,则:解得
(法二)即这次测验数学成绩的中位数为73.33.
【环节五】当堂检测——闭环达标
1、某校从参加高二年级学业水平测试的学生中抽出80名学生,其数学成绩(均为整数)的频率分布直方图如图所示.
(3)求这次测试数学成绩的平均分.
解:(3)
【环节五】当堂检测——闭环达标
2、某中学举行电脑知识竞赛,现将高一参赛学生的成绩整理后分成五组,绘制成频率分布直方图如图所示.已知图中从左到右的第一、二、三、四、五小组的频率依次是
(1)估计高一参赛学生的成绩的众数、中位数;
(2)估计高一参赛学生的平均成绩.
解:(1) 众数为65;中位数为60+5=65.
(2)由题图,估计高一参赛学生的平均成绩为
【环节五】当堂检测——闭环达标
3、从高三抽出名学生参加数学竞赛,由成绩得到如图的频率分布直方图.
由于一些数据丢失,试利用频率分布直方图求:
(1) 这名学生成绩的众数与中位数;
(2) 这名学生的平均成绩.
解:(1)由直方图可知,众数为75分.
中位数约为分.
(2)这名学生的平均成绩为
【环节五】当堂检测——闭环达标
本节课你学习到了什么?
(知识?方法?思想?)
【环节五】总结反思——建构集中趋势认知体系
20
总体集中趋势的估计
统计量
平均数、中位数、众数的区别与联系
平均数、中位数、众数在频率分布直方图中的计算
平均数、中位数、众数
【环节五】总结反思——建构集中趋势认知体系
1.教材209页——练习3(作业本);
情境引入:
课后作业
感谢大家的聆听
授课人:张发松 学 校:昆明市呈贡区第一中学
23
$