内容正文:
6.4 用样本估计总体数字特征
第六章
统计
北师大版2019必修第一册·高一
2 抽样的基本方法
前情回顾
统计是一门用科学的方法收集、整理、分析数据,提取有用的信息,作出推断和决策的学科。
1.3 总体与样本
2.1 简单随机抽样
1 获取数据的途径
整理数据
分析数据
作出推断
收集数据
1.1 直接获取与间接获取
1.2 普查与抽查
2.2 分层随机抽样
3 用样本估计总体分布
3.1 从频数到频率
3.2 频率分布直方图
4 用样本估计总体的数字特征
4.1 样本的数字特征
4.2 分层随机抽样的均值与方差
4.3 百分位数
统计的基本过程:
学 习 目 标
1
2
3
能够求出样本的平均数、中位数、众数、百分位数,并对样本进行简单分析.(重点、难点)
能求出样本的极差、标准差与方差.(难点)
通过应用相关知识解决实际统计问题,培养数据分析的核心素养.
读教材
阅读课本P168-P177,5分钟后完成下列问题:
我们一起来探究“用样本估计总体的数字特征”吧!
1.样本的数字特征有哪些?怎样通过这些数字特征分析样本数据呢?
2.分层抽样的均值与方差应该如何计算?
3.什么是百分位数?离散数据的百分位数如何计算?
新课引入
小范去某公司应聘. 公司经理说 ,我们这里报酬不错 ,月平均工资是5000元. 技术员C说 ,我的工资是 3500元 ,在公司算中等收入。 技术员D说 ,我们好几个 人的工资都是3200元 ,小范感觉待遇不错 ,第二天就去 上班了.
一周后 ,小范发现了问题 ,去找经理 ,“经理 , 你说的不对 ,我已问过其他技术员 ,没有一个技术员的工 资超过5000元. ”经理说 :“没错 ,平均工资确实是每 月5000元 ,不信可看看公司的工资报表。 ”小范糊涂了
这是怎么回事呢?
新课引入
员工 总工程 师 工程
师 技术
员A 技术
员B 技术
员C 技术
员D 技术
员E 技术
员F 见习
技术
员G
工资 11000 9000 4800 4700 3500 3200 3200 3200 2400
(1)请观察表中的数据, 计算该公司员工的月平均工资是多少? 经理是否骗了小范?
(2)技术员C与技术员D是否忽悠了小范?他们又是用的数据中的那些量呢?
下表是该公司月工资报表:
学习过程
01
03
02
目录
1 样本的数字特征
3 百分位数
2 分层抽样的均值与方差
04
4 题型训练
新知探究
反映数据集中趋势参数——众数、平均数、中位数
概念:一组数据中出现次数最多的数据称为这组数据的众数
特征:众数的大小只与这组数据中的数据有关.
众数作为一组数据的代表时,可靠性较差,众数很多时候不能反映一组数据的中心值.
新知探究
概念:平均数是指一组数据的平均值.
一般地,个数据的平均数记为,其计算公式为
.
反映数据集中趋势参数——众数、平均数、中位数
特征:平均数代表性较好,是反映数据集中趋势最常用的统计量.
平均数反映一组数据的平均水平,任何一个样本数据的改变一般都会引起平均数的改变.但在某些情况下,平均数也易受到一些极端值的影响而偏离一般情况.
新知探究
反映数据集中趋势参数——众数、平均数、中位数
概念:将一组数据按从小到大的顺序排列后,“中间”的那个数据称为这组数据的中位数.
如果数据的个数是偶数,即排序后为,那么中位数就取中间两个数据的平均数,即为中位数.
如果数据的个数是奇数,即排序后为,位于最中间位置的数就是中位数
特征:在一组数据中,有一半的数据不大于中位数,而另一半的数据则不小于中位数,中位数反映了一组数据的中心的情况.中位数不受极端值的影响.
新知探究
反映数据离散程度参数——极差、方差、标准差
概念:一组数据中最大值和最小值的差称为极差,即极差最大值最小值
特征:极差反映了一组数据变化的最大幅度,它对一组数据中的极端值非常敏感.
将极差作为数据的离散程度的估计量,可靠性较差.
新知探究
反映数据离散程度参数——极差、方差、标准差
概念:在一组数据中,各数据与它们的平均数的差的平方的平均数,称为这组数据的方差,通常用来表示,即
特征:方差刻画的是数据偏离平均数的离散程度,方差越小,表明各个样本数据在样本平均数周围越集中;反之,方差越大,表示各个样本数据在样本平均数的两边越分散.
新知探究
反映数据离散程度参数——极差、方差、标准差
概念:方差的算术平方根称为这组数据的标准差,通常用s表示,即
特征:标准差也反映了数据的离散程度,描述了以样本数据的单位表示的波动幅度.
与标准差相比,方差有两个弊端:
一是与原始数据的单位不同,
二是平方后可能夸大了偏差的程度.这也是引入标准差的必要性.
实例分析
例1.某赛季篮球运动员甲每场比赛的得分(单位:分)情况如下表所示.
平均数32.23分;
求在该赛季中,这名运动员得分情况的平均数、中位数、众数、极差、方差、标准差.
中位数:35分;
众数:31分,36分;
极差:50 -12=38分;
小
大
1 2 3 4 5 6 7 8 9 10 11 12 13
方差:
标准差:s≈10.53分
实例分析
例2.在 1996 年美国亚特兰大奥运会上,中国香港帆板运动员李丽珊,以惊人的耐力和斗志,勇夺金牌,实现了中国香港体育史上奥运金牌零的突破.这枚金牌能在比赛过程中预测出来吗?
在帆板比赛中,成绩以低分为优胜,共赛 11 场,并以最佳的 9 场成绩计算最终的名次.此次比赛前 7 场比赛结束后,排名前 5 位的选手积分如下表所示:
根据前 7 场的比赛结果,能否预测谁将获得最后的胜利?
分析:由上表,可以分别计算出5 位运动员前7场比赛积分的平均数和标准差,作为判断各运动员比赛的成绩及稳定情况的依据.
实例分析
最小
从上表可以看出:李丽珊的平均得分及得分标准差都比其他运动员的小,也就是说,在前7场的比赛过程中,她的成绩最为优异,而且表现也最为稳定 .可以把前7场的成绩作为总体的一组样本,并由此估计每位运动员最后比赛 的成绩,因此预测李丽珊获得最后的冠军.
实例分析
例3.有甲、乙两名射击运动员,10次射击成绩(单位:环)如下表.
次数 1 2 3 4 5 6 7 8 9 10
甲 7 7 8 9 8 9 10 9 9 9
乙 8 9 7 8 10 7 10 10 7 10
现要从两名运动员中选拔一人参加比赛,根据两名运动员的运动成绩,如何进行选拔?
分析:要从两名运动员中选拔一人参加比赛,首先应该根据不同的要求和状况确定选拔的标准,然后再根据标准和运动员的成绩进行决策.
当标准不同时,人们的决策也会随之发生改变.
实例分析
在情境1中,教练员可能会制订这样的标准,
标准1:以两名运动员的最后一次射击成绩作为评价标准,选择成绩较高者参赛. 据此,显然应选择乙参加比赛.
情境1 如果10 次射击成绩中,前9次都是个人独自进行训练的成绩,最后一次是教练在场的射击成绩,那么作为教练员,你最有可能根据什么成绩作为选拔的标准?
次数 1 2 3 4 5 6 7 8 9 10
甲 7 7 8 9 8 9 10 9 9 9
乙 8 9 7 8 10 7 10 10 7 10
实例分析
次数 1 2 3 4 5 6 7 8 9 10
甲 7 7 8 9 8 9 10 9 9 9
乙 8 9 7 8 10 7 10 10 7 10
情境2 如果10 次射击成绩是大型比赛选拔赛中的射击成绩,作为教练员,你可能怎样制订选拔标准?
在情境2中教练员可能会制订这样的标准,
即标准2:以两名运动员 10次射击成绩的众数作为评价标准,选择众数较高者参赛. 甲射击成绩的众数是9 环,乙射击成绩的众数是10环. 据此,选择乙参加比赛.
标准 3:以两名运动员 10 次射击成绩的中位数作为评价标准,选择中位数较高者参赛. 甲射击成绩的中位数是9 环,射击成绩的中位数是 8.5环. 据此,选择甲参加比赛.
标准4:以两名运动员 10 次射击成绩的平均数作为评价标准,选择平均数较高者参赛. 甲射击成绩的平均数是 8.5环,射击成绩的平均数是8. 据此,选择乙参加比赛.
实例分析
标准5:可以用两名运动员10次射击成绩的标准差作为评价标准,标准差越小成绩越稳定. 甲射击成绩的标准差0.92环,乙射击成绩的标准差1.28环.
据此,选择甲参加比赛.
情境3 教练员发现,按照上面的标准看,甲乙两名运动员相差不大,并且该运动队的成绩已经超过其他同水平运动队,只要维持目前状态就能取得冠军. 因此,教练员需要选择一名运动水平相对稳定的队员参赛. 此时,通常会再提出其他的要求(即使运动员的成绩相差很大,也可以提出新的要求). 例如,分别按照数据的极差、标准差的大小给出标准.
次数 1 2 3 4 5 6 7 8 9 10
甲 7 7 8 9 8 9 10 9 9 9
乙 8 9 7 8 10 7 10 10 7 10
实例分析
例如,甲、乙两名运动员,后者发挥极不稳定,有时成绩很好,有冲击金牌的可能,但有时又会很差,可能拿不到名次;前者没有冲击金牌的能力,但他成绩极其稳定,如果让他参加比赛,保证能拿到一块铜牌. 在这种情况下,如果运动队要先保奖牌,那么甲去参赛应该是更好的选择;反之,如果运动队已经得到了不少银牌和铜牌,最想要的是拿到一块金牌,这时可能就应该让乙参加比赛.
从上述问题可以看出,根据问题的实际背景,利用数据的数字特征,可以帮助人们进行决策,从而真正发挥数据分析的作用.
值得注意的是,在这里,不同的标准没有对和错的问题,也不存在所谓唯一解的问题,而是根据需要来选择“好”的决策. 至于决策的好坏,是根据提出的标准而定的.
抽象概况
用样本的数字特征估计总体的数字特征时
如果抽样的方法比较合理,那么样本可以很好地反映总体的信息.虽然从样本数据得到的数字特征并不是总体真正的数字特征,只是总体数字特征是一个估计,但这种估计是合理的. 样本容量越大,样本中包含的总体信息就越多,估计的合理性越充分.
学习过程
01
03
02
目录
1 样本的数字特征
3 百分位数
2 分层抽样的均值与方差
04
4 题型训练
新知探究
在分层随机抽样问题中,如果知道样本中的每一个数据,就可以计算出样本的平均数和方差.
但是,如果不知道样本中的每一个数据,只知道分层随机抽样中各层的平均数和方差,以及各层所占的比例(权重)
思考:如何计算出分层抽样样本的平均数和方差呢?
例如,某学校高一年级由甲板和乙班组成.如果知道甲班和乙班的数学平均成绩和方差,以及甲班和乙班的人数,而缺少每名同学的成绩,如何计算整个高一年级的平均成绩和方差?
实例分析
例4.某公司的高收人员工月平均工资是 11 000元,中等收人员工月平均工资是 6500元,低收入员工月平均工资是 2 900元. 能否认为该公司员工的月平均工资收入是6 800(元)? 这样计算平均数的方法合理吗?
解:不合理.
在这个问题中,如果该公司有 1 000 名员工,其中50名属于高收人者,150名属于中等收入者,800 名属于低收入者,那么由于每一类员工所占比例不同,特别是高收入者很少,他们的月平均工资对该公司员工的月平均工资影响较小.
因此,上述计算方法显然不合理.
牛刀小试
例5.甲、乙两位同学相约晚上在某餐馆吃饭. 他们分别在A,B两个网站查看同一家餐馆的好评率. 甲在网站A查到好评率98%,而乙在网站B查到好评率是85%,综合考虑这两个网站的信息,应该如何得到这家餐馆的总好评率?
解:好评率是由好评人数除以总评价人数得到的.98%的好评率意味着如果有 100 人评价,那么其中98 人给了好评.
设在网站 A 评价该馆的人数为,其中给出好的人数为 ;在网站 B评价该餐馆的人数为,其中给出好评的人数为.
由题目条件,98%85%.
新知探究
综合A,B两个网站的信息,这家餐馆的总好评率应为化简得
其中和分别是各自的权重,总好评率相应的好评率与其权重乘积的和.
所以除非再知道 A,B 两个网站评价人数的比例关系,否则并不能求出总好评率.
由以上分析可知,当且仅当时,总好评率等于91.5%.
例5.甲、乙两位同学相约晚上在某餐馆吃饭. 他们分别在A,B两个网站查看同一家餐馆的好评率. 甲在网站A查到好评率98%,而乙在网站B查到好评率是85%,综合考虑这两个网站的信息,应该如何得到这家餐馆的总好评率?
抽象概况
一般地,将样本,···, 和样本,···, 合并成一个新样本,则这个新样本的平均数为:
于是,当已知上述两层构成的新样本中每层的平均数分别为和时,可得这个新样本的平均数为+.
记,,则这个新样本的平均数为,其中,称为权重
分层随机抽样的平均数推导
更一般地,设样本中不同层的平均数和相应权重分别为和,则这个样本的平均数为.为了简化表示,引进求和符号,记作
抽象概况
分层随机抽样的平均数
一般地,设样本中不同层的平均数和相应权重分别为,和,
则这个样本的平均数为,
为了简化表示,引进求和符号,
记作.
w1,w2
∈[0,1]
实例分析
例6.甲乙两班参加了同一学科的考试,其中甲班50人,乙班40人. 甲班的平均成绩为80.5分,方差为 500;乙班的平均成绩为 85分,方差为360. 那么甲、乙两班全部90名学生的平均成绩和方差分别是多少?
解:设甲班 50名学生的成绩分别是,…, ,那么甲班的平均成绩、权重和方差分别为
设乙班 40名学生的成绩分别是,…, ,那么乙班的平均成绩、权重和方差分别为
实例分析
例6.甲乙两班参加了同一学科的考试,其中甲班50人,乙班40人. 甲班的平均成绩为80.5分,方差为 500;乙班的平均成绩为 85分,方差为360. 那么甲、乙两班全部90名学生的平均成绩和方差分别是多少?
如果不知道,…, 和,…, ,只知道甲、乙两班的平均成绩、方差及权重,那么根据前面的分析,全部90名学生的平均成绩应为
而全部90名学生的方差可以用式子
进行计算.
实例分析
例6.甲乙两班参加了同一学科的考试,其中甲班50人,乙班40人. 甲班的平均成绩为80.5分,方差为 500;乙班的平均成绩为 85分,方差为360. 那么甲、乙两班全部90名学生的平均成绩和方差分别是多少?
因此,
因此,甲、乙两班平均成绩为82.5分,方差为442.78
思考交流
思考:根据方差的意义,全部90名学生的方差应为
它与运用式子得出的结果是否一致呢?
实际上,
因为=+
所以
同理
思考交流
于是
=
=
思考:根据方差的意义,全部90名学生的方差应为
它与运用式子得出的结果是否一致呢?
抽象概况
分层抽样的方差
设样本中不同层的平均数分别为 ,方差分别为,相应的权重分别为,
则这个样本的方差为
(其中为这个样本的平均数)
每一层的权重
每一层的方差
每一层的平均数
学习过程
01
03
02
目录
1 样本的数字特征
3 百分位数
2 分层抽样的均值与方差
04
4 题型训练
新知探究
中位数:
总体数据中的任意一个数小于或等于它的可能性是50%.
类比
a
小于等于a的
可能性为80%
80%分位数:
总体数据中的任意一个数小于或等于它的可能性是80%.
m
小于等于m的
可能性为50%
(50%分位数)
请同学们回顾一下什么是中位数?
一组数据从小到大排列后,“中间”的那个数据为这组数据的中位数,它使得数据被分成的两部分的数据量一样.所以任取一个数据,它小于或等于中位数的概率是50%.
抽象概况
百分位数
定义:如果将一组数据从小到大排序,并计算相应的累计百分位,则某一百分位所对应的数据的值就称为这一百分位的百分位数.
总体的分位数有这样的特点:总体数据中的任意一个数小于或等于它的
可能性是.
25%,50%,75%分位数是三个常用的百分位数.把总体数据按照从小到大排列后,这三个百分位数把总体数据分成了4个部分,在这4个部分取值的可能性都是.因此这三个百分位数也称为总体的四分位数.
其他常用的百分位数有1%,5%,10%,90%,95%,99%.
概念辨析
不是.是指能够考取本科院校的同学占同学总数的百分比.
有70%的同学数学测试成绩在小于或等于85分.
问题1.班级人数为50的班主任老师说“90%的同学能够考取本科院校”,这里的“90%”是百分位数吗?
问题2.“这次数学测试成绩的第70百分位数是85分”这句话是什么意思?
问题3.第p百分位数有什么特点?
总体数据中的任意一个数小于或等于它的可能性是p.
抽象概括
计算一组n个数据的第p百分位数的步骤:
第1步,排序:按从小到大排列原始数据.
第2步,计算:计算.
第3步,取值:若i不是整数,而大于i的比邻整数为j,则第p百分位数为第j项数据;
若i是整数,则第p百分位数为第i项与第(i+1)项数据的平均数.
实例分析
例7.下表记录了某地区一年之内的月降水量.求这些数据的25%分位数、50%分位数、75%分位数分别是多少?
月 份 1 2 3 4 5 6 7 8 9 10 11 12
月降水量/mm 58 48 53 46 56 56 51 71 56 53 64 66
解:把这组数据由小到大排列,得:
46 48 51 53 53 56 56 56 58 64 66 71
25%分位数 50%分位数 75%分位数
12×25%=3,
12×50%=6,
12×75%=9,
实例分析
例8.1895 年,在英国伦敦有 106 块男性头盖骨被挖掘出. 经考证,这些头盖骨的主人死于 1665 年一1666 年的大瘟疫,人类学家分别测量了这些头盖骨的宽度,数据如下(单位 : mm).分别求出5%,25%,50%,75%和95%分位数.
实例分析
解:因为该样本共有106个数据,所以106×5%=5.3,106×25%=26.5,106×50%=53,106×75%=79.5,106×95%=100.7.
将所有数据由小到大排列后,第6个数据是133,从而得到5%分位数为133mm.
同理,25%,50%,75%和95%分位数分别为139mm,141mm,145mm和149mm.
121、129、131、132、132、133、134、134、135、136、136、136、136、137、137、137、138、138、138、138、138、138、138、139、139、139、139、139、139、139、140、140、140、140、140、140、140、140、140、140、140、140、141、141、141、141、141、141、141、141、141、141、141、141、142、142、142、142、142、142、142、143、143、143、143、143、143、143、143、143、143、144、144、144、144、144、145、145、145、145、145、145、145、146、146、146、146、146、146、147、148、148、148、148、148、148、148、148、149、149、149、150、152、153、153、158
学习过程
01
03
02
目录
1 数据的直接获取与间接获取
3 总体和样本
2 普查和抽查
4 题型训练
04
题型训练
题型一 众数、平均数、中位数
练习1:某学习小组在一次数学测验中,100分的有1人,95分的有1人,90分的有2人,85分的有4人,80分和75分的各1人,则该小组成绩的平均分、众数、中位数分别是( )
A.85、85、85 B.87、85、86
C.87、85、85 D.87、85、90
C
题型训练
题型一 众数、平均数、中位数
练习2:高一(3)班有男同学27名,女同学21名,在一次语文测验中,男同学的平均分是82分,中位数是75分;女同学的平均分是80分,中位数是80分.
(1)求这次测验全班的平均分(精确到0.01分);
(2)估计全班成绩不超过80分的同学至少有多少人;
(3)分析男同学的平均分与中位数相差较大的主要原因.
解:(1)利用平均数计算公式,得×(82×27+80×21)≈81.13,
即这次测验全班的平均分为81.13分.
(2)∵男同学成绩的中位数是75分,∴至少有14人得分不超过75分.
又∵女同学成绩的中位数是80分,∴至少有11人得分不超过80分,
∴估计全班至少有25人得分不超过80分.
(3)男同学的平均分与中位数的差别较大,说明男同学的成绩中两极分化现象严重,分数高的和分数低的相差较大.
题型训练
题型二 方差与标准差
练习3:某老师从星期一到星期五收到的信件数分别为10,6,8,5,6,则该组数据的方差s2=________.
3.2
题型训练
题型三 数据的集中趋势
练习4:在一次科技知识竞赛中,两组学生的成绩如下表:
已经算得两个组的平均分都是80分.请根据你所学过的统计知识,进一步判断这两个组在这次竞赛中的成绩谁优谁劣,并说明理由.
解:(1)甲组成绩的众数为90分,乙组成绩的众数为70分,从成绩的众数比较看,甲组成绩好些.
(2)[2×(50-80)2+5×(60-80)2+10×(70-80)2+13×(80-80)2+14×(90-80)2
+6×(100-80)2]=172,
[4×(50-80)2+4×(60-80)2+16×(70-80)2+2×(80-80)2+12×(90-80)2
+12×(100-80)2]=256.
∵,∴从方差角度看甲组成绩比乙组成绩稳定,故甲组好些.
分数 50 60 70 80 90 100
人数 甲组 2 5 10 13 14 6
乙组 4 4 16 2 12 12
题型训练
题型三 数据的集中趋势
练习4:在一次科技知识竞赛中,两组学生的成绩如下表:
已经算得两个组的平均分都是80分.请根据你所学过的统计知识,进一步判断这两个组在这次竞赛中的成绩谁优谁劣,并说明理由.
分数 50 60 70 80 90 100
人数 甲组 2 5 10 13 14 6
乙组 4 4 16 2 12 12
(3)甲、乙两组成绩的中位数、平均数都是80分.其中甲组成绩在80分以上(包括80分)的有33人,乙组成绩在80分以上(包括80分)的有26人.从这一角度看,甲组的成绩较好.
(4)从成绩统计表看,甲组成绩大于或等于90分的有20人,乙组成绩大于或等于90分的有24人,
∴乙组成绩集中在高分段的人数多.同时,乙组得满分的人数比甲组得满分的人数多6人.从这一角度看,乙组的成绩较好.
题型训练
题型四 分层抽样的均值与方差
练习5:某班为了了解学生每周购买零食的支出情况,利用分层随机抽样抽取了一个15人的样本统计如下:
学生数 平均支出 方差
男生 9 40 6
女生 6 35 4
求这15名学生每周购买零食的平均费用和方差.
解:
题型训练
题型四 分层抽样的均值与方差
练习6:甲、乙两支田径队体检结果如下:甲队的平均体重为60 kg,方差为200;乙队的平均体重为70 kg,方差为300.已知甲、乙两队的队员人数之比为1:4,求甲、乙两队所有队员的平均体重和方差.
解:由题意可知=60,甲队队员在所有队员中所占权重为,=70,乙队队员在所有队员中所占权重为,
则甲、乙两队所有队员的平均体重为×60+×70=68(kg),
甲、乙两队所有队员体重的方差s2=×[200+(60-68)2]+×[300+(70-68)2]=296.
题型训练
题型五 百分位数
解:数据从小到大排列为27,28,29,30,31,33,34,35,36,36,38,38,共12个,且12×25%=3,
故最大速度的25%分位数是=29.5.
练习7:对某自行车赛手在相同条件下进行了12次测试,测得其最大速度(单位:m/s)的数据如下:27,38,30,36,35,31,33,29,38,34,28,36,则他的最大速度的25%分位数是( ).
A.29 B.29.5 C.30 D.36
C
课堂小结
用样本估计总体的数字特征
中位数:
标准差:
众数:
方差:
平均数:
数据从小到大排序后,中间的那个数据
方差的算术平方根
出现次数最多的那个数据
样本的数字特征
方差
均值
分层抽样的均值与方差
百分位数
感谢聆听!
解:由题意知,该学习小组共有10人,
因此众数和中位数都是85,
平均数为eq \f(100+95+2×90+4×85+80+75,10)=87.
解:5个数据的平均数eq \o(x,\s\up6(-))=eq \f(10+6+8+5+6,5)=7,
∴s2=eq \f(1,5)×[(10-7)2+(6-7)2+(8-7)2+(5-7)2+(6-7)2]=3.2.
$