内容正文:
2.2用样本估计总体
学习过程
知识点1:频率分布的概念
频率分布是指一个样本数据在各个小范围内所占比例的大小。一般用频率分布直方图反映样本的频率分布。其一般步骤为:
(1) 计算一组数据中最大值与最小值的差,即求极差
(2) 决定组距与组数
(3) 将数据分组
(4) 列频率分布表
(5) 画频率分布直方图
知识点2:频率分布折线图、总体密度曲线
〖探究〗:同样一组数据,如果组距不同,横轴、纵轴的单位不同,得到的图和形状也会不同。不同的形状给人以不同的印象,这种印象有时会影响我们对总体的判断,分别以0.1和1为组距重新作图,然后谈谈你对图的印象?(把学生分成两大组进行,分别作出两种组距的图,然后组织同学们对所作图不同的看法进行交流……)
接下来请同学们思考下面这个问题:
〖思考〗:如果当地政府希望使85%以上的居民每月的用水量不超出标准,根据频率分布表2-2和频率分布直方图2.2-1,(见课本P57)你能对制定月用水量标准提出建议吗?(让学生仔细观察表和图)
知识点3:茎叶图
1.茎叶图的概念:
当数据是两位有效数字时,用中间的数字表示十位数,即第一个有效数字,两边的数字表示个位数,即第二个有效数字,它的中间部分像植物的茎,两边部分像植物茎上长出来的叶子,因此通常把这样的图叫做茎叶图。(见课本P61例子)
2.茎叶图的特征:
(1)用茎叶图表示数据有两个优点:一是从统计图上没有原始数据信息的损失,所有数据信息都可以从茎叶图中得到;二是茎叶图中的数据可以随时记录,随时添加,方便记录与表示。
(2)茎叶图只便于表示两位有效数字的数据,而且茎叶图只方便记录两组的数据,两个以上的数据虽然能够记录,但是没有表示两个记录那么直观,清晰。
[来源:Z_xx_k.Com]
知识点4:众数、中位数、平均数
〖探究〗:P62
(1)怎样将各个样本数据汇总为一个数值,并使它成为样本数据的“中心点”?
(2)能否用一个数值来描写样本数据的离散程度?(让学生回忆初中所学的一些统计知识,思考后展开讨论)
初中我们曾经学过众数,中位数,平均数等各种数字特征,应当说,这些数字都能够为我们提供关于样本数据的特征信息。例如前面一节在调查100位居民的月均用水量的问题中,从这些样本数据的频率分布直方图可以看出,月均用水量的众数是2.25t(最高的矩形的中点)(图略见课本第62页)它告诉我们,该市的月均用水量为2. 25t的居民数比月均用水量为其他值的居民数多,但它并没有告诉我们到底多多少。
〖提问〗:请大家翻回到课本第56页看看原来抽样的数据,有没有2.25 这个数值
根据众数的定义,2.25怎么会是众数呢?为什么?(请大家思考作答)
分析:这是因为样本数据的频率分布直方图把原始的一些数据给遗失的原因,而2.25是由样本数据的频率分布直方图得来的,所以存在一些偏差。
〖提问〗:那么如何从频率分布直方图中估计中位数呢?
分析:在样本数据中,有50%的个体小于或等于中位数,也有50%的个体大于或等于中位数。因此,在频率分布直方图中,矩形的面积大小正好表示频率的大小,即中位数左边和右边的直方图的面积应该相等。由此可以估计出中位数的值为2.02。(图略见课本63页图2.2-6)
〖思考〗:2.02这个中位数的估计值,与样本的中位数值2.0不一样,你能解释其中的原因吗?(原因同上:样本数据的频率分布直方图把原始的一些数据给遗失了)
(课本63页图2.2-6)显示,大部分居民的月均用水量在中部(2.02t左右),但是也有少数居民的月均用水量特别高,显然,对这部分居民的用水量作出限制是非常合理的。
〖思考〗:中位数不受少数几个极端值的影响,这在某些情况下是一个优点,但是它对极端值的不敏感有时也会成为缺点,你能举例说明吗?(让学生讨论,并举例)
知识点5:标准差、方差
1、样本数据
的标准差的算法:
(1) 、算出样本数据的平均数
。
(2) 、算出每个样本数据与样本数据平均数的差:
(3) 、算出(2)中
的平方。
(4) 、算出(3)中n个平方数的平均数,即为样本方差。
(5) 、算出(4)中平均数的算术平方根,,即为样本标准差。
其计算公式为:
[来源:Z,xx,k.Com]
显然,标准差较大,数据的离散程度较大;标准差较小,数据的离散程度较小。
〖提问〗:标准差的取值范围是什么?标准差为0的样本数据有什么特点?
从标准差的定义和计算公式都可以得出:
。当
时,意味着所有的样本数据都等于样本平均数。
(在课堂上,如果条件允许的话,可以给学生简单的介绍一下利用计算机来计算标准差的方法。)
2.方差
从数学的角度考虑,人们有时用标准差的平方
(即方差)来代替标准差,作为测量样本数据分散程度的工具:
在刻画样本数据的分散程度上,方差和标准差是一样的,但在解决实际问题时,一般