内容正文:
第八章:成对数据的统计分析
人教A版选择性必修第三册(高二)
8.3列联表与独立性检验
8.3.1分类变量与列联表
犯错误的概率不超过α
实际问题
总体数据
样本数据
成对分类
变量(X,Y)
零假设H。:X和Y独立
当,拒绝零假设H。
8.3
普查
2x2列联表
计算比率
2X2列联表
独立性检验
抽样调查.
1
本节知识点结构框图
确切
结论
当,拒绝零假设H。
重点
难点
教学目标
列联表,独立性检验的思想和方法
通过实例理解 列联表,准确列出 列联表,
提升数据分析的核心素养
χ2统计量的导出和意义,独立性检验的思想和方法
2
学习目标与重难点
起薪 ≥ 1万30人
起薪 ≥ 1万20人
起薪 < 1万20人
起薪 < 1万30人
3
情境导入
数据:某招聘平台统计了应届毕业生的学历和起薪情况(单位:人):
硕士学历
本科学历
学历的提升是否有助于增长工资呢?怎样用数学知识说明呢?
不同学校是否对学生成绩有影响
在现实生活中,任免经常需要回答一定范围内的两种现象或性质之间是否存在关联性或相互影响的问题。
在讨论上述问题时 , 为了表述方便 , 我们经常会使用一种特殊的随机变量 , 以区别不同的现象或性质 , 这类随机变量称为
分类变量.
3
分类变量
不同班级学生用于体育锻炼的时间是否有差别
吸烟是否会增加患肺癌的风险
4
新知探究
分类变量
数值变量
例如,学生所在的班级可以用1,2,3等表示,
男性、女性可以用1,0表示
数值变量的取值为实数,其大小与
运算都有实际的含义。
比如人的身高、体重、温度、收入等等,
分类变量的取值可以用实数来表示;
这些数值只作为编号使用,用来表示不同的类别;
并没有通常的大小和运算意义。
本节主要讨论取值于{0,1}的分类变量的关联性.
利用普查数据
4
新知探究
如何利用统计数据判断一对分类变量之间是否具有关联性呢?
借助概率的观点和方法
问题1 为了有针对性地提高学生体育锻炼的积极性, 某中学需要了解性别因素是否对本校学生体育锻炼的经常性有影响,为此对学生是否经常锻炼的情况进行了普查,全校学生的普查数据如下:523名女生中有331名经常锻炼; 601名男生中有473名经常锻炼.你能利用这些数据,说明该校女生和男生在体育锻炼的经常性方面是否存在差异吗?
这是一个简单的统计问题,最直接的解答方法可以用频率估计概率
结论:存在差异,男生更经常锻炼
4
新知探究
上面的问题还可以通过建立一个古典概型,使用条件概率的语言,给出另外一种解答方法.
用Ω表示该校全体学生构成的集合,考虑以Ω为样本空间的古典概率,定义一对分类变量X和Y如下: 对于Ω中的每一名学生,分别令
我们希望通过比较条件概率P(Y=1|X=0)和P(Y=1|X=1)回答上面的问题
如果从该校女生和男生中各随机选取一名学生,那么
性别对体育锻炼的经常性没有影响:
性别对体育锻炼的经常性有影响:
根据古典概型和条件概率公式
4
新知探究
1124
804
320
合计
601
473
128
男生(X=1)
523
331
192
女生(X=0)
经常(Y=1)
不经常(Y=0)
合计
锻炼
性别
结论:存在差异,男生更经常锻炼
4
新知探究
1124
804
320
合计
601
473
128
男生(X=1)
523
331
192
女生(X=0)
经常(Y=1)
不经常(Y=0)
合计
锻炼
性别
2x2列联表:
给出了成对分类变量数据的交叉分类频数
最后一行的前两个数分别是事件{Y=0}和{Y=1}中样本点的个数;
最后一列的前两个数分别是事件{X=0}和{X=1}中样本点的个数 ;
中间的四个格给出了事件{X=x, Y=y}(x,y=0,1)中样本点的个数;
右下角格中的数是样本空间中样本点的总数.
1
2
统计方法
对于大多数实际问题,无法获得所关心的全部对象的数据,因此无法准确计算出有关的比率或条件概率。
古典概型和条件概率的观点提供了一个解决问题的思路。比较简单的做法是利用随机抽样获得一定数量的样本数据,再利用随机事件发送的频率稳定于概率的原理对问题答案做出推断。
4
新知探究
4
新知探究
88
17
71
合计
45
7
38
乙校(X=1)
43
10
33
甲校(X=0)
优秀(Y=1)
不优秀(Y=0)
合计
数学成绩
学校
例1 为比较甲、乙两所学校学生的数学水平,采用简单随机抽样的方法抽取88名学生.通过测验得到了如下数据:甲校43名学生中有10 名数学成绩优秀;乙校45名学生中有7名数学成绩优秀.试分析两校学生中数学成绩优秀率之间是否存在差异.
用Ω表示两所学校的全体学生构成的集合. 考虑以Ω为样本空间的古典概型.对于Ω中每一名学生,定义分类变量X和Y如下:
¦
¦
¦
¦
¦
由2x2列联表可知
甲校学生数学成绩不优秀与优秀的概率分别为:
乙校学生数学成绩不优秀与优秀的概率分别为:
4
新知探究
例1 为比较甲、乙两所学校学生的数学水平,采用简单随机抽样的方法抽取88名学生.通过测验得到了如下数据:甲校43名学生中有10 名数学成绩优秀;乙校45名学生中有7名数学成绩优秀.试分析两校学生中数学成绩优秀率之间是否存在差异.
¦
¦
¦
¦
由2x2列联表可知
甲校学生数学成绩不优秀与优秀的概率分别为:
乙校学生数学成绩不优秀与优秀的概率分别为:
等高堆积条形图
通过比较发现,两个学校学生抽样数据中数学成绩优秀的频率存在差异,甲校的频率明显高于乙校的频率,即P(Y=1|X=0)>P(Y=1|X=1),甲校学生的数学成绩优秀率比乙校学生的高.
4
新知探究
思考:
你认为“两校学生的数学成绩优秀率存在差异”这一结论是否有可能是错误的?
事实上,“两校学生的数学成绩优秀率存在差异”这个结论是根据两个频率间存在差异推断出来的.有可能出现这种情况:在随机抽取的这个样本中,两个频率间确实存在差异,但两校学生的数学成绩优秀率实际上是没有差别的.
这就是说,样本的随机性导致了两个频率间出现较大差异.在这种情况下,我们推断出的结论就是错误的.
1
2
3
统计
收集数据
统计结果
列表
列出2x2列联表
计算频率
作图
绘制等高堆积图
直观分析
4
新知探究
利用等高堆积条形图判断两个分类变量是否有关联的步骤
4
新知探究
跟踪训练:
若有两个分类变量X与Y,定义它们的取值分别为 ,和 ,
其2x2列联表如下
m+54
44
10+m
合计
m+26
26
m
X=1
28
18
10
X=0
Y=1
Y=0
合计
Y
X
则当X与Y之间没有关联时,m的值最有可能是( )
A. 8 B. 9 C. 14 D. 19
解析:若X与Y之间没有关联,则有 ,解得
所以当m=14时,X与Y之间的关联性最弱,可以认为X与Y之间没有关联,故选C。
5
教材课后题P127-128
1. 成语“名师出高徒”可以解释为“知名老师指导出高水平学生的概率较大”,即老师的名声与学生的水平之间有关联. 你能举出更多的描述生活中两种属性或现象之间关联的成语吗?
水涨船高、登高望远、近朱者赤、勤能补拙等.
2. 例1中的随机抽样数据是否足够确定与X和Y有关的所有概率和条件概率?为什么?
不能。因为随机抽样得到的样本具有随机性,根据样本数据计算出来的频率也具有随机性。在统计推断中,依据频率稳定于概率的原理,可以利用频率推断与X和Y有关的概率和条件概率,但由于频率具有随机性,这种推断可能犯错误。因此,随机抽样数据不足以确定与X和Y有关的所有概率和条件概率.
5
教材课后题P127-128
3. 根据有关规定,香烟盒上必须印上“吸烟有害健康”的警示语. 那么
(1) 吸烟是否对每位烟民一定会引发健康问题?
(2) 有人说吸烟不一定引起健康问题,因此可以吸烟. 这种说法对吗?
(1) 从已掌握的知识来看,吸烟会损害身体的健康。但除了吸烟之外,身体的健康还受许多其他随机因素的影响,它是很多因素共同作用的结果。吸烟导致患病的案例非常普遍,但也可以找到长寿的吸烟者。因此健康与吸烟有关联,即从统计意义上讲,吸烟会损害健康,但不一定会对每位烟民都引起健康问题。
(2) 这种说法不正确。虽然吸烟不一定会对每个人都引起健康问题,但根据统计数据,吸烟比不吸烟引起健康问题的可能性大,因此“吸烟不一定引起健康问题,因此可以吸烟”的说法是不对的。
5
教材课后题P127-128
4. 假设在本小节“问题”中,只是随机抽取了44名学生,按照性别和体育锻炼情况整理为如下的列联表:
(1) 据此推断性别因素是否影响学生锻炼的经常性;
(2) 说明你的推断结论是否可能犯错,并解释原因.
性别 锻炼 合计
不经常 经常
女生 5 15 20
男生 6 18 24
合计 11 33 44
¦
¦
¦
¦
¦
解析:(1)根据列联表中的数据,女生不常锻炼跟经常锻炼的频率分别是 和 ;男生不常锻炼跟经常锻炼的频率是 和 。通过对比发现,男女生不常锻炼跟经常锻炼的频率是相等的,依据频率稳定于概率的原理,可以推断 。因此,可以认为性别对体育锻炼的经常性没有影响。
(2) 推断可能犯错误.因为样本是通过随机抽样得到的,频率具有随机性,因此推断可能犯错误.
6
基础巩固
例1.为考察A,B两种药物预防某疾病的效果,进行动物试验,分别得到两个等高堆积条形图如图所示:
根据图中信息,在下列各项中,说法最佳的一项是( )
A.药物B的预防效果优于药物A的预防效果
B.药物A的预防效果优于药物B的预防效果
C.药物A,B对该疾病均有显著的预防效果
D.药物A,B对该疾病均没有预防效果
解析:从题图可以看出,服用药物A后未患病的比例比服用药物B后未患病的比例大得多,
即预防效果更好.故选B
7
能力提升
例2.调查中发现480名男人中有38人患有色盲,520名女人中有6人患有色盲。下列说法错误的是( )
A.男人、女人中患色盲的频率分别为0.038,0.006
B.男、女患色盲的概率分别为19240,3260
C.患色盲在不同的性别中是有差异的
D.调查人数太少,不能说明色盲与性别有关
解析:由题意,得男人、女人中患色盲的频率分别为38480≈0.079 2,
6520≈0.011 5,频率不等于概率,故A,B项错误.因为0.079 2>0.011 5,说明男人中患色盲的比率比女人中患色盲的比率大,所以可以认为患色盲在不同的性别中是有差异的,故C项正确,D项错误.
答案:ABD
7
挑战创新
X Y 合计
Y=y1 Y=y2
X=x1 a b a+b
X=x2 c d c+d
合计 a+c b+d a+b+c+d
以下各组数据中,对于同一样本能说明X与Y有关联的可能性最大的一组为 ( )
A.a=5,b=4,c=3,d=2
B.a=5,b=3,c=4,d=2
C.a=2,b=3,c=4,d=5
D.a=2,b=3,c=5,d=4
例3:假设有两个分类变量X与Y,它们的可能取值分别为{x1,x2}和{y1,y2},其2×2列联表如下:
解析:比较 ,值越大,X与Y有关联的可能性越大。
选项A中, ,选项B中 ,
选项C中, ,选项D中 ,
因为 故答案选D
8
课堂小结
1. 分类变量
用以区别不同的现象或性质的一种特殊的随机变量,称为分类变量。
2. 列联表
将形如下表这种形式的数据统计表称为2×2列联表。2×2列联表给出了成对分类变量数据的交叉分类频数。
组别 甲(Y=0) 乙(Y=1) 合计
A(X=0) a b a+b
B(X=1) c d c+d
合计 a+c b+d a+b+c+d
THANK
YOU
$