内容正文:
4.3.2独立性检验
我们已经知道,事件A与B独立的充要条件是
P(AB)=P(A)P(B).
利用这一点,我们可以通过概率的计算来判断两个事件是否独立,
然而,如果要判断现实生活中两个随机事件是否独立,并不是一件容
易的事.
思考:任意抽取某市的一名学生,记A:喜欢长跑,B:是女生
(1)你能得出P(A),P(B),P(AB)这三者的准确值吗?
(2)如果要判断A与B是否独立,该怎么办?
类似情境与问题中P(A),P(B),P(AB)准确值的确定,
都是比较难
的,甚至是不可能的
然而,因为可以利用频率估计概率,所以通过抽样调查获得样本数
据后,我们就可以得到上述三个值的近似值
例如,假设通过调查,
我们获取了下述数据:
抽查了110个人,其中女生有50人;且这110人中,喜欢长跑的有
60人,其中女生有20人.
首先,为了方便起见,我们可以把这些数据整理成如下的表格形式
喜欢长跑
不喜欢长跑总计
女
20
30
50
男
40
20
60
总计
60
50
110
因为这个表格中,核心的数据是中间的4个格子,所以这样的表格
通常称为2×2列联表,
喜欢长跑
不喜欢长跑总计
女
20
30
50
男
40
20
60
总计
60
50
110
由2×2列联表可知:
60
6
喜欢长跑的概率P(A)可以估计为
110
11
50
5
是女生的概率P(B)可以估计为
110
11
20
2
喜欢长跑且是女生的概率P(AB)可以估计为
110
此时,可以利用P(AB)=P(A)P(B)是否成立来判断A与B是否独立吗?
因为P(A),P(B),P(AB)都是根据样本数据得到的估计值,
而估计是有误差的,因此直接用P(AB)=P(A)P(B)是否成立来判
断A与B是否独立是不合理的.
但是,如果A与B独立,那么P(A)P(B)应该可以作为P(AB)的
近似值.
因此理论上可知,喜欢长跑的女生数可以估计为110P(A)P(B),
注意到实际数为20(即110P(AB)),因此
[110P(AB)-110P(A)P(B)]2
110P(A)P(B)
应该不会太大,
类似地,考虑A与B,A与B,A与B,可知
[10P(AB)-110P(A)P(B)]
110P(A)P(B)
10P(4B)-110P(A)P(B
110P(A)P(B)
10P(AB)-110P(A)P(BL
若记上述四项的和为χ^°(读作“卡方”),则代入有关数据
可以算得χ^=7.8.
不过,概率学上可以证明,如果A与B独立,则X2≥6.635的
概率只有1%,即P(x≥6.635)=1%
因为算出的X值7.8大于6.635,所以若A与B独立(即“喜
欢长跑”与“是女生”独立),那么我们就观察到了一件概率
不超过1%的事件.
这也可以说成,在犯错误的概率不超过1%的前提下,可以
认为“喜欢长跑”与“是女生”不独立(也称为是否喜欢长跑与
性别有关);或说有99%的把握认为是否喜欢长跑与性别有关
上述1%通常称为显著性水平,而6.635称为显著性水平1%
所对应的分位数.
一般情况下,可以用完全类似的方法来检验两个随机事件
是否独立,
如果随机事件A与B的样本数据的2×2列联表如下.
A
A
总计
B
b
a+b
B
d
c+d
总计
a+c
b+d
a+b+c+d
记n=a+b+c+d,则由表可知:
(1)事件A发生的概率可估计为P()=+
(2)事件B发生的概率可估计为P(B)=
(3)事件AB发生的概率可估计为
P(AB)=
n
如果A与B独立,那么上述P(AB)与P(A)P(B)的估计值
相差不会太大,注意到总数为,因此利用后者可以估计出,理论上
既是A又是B的数据有nP(A)P(B)个,注意到实际的数据为a
(即nP(AB))个,因此
InP(AB)-nP(A)P(B)
[na-n(a+c)(a+b)
不会太大
nP(A)P(B)
n(a+c)(a+b)
类似地,考虑A与B,A与B,A与B,可知
[nb-n(b+d)(a+b)[nc-n(a+c)(c+d)][nd-n(b+d)(c+d)]
n(b+d(a+b)
n(a+c)(c+d)
n(b+d(c+d)
都不会太大,因此这四个数的和
n(ad -be)2
(a+b)(c+d)(a+c)(b+d)
也不会太大
O另外,任意给定一个α(称为显著性水平,通常取为0.05,0.01
等),可以找到满足条件
P(χ^2≥k)=α
的数(称为显著性水平α对应的分位数)
χ-是一个随机变量,其分布能够求出,上面的概率是可以计算的。
因此,如果根据样本数据算出X^的值后,发现χ≥k成立,就称在
犯错误的概率不超过α的前提下,可以认为A与B不独立(也称为
A与B有关);或说有1-α的把握认为A与B有关。
若χ^2<k成立,就称不