内容正文:
8.3
列联表与独立性检验
人教A版 · 选择性必修第三册 · 第八章
1.7.2013
大家好,今天我们来学习第八章的第三节——列联表与独立性检验。这是一个非常实用的统计方法,它能帮助我们判断两个分类变量之间是否存在关联。通过本节课的学习,我们将掌握如何从数据中发现规律,并进行科学的推断。
‹#›
学习目标
1. 理解分类变量、列联表的概念,能根据数据建立2×2列联表。
2. 了解等高条形图的作用,并能利用其直观判断两个分类变量是否有关联。
3. 理解独立性检验的基本思想,掌握其核心步骤。
4. 熟记卡方()统计量的计算公式,并能根据给定数据进行计算。
5. 会查卡方临界值表,并能依据检验规则作出正确的统计推断。
1.7.2013
本节课我们将围绕三个维度展开学习。在知识与技能方面,我们要掌握分类变量、列联表、独立性检验等核心概念和方法。在过程与方法上,我们将通过解决实际问题,体验统计推断的全过程。最后,希望大家能感受到统计的魅力,培养严谨的科学态度。
‹#›
分类变量
分类变量
▌ 定义:变量的不同“值”仅表示个体所属的不同类别,不具有数值大小和方向意义,这类变量称为分类变量.
▌ 常见示例:性别 {男, 女}、产品质量 {合格, 不合格}、学历 {高中, 本科, 硕士}、垃圾分类 {可回收, 厨余, 有害, 其他}.
▌ 核心区别:与数值变量不同,分类变量是对事物的定性描述,不具有算术运算意义.
数值变量
数值变量的取值为实数,其大小和运算都有实际含义.
1.7.2013
首先我们来学习两个基本概念。第一是分类变量,像性别、产品质量这些表示不同类别的变量就是分类变量,它们描述的是事物的“质”,而不是“量”。第二是列联表,它能把两个分类变量的数据整理在一起。比如我们刚才的例子,就可以整理成一个2x2列联表,清晰地展示不同性别学生的锻炼情况,这是我们后续分析两个分类变量之间是否有关联的基础工具。
‹#›
情境引入——身边的统计问题
女生统计数据
在校总人数:523 名
经常锻炼:331 名 (约63.3%)
男生统计数据
在校总人数:601 名
经常锻炼:473 名 (约78.7%)
思考与讨论
1.单纯对比人数,你能直接得出“性别”与“锻炼习惯”的关联吗?为什么?
2.你认为,应该采用什么统计方法,才能更直观、科学地描述并判断这种关系?
1.7.2013
让我们从一个身边的问题开始。学校想知道性别是否影响学生的锻炼习惯。这里有一些数据,女生523人中有331人经常锻炼,男生601人中有473人经常锻炼。大家思考一下,从这些数字里,你能直接得出结论吗?如果不能,我们应该用什么方法来更科学地分析呢?这就是我们今天要解决的问题。
‹#›
情境引入
变量组合 不常锻炼(Y=0) 经常锻炼(Y=1) 合计
女性(X=0) 192 331 523
男性(X=1) 128 473 601
合计 320 804 1124
建立古典概型,使用条件概率语言.用表示该校全体学生构成的集合,定义一对分类变量如下:对于中的每一名学生,分别令
通过比较条件概率回答上面问题.
用表示事件和的积事件,用表示和的积事件.
如果从该校女生和男生中各随机选取一名学生,那么该女生属于经常锻炼群体的概率是,该男生属于经常锻炼群体的概率是
1.7.2013
首先我们来学习两个基本概念。第一是分类变量,像性别、产品质量这些表示不同类别的变量就是分类变量,它们描述的是事物的“质”,而不是“量”。第二是列联表,它能把两个分类变量的数据整理在一起。比如我们刚才的例子,就可以整理成一个2x2列联表,清晰地展示不同性别学生的锻炼情况,这是我们后续分析两个分类变量之间是否有关联的基础工具。
‹#›
情境引入
在该校学生中,性别对体育锻炼的经常性有影响,男生更经常锻炼.
1.7.2013
首先我们来学习两个基本概念。第一是分类变量,像性别、产品质量这些表示不同类别的变量就是分类变量,它们描述的是事物的“质”,而不是“量”。第二是列联表,它能把两个分类变量的数据整理在一起。比如我们刚才的例子,就可以整理成一个2x2列联表,清晰地展示不同性别学生的锻炼情况,这是我们后续分析两个分类变量之间是否有关联的基础工具。
‹#›
知识点一:列联表
2×2 列联表:将两个分类变量(如“性别”与“锻炼习惯”)的频数分布交叉汇总在一张表中,用来直观展示不同类别组合下的样本数量.定义一对分类变量X和Y如下:X= 和Y= 其样本频数列联表(称为2×2列联表)为:
合计
合计
列联表:观测数据按两个或更多属性进行交叉分类时所列出的频数表,称为列联表.
1.7.2013
首先我们来学习两个基本概念。第一是分类变量,像性别、产品质量这些表示不同类别的变量就是分类变量,它们描述的是事物的“质”,而不是“量”。第二是列联表,它能把两个分类变量的数据整理在一起。比如我们刚才的例子,就可以整理成一个2x2列联表,清晰地展示不同性别学生的锻炼情况,这是我们后续分析两个分类变量之间是否有关联的基础工具。
‹#›
例题
例1: 为比较甲、乙两所学校学生的数学水平,采用简单随机抽样的方法抽取88名学生.通过测验得到了如下数据:甲校43名学生中有10名数学成绩优秀;乙校45名学生中有7名数学成绩优秀.试分析两校学生中数学成绩优秀率之间是否存在差异.
学校 数学成绩 合计
不优秀 优秀
甲校 33 10 43
乙校 38 7 45
合计 71 17 88
解:用表示两所学校的全体学生构成的集合.对于中每一名学生,定义分类变量X和Y如下:
甲校学生中数学成绩不优秀和优秀的频率分别为:和;
乙校学生中数学成绩不优秀和优秀的频率分别为:
和.
两校学生中数学成绩优秀率之间存在差异,甲校学生的数学成绩优秀率比乙校学生高.
1.7.2013
首先我们来学习两个基本概念。第一是分类变量,像性别、产品质量这些表示不同类别的变量就是分类变量,它们描述的是事物的“质”,而不是“量”。第二是列联表,它能把两个分类变量的数据整理在一起。比如我们刚才的例子,就可以整理成一个2x2列联表,清晰地展示不同性别学生的锻炼情况,这是我们后续分析两个分类变量之间是否有关联的基础工具。
‹#›
知识点二:直观分析——等高条形图
核心作用:可视化关联
相比于枯燥的列联表数据,等高条形图通过视觉化的条形高度差异,能让我们更直观、更快速地感知两个分类变量之间是否存在关联性.
绘制与解读逻辑
1.计算条件频率:依据频率稳定于概率,,
2.绘制与观察:在高度为1的条形中展示频率,对比发现甲校“优秀”占比显著更高.
3.初步结论:从图形上直观判断,学校与数学成绩优秀率存在关联.
⚠️ 局限性:感性认知≠严谨结论
通过等高条形图的比较是感性且主观的,它无法量化差异程度.同时,观察到的差异可能只是由于抽样的随机性造成的,不能直接作为最终的推断依据.
思考:“两校学生的数学成绩优秀率存在差异”这一结论是否有可能是错误的?
1.7.2013
有了列联表,我们还可以用更直观的方式来分析,那就是等高条形图。通过计算条件频率,我们可以看到男生经常锻炼的比例远高于女生。从图上看,这种高度差异非常明显。但是,这种直观的感觉可靠吗?它能不能作为我们下结论的依据呢?答案是不能,因为它不够严谨。
‹#›
思想引入:从“直观”到“理性”
回顾:直观分析的局限
列联表、等高条形图等直观方法虽然能给我们提供初步印象,但无法量化数据的差异,因此得出的结论往往是不可靠的,需要更严谨的数学证明.
核心思想:类比“反证法”
🔹 数学反证法:先假设结论不成立,推导矛盾,从而证明结论成立.
🔹 独立性检验:先假设“两个分类变量独立(无关系)”,若在该假设下观测到的样本数据是一个小概率事件,则有理由推翻原假设,认为两者有关.
1.7.2013
既然直观分析不可靠,我们就需要一种更理性的方法。这里要引入一个非常重要的思想——独立性检验,它的逻辑和我们数学中的反证法很像。我们先大胆地假设两个变量是独立的,然后通过计算来检验这个假设是否合理。如果不合理,我们就推翻这个假设。
‹#›
步骤一:提出零假设 ()
零假设 ()
定义:分类变量与相互独立,即两者之间不存在关联.
概率意义解读
通俗解释:
在零假设成立的条件下,“女生群体中经常锻炼的概率” 与 “男生群体中经常锻炼的概率” 是完全相等的.
案例说明:
: “性别”与“体育锻炼的经常性”是独立的.简单来说,性别不会影响一个人锻炼的频率.
1.7.2013
独立性检验的第一步,就是提出零假设,记作H₀。在我们的例子里,零假设就是“性别”和“锻炼习惯”这两个变量是相互独立的,没有关系。与之相对的,是备择假设H₁,即两个变量不独立。我们的任务,就是通过检验,来判断应该接受H₀还是拒绝H₀。
‹#›
步骤二:构造检验统计量——卡方 ()
核心思想
衡量观测频数与在成立时的期望频数之间的差异,以此判断分类变量间的相关性.
2x2列联表 · 简化计算公式
值的大小意味着什么?
数值越大,说明观测到的实际频数与“独立”假设下的理论期望频数之间的偏离程度越严重,原假设成立的可能性越小.
行列式 () 的角色
它是公式的核心驱动力.其绝对值越大,代表行变量与列变量之间的关联度越强.平方运算保证了无论正负偏离,最终结果都反映差异的严重程度.
1.7.2013
第二步,我们需要一个工具来衡量观测数据与假设之间的差异,这个工具就是卡方统计量,记作χ²。大家需要牢记这个简化公式。这个公式的核心是计算(ad-bc)的平方,它反映了实际数据与理论期望之间的偏离程度。χ²值越大,说明偏离越严重,原假设H₀成立的可能性就越小。
‹#›
步骤三:确定检验规则 —— 临界值
小概率原理
在一次随机试验中,小概率事件几乎不可能发生.
这是我们判断“是否推翻假设”的逻辑基石.
临界值
对于一个给定的显著性水平 ,我们可以找到一个临界值 若成立,则满足概率关系:
常用临界值参考表
小概率值 对应临界值
0.1 2.706
0.05 3.841
0.01 6.635
0.005 7.879
0.001 10.828
拒绝零假设
当时,我们推断不成立,即认为不独立,该推断犯错误的概率不超过;
不拒绝零假设
当时,我们没有充分证据推断不成立,可以认为独立.
这种利用的取值推断分类变量和是否独立的方法称为独立性检验,读作“卡方独立性检验”,简称独立性检验.
1.7.2013
有了χ²值,我们如何判断它是否足够大呢?这就需要用到临界值表。我们会预先设定一个小概率α,比如0.05,然后找到对应的临界值,比如3.841。如果我们计算出的χ²值大于这个临界值,就说明在假设H₀成立的情况下,发生了小概率事件,我们就有理由拒绝H₀。
‹#›
独立性检验完整步骤总结
01
确定变量
明确要研究的
两个分类变量
02
提出假设
建立零假设:
两个变量独立
03
构建表格
构建2×2列联表
确定 的值
04
计算统计量
将数据代入公式
计算的值
05
作出判断
比较与临界值
得出结论
💡 步骤口诀:
假设独立是前提,列表计算要仔细. | 卡方公式代数据,临界值前比一比. | 若大则拒无关系,结论表述要清晰.
1.7.2013
现在我们来总结一下独立性检验的完整步骤。总共五步:确定变量、提出假设、构建表格、计算统计量、作出判断。
为了方便大家记忆,我编了一个口诀,大家可以跟着念一遍:“假设独立是前提,列表计算要仔细。卡方公式代数据,临界值前比一比。若大则拒无关系,结论表述要清晰。”
‹#›
案例分析——饮食习惯与年龄
❓ 提出问题
某同学调查了30位亲属的饮食习惯,数据如下表所示.
问:能否在犯错误概率不超过0.05的前提下,认为饮食习惯与年龄有关?
人群 偏爱蔬菜 偏爱肉类 合计
50岁以下 4 8 12
50岁以上 16 2 18
1.假设: 饮食习惯与年龄相互独立.
2.计算卡方值: = 30 × (4×2 - 8×16)² / (12×18×20×10) =10
3.比较临界值: 10 > 3.841
4.得出结论: 在犯错误概率不超过0.05的前提下,认为饮食习惯与年龄有关.
1.7.2013
理论学完了,我们来看一个案例。这是一个关于饮食习惯和年龄的调查。我们按照刚才总结的步骤来操作:首先提出假设,然后构建列联表,接着代入公式计算出χ²值为10。最后,我们将10与临界值3.841比较,发现10更大。因此,我们可以得出结论:在犯错误概率不超过0.05的前提下,认为饮食习惯与年龄有关。
‹#›
课堂练习 1
题目描述
在一项打鼾与患心脏病的调查中,共调查了1768人,经计算得的观测值为27.63.根据这一数据分析,我们有多大的把握认为打鼾与患心脏病有关?
A. 90% B. 95% C. 99% D. 99.9%
答案与解析
1. 比较观测值与临界值:27.63 > 10.828 ().
2. 结论:我们有99.9%的把握认为打鼾与患心脏病有关.正确答案:D
1.7.2013
我们来做个练习。这里有一个关于打鼾和心脏病的调查,计算出的χ²值是27.63。大家看一下临界值表,27.63比哪个临界值大?对,它比10.828还要大,而10.828对应的是α=0.001。所以,我们有99.9%的把握认为两者有关。
‹#›
课堂练习 2:独立性检验
▍ 题目背景
为考察高中生的性别与是否喜欢数学课程之间的关系,在某校随机抽取300名学生,得到如下列联表数据:
类别 喜欢数学 不喜欢数学 合计
男 37 85 122
女 35 143 178
合计 72 228 300
Q: 能否在犯错误概率不超过0.05的前提下,认为两者有关?
💡 解题思路:
1. 零假设:性别与是否喜欢数学课程独立.
2. 计算:代入公式求得 χ² ≈4.514.
3. 比较:4.514 > = 3.841.
4. 结论:在犯错误概率不超过0.05的前提下,认为两者有关.
1.7.2013
再来一个练习,这次是关于性别和是否喜欢数学的。大家可以自己动手算一下,根据表格中的数据,a=37, b=85, c=35, d=143, n=300。代入公式计算出的χ²值大约是4.514。这个值大于3.841,所以我们可以得出结论:在犯错误概率不超过0.05的前提下,认为性别与是否喜欢数学有关。
‹#›
知识梳理与方法总结
核心逻辑链条
1.分类变量→ 整理数据
2.2×2 列联表
3.等高条形图(直观判断是否有关联)
4.独立性检验(严谨证明:假设检验思想 · 计算统计量 · 临界值判断)
解题口诀 · 速记版
假设独立是前提,列表计算要仔细.
卡方公式代数据,临界值前比一比.
若大则拒无关系,结论表述要清晰.
1.7.2013
课程接近尾声,我们来梳理一下今天学习的知识。从分类变量开始,到列联表,再到直观的等高条形图,最后我们学习了严谨的独立性检验方法。整个过程体现了从感性到理性的认知升级。大家要牢记独立性检验的思想和步骤,特别是右下角的这个口诀,它涵盖了“假设、计算、比较、结论”四个关键步骤,能帮助我们快速准确地解题。
‹#›
易错点提醒
01
混淆 的位置
严格按照列联表定义,注意行列分类标准, 的位置不能随意调换,否则后续计算全部错误.
02
卡方 () 计算错误
公式中包含多个分数项和求和运算,计算时要细心.特别注意先算分子的平方差,再乘,最后除以四个边缘乘积的和.
03
结论表述不当
❌ 错误:“我们证明了两个变量有关.”
✅ 正确:“在犯错误概率不超过的前提下,认为两个变量有关联.”
04
误解统计量含义
卡方 () 值本身不是概率,而是一个衡量观测值与期望值偏离程度的统计量.值才是在“原假设成立”条件下,出现当前观测结果的概率.
1.7.2013
最后,我要强调几个易错点。首先,列联表中a,b,c,d的位置千万不能搞混,它直接决定了后续计算的正确性。其次,计算χ²公式复杂,计算时一定要细心,注意运算顺序,避免低级的计算错误。最关键的是结论的表述,我们不能说“证明了”两个变量有关,而应该说“在犯错误概率不超过α的前提下,认为两个变量有关”。最后,不要误解卡方值,它本身不是概率,而是一个衡量偏离程度的统计量。记住,统计推断是带有概率性质的。
‹#›
布置作业
01 / 基础巩固
教材第134页,练习第 1, 3, 4题.
夯实基础知识,熟练掌握核心概念与基本计算.
02 / 能力提升
教材第135页,习题8.3 第 4, 5 题.
挑战进阶题型,提升对独立性检验原理的理解和应用能力.
03 / 实践探究
设计一个小调查,研究你感兴趣的两个分类变量(如:是否熬夜与是否迟到),收集数据并进行独立性检验,体会统计的实用价值.
1.7.2013
今天的课后作业分为三个层次。基础题和提升题请大家完成教材上的相应练习,巩固今天所学的知识。我特别推荐大家尝试一下实践题,自己设计一个调查,亲身感受一下统计在生活中的应用。这会让你对这部分知识有更深刻的理解。
‹#›
$