内容正文:
第八章 成对数据的统计分析
8.3 列联表与独立性检验
8.3.1 分类变量与列联表
【学习目标】
1. 了解分类变量的概念,能区分数值变量与分类变量.
1. 理解 2×2 列联表的构造与意义,会用频率分析法、图形分析法(等高堆积条形图)探究两个分类变量之间的关系.
1. 能够对统计数据进行整理、初步分析,提升数据建模与数据分析素养.
【学习重点】
1. 分类变量的定义及与数值变量的区别.
2. 2×2 列联表的制作与解读.
3. 利用频率、条件概率和等高堆积条形图判断两个分类变量之间是否存在关联.
【学习难点】
1. 理解“样本随机性可能导致推断错误”这一思想.
2. 从等高堆积条形图中直观判断两个变量是否独立.
学习任务一 分类变量的概念与列联表的构造
【合作探究】
1. 问题引入:
· 玩手机时间长短会不会影响数学考试成绩?如何用数据而不是感觉来判断?
· 这里的“玩手机时间长短”可以分成“长时间” “短时间”等类别,“数学成绩”可以分成“好” “差”等类别.这种取值为“类别”的变量称为分类变量.
1. 变量分类:
(1) 数值变量:取值为实数,大小和运算有实际意义(如身高、成绩分数、时间).
(2) 分类变量:取值表示不同类别,数值仅作为代号(如性别:0/1,班级:1,2,3).
1. 列联表的构造:
· 研究性别与体育锻炼经常性的关系,得到普查数据:
· 女生 523 人中经常锻炼 331 人,男生 601 人中经常锻炼 473 人.
· 整理成 2×2 列联表:
性别
经常锻炼
不经常锻炼
合计
女
331
192
523
男
473
128
601
合计
804
320
1124
· 该表称为 2×2 列联表,用于交叉分类频数统计.
1. 分析:
(1)
女生经常锻炼的比例:;
(2)
男生经常锻炼的比例:.
· 两者差异明显,初步认为性别与锻炼经常性相关.
【自主梳理】
1. 分类变量:取值为有限个类别,数值仅作标签,无大小运算含义.
1. 2×2 列联表:按两个分类变量的两种取值交叉分类得到的频数表,形式为:
合计
合计
1. 频率分析法:比较两个类别的条件频率(比例)是否相等.
学习任务二 直观判断——等高堆积条形图
【合作探究】
1. 等高堆积条形图的绘制:
· 以性别为例,画两个条形(女、男),高度均为 1,内部按经常锻炼与不经常锻炼的比例分割.
· 如果两个条形的内部结构相似(即经常锻炼的比例相同),则说明两个变量可能独立;如果差异较大,则可能存在关联.
1. 实例(例1):
· 甲校 43 名学生中 10 人数学成绩优秀,乙校 45 名学生中 7 人优秀.
(1)
甲校优秀率:;
(2)
乙校优秀率:.
· 频率差异约为 0.077,画出等高堆积条形图(描述:甲校的“优秀”段比乙校稍高).
· 问:这个差异是否足以推断两校优秀率有本质差异?
· 答:样本具有随机性,可能只是因为抽样偶然导致差异,不一定反映总体真实情况.下一节将学习如何量化这种犯错概率.
1. 功能:等高堆积条形图能直观展示两个分类变量间是否存在关系,但只能作为初步判断,不能作为最终结论.
【自主梳理】
等高堆积条形图:
1. 横轴:一个分类变量的不同取值(如男、女).
2. 每个条形高度为 1,内部按另一个分类变量的比例分割.
3. 若各条形的分割比例差异明显,则两个变量可能相关.
学习任务三 条件概率视角与样本随机性
【合作探究】
1. 用条件概率判断:
·
设 为“女生”, 为“经常锻炼”.
·
,.
·
若性别与锻炼无关,则 应等于 .现两者不等,提示有关联.
1. 样本随机性与推断错误:
· 样本只是总体的一个子集,频率具有随机性.即使总体中两变量独立,样本也可能出现较大差异.
· 因此,仅凭样本频率差异就下结论可能犯错.后续将学习 独立性检验 来量化犯错概率.
【自主梳理】
1.
条件概率 与 的差异可以反映 与 的关联程度.
2. 由于样本随机性,观察到的差异不一定代表总体真实情况,需借助统计检验.
【自查自纠】(正误判断)
1. 分类变量的取值可以进行加减运算. ( )
1. 2×2 列联表是用于整理两个分类变量数据的表格. ( )
1. 等高堆积条形图中,若两个条形的内部比例相同,则两变量一定独立. ( )
1. 样本频率的差异可以直接作为总体结论的依据. ( )
1. 从列联表可以计算条件频率来比较不同组间的差异. ( )
答案:1.× 2.√ 3.×(样本随机性,可能只是巧合) 4.× 5.√
【典例分析】
例1:某校调查了 200 名学生,其中男生 120 人,女生 80 人.喜欢篮球的男生有 90 人,喜欢篮球的女生有 40 人.
(1) 完成 2×2 列联表.
(2) 分别计算男生和女生的喜欢篮球的比例,并判断性别与喜欢篮球是否可能存在关联.
解:
(1) 列联表:
性别
喜欢篮球
不喜欢篮球
合计
男
90
30
120
女
40
40
80
合计
130
70
200
(2) 男生喜欢比例:;女生喜欢比例:.
差异较大,表明性别与喜欢篮球可能存在关联.
例2:某机构调查了 300 人,分为“吸烟”与“不吸烟”,调查他们是否患肺病.吸烟组 150 人中有 30 人患肺病,不吸烟组 150 人中有 10 人患肺病.
(1) 构建 2×2 列联表.
(2) 判断吸烟与患肺病是否可能有关.
解:
(1)
吸烟
患肺病
未患肺病
合计
是
30
120
150
否
10
140
150
合计
40
260
300
(2) 吸烟者患病率 ,不吸烟者患病率 ,差异明显,说明吸烟可能与患肺病有关.
【习题巩固】
1. 下列变量中,属于分类变量的是( )
· A. 身高 B. 体重 C. 性别 D. 温度
1.
在 2×2 列联表中,若 ,则样本总数为( )
· A. 50 B. 60 C. 70 D. 100
1. 等高堆积条形图的主要作用是( )
· A. 精确计算两个变量的相关系数
· B. 直观展示两个分类变量间的关联
· C. 检验两个变量是否独立
· D. 绘制两个数值变量的散点图
1. 某校调查了 500 名学生,其中男生 300 人,女生 200 人.喜欢数学的男生有 210 人,喜欢数学的女生有 110 人.
· (1) 完成 2×2 列联表.
· (2) 分别计算男生和女生的喜欢数学比例,并判断性别与喜欢数学是否可能存在关联.
1. (选做)根据例1(甲、乙两校数学优秀)的数据,画出等高堆积条形图的文字描述,并说明你的初步结论.
【参考答案】
自查自纠:已附.
习题巩固:
1. C
1. D(总数 = 20+30+40+10 = 100)
1. B
1. (1) 列联表:
性别
喜欢数学
不喜欢数学
合计
男
210
90
300
女
110
90
200
合计
320
180
500
(2) 男生喜欢比例 ,女生喜欢比例 ,差异明显,可能存在关联.
1. 描述:横轴为甲校、乙校两个条形,高度均为1.甲校内部优秀部分约占 0.233,乙校优秀部分约占 0.156,两者存在差距,初步认为甲校优秀率可能高于乙校.但由于样本随机性,需进一步检验.
学科网(北京)股份有限公司
$