内容正文:
课程名称
第3章 决策树
计划学时
4学时
内容分析
本章主要介绍决策树信息熵、构建决策树、可视化决策树、基尼指数与CART算法、决策树的剪枝
教学目标
与教学要求
要求学生理解决策树的构建、掌握决策树的实现方法、掌握树形图的绘制方法、了解决策树的剪枝技术
教学重点
构建决策树、可视化决策树、基尼指数与CART算法、决策树的剪枝
教学难点
构建决策树、可视化决策树、基尼指数与CART算法、决策树的剪枝
教学方式
课堂讲解及ppt演示
教
学
过
程
第一课时
(决策树与信息熵、构建决策树)
了解Python机器学习知识
1.介绍本书,引出本课时的主题
决策树算法是一种非参数的监督学习方法, 常被用于从一组无序、 无规则的样本数据中推理出决策树表示形式的分类规则, 例如数据挖掘任务。 顾名思义, 决策树以树形数据结构来进行分类或预测决策, 在分类应用中, 决策树中的每个结点构成类标签, 叶子结点是最终的分类标号; 树中的分支由决策规则组成。 决策树是最常见的一种机器学习算法, 它易于实现, 可解释性强, 符合人类的直观思维。 本章将对决策树的构建以及实现方法进行讲解。
2.明确学习目标
(1) 能够了解决策树简介
(2) 能够掌握信息与自信息
(3) 能够掌握信息熵
(4) 能够掌握信息增益与划分数据集
(5) 能够掌握构建决策树
知识讲解
· 决策树简介
决策树通常用一棵倒置的树结构来表示数据间的逻辑关系, 基于数据的特征进行判断,进而得到分类或回归结果。 树结构中通常包含三种结点, 分别为根结点、 子结点和叶子结图判断用户是否能贷款点。 根结点是树的最顶端的结点, 每棵决策树只会有一个根结点; 子结点对应于每一个分裂问题, 该结点的每一个后继分支对应于该特征的一个可能值; 叶子结点是带有分类标签的数据集合, 即样本所属的分类。 当决策树不断分裂直到无法再分出子结点时称该结点为叶子结点。 接下来, 通过一个简单示例展示决策树模型。
· 信息与自信息
在进一步学习决策树算法之前, 有必要掌握一些必要的基础概念, 如信息与自信息的概念。
广义上的信息是指事物运动时发出的信号所带来的消息, 是事物存在方式和运动规律的一种表现形式。 不同的事物具有不同的存在方式和运动规律, 从而构成了各种事物的不同特征。 信息普遍存在于自然界、 社会界以及人的思维之中, 是客观事物千差万别的本质特征的反映。 信息分为两大类: 自然信息与社会信息。
消息是指信息的具体反映形式, 是信息的实质内容。 不同的消息中所包含的信息量是不同的。 只有被消息的接收者了解并认识的内容(这部分内容接受者事先不知道) 才蕴含着信息。
· 信息熵
一般情况下, 数据集划分的大原则是将原本无序的数据整理成更加有序的分组。 其中一种对杂乱无章的数据进行整理的方法便是通过信息论度量信息。 信息论属于量化处理信息的分支科学。
如果待分类的数据集D 中第i 类样本所占的比例为p (xi ),(i =1 ,2,…,n ),n 表示分类数量, 则类别xi 的自信息表达式如下所示。
· 信息增益与划分数据集
信息增益是指以某特征划分数据集前后的熵的差值。 在3.1.3 节中, 本书介绍了度量数据集无序程度的方法, 在分类算法中, 除了需要计算信息熵, 还需要对数据集进行划分, 计算划分数据集的熵, 从而判断该分类方法是否正确地对数据集进行了划分。 通过对按照每种特征划分数据集的结果逐一计算信息熵来找出最优的划分方式。 掌握了计算信息增益的方法, 就可以计算每一个特征值划分数据集获得的信息增益, 获得信息增益最高的特征就是最优特征。
在之前介绍熵的时候已经提到, 可以通过熵来表示数据集的不确定性, 熵的值越大, 数据集的不确定性就越大。 因此, 可以根据划分前后数据集熵值的变化来衡量使用当前特征对样本集合D 划分的效果。 划分前数据集D 的熵是确定的, 根据某个特征 A 划分数据集D , 计算划分后的数据子集的熵。
· 构建决策树
在构建决策树时, 首先要解决的问题是判断出当前数据集中哪个特征在划分数据分类时起决定性作用。 为找到决定性的特征, 划分出最好的结果, 需要对每个特征进行评估。 假设已经根据一定的方法选取了待划分的特征, 则原始数据集将根据这个特征被划分为几个数据子集。 由于特征值可能多于2 个, 因此可能出现多于2 个分支的划分情况: 如果某个分支下的数据属于同一类型, 则无须进一步对数据集进行划分; 如果数据子集内的数据不属于同一类型, 则需要递归地重复划分数据子集的过程, 直到每个数据子集内的数据类型相同。
第二课时
(可视化决策树、基尼指数与CART算法、决策树的剪枝)
回顾内容
1. 回顾上节内容,引出本课时主