内容正文:
课程名称
第5章 决策树
计划学时
4学时
内容分析
本章主要介绍逻辑回归Sigmoid函数、梯度下降算法、通过梯度下降算法找到最佳参数、决策边界、梯度下降算法的改进
教学目标
与教学要求
要求学生理解逻辑回归的概念、了解梯度下降算法、了解随机梯度下降算法、掌握通过逻辑回归实现手写数字识别的方法
教学重点
梯度下降算法、通过梯度下降算法找到最佳参数、决策边界、梯度下降算法的改进
教学难点
梯度下降算法、通过梯度下降算法找到最佳参数、决策边界、梯度下降算法的改进
教学方式
课堂讲解及ppt演示
教
学
过
程
第一课时
(逻辑回归与Sigmoid函数、梯度下降算法)
了解Python机器学习知识
1.介绍本书,引出本课时的主题
在机器学习领域, 逻辑回归(logisticregression) 常被用于解决二分类问题, 例如用于预测某个事件发生的可能性: 预测某用户购买某件商品的可能性, 或者预测病人患有某种疾病的可能性。 逻辑回归是广义线性模型的一个特例, 虽然被称为回归, 但在实际应用中常被用于分类任务。 接下来, 本章将介绍通过最优化算法训练非线性函数模型并将模型用于解决分类任务的方法。
2.明确学习目标
(1) 能够了解逻辑回归简介
(2) 能够掌握Sigmoid函数简介
(3) 能够掌握二维坐标系中的梯度下降算法
(4) 能够掌握三维坐标系中的梯度下降算法
知识讲解
· 逻辑回归简介
机器学习通常由三个要素构成: 模型、 策略和算法。 模型是指假设数据空间的形式(例如线性模型或者条件概率模型); 策略是指模型好坏的判别标准, 即优化问题( 损失函数);算法是指优化问题的求解方法(例如梯度下降算法)。
逻辑回归与线性回归都属于广义线性模型。 逻辑回归假设因变量y 服从伯努利分布,而线性回归假设因变量y 服从高斯分布, 逻辑回归与线性回归有许多相似之处。 简单来说, 逻辑回归模型就是在线性回归的结果中添加了 Sigmoid 函数。 逻辑回归模型通过引入Sigmoid 函数为模型增加了非线性因素, 因此可以更轻松地处理0-1 分类问题。
逻辑回归是在线性回归的基础上加了一个 Sigmoid 函数( 非线性) 映射, 使得逻辑回归成为一个优秀的分类算法。 从本质上来说, 两者都属于广义线性模型, 但它们两个要解决的问题不一样: 逻辑回归解决的是分类问题, 输出的是离散值; 线性回归解决的是回归问题,输出的连续值。
逻辑回归的求解过程可以大致分为以下三个步骤。
(1) 寻找合适的函数, 用来预测输入数据的分类结果。
(2) 构建损失函数, 该函数用于表达预测输出与训练数据类别之间的偏差。 损失函数
通常会计算预测的输出值与实际值的各类差值作为偏差评价标准。
(3) 找到损失函数的最小值(损失值越小表示预测函数的预测越准确)。 求解损失函数的最小值通常采用梯度下降法(gradient descent)。 二分类问题中一般使用Sigmoid 函数作为预测分类函数(5.1.2 节将会详细讲解)。
通过 Python 实现逻辑回归的一般流程如下所示。
(1) 收集数据: 进行原始数据的收集。
(2) 预处理数据: 由于计算中涉及距离运算, 因此需要将原始数据的数据类型转换为数值型(结构化数据格式效果更好)。
(3) 数据分析: 采用相应的分析方法对数据进行分析。
(4) 训练模型: 训练模型将花费大量的时间资源和计算资源, 训练模型的目的在于找到最佳的分类回归系数。
(5) 测试模型: 当模型训练完成后, 通过测试数据集对模型进行检测, 测试模型的预测准确度。
(6) 应用模型: 基于之前训练好的模型对这些数值进行简单的回归计算, 判定新的未知数据所属的类别。
决策树通常用一棵倒置的树结构来表示数据间的逻辑关系, 基于数据的特征进行判断,进而得到分类或回归结果。 树结构中通常包含三种结点, 分别为根结点、 子结点和叶子结图判断用户是否能贷款点。 根结点是树的最顶端的结点, 每棵决策树只会有一个根结点; 子结点对应于每一个分裂问题, 该结点的每一个后继分支对应于该特征的一个可能值; 叶子结点是带有分类标签的数据集合, 即样本所属的分类。 当决策树不断分裂直到无法再分出子结点时称该结点为叶子结点。 接下来, 通过一个简单示例展示决策树模型。
· Sigmoid函数简介
逻辑回归的目的在于找到能对所有输入数据准确预测的分类函数。 以二元分类为例,输出结果只有“0”或“1”两个, 即y ∈ {0,1}, 阶跃函数曾被用于处理此类问题, 但是阶跃函数在x =0 时位置会发生突变, 这个突变在数学上很难处理, 即阶跃函数具有不连续、 不可导的特点, 因此, 在逻辑回归里引入了Sigmoid 函数。 Sigmoid