第9章 K-means 算法-【千锋教育】Python快乐编程——机器学习从入门到实战同步教案

2023-03-23
| 7页
| 119人阅读
| 0人下载
教辅

内容正文:

课程名称 第9章 K-means算法 计划学时 4学时 内容分析 本章主要介绍无监督学习算法、K-means算法简介、构建简单的K-means模型、K值的选择、二分K-means算法 教学目标 与教学要求 要求学生了解K-means算法的相关概念、掌握实现K-means算法的方法、掌握选择恰当的K值的方法、掌握实现二分K-means算法的方法 教学重点 构建简单的K-means模型、K值的选择、二分K-means算法 教学难点 构建简单的K-means模型、K值的选择、二分K-means算法 教学方式 课堂讲解及ppt演示 教 学 过 程 第一课时 (无监督学习算法、K-means算法简介、构建简单的K-means模型) 了解Python机器学习知识 1.介绍本书,引出本课时的主题 在群体决策出现分歧时, 如果赞同不同决策的人比例大致相同, 那么将很难通过“少数服从多数”这样的思想来做出决策。 实际上, 此时人群中存在着少部分犹豫不决的人, 尽管这类摇摆不定的人占比很少, 但当持各观点人数接近时, 这些人的立场便会对最终的决策产生重要影响。 如果对这一部分人进行引导, 便能影响最终的决策。 如何才能找出这类人呢?答案便是本章将要涉及的聚类算法。 2.明确学习目标 (1) 能够掌握无监督学习算法 (2) 能够掌握K-means算法简介 (3) 能够掌握构建简单的K-means模型 知识讲解 · 无监督学习算法 在之前介绍的各算法中, 模型的训练目标通常是提升根据现有数据来预测新数据点的准确度, 这类算法称为“监督学习”。 然而, 有时候算法的作用并不是“做出预测”, 而是将数据集划分成多个簇从而对数据进行分类, 这类算法便属于“无监督学习”。 本章将要介绍的聚类算法便是一种无监督学习。 聚类分析又称簇分析, 属于研究(样品或指标) 分类问题的统计分析方法, 是数据挖掘中的重要算法之一。 无监督学习算法目前的主要应用领域有以下几种。 1. 个性化推荐 网络购物目前正飞速发展, 其中个性化推荐的作用越来越受重视。 个性化推荐是根据用户的兴趣特点和购买行为, 向用户推荐用户感兴趣的信息和商品。 随着电子商务规模的不断扩大, 商品个数和种类快速增长, 顾客需要花费大量的时间才能找到自己想买的商品。这种浏览大量无关的信息和产品的过程无疑会使淹没在信息过载问题中的消费者不断流失。 2. 聚类分组 聚类是将数据集划分为若干簇的过程。 同一簇内的数据对象具有较高的相似度, 不同簇中的数据对象的相似度较低。 聚类算法广泛应用于数据分析、 数据挖掘、 图像分割、 统计学和机器学习等领域。 聚类算法在处理大量数据时效率较高, 在大数据时代有着重要的价值。 例如, 按照微博用户所讨论的话题以及用户所使用的某些关键词汇对用户进行分组。 本章后续将重点讲解的 K-means 算法便属于聚类算法, 它会先随机确定 K 个质心, 然后将各个数据对象分配给距离最近的质心。 在分配完成后, 质心可能会发生变化, 新的质心会转移到该质心所属簇中所有数据点的平均位置处。 然后, 整个分配过程重新开始。 不断迭代, 直到结果不再发生变化为止。 3. 搜索和排名 搜索引擎的工作原理是根据用户的检索信息, 对互联网上的信息进行搜集整理, 并将搜集结果按照一定的规则进行排名后展示出来。 Google 搜索引擎如图所示。 4. 文档过滤 文档过滤中最为大家所熟识的便是邮箱的垃圾邮件过滤功能。 例如, QQ 邮箱当年刚推出时, 广大用户饱受垃圾邮件的侵扰, 但是随着腾讯公司对垃圾邮件过滤进行算法的迭代, 现在已经不再像过去那样, 一打开邮箱垃圾邮件铺天盖地地袭来。 不过, 如今网络上的垃圾信息问题早已不再局限于垃圾邮件问题。 5. 特征提取 特征提取通过从数据集中寻找独立的特征, 来发掘数据集中值得关注的重要信息。 金融市场拥有众多的参与者, 这些参与者根据掌握的各种信息和市场行情, 彼此独立地采取行动对金融市场产生干预。 通过对相关数据进行分析, 可以找出反映重要交易日的模式, 以及驱动某些股票交易量大幅上涨的潜在因素。 · K-means算法简介 聚类算法属于无监督学习的范畴, 它可以将数据集中的样本切分为互不相交的多个子集(簇)。 通过这种划分方式, 每个簇可能对应于一些潜在的类别, 聚类过程是自动形成簇结构的过程。 聚类算法的应用领域非常广, 适用于所有对象。 判断该算法效果的主要目标为: 将相似对象归入同一簇, 将不相似对象归到不同簇。 同一簇内对象的相似程度越高则聚类效果越好。 本章将主要介绍 K-means 算法, 并以此作为无监督学习算法的入门。 K-means 算法的特点是簇的个数是人为给定的, 且每个簇的中心(质心) 采用

资源预览图

第9章 K-means 算法-【千锋教育】Python快乐编程——机器学习从入门到实战同步教案
1
所属专辑
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。