内容正文:
第9章 Scikit-Learn数据建模
数据建模的基本概述
回归模型的应用与评价
NLTK的基本介绍和使用
聚类模型的应用与评价
分类模型的应用与评价
数据建模的基本概述
回归模型的应用与评价
聚类模型的应用与评价
分类模型的应用与评价
目 录
CATALOUGUE
初心至善 匠心育人
01
02
04
03
掌握数据建模的基本流程
掌握分类模型的创建与评价
掌握回归模型的创建与评价
掌握聚类模型的创建与评价
学 习 目 标
LEARNING OBJECTIVES
初心至善 匠心育人
在 21 世纪的今天,我国的综合国力不断提升,科技水平成为现代衡量国家力量的重要指标。近年来,我国在 AI 领域的科技水平迅速发展,促进了国防科技的更新换代, AI 科技在国际竞争中的地位可见一斑。 Scikit-Learn 是 AI 入门的必学之器,学好 Scikit-Learn 为祖国 AI 事业做贡献是必然之事。
初心至善 匠心育人
9.1
数据建模
的基本概述
初心至善 匠心育人
9.1.1 Scikit-Learn的基本介绍
作为 GitHub 上排名第二的 Python 机器学习项目, Scikit-Learn 具有分类、回归、聚类、数据降维、模型选择、数据处理六大功能。 Scikit-Learn 库是基于科学计算领域的 SciPy 包开发,该包是 SciPy 在机器学习领域的定制包。 SciPy 具有许多领域的分支包,通常将所有领域的包的集合称为 Scikits ,即 SciPy 工具包的集合。 Scikit-Learn 本身并不支持深度学习,同时不支持 GPU 加速。
Scikit-Learn (以下 简称 sklearn )中具有 用 于 监 督 学 习 和 无 监 督 学 习 的 基 本 方 法。sklearn 中的函数大致可以分为两类,分别是估计器和转换器。估计器就是模型,用于对数据的预测和回归;转换器用于对数据的处理,如标准化、数据降维及特征选择等。
初心至善 匠心育人
9.1.1 Scikit-Learn的基本介绍
估计器通常具有三个函数,分别是 fit ()、socre ()和 predict ()函数。 fit ()函数通常为可训练模型;socre ()函数多用于对模型的评分;predict ()函数用于对数据的预测,并输出预测标签。
转换器通常具有三个函数,分别是 fit ()、transform ()、 fit _ transform ()。 fit ()函数用于计算数据变换方式;transform ()根据已经计算的变换方式,计算数据的变换结果;fit _tramsform ()函数用于计算出数据变换方式之后对输入数据进行就地转换。
初心至善 匠心育人
9.1.2 数据建模的基本流程
sklearn 作为数据建模的利器,在使用过程中会经过如下步骤:数据集加载、数据集划分、数据集预处理、数据模型评估。下面将对这几个步骤分别进行介绍。
1.数据集加载
数据集加载是将已知的数据源加载到当前工程的内存环境中,供数据预处理与数据建模使用。当然,开发者也可以根据自己的实际需求,调整数据集的大小等相关属性。
初心至善 匠心育人
9.1.2 数据建模的基本流程
sklearn 库中集成了 datasets 模块,该 模块中包含 数据分析中 常用的经典 数据集。datasets 模块中常用的数据集加载函数具体如表所示。
初心至善 匠心育人
9.1.2 数据建模的基本流程
sklearn 同时支持加载实际的数据集,相对上述数据集而言,实际数据集可靠性更强,数据量更大,实际数据集的加载函数具体如表所示。
初心至善 匠心育人
9.1.2 数据建模的基本流程
除此之外,sklearn 同时支持加载外部数据集,加载外部数据集主要通过 pandas.io 加载CSV 、 Excel 、 JSON 、 SQL 等类型的数据;通过 scipy.io 可以加载 .mat 、 .arff 格式的数据;除了文本数据外,sklearn 支持使用 skimage.io 或者 Imageio 加载图像或者视频数据,并将数据处理为 NumPy 的数据类型数据;通过 scipy.io.wavfile.read ()函数读取 WAV 形式的音频数据。
开发者可以使用 datasets 数据集进行相关数据的导入,具体代码如下。
初心至善 匠心育人
9.1.2 数据建模的基本流程
上述代码从 datasets 模块中导入 load _ iris ()函数,通过调用该函数实现数据集的加载。数据加载后,可认为是一个字典形式的数据,可以查看其元素个数。但是数据类型并非字典类型,而是 sklearn 中的 Bunch 类型,具体代码