内容正文:
第五章 数据处理与可视化表达
信息技术 必修1
粤教版普通高中教科书
数据与计算
内容回顾
课时内容安排
网络购物平台客户行为数据分析和可视化表达
网购行为分析
网购数据的采集
网购数据的分析
网购数据的可视化表达
5.1
认识大数据
5.2
数据的采集
子项目主题
内容目录
5.3
数据的分析
5.4
数据的可视化表达
5.2.1 数据采集的方法与工具
子项目二:网购数据的采集
子项目二:
网购数据的采集
问题:
数据采集的方式有哪些?
数据的采集
数据的分析
一、数据采集的内涵与过程
内涵:数据采集根据需求采用适当的方法和工具获取数据。
过程:
明确数据应用项目的需求
采用适当的方法和工具
数据的存储和保护
围绕选定的项目主题,制定数据采集的需求清单和内容大纲
针对不同的数据类型,选择适当的工具和方法,采集数据
要选择合适的存储方式并注意数据安全
过程:
二、数据采集的基本方法
01
03
系统日志采集法
网络数据采集法
其他数据采集法
02
数据采集的基本方法:
二、数据采集的基本方法
1
系统日志采集法
在信息系统中,系统日志是记录系统中硬件、软件和系统问题的信息文件。
通常是在目标主机上安装一个小程序,将目标主机的文本、应用程序、数据库等日志信息有选择地定向推送到日志服务器进行存储、监控和管理。
通过日志服务器可以监视系统中发生的事件,可以检查错误发生的原因,或者寻找受到攻击时攻击者留下的痕迹。
二、数据采集的基本方法
探究活动一
小组协作,参照微课《系统日志采集法》进行实践,在探究活动记录表中截图粘贴并分析你的计算机的情况。
截图:
分析:
二、数据采集的基本方法
2
网络数据采集法
通过网络爬虫或网站公开的API(应用程序接口)等方式从网站上获取数据信息。
该方法可将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。
二、数据采集的基本方法
2
网络数据采集法
通过网络爬虫或网站公开的API(应用程序接口)等方式从网站上获取数据信息。
该方法可将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。
网络爬虫?
二、数据采集的基本方法
2
网络数据采集法
通过网络爬虫或网站公开的API(应用程序接口)等方式从网站上获取数据信息。
该方法可将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。
网络爬虫?
1.什么是网络爬虫?
网络爬虫:又称网络蜘蛛、网络蚂蚁、网络机器人等。
按照人们事先制定的爬取规则,可以代替人们自动地在互联网中进行数据的采集与整理。
即:可以自动采集网络数据的程序
二、数据采集的基本方法
2
网络数据采集法
通过网络爬虫或网站公开的API(应用程序接口)等方式从网站上获取数据信息。
该方法可将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。
网络爬虫?
2.网络爬虫的应用有哪些?
二、数据采集的基本方法
2
网络数据采集法
通过网络爬虫或网站公开的API(应用程序接口)等方式从网站上获取数据信息。
该方法可将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。
网络爬虫?
3.网络爬虫获取数据的流程是怎样的?
获取网页的URL
爬取网页的内容
分析网页的内容
提取有用的数据
获取其他的URL,重复前面的步骤,直到满足停止条件
注意:网络爬虫的合法性
二、数据采集的基本方法
2
网络数据采集法
通过网络爬虫或网站公开的API(应用程序接口)等方式从网站上获取数据信息。
该方法可将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。
网络爬虫?
4.如何实现爬虫程序爬取数据?
使用Python语言的第三方库来实现爬虫编写:
常使用到的库:
requests库——获取网页信息
bs4库(beautifulsoup)——解析HTML页面
xlwt库——调用Excel模块,将获取的有用信息写入表格文件保存
NumPy库 ——构建科学计算最基础的软件库
Pandas ——主要用于快速简单的数据操作、聚合和可视化呈现
Matplotlib ——Python绘图库
二、数据采集的基本方法
2
网络数据采集法
通过网络爬虫或网站公开的API(应用程序接口)等方式从网站上获取数据信息。
该方法可将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。
网络爬虫?
4.如何实现爬虫程序爬取数据
使用Python语言的第三方库来实现爬虫编写:
使用前需要用pip命令安装第三方库:
二、数据采集的基本方法
2
网络数据采集法
通过网络爬虫或网站公开的API(应用程序接口)等方式从网站上获取数据信