内容正文:
第13章网络爬虫与数据可视化实战
〉网络爬虫概述
模块6∶requests库的使用
模块7:beautifulsoup4库的使用
实战20:电影排行爬取及分析
,模块8∶openpyxl库的使用
′实战21:Python职位分析及可视化
学习目标
LEARNING OBJECTIVES
掌握网络爬虫的基本工作流程
理解requests:模块访问URL的过程
运用peautifulsoup4模块解析和处理HTML
掌握openpyxl模块进行xlsx文件的存取和可视化的方法
初心至善匠心育人
13.1
网络爬虫概述
网络爬虫的概念
目录
Contents
网络爬虫的基本工作流程
初心至善匠心有人
13.1网络爬虫概述
13.1.1网络爬虫的概念
网络爬虫(Web Crawler)是按照-定的规则,自动地抓取万维网(World
Vide Web,WW)并获取信息的程序或脚本。在浏览器的网页中,除了供用户
阅读的文字信息外,还包括一些超链接,网络爬虫可以通经过网页中的超链接
不断地获得网络上的其它页面。网络数据采集的过程像爬虫在网络上漫游,因
此得名为网络爬虫。
初心至善匠心育人
13.1网络爬虫概述
13.1.1网络爬虫的概念
网络爬虫时需要考虑爬虫合法性。Robots协议的全称是“网络爬虫排除标准”
(Robots Exclusion Protocol),也称为爬虫协议,是国际互联网中的一种通用
道德规范。网站管理者可以通过robot.txt文件列出不允许爬虫爬取的链接,以表
达是否希望爬虫获取网络数据的意愿。Robots协议并非强制的命令,而是约定倍
成的标准,大多数的搜索引解都会遵守此协议,建议个人也能够按照此协议的要求
合理地使用网络爬虫技术。
初心至善匠心育人
13.1网络爬虫概述
13.1.2网络爬虫的基本工作流程
简单的网络爬虫通常分为以下三个部分的内容:
数据采集,即获取网页中的数据;
数据处理,即进行网页解析;
数据存储,即将有用的信息持久化。
初心至善匠心育人
13.1网络爬虫概述
13.1.2网络爬虫的基本工作流程
开始
设定抓取目标(初始URL)并获取页面。
,不断地爬取页面,直到满足停止爬取的条件。
初始URL
对于获取的页面,进行网页下载,获得网页中的数据。获得网页中
阿页下到
网贡解折
的数据需要用到Python中的requestsi模块,
获取网页
网页中的数据
有用的信息持久化
获取网页中的数据后,需要对此数据进行解析。进行网页解析需要
抓电新红L,并放入
用到Python中的beautifulsoup.4模块
URL队列
,对于网页解析出来的数据,可以对有用的信息进行存储。有用的信
足停止衡的摔件了≥
息,可以存储在文件中,也可以存储在数据库中,本章将选择存放在
Microsoft Office EXCEL中的xlsx文件中。对xlsx文件进行操作有多
结束
个模块可以使用,本章中选择第三方库openpyxl,.不但可以进行xlsx
文件的读写,还可以进行可视化的展示。
初心至善匠心育人
13.1网络爬虫概述
13.1.2网络爬虫的基本工作流程
pip install requests
pip install beautifulsoup4
pip install openpyxl
初心至善匠心育人
13.2
模块6:requests库的使用
requests库的基本介绍
目录
Contents
requests库的基本操作
初心至善匠心育人
13.2模块6:requests)库的使用
13.2.1 requests.库的基本介绍
requests库的本质就是封装了urllib3模块,它可以摸拟浏览器的请求,编写过程更接近正常URL的访
问过程。requests库的宗旨是服务于人类(for human beings),具有以下功能特性:
,支持URL数据自动编码:
支特HTTP连接保特和连接池:
支持使用Cookie保持会话:
支持文件分块上传:
支持自动确定相应内容的编码。
支持连接超时处理和流数据下载。
初心至善匠心育人