内容正文:
YCF
(中职)Python编程基础与应用电子课件网络爬虫库的应用
1
网络爬虫库的应用
主讲:
:
《Python编程基础与应用》配套课件
2
+
contents
目
录
requests的安装和简介
Beautifulsoup4的安装和简介
SQLite数据库的使用
案例:新闻网页爬虫项目
《Python编程基础与应用》配套课件
3
requests的安装和简介
01
《Python编程基础与应用》配套课件
4
requests的简介
requests库是一个常用的用于http请求的模块,它使用python语言编写,可以方便地对网页进行爬取,是学习python爬虫的较好的http请求模块。
requests库支持非常丰富的链接访问功能,包括域名和URL的获取、HTTP长连接和连接缓存、HTTP会话和cookie保持、浏览器的SSL验证、基本的制作摘要认证、有效的键值对cookie记录、自动解压缩、自动内容解码、文件分块上传、HTTP和HTTPS代理功能、连接超时处理、流数据下载等。Requests 支持 Python 2.6—2.7以及3.3—3.7,而且能在 PyPy 下运行。
《Python编程基础与应用》配套课件
5
requests的安装
有关它的更多介绍请访问英文网站https://2.python-requests.org/en/latest/或者中文网站https://2.python-requests.org/zh_CN/latest/index.html。
它的安装方法很简单,可以直接使用PIP进行安装:
pip install requests
《Python编程基础与应用》配套课件
6
requests的常用函数
《Python编程基础与应用》配套课件
7
response对象的一些属性
《Python编程基础与应用》配套课件
8
范例11-4 requests的基本方法
以下范例中使用简单的几行代码就可以实现抓取百度首页的信息。
《Python编程基础与应用》配套课件
9
范例11-4 requests的基本方法
其中response.text和response.content可以获取网页源码,读者可以自己尝试一下
它的结果如下
《Python编程基础与应用》配套课件
10
范例11-5使用requests下载一个网页到本地
应用requests库可以快速地所一个URL网页的源码信息下载下来,并保存到本地。以下范例把百度新闻首页抓取下来并保存到文本文件newshtml.txt中。
《Python编程基础与应用》配套课件
11
范例11-5使用requests下载一个网页到本地
结果如下:
网页抓取结束,并写入文件newshtml.txt成功
提示:使用requests.get(url)可以抓取网页,也可以加上超时要求,如r = requests.get(url, timeout=30) 表示请求超时时间为30秒。在文件夹中找到newshtml.txt并打开它,
《Python编程基础与应用》配套课件
12
阅读角
-
《Python编程基础与应用》配套课件
13
爬虫与职业道德
据说互联网上 50%以上的流量都是爬虫创造的,也许你看到很多热门数据都是爬虫所创造的,所以可以说无爬虫就无互联网的繁荣。曾有报道程序员因写爬虫而被刑侦的事件。
《Python编程基础与应用》配套课件
14
爬虫与职业道德
我家颁布《中华人民共和国网络安全法》之后,对网络安全有了更高的要求。随着中国经济的不断往前走,知识产权问题会越来越重视,非法爬虫是现在一个重要的打击部分。技术是无罪的,技术本身确实是没有对错的,但使用技术的人是有对错的。公司或者程序员如果明知使用其技术是非法的,那么他们就需要为之付出代价。
《Python编程基础与应用》配套课件
15
爬虫与职业道德
编写爬虫程序爬取数据之前,为了避免某些有版权的数据后期带来的诸多法律问题,可以通过查看网站的robots.txt文件来避免爬取某些网页。
《Python编程基础与应用》配套课件
16
爬虫与职业道德
robots协议,告知爬虫等搜索引擎那些页面可以抓取,哪些不能。它只是一个通行的道德规范,没有强制性规定,完全由个人意愿遵守。作为一名有道德的技术人员,遵守robots协议,有助于建立更好的互联网环境。网站的robots文件地址通常为网页主页后加robots.txt,如 www.baidu.com/robots.txt。
《Python编程基础与应用》配套课件
17
Beautifulsoup4的安装和简介
02
《Python编程基础与应用》配套课件
18
Beautifulsoup4的简介
HTML 文档本身是结构化的文本,有一定的规则,通