scrapy框架的初始
Scrapy框架(爬虫框架)
什么是Scrapy?
- Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架,非常出名,非常强悍。所谓的框架就是一个已经被集成了各种功能(高性能异步下载,队列,分布式,解析,持久化存储等)的具有很强通用性的项目模板。对于框架的学习,重点是要学习其框架的特性、各个功能的用法即可。
安装scrapy
- pip3 install wheel
- 进入下载目录,执行 pip3 install Twisted-19.2.1-cp36-cp36m-win_amd64.whl
- pip3 install pywin32
- pip3 install scrapy
scrapy的使用方法:
- 创建项目: scrapy startproject xxx
- 创建爬虫文件: scrapy genspider first www.xxx.com
- 执行爬虫文件:scrapy crawl first
- 执行爬虫文件不打印日志: scrapy crawl budejie --nolog
- 执行爬虫文件并持久化存储到csv文件中: scrapy crawl budejie -o budejie.csv
管道持久化存储
- 文件存储: 可以实现任意文件类型的存储
- mysql存储:
- 创建连接
- 创建游标
- 使用事务
- 关闭游标和连接
- redis存储
- 创建连接
- 存储的数据需要进行json序列化
- 关闭连接
相关推荐
wwzaqw 2020-09-04
chensen 2020-11-14
lwnylslwnyls 2020-11-06
ATenhong 2020-10-15
yanzhelee 2020-10-13
佛系程序员J 2020-10-10
guojin0 2020-10-08
佛系程序员J 2020-10-08
bluewelkin 2020-09-16
zhongdaowendao 2020-09-02
favouriter 2020-08-18
奎因amp华洛 2020-08-15
一青年 2020-08-13
千锋 2020-08-10
nangongyanya 2020-08-09
dongxurr 2020-08-08
明天你好 2020-08-03
kyelu 2020-08-03
Ashes 2020-08-03