Scrapy框架使用的基本知识

ZHANGRENXIANG00

2018-10-21

关注关注

scrapy是一个基于Twisted的异步处理框架，可扩展性很强。优点此处不再一一赘述。

下面介绍一些概念性知识，帮助大家理解scrapy。

一、数据流向

要想熟练掌握这个框架，一定要明白数据的流向是怎么一个过程。总结如下：

1.引擎先打开网站，请求url。

2.引擎通过调度器以Request形式调度url。

3.引擎请求下一个url。

4.调度器将url通过Downloader Middlewares发送给引擎

5.Downloader 生成response，通过Downloader Middlewares发送给引擎

6.引擎接收Response 通过spiderMiddleware发送给spider处理

7.spider处理response

8.引擎将spider处理的item给ItemPipeline 然后将新的Request给调度器。

二、各个结构的作用

DownloderMiddleware

调度器会从队列之中拿出Request发送给Downloader执行下载，这个过程会经过DownloaderMiddleware的处理。

作用的位置有两个：

在调度器调出Request发送给Downloader之前。
下载之后生成Response发送给spider之前。

核心方法有三个：

process_request(request,spider)

Request 到达Downloader之前，就会被调用

参数介绍：

request ：Request对象，被处理的Request。
spider：spider对象，上面被处理的Request对应的spider。

返回值：

1.返回None 调用别的process_request()方法，直至将Request执行得到Response才会结束。

2.返回Response对象，低优先级的process_request()和process_exception不调用。

3.返回request对象，低优先级的process_request()停止执行，返回新的request。

process_response(request,response,spider)

作用位置：

Downloader 执行Request之后，会得到对应的Reponse ，scrapy 引擎会将Response发送给spider进行解析，发送之前调用这个方法对Response进行处理。

返回值的情况：

1.返回request低优先级的process_respons()不调用。

2.返回Response低优先级的process_respons()继续调用。

process_exception（request,exception,spider）

此函数主要是用来处理异常的。

spiderMiddleware

作用位置：

Downloader生成Response之后会发送给spider，
在发送之前，会经过spiderMiddleware处理。

核心方法：

process_soider_input(response,spider)

返回值：

1.返回None

继续处理Response，调用所有的spiderMiddleware，知道spider处理

2.跑出异常

直接调用Request的errback（）方法，使用process_spider_output()处理。

process_spider_output(response,result,spider)

当spider处理Response返回结果时，被调用。

process_spider_exception(response,exception,spider)

返回值：none

继续处理response，返回一个可迭代对象，process_spider_output()方法被调用。

process_start_request(start_requests,spider)

以spider启动的request为参数被调用，必须返回request。

scrapy response downloader

ZHANGRENXIANG00

0 关注 0 粉丝 0 动态

关注关注

8_3 scrapy模拟登录人人网

在这个方法中发送post请求，没有重写这个方法基类Spider中的方法 start_request()默认是发送get请求。

javaraylu 2020-06-28

Python爬虫 - scrapy

start_requests:可以将遍历start_urls列表，将每一个列表元素进行get请求的发送。def file_path:指定文件路径。# Don‘t forget to add your pipeline to the ITEM_PIPELIN

ZHANGRENXIANG00 2020-06-28

用scrapy爬取图片

detail_list = response.xpath(‘//*[@id="main"]/div[3]/ul/li/a/@href‘).extract(). yield scrapy.Request(detail_url, callb

Catastrophe 2020-06-26

scrapy中使用selenium+webdriver获取网页源码，爬取简书网站

由于简书中一些数据是通过js渲染出来的，所以通过正常的request请求返回的response源码中没有相关数据，# 加载chrome驱动，若chromedriver.exe文件和python.exe 在相同目录下，可以省略executable_path=

andrewwf 2020-05-30

三、Scrapy Shell

　　Scrapy终端是一个交互终端，可以在未启动spider的情况下尝试及调试代码，也可以用来测试XPath或CSS表达式，查看它们的工作方式，方便在爬取的网页中提取数据。　　如果安装了 IPython ，Scrapy终端将使用 IPython 。IPyt

ZHANGRENXIANG00 2020-05-11

python爬虫：scrapy自定义item

item[‘body‘]=response.xpath("//div[@class=‘xx‘]/text()").get()

Catastrophe 2020-05-07

scrapy下载中间件(downloader middleware)和蜘蛛中间件(spider middleware)

首先我们看下scrapy官网提供的新结构图，乍一看这画的是啥啊，这需要你慢慢的理解其原理就很容易看懂了，这些都是一个通用爬虫框架该具有的一些基本组件。上一篇博客说了项目管道，可以看到中间的引擎将item传递给了项目管道，也就是让项目管道来处理抓取到的内容。

MiracleZhao 2020-05-19

如何利用Scrapy爬虫框架抓取网页全部文章信息（上篇）

首先我们理一下爬取思路，大致思想是：当获取到第一个页面的URL之后，尔后将第二页的URL发送给Scrapy，让Scrapy去自动下载该网页的信息，之后通过第二页的URL继续获取第三页的URL，由于每一页的网页结构是一致的，所以通过这种方式如此反复进行迭代，

andrewwf 2020-11-11

一分钟搞定Scrapy分布式爬虫、队列和布隆过滤器

你知道最快的方法是什么吗？一分钟真的能开发好或者修改出一个分布式爬虫吗？话不多说，先让我们看看怎么实践，再详细聊聊细节。如果你没有所需要的运行条件，你可以启动两个 Docker 镜像进行测试 :. 如果你有一个现成的爬虫，可以跳过这个 Step，直接到

Arvinzx 2020-10-28

一篇文章教会你理解Scrapy网络爬虫框架的工作原理和数据采集过程

今天小编给大家详细的讲解一下Scrapy爬虫框架，希望对大家的学习有帮助。Scrapy是一个使用Python编程语言编写的爬虫框架，任何人都可以根据自己的需求进行修改，并且使用起来非常的方便。它可以应用在数据采集、数据挖掘、网络异常用户检测、存储数据等方面

CycloneKid 2020-10-27

在Scrapy中如何利用Xpath选择器从网页中采集目标数据——详细教程（下篇）

前几天给大家分享了在Scrapy中如何利用Xpath选择器从网页中采集目标数据——详细教程（上篇），没来得及上车的小伙伴可以戳进去看看，今天继续上篇的内容往下进行。至此，关于Xpath表达式的具体应用教程先告一段落。

paleyellow 2020-10-25

在Scrapy中如何利用Xpath选择器从网页中采集目标数据——详细教程（上篇）

上一篇文章我们讲述了网页结构和Xpath表达式语法知识，感兴趣的小伙伴可以戳这篇文章：网页结构的简介和Xpath语法的入门教程。我们了解到Xpath表达式最好是通过自己进行网页分析和针对性的选取唯一性的标签进行定位，可以提高提取效率，而且还不容易出错。

baifanwudi 2020-10-25

手把手教你进行Scrapy中item类的实例化操作

首先去parse_detail函数下对其进行实例化，实例化的方法也十分简单，如下图所示。其中，目标字段可以参考items.py中定义的item，这样可以加快填充的速度。

heyboz 2020-10-21

如何改造 Scrapy 从而实现多网站大规模爬取？

Scrapy 框架默认是用来开发定向爬虫的。一般情况下，在 spiders 文件夹下面的一个.py 文件对应了一个网站的爬取。但还有另外一种爬虫，它不会拘泥于提取页面上的特定文字，而是关注如何并行爬取非常多的网站。这种爬虫，一般是从若干个种子网址开始爬。但

wumxiaozhu 2020-10-16

二十六、Scrapy自定义命令

from scrapy.commands import ScrapyCommand??class Command(ScrapyCommand): requires_project = True?

ZHANGRENXIANG00 2020-07-27

scrapy 管理部署的爬虫项目的python类

还有部分api接口没有添加进来,可以参照官方的文档添加.

hilary0 2020-07-05

分布式爬虫部署基于scrapy和scrapy-redis

安装一个scrapy-redis的组件。原生的scrapy是不可以实现分布式爬虫，必须要让scrapy结合着scrapy-redis组件一起实现分布式。scrapy-redis组件的作用可以给原生的scrapy框架提供可以被共享的管道和调度器。结合配置文件

zhangll00 2020-07-05

Scrapy爬虫

二、Scrapy爬虫框架结构

ZHANGRENXIANG00 2020-06-27

scrapy基本知识

Scrapy爬虫框架主要由5个部分组成，分别是：Scrapy Engine，Scheduler（调度器），Downloader（下载器），Spiders（蜘蛛），Item Pipeline。爬取过程是Scrapy引擎发送请求，之后调度器把初始URL交给下载

Catastrophe 2020-06-26

Python爬虫 - scrapy框架的基本操作

scrapy异步的爬虫框架。c. 进入下载目录，执行 pip3 install Twisted?只可以将parse方法的返回值存储到指定后缀的文本文件中。# #xpath在进行数据提取时，返回的不再是字符串而是一个Selector对象，想要

fangjack 2020-06-25

安科网

Scrapy框架使用的基本知识

ZHANGRENXIANG00

ZHANGRENXIANG00

相关推荐

8_3 scrapy模拟登录人人网

Python爬虫 - scrapy

用scrapy爬取图片

scrapy中使用selenium+webdriver获取网页源码，爬取简书网站

三、Scrapy Shell

python爬虫：scrapy自定义item

scrapy下载中间件(downloader middleware)和蜘蛛中间件(spider middleware)

如何利用Scrapy爬虫框架抓取网页全部文章信息（上篇）

一分钟搞定Scrapy分布式爬虫、队列和布隆过滤器

一篇文章教会你理解Scrapy网络爬虫框架的工作原理和数据采集过程

在Scrapy中如何利用Xpath选择器从网页中采集目标数据——详细教程（下篇）

在Scrapy中如何利用Xpath选择器从网页中采集目标数据——详细教程（上篇）

手把手教你进行Scrapy中item类的实例化操作

如何改造 Scrapy 从而实现多网站大规模爬取？

二十六、Scrapy自定义命令

scrapy 管理部署的爬虫项目的python类

分布式爬虫部署基于scrapy和scrapy-redis

Scrapy爬虫

scrapy基本知识

Python爬虫 - scrapy框架的基本操作

ZHANGRENXIANG00