Python爬虫 --- 2.3 Scrapy 框架的简单使用

张艳秋

2019-06-29

原文链接：https://www.fkomm.cn/article/...

网络爬虫，是在网上进行数据抓取的程序，使用它能够抓取特定网页的HTML数据。

Scrapy框架的简单使用：

虽然我们利用一些库开发一个爬虫程序，但是使用框架可以大大提高效率，缩短开发时间。Scrapy是一个使用Python编写的，轻量级的框架，简单轻巧，并且使用起来非常的方便。使用Scrapy可以很方便的完成网上数据的采集工作，它为我们完成了大量的工作，而不需要自己费大力气去开发。

下面我们来通过一个很简单的例子来介绍Scrapy框架的使用。

我们要爬的网址是：搜读网： http://www.sodu.cc。

我喜欢在这个网站看小说，里面的小说内容还是比较丰富的，推荐读者喜欢看小说的可以来看看。因为只是简单介绍，所以我只准备抓取小说的标题。

好的，基本流程既然确定了，那接下来就一步一步的完成就可以了。

其实只需要四步即可！！！

步骤一：创建一个工程和Spider模板

我们先用命令行创建一个Scrapy工程：

`$ scrapy startproject soudu

接着，我们进入到工程目录：

$ cd soudu

我们来看一下目录结构：

tree
# OUT:
.
├── soudu                  #外层目录
│   ├── __init__.py         #初始化脚本    
│   ├── __pycache__         #Python缓存文件。暂时无视
│   ├── items.py            #Items代码模板，继承类自scrapy.Item
│   ├── middlewares.py      #Middlewares代码模板(继承类)
│   ├── pipelines.py        #Pipelines代码模板(继承类)
│   ├── settings.py         #Scrapy爬虫的配置文件
│   └── spiders             #Spiders代码模板目录 我们写爬虫的地方
│       ├── __init__.py
│       └── __pycache__
└── scrapy.cfg              #部署爬虫的配置文件

4 directories, 7 files

最后，我们用命令行创建第一个Spider：

$ scrapy genspider title www.sodu.cc

这样我们就创建了一个名为title的爬虫了。

我们来看看他长什么样，打开/spiders/title.py:

# -*- coding: utf-8 -*-
import scrapy

class NewsSpider(scrapy.Spider):
    name = 'title'
    allowed_domains = ['www.sodu.cc']
    start_urls = ['http://www.sodu.cc/']

    def parse(self, response):
        pass

可以看到，Scrapy已经帮我们把爬虫的框架写好了，我们只要在这个框架的基础上进行进一步的定制就可以了。

步骤二：编写Spider

我们来着手定制我们的爬虫吧：

看一下详细的注释

# -*- coding: utf-8 -*-
import scrapy

# 将我们需要爬的项目引入进来
from soudu.items import SouduItem

class DemoSpider(scrapy.Spider):

    #该爬虫的名字
    name = "title"

    #规定爬虫爬取网页的域名   
    allowed_domains = ['www.sodu.cc']

    #开始爬取的url链接
    start_urls = ['http://www.sodu.cc/']

    def parse(self, response):
        '''
        parse()函数接收Response参数，就是网页爬取后返回的数据
        用于处理响应，他负责解析爬取的内容
        生成解析结果的字典，并返回新的需要爬取的请求
        '''

        #由于是demo 我们不做完全的功能，
        #只要求爬取出第一部小说的名字
        #xpath规则可以通过查看网页源文件得出，chrome右键检查定位到所要爬取的内容
        name = response.xpath('//a[@onclick="getpage(this)"]/text()').extract()[0]

        #建立一个items字典，用于保存我们爬到的结果，并返回给pipline处理
        items = {}
        items['第一部小说名']= name

        return items

步骤三：编写Item Pipeline

首先我们编写itmes.py来定义这个爬虫框架需要爬哪些内容：

# -*- coding: utf-8 -*-

# Define here the models for your scraped items
#
# See documentation in:
# https://doc.scrapy.org/en/latest/topics/items.html

import scrapy


class SouduItem(scrapy.Item):
    # define the fields for your item here like:
    # name = scrapy.Field()
    name = scrapy.Field()

接着我们编写 piplines.py来处理spider爬到的内容：

# -*- coding: utf-8 -*-

# Define your item pipelines here
#
# Don't forget to add your pipeline to the ITEM_PIPELINES setting
# See: http://doc.scrapy.org/en/latest/topics/item-pipeline.html
class ZimukuPipeline(object):
    def process_item(self, item, spider):

        # 因为是最简单的，所以我们把爬到的结果打印一下

        print(item)

        return item

步骤四：优化配置Settings.py

# -*- coding: utf-8 -*-

# Scrapy settings for soudu project
#
# For simplicity, this file contains only settings considered important or
# commonly used. You can find more settings consulting the documentation:
#
#     https://doc.scrapy.org/en/latest/topics/settings.html
#     https://doc.scrapy.org/en/latest/topics/downloader-middleware.html
#     https://doc.scrapy.org/en/latest/topics/spider-middleware.html

BOT_NAME = 'soudu'

SPIDER_MODULES = ['soudu.spiders']
NEWSPIDER_MODULE = 'soudu.spiders'

# Crawl responsibly by identifying yourself (and your website) on the user-agent
#USER_AGENT = 'soudu (+http://www.yourdomain.com)'

# Obey robots.txt rules
ROBOTSTXT_OBEY = True

#只增加了这一行，通过配置告诉Scrapy明白是谁来处理结果
ITEM_PIPELINES = {
   'soudu.pipelines.SouduPipeline': 300,
}

好了，这样一个爬虫就算完成了，那怎么获取爬到的结果呢？？？

运行

首先我们通过命令来执行爬虫：

$ scrapy crawl title

让我们这个最最简单的爬虫跑起来。

来看一下结果：

我只截取部分我们需要的内容，其他的我且暂不写出了：

2018-08-03 19:31:53 [scrapy.core.scraper] DEBUG: Scraped from <200 http://www.sodu.cc/>
{'第一部小说名': '圣墟'}

是不是可以看到我们需要找到的内容了？

Scrapy框架的基本使用已经说完了，以后我会一步一步来讲解其他的例子。

张艳秋

0 关注 0 粉丝 0 动态

关注关注

一篇文章教会你理解Scrapy网络爬虫框架的工作原理和数据采集过程

今天小编给大家详细的讲解一下Scrapy爬虫框架，希望对大家的学习有帮助。Scrapy是一个使用Python编程语言编写的爬虫框架，任何人都可以根据自己的需求进行修改，并且使用起来非常的方便。它可以应用在数据采集、数据挖掘、网络异常用户检测、存储数据等方面

CycloneKid 2020-10-27

scrapy 管理部署的爬虫项目的python类

还有部分api接口没有添加进来,可以参照官方的文档添加.

hilary0 2020-07-05

Python爬虫 - scrapy

start_requests:可以将遍历start_urls列表，将每一个列表元素进行get请求的发送。def file_path:指定文件路径。# Don‘t forget to add your pipeline to the ITEM_PIPELIN

ZHANGRENXIANG00 2020-06-28

Python爬虫 - scrapy框架的基本操作

scrapy异步的爬虫框架。c. 进入下载目录，执行 pip3 install Twisted?只可以将parse方法的返回值存储到指定后缀的文本文件中。# #xpath在进行数据提取时，返回的不再是字符串而是一个Selector对象，想要

fangjack 2020-06-25

Scrapy爬虫

　　Scrapy是一个常用的爬虫框架，可以提升爬虫的效率，从而更好的实现爬虫。Scrapy是一个为了抓取网页数据、提取结构性数据而编写的应用框架，该框架是封装的，包含request、下载器、解析器和twisted等。定义一个item容器，item容器是存储

qyf 2020-06-14

新手必学Python爬虫之Scrapy框架案例详解

Scrapy是用纯Python实现一个为了爬取网站数据、提取结构性数据而编写的应用框架，用途非常广泛。框架的力量，用户只需要定制开发几个模块就可以轻松的实现一个爬虫，用来抓取网页内容以及各种图片，非常之方便。Scrapy Engine(引擎): 负责Spi

javaraylu 2020-05-16

【python爬虫】scrapy入门8:发送POST请求

scrapy基础知识之发送POST请求与使用 FormRequest.from_response() 方法模拟登陆 https://blog.csdn.net/qq_33472765/article/details/80958820 scrapy框架

hilary0 2020-05-15

【python爬虫】scrapy入门6:Scrapy中runspider和crawl的区别

命令：scrapy runspider myspider.py 等同于 pyhtonmyspider.py

fangjack 2020-05-08

python爬虫一般用什么框架?六大Python框架

python爬虫可以使用的框架有很多，一般在大型需求的时候才会使用python爬虫框架。　　Scrapy：一个为了爬取网站数据，提取结构性数据而编写的应用框架。应用在数据挖掘、信息处理或者存储历史数据等一系列程序中。是很强大的爬虫框架，可以满足简单的页面爬

数据挖掘工人 2020-08-15

Python爬虫破解登陆哔哩哔哩的方法

作为一名找不到工作的爬虫菜鸡人士来说，登陆这一块肯定是个比较大的难题。从今天开始准备一点点对大型网站进行逐个登陆破解。加深自己爬虫水平。if response_json['code'] == 0 and response_json['data']['sta

夜斗不是神 2020-11-17

python 爬虫如何实现百度翻译

本文将会通过爬虫的方式实现简单的百度翻译。本文中的代码只供学习，不允许作为于商务作用。若有侵犯，立即删文！在网站文件中找到隐藏的免费api。传入api所需要的参数并对其发出请求。在返回的json结果里找到相应的翻译结果。进入百度翻译，随便输入一段需要翻译的

染血白衣 2020-11-16

可能是最全的反爬虫及应对方案

爬虫是 Python 的一个常见应用场景，很多练习项目就是让大家去爬某某网站。爬取网页的时候，你大概率会碰到一些反爬措施。这种情况下，你该如何应对呢？本文梳理了常见的反爬措施和应对方案。很多网站都会建立 user-agent白名单，只有属于正常范围的use

ARCXIANG 2020-11-02

Python爬虫遇到验证码的几种处理方式，文章末尾有源码

不管这些了，无所谓的东西，这边博客，将处理图片验证码的2个比较优秀的方式进行了一次封装, 分别是百度的aip 和一个最近火起来的识别muggle-ocr. 本篇文章介绍了爬虫中验证码的处理方式，并把这些功能封装起来，供我们使用，涉及到百度AIP的

ARCXIANG 2020-10-28

Python爬虫入门教程！手把手教会你爬取网页数据

这里的“技术手段”就是网络爬虫。今天就给大家分享一篇爬虫基础知识和入门教程：。爬虫就是自动获取网页内容的程序，例如搜索引擎，Google，Baidu 等，每天都运行着庞大的爬虫系统，从全世界的网站中爬虫数据，供用户检索时使用。Requests 库是 Py

荒谬小孩 2020-10-26

Python快速上手爬虫的7大技巧

Python应用最多的场景还是Web快速开发、爬虫、自动化运维。爬虫在开发过程中也有很多复用的过程，这里总结一下，以后也能省些事情。关键在于CookieJar()，它用于管理HTTP cookie值、存储HTTP请求生成的cookie、向传出的HTTP请

逍遥友 2020-10-26

只听说过用Python做爬虫，Java程序员笑了！

本文转载自微信公众号「Java极客技术」，作者鸭血粉丝。网络爬虫技术，早在万维网诞生的时候，就已经出现了，今天我们就一起来揭开它神秘的面纱!的确，pyhton 在处理网页方面，有着开发简单、便捷、性能高效的优势!但是我们 java 也不赖，在处理复杂的网

snakeson 2020-10-09

快速指南：如何创建基于Python的爬虫

Web抓取的使用正在积极增加，特别是在大型电子商务公司中，Web抓取是一种收集数据以竞争，分析竞争对手和研究新产品的方式。Web抓取是一种从网站提取信息的方法。在本篇文章中，学习如何创建基于Python的刮板。深入研究代码，看看它是如何工作的。在当今的大数

meylovezn 2020-08-28

山东创睦网络科技有限公司：如何在一个月内学会爬取数据

如果你仔细观察，就不难发现，懂爬虫、学习爬虫的人越来越多，一方面，互联网可以获取的数据越来越多，另一方面，像 Python这样的编程语言提供越来越多的优秀工具，让爬虫变得简单、容易上手。爬虫是入门Python最好的方式，没有之一。因为这个过程中，Pytho

囧芝麻 2020-08-17

python爬虫使用lxml解析数据编码乱码问题

response = requests.get(url=url, headers=headers).text. name = html.xpath("/html/body/div[2]/ul/li[1]/a/p/text()")[0].

cxcxrs 2020-07-28

如何用一行代码让gevent爬虫提速100%

用python做网络开发的人估计都听说过gevent这个库，gevent是一个第三方的python协程库，其是在微线程库greenlet的基础上构建而成，并且使用了epoll事件监听机制，这让gevent具有很好的性能并且比greenlet更好用。基于li

dashoumeixi 2020-07-20

安科网

Python爬虫 --- 2.3 Scrapy 框架的简单使用

张艳秋

Scrapy框架的简单使用：

步骤一：创建一个工程和Spider模板

步骤二：编写Spider

步骤三：编写Item Pipeline

步骤四：优化配置Settings.py

运行

相关文章和视频推荐

张艳秋

相关推荐

一篇文章教会你理解Scrapy网络爬虫框架的工作原理和数据采集过程

scrapy 管理部署的爬虫项目的python类

Python爬虫 - scrapy

Python爬虫 - scrapy框架的基本操作

Scrapy爬虫

新手必学Python爬虫之Scrapy框架案例详解

【python爬虫】scrapy入门8:发送POST请求

【python爬虫】scrapy入门6:Scrapy中runspider和crawl的区别

python爬虫一般用什么框架?六大Python框架

Python爬虫破解登陆哔哩哔哩的方法

python 爬虫如何实现百度翻译

可能是最全的反爬虫及应对方案

Python爬虫遇到验证码的几种处理方式，文章末尾有源码

Python爬虫入门教程！手把手教会你爬取网页数据

Python快速上手爬虫的7大技巧

只听说过用Python做爬虫，Java程序员笑了！

快速指南：如何创建基于Python的爬虫

山东创睦网络科技有限公司：如何在一个月内学会爬取数据

python爬虫使用lxml解析数据编码乱码问题

如何用一行代码让gevent爬虫提速100%

张艳秋

Python爬虫 --- 2.3 Scrapy 框架的简单使用

Scrapy框架的简单使用：

步骤一： 创建一个工程和Spider模板

步骤二：编写Spider

步骤三：编写Item Pipeline

步骤四：优化配置Settings.py

运行

相关文章和视频推荐

相关推荐

步骤一：创建一个工程和Spider模板