使用scrapy编写爬虫：爬取豆瓣Top250读书的评论

andrewwf

2020-01-31

关注关注

介绍

以前我们写爬虫，要导入和操作不同的模块，比如requests模块、gevent库、csv模块等。而在Scrapy里，你不需要这么做，因为很多爬虫需要涉及的功能，比如麻烦的异步，在Scrapy框架都自动实现了。

我们之前编写爬虫的方式，相当于在一个个地在拼零件，拼成一辆能跑的车。而Scrapy框架则是已经造好的、现成的车，我们只要踩下它的油门，它就能跑起来。这样便节省了我们开发项目的时间。

安装

pip3 install scrapy

创建scrapy项目

先cd到你存放项目的文件夹位置，然后，使用命令：scrapy startproject 项目名称，创建项目

这里以【获取豆瓣 Top250 读书的评论（图书名称、评论人、评论时间、评论内容），链接地址：https://book.douban.com/top250?start=0】作为演示项目

创建项目：

scrapy startproject doubancomment

项目结构说明

使用scrapy编写爬虫：爬取豆瓣Top250读书的评论

配置 settings.py

USER_AGENT = ‘Mozilla/5.0 (Macintosh; Intel Mac OS X 10_14_3) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.117 Safari/537.36 OPR/66.0.3515.36 (Edition Baidu)‘

# 是否遵循robots协议
ROBOTSTXT_OBEY = False

# 控制下载速度
DOWNLOAD_DELAY = 0.5

# 开启管道
ITEM_PIPELINES = {
   ‘doubancomment.pipelines.DoubancommentPipeline‘: 300,
}

设置数据模型 items.py

import scrapy

class DoubancommentItem(scrapy.Item):
    # 图书名称
    bookname = scrapy.Field()
    # 评论人
    common_id = scrapy.Field()
    # 评论时间
    common_date = scrapy.Field()
    # 指数
    common_vote_num = scrapy.Field()
    # 评论内容
    common_content = scrapy.Field()

爬虫代码 common_spider.py

# 获取豆瓣读书Top250的评论

import scrapy
from bs4 import BeautifulSoup
from ..items import DoubancommentItem

class Common_spider(scrapy.Spider):
    # 爬虫名称
    name = ‘comment‘
    # 允许爬取的网站域名
    allowed_domains = [‘book.douban.com‘]
    # 起始网址
    start_urls = []
    # 获取前2页书籍的评论
    for x in range(2):
        url = "https://book.douban.com/top250?start={}".format(25*x)
        start_urls.append(url)

    # 解析起始网址
    def parse(self, response):
        soup = BeautifulSoup(response.text, ‘html.parser‘)
        pl2_list = soup.find_all("div", class_=‘pl2‘)
        for pl2 in pl2_list:
            # 书籍链接
            book_link = pl2.find("a")[‘href‘]
            # 评论链接
            common_link = book_link + "comments/"

            yield scrapy.Request(common_link, callback=self.common_parse)

    # 解析评论
    def common_parse(self, response):
        soup = BeautifulSoup(response.text, ‘html.parser‘)
        # 书籍名称
        bookname = soup.find_all("p", class_=‘pl2 side-bar-link‘)[1].find("a").text

        li_list = soup.find_all(‘li‘, class_=‘comment-item‘)
        for li in li_list:
            common_info = li.find(class_=‘comment-info‘)
            # 评论人
            common_id = common_info.find("a").text
            # 评论时间
            if len(common_info.find_all("span")) > 1:
                common_date = common_info.find_all("span")[1].text
            else:
                common_date = common_info.find("span").text
            # 指数
            common_vote_num = li.find(class_=‘vote-count‘).text
            # 评论内容
            common_content = li.find(class_=‘comment-content‘).find("span").text

            item = DoubancommentItem()
            item[‘bookname‘] = bookname
            item[‘common_id‘] = common_id
            item[‘common_date‘] = common_date
            item[‘common_vote_num‘] = common_vote_num
            item[‘common_content‘] = common_content

            yield item

处理数据 pipelines.py

from openpyxl import Workbook
import os

class DoubancommentPipeline(object):
    def __init__(self):
        self.wb = Workbook()
        self.sheet = self.wb.active
        self.sheet.append([‘图书名称‘, ‘评论人‘, ‘评论时间‘, ‘指数‘, ‘评论内容‘])

    # 处理数据
    def process_item(self, item, spider):
        line = [item[‘bookname‘], item[‘common_id‘], item[‘common_date‘], item[‘common_vote_num‘], item[‘common_content‘]]
        self.sheet.append(line)

        return item

    # 爬虫结束时，会调用这个方法
    def close_spider(self, spider):
        # 目录不存在 -> 创建目录
        data_dir = os.path.dirname(__file__) + "/storage/data/"
        if not os.path.isdir(data_dir):
            os.makedirs(data_dir)

        # 保存文件
        self.wb.save(data_dir + "comment.xlsx")
        # 关闭文件
        self.wb.close()

运行

方式一：cd到根目录，执行命令：scrapy crawl 爬虫的名称

scrapy crawl comment

方式二：cd到根目录，创建文件 main.py：

from scrapy import cmdline
cmdline.execute([‘scrapy‘, ‘crawl‘, ‘comment‘])

也就是将方式一的命令，写成列表的形式，然后，执行 main.py

执行完毕，会有这样的提示：[scrapy.core.engine] INFO: Spider closed (finished)

scrapy 豆瓣

andrewwf

0 关注 0 粉丝 0 动态

关注关注

如何利用Scrapy爬虫框架抓取网页全部文章信息（上篇）

首先我们理一下爬取思路，大致思想是：当获取到第一个页面的URL之后，尔后将第二页的URL发送给Scrapy，让Scrapy去自动下载该网页的信息，之后通过第二页的URL继续获取第三页的URL，由于每一页的网页结构是一致的，所以通过这种方式如此反复进行迭代，

andrewwf 2020-11-11

一分钟搞定Scrapy分布式爬虫、队列和布隆过滤器

你知道最快的方法是什么吗？一分钟真的能开发好或者修改出一个分布式爬虫吗？话不多说，先让我们看看怎么实践，再详细聊聊细节。如果你没有所需要的运行条件，你可以启动两个 Docker 镜像进行测试 :. 如果你有一个现成的爬虫，可以跳过这个 Step，直接到

Arvinzx 2020-10-28

一篇文章教会你理解Scrapy网络爬虫框架的工作原理和数据采集过程

今天小编给大家详细的讲解一下Scrapy爬虫框架，希望对大家的学习有帮助。Scrapy是一个使用Python编程语言编写的爬虫框架，任何人都可以根据自己的需求进行修改，并且使用起来非常的方便。它可以应用在数据采集、数据挖掘、网络异常用户检测、存储数据等方面

CycloneKid 2020-10-27

在Scrapy中如何利用Xpath选择器从网页中采集目标数据——详细教程（下篇）

前几天给大家分享了在Scrapy中如何利用Xpath选择器从网页中采集目标数据——详细教程（上篇），没来得及上车的小伙伴可以戳进去看看，今天继续上篇的内容往下进行。至此，关于Xpath表达式的具体应用教程先告一段落。

paleyellow 2020-10-25

在Scrapy中如何利用Xpath选择器从网页中采集目标数据——详细教程（上篇）

上一篇文章我们讲述了网页结构和Xpath表达式语法知识，感兴趣的小伙伴可以戳这篇文章：网页结构的简介和Xpath语法的入门教程。我们了解到Xpath表达式最好是通过自己进行网页分析和针对性的选取唯一性的标签进行定位，可以提高提取效率，而且还不容易出错。

baifanwudi 2020-10-25

手把手教你进行Scrapy中item类的实例化操作

首先去parse_detail函数下对其进行实例化，实例化的方法也十分简单，如下图所示。其中，目标字段可以参考items.py中定义的item，这样可以加快填充的速度。

heyboz 2020-10-21

如何改造 Scrapy 从而实现多网站大规模爬取？

Scrapy 框架默认是用来开发定向爬虫的。一般情况下，在 spiders 文件夹下面的一个.py 文件对应了一个网站的爬取。但还有另外一种爬虫，它不会拘泥于提取页面上的特定文字，而是关注如何并行爬取非常多的网站。这种爬虫，一般是从若干个种子网址开始爬。但

wumxiaozhu 2020-10-16

二十六、Scrapy自定义命令

from scrapy.commands import ScrapyCommand??class Command(ScrapyCommand): requires_project = True?

ZHANGRENXIANG00 2020-07-27

scrapy 管理部署的爬虫项目的python类

还有部分api接口没有添加进来,可以参照官方的文档添加.

hilary0 2020-07-05

分布式爬虫部署基于scrapy和scrapy-redis

安装一个scrapy-redis的组件。原生的scrapy是不可以实现分布式爬虫，必须要让scrapy结合着scrapy-redis组件一起实现分布式。scrapy-redis组件的作用可以给原生的scrapy框架提供可以被共享的管道和调度器。结合配置文件

zhangll00 2020-07-05

8_3 scrapy模拟登录人人网

在这个方法中发送post请求，没有重写这个方法基类Spider中的方法 start_request()默认是发送get请求。

javaraylu 2020-06-28

Python爬虫 - scrapy

start_requests:可以将遍历start_urls列表，将每一个列表元素进行get请求的发送。def file_path:指定文件路径。# Don‘t forget to add your pipeline to the ITEM_PIPELIN

ZHANGRENXIANG00 2020-06-28

Scrapy爬虫

二、Scrapy爬虫框架结构

ZHANGRENXIANG00 2020-06-27

用scrapy爬取图片

detail_list = response.xpath(‘//*[@id="main"]/div[3]/ul/li/a/@href‘).extract(). yield scrapy.Request(detail_url, callb

Catastrophe 2020-06-26

scrapy基本知识

Scrapy爬虫框架主要由5个部分组成，分别是：Scrapy Engine，Scheduler（调度器），Downloader（下载器），Spiders（蜘蛛），Item Pipeline。爬取过程是Scrapy引擎发送请求，之后调度器把初始URL交给下载

Catastrophe 2020-06-26

Python爬虫 - scrapy框架的基本操作

scrapy异步的爬虫框架。c. 进入下载目录，执行 pip3 install Twisted?只可以将parse方法的返回值存储到指定后缀的文本文件中。# #xpath在进行数据提取时，返回的不再是字符串而是一个Selector对象，想要

fangjack 2020-06-25

十八、scrapy内置媒体（图片和文件）下载方式

　　MediaPipeline会为当前安排好的要下载的图片保留一个内部队列，并将那些到达的包含相同图片的项目连接到该队列中，避免多次下载几个item共享的同一图片。　　3、当item进入filespipeline,file_urls组内的url将被Scra

andrewwf 2020-06-16

Scrapy爬虫

　　Scrapy是一个常用的爬虫框架，可以提升爬虫的效率，从而更好的实现爬虫。Scrapy是一个为了抓取网页数据、提取结构性数据而编写的应用框架，该框架是封装的，包含request、下载器、解析器和twisted等。定义一个item容器，item容器是存储

qyf 2020-06-14

Python Scrapy图片爬取原理及代码实例

在管道文件对图片进行下载和持久化存储。配置文件要增加IMAGES_STORE = './imgsLib'表明图片存放的路径。#对某一个媒体资源进行请求发送。#item就是接收到的spider提交过来的item. #制定媒体数据存储的名称。#将item传递给

荒乱的没日没夜 2020-06-14

scrapy 详解

　　Scrapy是一个为了爬取网站数据，提取结构性数据而编写的应用框架，我们只需要实现少量的代码，就能够快速的抓取。Scrapy 使用了Twisted[‘tw?st?d]异步网络框架。def parse: # 数据提取方法，处理start_url地址中的

MiracleZhao 2020-06-13

安科网

使用scrapy编写爬虫：爬取豆瓣Top250读书的评论

andrewwf

介绍

安装

创建scrapy项目

项目结构说明

配置 settings.py

设置数据模型 items.py

爬虫代码 common_spider.py

处理数据 pipelines.py

运行

andrewwf

相关推荐

如何利用Scrapy爬虫框架抓取网页全部文章信息（上篇）

一分钟搞定Scrapy分布式爬虫、队列和布隆过滤器

一篇文章教会你理解Scrapy网络爬虫框架的工作原理和数据采集过程

在Scrapy中如何利用Xpath选择器从网页中采集目标数据——详细教程（下篇）

在Scrapy中如何利用Xpath选择器从网页中采集目标数据——详细教程（上篇）

手把手教你进行Scrapy中item类的实例化操作

如何改造 Scrapy 从而实现多网站大规模爬取？

二十六、Scrapy自定义命令

scrapy 管理部署的爬虫项目的python类

分布式爬虫部署基于scrapy和scrapy-redis

8_3 scrapy模拟登录人人网

Python爬虫 - scrapy

Scrapy爬虫

用scrapy爬取图片

scrapy基本知识

Python爬虫 - scrapy框架的基本操作

十八、scrapy内置媒体（图片和文件）下载方式

Scrapy爬虫

Python Scrapy图片爬取原理及代码实例

scrapy 详解

andrewwf