Python超强爬虫技术，年入百万的秘密

银角大王

2019-08-29

关注关注

最近在学习网络爬虫，完成了一个比较简单的python网络爬虫。首先为什么要用爬虫爬取信息呢，当然是因为要比人去收集更高效；网络爬虫，可以理解为自动帮你在网络上收集数据的机器人。

Python超强爬虫技术，年入百万的秘密

网络爬虫简单可以大致分三个步骤：

第一步要获取数据，

第二步对数据进行处理，

第三步要储存数据。

获取数据的时候这里我用到了python的urllib标准库，它是python中非常方便抓取网页内容的一个模块。

Python超强爬虫技术，年入百万的秘密

项目目的：这里我要爬取的是电影天堂一个电影页面的电影名称，日期等数据。

源代码如下：

from urllib import request
def get_data ( ):
 url='http://www.dytt8.net/html/gndy/dyzz/list_23_1.html'
 headers={'User-Agent': ' Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.99 Safari/537.36' }
 req=request.Request(url, headers=headers)
 response=request.urlopen(req)
 # print (type(response)) #响应对象的类型
 # print(response.getcode()) #响应状态码
 # print(response.info())
 if response.getcode() == 200:
 data=response.read()#读取响应的结果
 data =str(data,encoding='gb2312')
 #print(data)
 #将数据写入文件中
 with open ('index.html',mode='w',encoding='gb2312') as f:
 f.write(data)

这里的headers是一个参数，就是你的浏览器在访问服务器的时候，会让服务器知道你的浏览器的一些信息，还有操作系统等信息。if 函数来判断当网站成功响应的时候，会返回一个200.这时候读取响应的数据结果，就是网页的代码。这里我做了一个字符串转化处理，根据网页代码显示编码为gb2312，所以这时候只要将encoding设置为gb2312就可以了。

&lt;!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"&gt;
&lt;html xmlns="http://www.w3.org/1999/xhtml"&gt;
&lt;head&gt;
&lt;META http-equiv=Content-Type content="text/html; charset=gb2312"&gt;

根据上面的网页代码，charset为gb2312判断的。

当我们存取了网页数据后，发现它还是html格式的，而且有很多html，css的代码，但是我们只想要其中的文字信息，这时候怎么办呢。

这时候就要用到一个强大的数据处理模块，beautifusoup4，俗称美味汤。安装好这个模块后。我们就可以对我们的html文件做进一步的处理，提取我们需要的信息。

from urllib import request
from bs4 import BeautifulSoup
def get_data ( ):
 url='http://www.dytt8.net/html/gndy/dyzz/list_23_1.html'
 headers={'User-Agent': ' Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.99 Safari/537.36' }
 req=request.Request(url, headers=headers)
 response=request.urlopen(req)
 # print (type(response)) #响应对象的类型
 # print(response.getcode()) #响应状态码
 # print(response.info())
 if response.getcode() == 200:
 data=response.read()#读取响应的结果
 data =str(data,encoding='gb2312')
 #print(data)
 #将数据写入文件中
 with open ('index.html',mode='w',encoding='gb2312') as f:
 f.write(data)
def parse_data():
 with open ('index.html',mode='r',encoding='gb2312') as f:
 html = f.read()
 bs = BeautifulSoup(html,'html.parser')
 metas = bs.select("[class~=ulink]")
 date = bs.select("[color=#8F8C89]")
 i=0
 while i &lt; 25:
 print(metas[i].get_text())
 print(date[i].get_text())
 i=i+1
if __name__ == '__main__':
 #get_data()
 parse_data()

这里我们用到了美味汤中的CSS选择器功能，就是只把我们想要的信息选择处来，根据网页代码，发现class等于ulink的时候后面跟着的信息是我们需要的。还有color=#8F8C89也是我们需要的。使用select方法，将选中的信息筛选出来。最终结果：

Python超强爬虫技术，年入百万的秘密

点击0是因为网站显示就是0，估计是网站的问题。这样我们就得到了电影信息以及发布的时间信息。后面还有很多。根据这次简单爬虫的实现，我发现web爬虫除了你要懂python的知识之外，对于html，CSS等前端知识你也要有一定了解。爬虫是模拟人去收集网站数据的，有些网站以及建立了反爬虫技术。所以爬虫的技术也在不断更新。

最后，如果你想学python编程可以私信小编“01”获取素材资料与开发工具和听课权限！

Python超强爬虫技术，年入百万的秘密

声明：本文于网络整理，著作权归原作者所有，如有侵权，请联系小编删除。

python python爬虫 response data

安科网

Python超强爬虫技术，年入百万的秘密

银角大王

银角大王

相关推荐

Python爬虫破解登陆哔哩哔哩的方法

python 爬虫如何实现百度翻译

python 发送get请求接口详解

python 使用tkinter+you-get实现视频下载器

python中requests模拟登录的三种方式(携带cookie/session进行请求网站)

python开发一个解析protobuf文件的简单编译器

python 下载文件的多种方法汇总

Linux Shell 如何获取参数的方法

python跨文件使用全局变量的实现

python调用百度API实现人脸识别

Python调用ffmpeg开源视频处理库，批量处理视频

详解python os.path.exists判断文件或文件夹是否存在

python实现在列表中查找某个元素的下标示例

python如何获得list或numpy数组中最大元素对应的索引

Python实现列表索引批量删除的5种方法

致命错误！Python开发者的7个崩溃瞬间

针对Python开发人员的10个“疯狂”的项目构想

用Python内置模块处理ini配置文件

VS Code 中 Python 扩展的部分功能重构，支持 R 和 Julia

Python五个隐藏的特性，你可能从未听说过

银角大王