简单好用的网络爬虫spider/crawler

MemoryBuffer

2011-05-17

关注关注

packagespider;

importjava.io.BufferedReader;

importjava.io.InputStreamReader;

importjava.net.URL;

importjava.util.ArrayList;

importjava.util.HashMap;

importjava.util.HashSet;

importjava.util.LinkedHashSet;

importjava.util.regex.Matcher;

importjava.util.regex.Pattern;

publicclassSearchCrawlerimplementsRunnable{

*disallowListCache缓存robot不允许搜索的URL。Robot协议在Web站点的根目录下设置一个robots.txt文件,

*规定站点上的哪些页面是限制搜索的。搜索程序应该在搜索过程中跳过这些区域,下面是robots.txt的一个例子:#robots.txtfor

*http://somehost.com/User-agent:Disallow:/cgi-bin/Disallow:

*/registration#DisallowrobotsonregistrationpageDisallow:/login

privateHashMap<String,ArrayList<String>>disallowListCache=newHashMap<String,ArrayList<String>>();

ArrayList<String>errorList=newArrayList<String>();//错误信息

ArrayList<String>result=newArrayList<String>();//搜索到的结果

StringstartUrl;//开始搜索的起点

intmaxUrl;//最大处理的url数

StringsearchString;//要搜索的字符串(英文)

booleancaseSensitive=false;//是否区分大小写

booleanlimitHost=false;//是否在限制的主机内搜索

publicSearchCrawler(StringstartUrl,intmaxUrl,StringsearchString){

this.startUrl=startUrl;

this.maxUrl=maxUrl;

this.searchString=searchString;

}

publicArrayList<String>getResult(){

returnresult;

}

publicvoidrun(){//启动搜索线程

crawl(startUrl,maxUrl,searchString,limitHost,caseSensitive);

}

//检测URL格式

privateURLverifyUrl(Stringurl){

//只处理HTTPURLs.

if(!url.toLowerCase().startsWith("http://"))

returnnull;

URLverifiedUrl=null;

try{

verifiedUrl=newURL(url);

}catch(Exceptione){

returnnull;

}

returnverifiedUrl;

}

//检测robot是否允许访问给出的URL.

privatebooleanisRobotAllowed(URLurlToCheck){

Stringhost=urlToCheck.getHost().toLowerCase();//获取给出RUL的主机

//System.out.println("主机="+host);

//获取主机不允许搜索的URL缓存

ArrayList<String>disallowList=disallowListCache.get(host);

//如果还没有缓存,下载并缓存。

if(disallowList==null){

disallowList=newArrayList<String>();

try{

URLrobotsFileUrl=newURL("http://"+host+"/robots.txt");

BufferedReaderreader=newBufferedReader(

newInputStreamReader(robotsFileUrl.openStream()));

//读robot文件，创建不允许访问的路径列表。

Stringline;

while((line=reader.readLine())!=null){

if(line.indexOf("Disallow:")==0){//是否包含"Disallow:"

StringdisallowPath=line.substring("Disallow:"

.length());//获取不允许访问路径

//检查是否有注释。

intcommentIndex=disallowPath.indexOf("#");

if(commentIndex!=-1){

disallowPath=disallowPath.substring(0,

commentIndex);//去掉注释

}

disallowPath=disallowPath.trim();

disallowList.add(disallowPath);

}

//缓存此主机不允许访问的路径。

disallowListCache.put(host,disallowList);

}catch(Exceptione){

returntrue;//web站点根目录下没有robots.txt文件,返回真

}

Stringfile=urlToCheck.getFile();

//System.out.println("文件getFile()="+file);

for(inti=0;i<disallowList.size();i++){

Stringdisallow=disallowList.get(i);

if(file.startsWith(disallow)){

returnfalse;

}

returntrue;

}

privateStringdownloadPage(URLpageUrl){

try{

//OpenconnectiontoURLforreading.

BufferedReaderreader=newBufferedReader(newInputStreamReader(

pageUrl.openStream()));

//Readpageintobuffer.

Stringline;

StringBufferpageBuffer=newStringBuffer();

while((line=reader.readLine())!=null){

pageBuffer.append(line);

}

returnpageBuffer.toString();

}catch(Exceptione){

}

returnnull;

}

//从URL中去掉"www"

privateStringremoveWwwFromUrl(Stringurl){

intindex=url.indexOf("://www.");

if(index!=-1){

returnurl.substring(0,index+3)+url.substring(index+7);

}

return(url);

}

//解析页面并找出链接

@SuppressWarnings("unchecked")

privateArrayList<String>retrieveLinks(URLpageUrl,StringpageContents,

HashSetcrawledList,booleanlimitHost){

//用正则表达式编译链接的匹配模式。

Patternp=Pattern.compile("<a\\s+href\\s*=\\s*\"?(.*?)[\"|>]",

Pattern.CASE_INSENSITIVE);

Matcherm=p.matcher(pageContents);

ArrayList<String>linkList=newArrayList<String>();

while(m.find()){

Stringlink=m.group(1).trim();

if(link.length()<1){

continue;

}

//跳过链到本页面内链接。

if(link.charAt(0)=='#'){

continue;

}

if(link.indexOf("mailto:")!=-1){

continue;

}

if(link.toLowerCase().indexOf("javascript")!=-1){

continue;

}

if(link.indexOf("://")==-1){

if(link.charAt(0)=='/'){//处理绝对地址

link="http://"+pageUrl.getHost()+":"

+pageUrl.getPort()+link;

}else{

Stringfile=pageUrl.getFile();

if(file.indexOf('/')==-1){//处理相对地址

link="http://"+pageUrl.getHost()+":"

+pageUrl.getPort()+"/"+link;

}else{

Stringpath=file.substring(0,

file.lastIndexOf('/')+1);

link="http://"+pageUrl.getHost()+":"

+pageUrl.getPort()+path+link;

}

intindex=link.indexOf('#');

if(index!=-1){

link=link.substring(0,index);

}

link=removeWwwFromUrl(link);

URLverifiedLink=verifyUrl(link);

if(verifiedLink==null){

continue;

}

/*如果限定主机，排除那些不合条件的URL*/

if(limitHost

&&!pageUrl.getHost().toLowerCase().equals(

verifiedLink.getHost().toLowerCase())){

continue;

}

//跳过那些已经处理的链接.

if(crawledList.contains(link)){

continue;

}

linkList.add(link);

}

return(linkList);

}

//搜索下载Web页面的内容，判断在该页面内有没有指定的搜索字符串

privatebooleansearchStringMatches(StringpageContents,

StringsearchString,booleancaseSensitive){

StringsearchContents=pageContents;

if(!caseSensitive){//如果不区分大小写

searchContents=pageContents.toLowerCase();

}

Patternp=Pattern.compile("[\\s]+");

String[]terms=p.split(searchString);

for(inti=0;i<terms.length;i++){

if(caseSensitive){

if(searchContents.indexOf(terms[i])==-1){

returnfalse;

}

}else{

if(searchContents.indexOf(terms[i].toLowerCase())==-1){

returnfalse;

}

returntrue;

}

//执行实际的搜索操作

publicArrayList<String>crawl(StringstartUrl,intmaxUrls,

StringsearchString,booleanlimithost,booleancaseSensitive){

HashSet<String>crawledList=newHashSet<String>();

LinkedHashSet<String>toCrawlList=newLinkedHashSet<String>();

if(maxUrls<1){

errorList.add("InvalidMaxURLsvalue.");

System.out.println("InvalidMaxURLsvalue.");

}

if(searchString.length()<1){

errorList.add("MissingSearchString.");

System.out.println("MissingsearchString");

}

if(errorList.size()>0){

System.out.println("err!!!");

returnerrorList;

}

//从开始URL中移出www

startUrl=removeWwwFromUrl(startUrl);

toCrawlList.add(startUrl);

while(toCrawlList.size()>0){

if(maxUrls!=-1){

if(crawledList.size()==maxUrls){

break;

}

//GetURLatbottomofthelist.

Stringurl=toCrawlList.iterator().next();

//RemoveURLfromthetocrawllist.

toCrawlList.remove(url);

//ConvertstringurltoURLobject.

URLverifiedUrl=verifyUrl(url);

//SkipURLifrobotsarenotallowedtoaccessit.

if(!isRobotAllowed(verifiedUrl)){

continue;

}

//增加已处理的URL到crawledList

crawledList.add(url);

StringpageContents=downloadPage(verifiedUrl);

if(pageContents!=null&&pageContents.length()>0){

//从页面中获取有效的链接

ArrayList<String>links=retrieveLinks(verifiedUrl,

pageContents,crawledList,limitHost);

toCrawlList.addAll(links);

if(searchStringMatches(pageContents,searchString,

caseSensitive)){

result.add(url);

System.out.println(url);

}

returnresult;

}

//主函数

publicstaticvoidmain(String[]args){

SearchCrawlercrawler=newSearchCrawler(

"http://www.blogjava.net/Jack2007/",20,"jack");

Threadsearch=newThread(crawler);

System.out.println("Startsearching...");

System.out.println("result:");

search.start();

try{

search.join();

}catch(InterruptedExceptione){

//TODOAuto-generatedcatchblock

e.printStackTrace();

}

网络爬虫 arraylist string

MemoryBuffer

0 关注 0 粉丝 0 动态

关注关注

一篇文章教会你理解Scrapy网络爬虫框架的工作原理和数据采集过程

今天小编给大家详细的讲解一下Scrapy爬虫框架，希望对大家的学习有帮助。Scrapy是一个使用Python编程语言编写的爬虫框架，任何人都可以根据自己的需求进行修改，并且使用起来非常的方便。它可以应用在数据采集、数据挖掘、网络异常用户检测、存储数据等方面

CycloneKid 2020-10-27

用Python网络爬虫来看看最近电影院都有哪些上映的电影

猫眼电影是淘宝联合打造电影分类最全的电影的平台，能够第一时间告知用户，最新的电影上线时间。今天教大家获取猫眼电影的即将上映的电影详情。1）基准xpath节点对象列表。

jling 2020-09-17

大数据获取案例：Python网络爬虫实例

网络爬虫，是一种按照一定的规则，自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。用来获取新冠肺炎的实时数据。使用的工具PyCharm新建Python文件，命名为get_data使用爬虫最常用的request模

fengling 2020-08-15

python网络爬虫——requests模块（第二章）

requests模块是python中原生的基于网络请求的模块，其主要作用是用来模拟浏览器发起请求。功能强大，用法简洁高效。在爬虫领域中占据着半壁江山的地位。服务器端检测到该次请求不是基于浏览器访问。本身是请求头中的一个信息。对方服务器端会检测请求载体的身份

我欲疾风前行 2020-06-18

企业级Python开发大佬利用网络爬虫技术实现自动发送天气预告邮件

前天小编带大家利用Python网络爬虫采集了天气网的实时信息，今天小编带大家更进一步，将采集到的天气信息直接发送到邮箱，带大家一起嗨~~拓展来说，这个功能放在企业级角度来看，只要我们拥有客户的邮箱，之后建立邮箱数据库，然后我们就可以通过网络爬虫将采集到的信

我欲疾风前行 2020-06-04

1、网络爬虫

　　网络爬虫，是一种按照一定的规则，自动的抓取万维网信息的程序或脚本。它是一种按照一定的规则，自动地抓取万维网信息的程序或者脚木，可以自动采集所有其能够访问到的页而内容，以获取相关数据。

athrenzala 2020-05-30

Python网络爬虫四大选择器（正则表达式、BS4、Xpath、CSS）总结

前几天小编连续写了四篇关于Python选择器的文章，分别用正则表达式、BeautifulSoup、Xpath、CSS选择器分别抓取京东网的商品信息。今天小编来给大家总结一下这四个选择器，让大家更加深刻的理解和熟悉Python选择器。正则表达式为我们提供了抓

zengni 2020-05-29

python系列整理---爬虫

　　一种按照一定的规则，自动地抓取万维网信息的程序或者脚本。实际的网络爬虫系统通常是几种爬虫技术相结合实现的。由于商业原因，它们的技术细节很少公布出来。虽然存在一定缺陷，通用网络爬虫适用于为搜索引擎搜索广泛的主题，有较强的应用价值。为提高工作效率，通用网络

sunzhihaofuture 2020-05-17

一篇文章带你用Python网络爬虫实现网易云音乐歌词抓取

前几天小编给大家分享了数据可视化分析，在文尾提及了网易云音乐歌词爬取，今天小编给大家分享网易云音乐歌词爬取方法。找到正确的URL，获取源码；利用bs4解析源码，获取歌曲名和歌曲ID；本文的目的是获取网易云音乐的歌词，并将歌词存入到本地文件。本文以民谣歌神赵

hilary0 2020-05-15

《肖申克的救赎》百度百科网络爬虫

<!doctype html>. margin: 0;width: 780px;height: 50px;margin: 150px auto 75px;text-indent: -9999em;width: 780px;margin: 0 a

hilary0 2020-05-04

网络爬虫百度新闻标题及链接爬取

　　我的本意是只要链接的那部分属性，经过反复看视频和多次的实验终于解决了这个难题，形成了开头那个样子。　　但是开头和结尾还是有多余的部分不知道怎么解决，求助！

hilary0 2020-05-03

理解网络爬虫

我们现在生活在一个数据爆发的时代，日益增长的数据太过繁杂，人们如何能获取有效的知识和数据，这是个问题，所以爬虫应运而起，近几年网络爬虫的需求更加呈现井喷之势，但是由于应聘者的能力低于企业的需求，传统的爬虫有百度、Google、必应等搜索引擎，这类通用的搜索

fangjack 2020-04-22

Python网络爬虫与信息提取（二）——HTTP协议及Requests库的方法

HTTP是一个基于“请求与响应”模式的、无状态的应用层协议。也就是用户发出请求，服务器给出响应。无状态是指第一次请求与第二次请求之间并没有相关关联。应用层协议工作在TCP协议之上。HTTP协议采用URL作为定位网络资源的标识。HTTP URL的理解：URL

knightwatch 2020-04-16

python网络爬虫与信息提取mooc------爬取实例

wd=keyword. q=keyword. print("爬取失败")--------------------------------------------------. ip=ipaddress. ip="

宿舍 2020-03-06

Python——网络爬虫，一个简单的通用代码框架

三、总结异常情况的原因多样，通用代码框架并不能包含全部异常，代码写正确才是王道

qyf 2020-03-01

网络爬虫（二）

在我们抓取到页面之后，还需要对页面进行解析。整个页面都是字符串的形式，可以使用字符串处理工具来解析页面，也可以使用正则表达式，但这些方法都会带来很大的开发成本。所以我们需要一款准们解析 html 页面的工具。jsoup是一款 java 的 HTML 解析器

四叶草 2020-02-15

网络爬虫（一）- 基本使用

基本使用与get相同把HttpGet改为HttpPost就可以了。

四叶草 2020-02-15

python网络爬虫（二）requests库的基本介绍和使用

　　　　　　　① url:拟获取页面的url链接。　　　　　　　　该地址就叫URL，它是WWW的统一资源定。　　　　　　　　位标志，就是指网络地址。　　　　　　　③ **kwargs：12个控制访问的参数。　　　　对应HTTP协议的HEAD操作 . 　　　

oXiaoChong 2020-02-14

网络爬虫学习——抓取猫眼电影排行

　　write()方法：将指定内容写入文件，使用方式：write，content为指定内容，注意：如果文件不存在那么创建，如果存在那么就先清空文件(覆盖)，然后写入数据到文件里。　　json全称为JavaScript Object Notation，Jav

四叶草 2020-01-30

Requests库网络爬虫实战

kv = {‘user-agent‘ :‘Mozilla/5.0‘}. 实例三：百度360搜索关键词提交。#设置爬取图片的存储位置及名称，名称可以使用图片原有的名称也可以自定义。path = root + url.split(‘/‘)[-1]

qyf 2020-01-30

安科网

简单好用的网络爬虫spider/crawler

MemoryBuffer

MemoryBuffer

相关推荐

一篇文章教会你理解Scrapy网络爬虫框架的工作原理和数据采集过程

用Python网络爬虫来看看最近电影院都有哪些上映的电影

大数据获取案例：Python网络爬虫实例

python网络爬虫——requests模块（第二章）

企业级Python开发大佬利用网络爬虫技术实现自动发送天气预告邮件

1、网络爬虫

Python网络爬虫四大选择器（正则表达式、BS4、Xpath、CSS）总结

python系列整理---爬虫

一篇文章带你用Python网络爬虫实现网易云音乐歌词抓取

《肖申克的救赎》百度百科网络爬虫

网络爬虫百度新闻标题及链接爬取

理解网络爬虫

Python网络爬虫与信息提取（二）——HTTP协议及Requests库的方法

python网络爬虫与信息提取mooc------爬取实例

Python——网络爬虫，一个简单的通用代码框架

网络爬虫（二）

网络爬虫（一）- 基本使用

python网络爬虫（二）requests库的基本介绍和使用

网络爬虫学习——抓取猫眼电影排行

Requests库网络爬虫实战

MemoryBuffer