December 24, 2004

Larbin 一种高效的搜索引擎爬虫工具::[Search Engine]


Liang

离开dallas已经整整十天了,基本上除了到处见见人之外基本上没有其它的时间来学习新知识,也没有空将要完成的工作收尾。

Niu.la ,Booso,luliang.dhs.org 和 wespoke 相继宕机,看来年底各个地方的维护都不力。

itseek的开发者多次问起 larbin 的事情,我就在这里对larbin做一个简单的介绍。因为相对于复杂的系统来讲,larbin具有高度的可配置性,和良好的工作效率。

1]larbin的简介
larbin是一种开源的网络爬虫/网络蜘蛛,由法国的年轻人 Sébastien Ailleret独立开发。larbin目的是能够跟踪页面的url进行扩展的抓取,最后为搜索引擎提供广泛的数据来源。

Larbin只是一个爬虫,也就是说larbin只抓取网页,至于如何parse的事情则由用户自己完成。另外,如何存储到数据库以及建立索引的事情 larbin也不提供。

latbin最初的设计也是依据设计简单但是高度可配置性的原则,因此我们可以看到,一个简单的larbin的爬虫可以每天获取500万的网页,实在是非常高效。

2] Larbin的性能特征
高效是我对 larbin 的评价。
今年四月份的时候我对larbin的性能做过一个测试,luliang.dhs.org是我自己常用的服务器,CPU 为1G,内存512,其它的性能一般,因为是三年前购置的。

我将我自己的网页 六翼作为入口,运行larbin进行5层内的url的抓取。

当时纪录的一些数据:
Internet IO: 500-700k/per second (我想大约我的网络下载的瓶颈了吧)
CPU top: 5%-15%
disk consume: 1M/s ,基本上一个小时爬 3个G 的网页。差不多20万的页面
url 解析: 200万-300万每小时

3] larbin 的作用
很多人初见 larbin 不知道从哪里下手,那么我来简单介绍一下 larbin 的功能和实际应用。
1. larbin 获取单个、确定网站的所有联结,甚至可以镜像一个网站。
2. larbin建立 url 列表群,例如针对所有的网页进行 url retrive后,进行xml的联结的获取。或者是 mp3 。
3. larbin 定制后可以作为搜索引擎的信息的来源(例如可以将抓取下来的网页每2000一组存放在一系列的目录结构里面)。

总归,larbin应当是一个被广大搜索引擎爱好者应当引起注意的一个产品,虽然其功能逐渐被 Nutch 所接受和替代,但是其在爬虫上的优美设计的确值得称道。

Posted at December 24, 2004 02:35 AM by Liang at 02:35 AM | Comments (11) | TrackBack(1) | Booso!| Niu.la收藏!


Trackback

You can ping this entry by using http://www.wespoke.com/cgi-bin/mt/mt-tb.cgi/685

Trackbacked from http://party-poker-download-en.bargarmetal.com with Cool stuff. Keep up the good work. on .

Comments

第 1 楼:

我自己站的Google广告我可以点一下吗?
Google说自己不能点击自己投放的Google广告,可我是北京电信的ADSL用户,我的ip应该是不是固定的,那我是不是从技术角度说就可以点自己站的Google广告了?如果别人用我的pc用我的上网账号上网点击了我投放的广告,那怎么算?如果我误点击了一次自己投放的广告,google会怎么处理?
具体的说,google是如何确定是我点击了我投放的广告呢?

Posted by: 吴志勇 at December 27, 2004 11:34 PM from 61.51.45.241

第 2 楼:

自己点google 当然会指导了。具体如何指导我就不说了。哪怕你的IP每天都变。

adsense作弊的方法很多,现在印度有专门的公司替你作弊。真是世风日下啊。

Posted by: 6e at December 28, 2004 12:28 AM from 60.220.252.173

第 3 楼:

那你说会不会非常容易的就误判了呢?

Posted by: 吴志勇 at December 28, 2004 09:32 PM from 221.217.56.187

第 4 楼:

我看你把cookie也去了,google怕是没线索了,呵呵

Posted by: Lewis at February 2, 2005 10:21 PM from 220.248.24.10

第 5 楼:

没有人会无聊到自己去点广告的地步吧

Posted by: php at March 7, 2005 04:09 AM from 219.139.118.14

第 6 楼:

请大家帮帮忙,那里有,网络真正的蜘蛛软件下载。我已经在搜索引擎找了N天N时间,也没有找到,快要泄气了^_^。

Posted by: yf at May 21, 2005 11:55 AM from 211.150.234.144

第 7 楼:

请大家帮帮忙,那里有,网络真正的蜘蛛软件下载。我已经在搜索引擎找了N天N时间,也没有找到,快要泄气了^_^。
我的邮件smydsys@yahoo.com.cn谢谢大家了

Posted by: yf at May 21, 2005 11:58 AM from 211.150.234.144

第 8 楼:

Larbin是啥呢?

Posted by: walker at July 30, 2005 03:46 AM from 219.128.197.53

第 9 楼:

一个问题,我的网站这样做的,不知道可以不?
我把连接设置成1.htm,然后在IIS设置404错误页面,指向处理程序,把1取出来,然后读去数据库,把真实数据输出,这样可以吗?
会不会被搜索引擎收录?谢谢.....
希望可以跟我联系。

Posted by: sequelbo at October 20, 2005 03:51 AM from 218.25.39.66

第 10 楼:

卢亮:你好,我有建一个网站,涉及到网页抓取的要求,能和你聊聊吗?我的QQ:512764594

Posted by: 陈元阶 at November 15, 2005 04:16 AM from 61.141.194.55

第 11 楼:

我决定看一下爬虫的原代码,不出意外,会过来搔挠一下

Posted by: lgonhia at December 15, 2005 01:58 AM from 218.94.38.85

Post a comment

请注意,为了防止spam,您的留言必需含有中文字符!









Remember personal info?




所有发表