读书人

Nutch保留要抓取的起始网页

发布时间: 2012-07-30 16:19:05 作者: rapoo

Nutch保存要抓取的起始网页

在\home\apache-nutch-1.4-bin\runtime\local下新建urls新建url.txt输入如下内容:?

http://www.163.com/

http://www.baidu.com/

http://www.sina.com.cn/

http://www.renren.com/

更改\home\apache-nutch-1.4-bin\runtime\local\conf\regex-urlfilter.txt最下面:

# accept anything else

#+^http://([a-z0-9]*\.)*(.*\.)*.*/ ?

#+^http://([a-z0-9]*\.)*nutch.apache.org/

+^http://([a-z0-9]*\.)*renren.com/

+^http://([a-z0-9]*\.)*163.com/

+^http://([a-z0-9]*\.)*baidu.com/

+^http://([a-z0-9]*\.)*sina.com.cn/

?

如果配置了solr,就可以执行了: bin/nutch crawl urls -solr http://localhost:8983/solr/ -depth 5 -topN 100 -threads 4 >&log.txt

读书人网 >开源软件

热点推荐