Heritrix3.0教程 使用入门(一) 下载安装与运行
本博客属原创文章,转载请注明出处:http://www.yun5u.com/articles/heritrix3-1.html
Heritrix3.0.0在2009年底发布,但资料甚少.我这里就先抛砖引用,以前也分析过Heritrix1.4.3,但只是源码,不系统.这里就系统的介绍Heritrix的使用,源码分析和借鉴.先介绍Heritrix的下载与使用吧.
1.下载,下载地址:http://sourceforge.net/projects/archive-crawler/files/heritrix3/?.下载后的截图为
出现以上界面,就表示你可以使用Heritrix去抓取数据了,但这里还需配置Job,也就是抓取任务.
这里先大概介绍下界面:
- Memory 表示内存使用情况
- Jobs Directory?:表示抓取job目录,默认是Heritrix_home/jobs
- rescan按钮表示扫描jobs目录,目录有改动,也就是抓取任务有增加或者删除,这里则都会显示
- create按钮表示创建一个Job
- add按钮表示添加一个已经存在的job,这里是输入这个job所在的路径
好了,这里基本上可以下载并使用Heririx了.下一篇则介绍如何配置CrawlJob,也就是抓取任务去抓取数据.