Windows配置heritrix3做网络爬虫开发实例

首页
Windows配置heritrix3做网络爬虫开发实例

Windows配置heritrix3做网络爬虫开发实例

2022-07-21 6:00:58 网络知识 官方管理员

304|0条评论

一、引言：

最近在忙某个商业银行的项目，需要引入外部互联网数据作为参考，作为技术选型阶段的工作，之前已经确定了中文分词工具，下一个话题就是网络爬虫的选择，目标很明确，需要下载一些财经网站的新闻信息，然后进行文本计算。记得上一次碰爬虫还是5年前，时过境迁，不知道爬虫的世界里是否有了新的崛起。比较过一些之后，初步认定Heritrix基本能够满足需要，当然肯定是需要定制的了。

二、版本选择

Heritrix当前版本3.1.0，安装后发现，启动任务时，Windows平台有BDBOpen的错误（具体原因不详），Linux环境没有测试。度娘了一把，没啥实质性收获，如果从源码去看，又太费时间。就换到了3.0.5，这个版本也有问题，就是创建Job时，总是提示文件夹有问题，可以选择手动创建下载任务。操作界面如下图所示：

三、配置任务-手动

　　1.jobs目录下新建文件夹sohu；

　　2.拷贝模板文件profile-crawler-beans.cxml到sohu目录

　　3.重命名profile-crawler-beans.cxml文件为crawler-beans.cxml

　　4.手动修改文件crawler-beans.cxml，设置目标网站和存储方式：

复制代码

SQL Server 2008 连接JDBC详细图文教程 visual studio 2013常用快捷键 VS2013快捷键大全

发表评论：取消回复

MORE>

热门推荐网友点评

访客评论文章：

电脑上软件双击打不开win10电脑点不开软件最简单办法win10电脑双击软件打不开是为什么

你好，显示拒绝访问，怎么办，谢谢...
交指评论文章：

快速全选的快捷键是什么,选择全部快捷键全选是哪个

求田问舍，怕应羞见，刘郎才气。...
聪图评论文章：

快速全选的快捷键是什么,选择全部快捷键全选是哪个

一视同仁虎头虎脑...
爬被评论文章：

快速全选的快捷键是什么,选择全部快捷键全选是哪个

窗含西岭千秋雪，门泊东吴万里船。...
古呵评论文章：

快速全选的快捷键是什么,选择全部快捷键全选是哪个

画龙点睛一举两得...

最近发表

网站分类

网络知识