火车采集器V7正式版是一次彻底的重构版本,整个程序底层重新搭建,形成了一个全新的采集平台。这个版本把数据采集过程中最常用的模块都整合了进来,包括计划任务、数据发布、正文识别、OCR图形图像识别以及采集入库等。它也能让其他采集软件在平台上快速稳定地运行。下面从任务管理、采集能力、数据处理和发布扩展几个方面来了解它的具体表现。

1、 任务队列运行管理,支持Cron表达式来安排执行时间
2、 无限级分组任务管理,配合任务回收站功能,方便整理和恢复任务
3、 提供Http接口,可以查看采集器的运行情况,也能通过接口管理采集器的运行
4、 支持主从服务器分布式采集,适合需要多机协作的场景
- 无限级多页采集,能够实现无限深度的采集
- 无限级列表网址采集,列表页分页采集获取功能也一并支持
- 列表页附加参数获取功能,可以拿到更多列表层面的信息
- 列表页及标签XPath可视化提取功能,让提取规则更直观
- 标签纯正则替换功能,配合标签间自由组合功能,灵活处理内容
- 针对标签内容继续发送Http请求功能,可以从Http头信息中获取数据
- 支持RSS地址采集功能,Aspx列表分页自识别也能自动处理
- 标题内容正文提取功能,帮助从页面中定位核心正文
- 采集入库是基础能力,同时支持使用Mongodb数据库保存数据
- 导出记录为单个或多个Txt、html文件
- 导出记录为Word格式
- 导出所有记录为Excel格式
- 多扩展间数据交换功能,方便不同环节之间传递数据
1、 多网站站群式web发布,适合同时管理多个站点的发布需求
2、 使用随机二级代理服务器,支持Socket代理
3、 下载的图片自动加增强型水印功能
4、 Ocr识别功能,可以把图片转化为文字
(您的评论需要经过审核才能显示)
0条评论