WebHarvy 是一款面向 Windows 平台的网页数据抓取工具,由 SysNucleus 开发。它内置浏览器,让用户直接在页面上点选要采集的内容,无需编写代码或脚本。软件能够自动识别网页中重复出现的数据模式,把列表或表格中的名称、地址、价格、邮件等信息批量提取出来。采集结果可以导出为 Excel、CSV、JSON、XML、TSV 等文件,也能写入 SQL 数据库。对于分页展示的产品列表或搜索结果,WebHarvy 可以顺着“下一页”链接自动翻页抓取。

1、 在 WebHarvy 自带浏览器中打开目标网站,像平常上网一样浏览和翻页
2、 用鼠标点击页面上想要采集的文字、图片或链接,即可完成字段选择
3、 软件会自动判断页面中重复出现的数据模式,列表或表格无需额外配置就能整体抓取
4、 也可以把整个页面保存为 HTML 格式,留作后续处理
- 抓取结果支持保存为 Excel、XML、CSV、JSON 或 TSV 文件
- 数据还能导出到 SQL 数据库,方便接入已有的数据流程
- 面对跨多页展示的产品列表或搜索结果,只需指定“下一页”链接,WebHarvy 就会自动遍历所有页面并采集数据
- 采集范围覆盖文本、图片、网址以及电子邮件等信息
- 可以把一组关键词自动提交到搜索表单,并从所有组合的搜索结果中抓取数据
- 支持向多个输入文本字段提交关键词,适合需要多条件检索的场景
- 能够从一个指向站内相似页面或列表的链接集合出发,用同一套配置抓取类别与子类别
- 这种链接跟进方式减少了为每个页面单独配置的重复工作
1、 可以把正则表达式应用到网页文本或 HTML 源码上,只抓取匹配的部分
2、 在正式抓取前,可以在浏览器中运行自己写的 JavaScript,用来操作页面元素、修改 DOM 或调用目标页面已有的函数
3、 图片既可以下载到本地,也可以只抓取图片 URL;电商产品详情页中的多张图片能自动采集
4、 软件可配置点击链接、选择下拉选项、在字段中输入文本、滚动页面、打开弹窗等操作
- WebHarvy 需要 Windows 操作系统,暂不支持 OS X / macOS;在 Mac 上可通过 BootCamp 安装 Windows,或用 Parallels 运行
- 当前版本基于 Google 开源的 Chrome 浏览器项目,在安全、稳定和速度方面有所提升
- 可以在 Amazon AWS EC2 的 Windows 实例中运行 WebHarvy
- 为了匿名采集并降低被目标服务器拦截的概率,可以选择通过代理服务器或 VPN 访问网站,支持单个代理,也支持代理列表
(您的评论需要经过审核才能显示)
0条评论