Cyotek WebCopy 是一款用于将完整网站抓取到本地的工具,适合需要离线浏览网页副本或参考站点结构进行建站的用户。它能够把目标站点的页面、媒体资源以及可访问的链接一并下载到指定目录,并保留可脱机打开的路径关系。使用门槛不高,只需填写待复制的网址并设定保存位置即可启动任务。软件还提供规则控制、表单提交、身份验证等进阶选项,方便处理结构复杂或带有访问限制的站点。

1、 打开软件后,在 Website 输入框中填入需要复制的网站地址
2、 在 Save folder 区域指定文件存放的文件夹路径
3、 从工具栏的 Project 菜单选择 Copy Website,或直接按 F5 开始抓取
4、 抓取结束后进入保存目录,找到 index.htm 并用浏览器打开,页面内容与原始站点一致即表示复制成功
- 规则功能可以约束扫描行为,比如把网站的某一部分排除在下载之外
- 还能设置某些 URL 仅包含在副本中,但不对其进行抓取
- 分析站点之前,允许提交一个或多个表单,例如登录管理区域
- 支持 HTTP 401 质询身份验证,可预先填写用户名和密码,也可在扫描过程中根据提示输入凭据
- 链接地图查看器会列出站内找到的全部链接,包含内部链接与外部链接,并可通过过滤快速区分不同类型
- 可配置的选项覆盖域别名、用户代理字符串、默认文档等,用于调整爬网方式
- 扫描完成后、能够查看页面、错误、缺失页面、媒体资源等分类列表
- 部分配置项采用正则表达式,内置编辑器可用来测试表达式是否正确
- 网站的可视化图表支持查看和定制,也可以导出为图像文件
1、 新增从外部文件读取 cookies 的能力
2、 测试 URL 对话现在允许配置 cookies
3、 增加 cookie、cookie-jar 和 discard-session-cookies 命令行参数
4、 增加对传统 compress 和非标准 BZip2 内容编码的支持
5、 测试 URL 对话对设置页面改用按需加载方式
6、 401 质询不再弹出凭据对话,除非身份验证类型为 Basic 或 Digest;其他值因缺乏资源未做测试
7、 如果某个 URL 先前被跳过,之后又被纳入未来扫描,可保留原来的跳过原因
- Brotli 解压缩错误会显示一条空白错误消息
- 一次性项目验证检查会忽略项目的内容编码设置,默认使用 Gzip 和 Deflate,并请求 Brotli 压缩内容
- 对于大于 65535 字节的流,Brotli 解压缩可能失败
- URI 转换服务在 mailto: 引用格式不正确时,会错误地尝试向电子邮件地址添加前缀
- 内容类型标头格式不正确且涉及 utf 或 utf- 时存在处理异常
- 修复了命令行参数有时无法正确处理可能是文件名或非限定 URI 的模糊相对参数的问题;该修复后,命令行提供的所有 URI 必须完全限定,例如使用 https://example.com 而非 example.com
- 修复了抓取期间在空的虚拟列表视图之间切换、随后项目被添加时可能发生的崩溃
- 加载本地化文本时可能发生的崩溃不再致命;如果此前在设置非英语语言后遇到崩溃,可发送邮件至 support@cyotek.com 反馈
- 速度和估计停机时间计算不正确,可能导致下载大文件时崩溃,已做修复
- 对完成新建项目向导时可能发生的崩溃做了推测性修复
- 修复了收到 401 质询且 www-authenticate 标题为裸类型时发生的崩溃
- 如果网站返回非标准或当前不支持的内容编码值,将不再尝试解压缩,而是按原样下载;同时新增了一个禁用该行为的设置,但尚未公开
- 应用项目验证更正时发生的崩溃已不再致命,例如基本 URL 重定向时提示使用重定向版本的情况
- 如果检测到无效主机名,快速扫描图视图可能崩溃的问题已修复;若此前遇到类似情况,可发送邮件至 support@cyotek.com 反馈
- “限制与基本 URL 的距离”设置现在仅适用于内容类型为 text/html,可阻止深度扫描,同时仍允许检索所有链接的资源
- 根据项目设置的组合,带有排除规则的 URL 仍然会被请求的问题已处理
- 当 recursive 和 output 参数已定义但指定输出目录不存在时,CLI 会崩溃的问题已修复
- 客户端不再标记为 dpi 感知,这应能解决高 DPI 屏幕上无法正确显示的多数问题,属于临时方案,后续会正式引入 dpi-awareness
- 修复了尝试查询扫描以上根设置应启用且项目 URI 无效时可能发生的崩溃
- 修复了关闭扫描或下载进度对话框时可能发生的崩溃
- “导出 CSV”对话框未正确本地化,导致出现两个取消按钮的问题已修正
(您的评论需要经过审核才能显示)
0条评论