Offline Explorer Enterprise 是面向商用场景的高级离线抓取程序,支持单次任务处理上亿条网页链接,下载完整站点、FTP 目录与流媒体资源并保存至本地。配备增量更新、定时调度、正则过滤、本地全文检索,自带 OLE 自动化开发接口,可二次开发定制抓取流程,完成大规模网站资源长期归档与数字资料保存工作。
软件功能
新建大型抓取项目并设定网页递归深度,可执行小规模栏目抓取或是上亿链接量级的完整站点镜像下载任务。
配置丰富的过滤规则,借助正则表达式、域名黑白名单、文件大小、媒体类型精准筛选需要抓取下载的网络资源。
开启增量同步模式,仅抓取站点上新产生或者改动过的文件,无需重复下载全部内容,节省网络带宽与处理耗时。
内置定时调度任务,按照自定义周期自动启动站点抓取作业,定期同步线上网页内容,更新本地离线存档资料库。
提供 OLE 自动化编程接口,可通过 VB、C++ 等代码操控下载任务,搭建自动化批量爬虫工作流,拓展软件处理能力。
对已经下载完成的网页库建立全文检索索引,在本地离线环境之内快速搜索存档页面当中包含的文字内容。
软件特点
企业级爬虫内核拥有超高的 URL 处理上限,能够稳定承载海量网页的抓取任务,适合大容量站点长期归档作业。
增量更新机制大幅降低重复下载开销,长期维护多个站点镜像时,本地存档可以持续和线上网页版本保持同步。
精细完备的过滤管控体系,多维度排除无关页面与资源文件,避免下载大量无用素材造成硬盘存储空间浪费。
自动化开放接口赋予软件极强的拓展潜力,可融入企业内部工作流程,实现无人值守的网页资源批量采集工作。
下载后的网页内部链接自动修正,离线浏览时页面跳转正常,CSS 样式、多媒体附件一同保存还原原版网页观感。
内置完整的任务日志与项目管理系统,能够同时维护大量站点存档工程,随时查看抓取进度、排查下载失败链接。

请登录后查看评论内容