中断后不要重新跑一遍,也不要凭“扫到一半”估算。先看工具是否留下了可续跑的进度标记或分页游标,再用小样本回扫验证断点位置,最后按页面类型决定保留、改写还是退出。下面把判断顺序和取舍条件拆开说。
全站扫描通常分三层:URL 发现、页面抓取、关键词数据匹配。进度条停在 60% 不等于六成页面拿到了关键词数据,可能只是 URL 列表读完了。判断方法是打开工具的日志或任务详情,找三类信号:已发现 URL 数、已成功抓取数、已匹配关键词数。三者差距越大,说明中断越靠前。
如果工具只显示一个总进度,没有分层计数,就把它当成“范围不可知”,不要基于这次结果做删除或合并决策。此时更稳妥的动作是导出已完成的 URL 列表,与站点地图或内链清单做差集,差集部分视为未覆盖,而不是视为无价值。
已覆盖范围本身不决定内容去留。真正要问的是:这个页面属于哪种类型,它承担的是入口、承接还是存档功能。
这里的关键是:扫描中断只影响你对“覆盖面”的信心,不影响页面类型判断。类型判断靠的是链接、入口和主题关系,这些可以从其他来源核对。
假设一次全站扫描在 4,200 个 URL 处中断,工具显示已抓取 3,100 个。不要直接补跑剩余 1,100 个。先随机抽 30 个已抓取 URL,手动检查它们的标题、描述和关键词匹配是否完整。如果这 30 个里有超过一小部分缺少关键词数据,说明中断发生在匹配层,已抓取不等于已覆盖。
反过来,如果这 30 个数据完整,再抽 30 个未抓取 URL,确认它们是否真的没被处理。这个动作的结果会直接影响下一步:数据完整就按断点续跑;数据不完整就缩小范围,先只跑需要决策的那批页面,而不是全站重来。
全站重跑的成本往往高于收益,尤其是旧站。更实际的做法是把待处理页面按决策优先级分成三批:
这样做的结果是:你不需要等全站扫描完成,就能对第一批做出保留或改写的决定。后续扫描是否补全,取决于第一批的结论是否暴露出新的重叠或缺口。
即使工具显示“已完成”,也要留意几种情况:URL 总数与站点地图差异过大、大量页面返回相同标题、关键词匹配字段为空的比例异常。这些现象可能来自抓取限制、模板问题或数据源未加载,不能单独证明页面本身有问题。
遇到这类情况,先核对工具的任务配置和站点当前的 robots 与 sitemap 状态,再决定是否重跑。如果只是部分字段缺失,可以只补跑缺失字段对应的页面,而不是全站重来。
最终判断标准不是“扫了多少”,而是“能不能对每个待决策页面说清保留、改写或退出的理由”。说不清的那部分,才是真正需要补扫的范围。