先看扫描日志和断点记录,再决定是继续跑、缩小范围重跑,还是放弃这次结果。判断的核心不是“扫了多少页”,而是“哪些页面已经拿到了可用于后续决策的数据”。如果日志里只有开始时间和中断时间,没有逐页状态,这次扫描的覆盖范围就无法可靠还原,应当重跑而不是凭感觉补数。
全站扫描被中断,结果能不能用,取决于工具留下了什么痕迹。可以按下面三类处理:
假设某工具在中断后只保存了已抓取的URL列表,没有保存失败和跳过记录。此时你能确认的只是“这些页面被访问过”,不能确认“这些页面被成功解析”。要把“访问过”和“拿到可用数据”分开看待,否则会把超时页面误算成已覆盖。
决定保留并继续使用,需要同时满足几个条件。第一,中断原因与页面本身无关,比如是本地网络波动或手动停止,而不是目标站持续返回异常。第二,日志能按URL区分成功、失败和跳过。第三,未覆盖部分与已覆盖部分在站点结构上相对独立,比如按栏目或目录分批扫描,中断发生在某一批之后。
满足这些条件时,可以只补扫未完成区间,把两次结果合并。合并前要确认两次扫描的参数一致:同一入口、同一深度限制、同一排除规则。参数不同,合并后的数据口径就不一致,后续比较会失真。
如果中断原因是目标站开始大量返回超时或验证页面,那么已覆盖部分也可能混入了不完整数据。此时保留旧结果的意义有限,应先降低请求频率或缩小单次范围,再重新扫描。
全站重跑成本高,但并非所有中断都值得重跑。当站点规模较大、且你真正关心的只是部分栏目时,可以把“全站扫描”改写为“按优先级分批扫描”。具体动作是:先列出与当前决策直接相关的栏目或页面类型,只对这些范围重新扫描,其余部分暂时标记为未覆盖。
这样做的结果是,你拿到的是范围明确的部分数据,而不是范围模糊的全量数据。下一步判断就有了清晰边界:哪些结论只适用于已扫描栏目,哪些结论还需要等剩余范围完成。代价是无法一次性得到全站视图,适合“先处理重点问题、再补全其余”的节奏。
需要提醒的是,分批扫描之间如果间隔较长,站点内容可能已经变化。合并结果时要记录各批次的扫描时间,避免把不同时间点的数据当成同一状态比较。
出现以下情况时,继续修补这次扫描的收益很低:日志无法还原URL级别状态;中断前已经出现大面积异常状态;扫描参数在中断前后被改动过;或者你无法确认工具是否对已访问页面完成了完整解析。
这时更稳妥的做法是重新组织一次扫描,并在开始前设定可恢复的检查点,比如按目录分批、每批结束后导出一次结果。这样即使再次中断,也能明确知道上一批的边界。重新扫描前还应确认工具当前的抓取设置和导出字段,具体项目以你实际使用的版本为准,必要时核对工具说明或联系提供方确认。
判断覆盖范围的目的,是决定接下来做什么。可以按下面的顺序推进:
完成这一步后,你会得到一个边界清楚的结论:哪些判断有数据支撑,哪些还停留在推测。后续无论是调整页面、继续观察还是更换工具,都基于这个边界展开,而不是基于一个被中断打乱的模糊进度。