扫描中断后,最稳妥的判断方式不是看进度条停在多少,而是回到“已完成清单”这一层:先确认工具是否留下了可读取的逐页结果或日志,再用一份独立的URL样本去反查哪些页面确实出现过。如果找不到这类记录,就只能把本次结果当作部分样本,不能推算整站覆盖率。接下来先决定是保留、改写还是退出这次扫描,再安排下一步动作。
全站扫描通常至少包含三个阶段:发现URL、抓取页面、对抓取结果做分析。中断可能只打断其中一层,而不同层被打断,可用的证据完全不同。
判断依据是工具是否提供逐页状态、时间戳或日志文件。若只有一张汇总图,没有逐页明细,那么无论进度条显示多少,都难以证明覆盖范围。
在缺少完整数据或权限时,可以做一个最小动作:自己准备一份URL清单,从站点地图、导航、分类页或已知的重要落地页中抽取若干条,逐条在本次扫描结果里查找。
这个动作的结果会直接影响下一步:样本命中率高,可以先基于已有结果做局部判断,再补扫缺失部分;命中率低,说明发现层可能就没走完,应优先检查站点地图和入口链接,而不是直接重跑一次同样的扫描。
假设示例:某次扫描在抓到约三成页面时中断,你抽取20条已知URL去反查,其中18条能在结果里找到。这只能说明“这20条所代表的入口路径被覆盖到”,不能推出全站已覆盖约九成,因为未被抽取的深层页面、孤立页面可能从未进入发现队列。
中断后的处理方式不是越彻底越好,而是看已有结果能否支撑你当前要回答的问题。
需要注意,请求量或抓取量突然归零,并不能单独证明扫描已经正确结束。它也可能是被目标站点限流、网络中断、权限失效或任务被手动停止。要区分这些原因,可以看中断前是否有连续的失败记录、是否集中在同一时间段、是否伴随错误码。只有把这些现象和逐页记录对照,才能判断是“正常结束”还是“被迫停止”。
在证据不完整时,输出结论要带上限定条件,例如“在已抓取的这批页面中,某类问题集中出现”,而不是“全站存在该问题”。这样写的好处是,后续补扫只针对未覆盖部分,不必推翻已有判断。
补扫前先确认三件事:中断原因是否已排除、工具是否支持按URL清单或目录范围重扫、上次的逐页记录是否已导出保存。如果工具的具体入口、配额或导出权限不清楚,需要以该工具当前的实际说明为准,不要按旧教程或记忆操作。补扫完成后,把新旧两份逐页记录按URL合并去重,再重新计算覆盖范围,这时的结论才接近全站层面。
如果连逐页记录都无法获取,那么这次扫描对全站判断的价值有限,更合理的做法是换一种能留下明细的执行方式,或把问题缩小到可验证的局部范围,而不是在缺少证据的情况下继续推断整站状态。