先看扫描日志和结果文件里有没有“断点标记”,再决定是补扫还是重扫。多数网站关键词提升软件会在中断时留下最后完成的批次编号或时间戳,但不同工具记录方式差异很大,不能默认它一定可续跑。判断覆盖范围的核心不是看进度条百分比,而是看已完成对象清单和未完成对象清单能否对上你站点的实际URL总数。
进程被杀(如断电、内存不足、手动关窗口)通常只留下部分结果文件,进度状态可能没写入。任务主动停止(点“暂停”或“停止”)一般会写入一个可读的状态记录。两者的处理方式不同:前者要按文件时间戳和批次号倒推,后者可以直接读取工具给出的中断位置。
具体动作:打开结果目录,按修改时间排序,找到最后写入的文件。如果文件名带批次号或分页参数(例如 batch_017),说明前16批大概率完整,第17批可能只写了一半。这时不要直接信任第17批,应把它单独隔离,从第18批开始补扫。
进度条显示的80%可能对应URL数量,也可能对应任务步骤,两者差别很大。更可靠的做法是导出已完成URL列表,与你自己准备的站点清单做差集。
这里有一个假设例子:站点有200个可抓取URL,中断后已完成列表有150条,但其中30条是同一页面的不同参数版本。那么实际覆盖约120个独立页面,缺口是80个,而不是50个。这个差值会直接影响你下一步是补扫还是重扫。
两种做法都成立,但代价不同。
选择补扫的条件:中断点之后的任务没有依赖前面已完成的中间数据,且工具支持指定URL范围或批次续跑。代价是可能遗漏中断瞬间正在处理但未写入结果的那几条,需要额外核对边界批次。
选择重扫的条件:中断导致状态文件损坏、批次号缺失,或者你无法确认已完成结果是否被截断。代价是重复消耗抓取资源和时间,但结果一致性更有保障。
一个可执行的判断动作:先尝试用已完成列表做一次抽样复核,随机取10条记录,检查它们对应的页面是否真的被完整分析(例如是否有标题、状态码、关键内容字段)。如果10条里有2条以上字段为空或异常,说明结果文件不可靠,倾向重扫;如果10条都完整,可以补扫。
确认覆盖范围后,按以下顺序处理:
这个动作的结果会直接影响下一步:如果小批量补扫能顺利合并,说明工具支持分段处理,后续可以按批次管理;如果合并时出现冲突或覆盖,说明该工具的结果文件不适合增量拼接,应改为整站重扫并保留完整日志。
不同网站关键词提升软件对中断的处理方式没有统一标准,日志格式、断点续跑能力、结果文件结构都需要以你实际使用的工具为准。如果工具文档没有说明中断恢复行为,不要假设它一定支持续跑。必要时用一个小型测试站点或少量URL做一次中断实验,观察它留下什么记录,再决定正式任务的处理方式。
判断覆盖范围的最终依据是你能否说清楚“哪些对象已处理、哪些没有、依据是什么”,而不是工具给出的一个百分比数字。