当页面、栏目和作者数量越过某个规模,手工维护的瓶颈往往不在“做得慢”,而在“做得不一致”:同一规则在不同页面被不同人执行,错误会随规模放大。判断是否该停止手工,关键看两项证据——重复动作是否已形成稳定规则,以及错误是否已经影响到抓取、索引或用户路径中的至少一环。
规模扩大后,手工操作会暴露两类不同问题,处理方式完全不同。
区分方法很直接:随机抽同一栏目的若干页面,逐项对照标题写法、描述写法、内链位置和层级路径。如果差异只出现在个别页面,属于执行疏漏;如果差异成片出现,说明规则已经无法靠人工记忆维持,该考虑工具化或模板化。
当栏目数量少、更新频率低,手工处理标题、描述、内链反而更灵活,因为编辑能针对单篇内容做判断。此时不必急于上工具,但需要设置可核对的检查点,避免问题积累到无法回溯。
这样做的结果是:你能拿到一份“偏差分布”记录。如果偏差集中在少数栏目,说明是培训或规则表述问题,继续手工加检查点即可;如果偏差分散在多数栏目,说明规则本身已超出人工可维护范围,下一步就该转向模板或批量处理。
当某类页面的结构已经固定,例如所有作者页都需要相同的标题格式、相同的描述结构、相同的上下级链接关系,继续手工维护就不再是灵活,而是引入不一致。
此时适合停止手工的工作通常包括:
一个假设例子:某站点有若干作者页,最初由编辑逐页填写描述。规模扩大后,编辑改为统一模板生成。结果发现部分作者页的描述与页面实际内容主题偏离,原因是模板变量取错了字段。这说明工具化不是终点,仍需保留一轮针对模板输出的抽查,确认字段映射正确后再扩大范围。
规模扩大后如果发现抓取量或索引量出现与预期相反的下降,不要立刻归因于算法或权重变化。手工维护阶段遗留的问题常常是更合理的解释之一:
可执行的核对动作是:抽取近期改动过的栏目,检查其下级页面的路径、内链目标和标题格式是否一致。如果异常集中在改动过的栏目,优先修复这些遗留问题,再观察抓取与索引的变化,而不是同时调整多个方向导致无法判断哪一步起了作用。
并非所有重复工作都适合工具化。以下情况保留人工判断更稳妥:
判断标准可以归纳为一句:规则是否已经稳定到可以用同一句话描述,且描述结果不依赖具体页面的语境。满足这一条,手工维护就该逐步退出;不满足,就先保留人工,同时把每次判断的理由记录下来,为后续制定规则提供依据。