先把结论说清楚:自动评分适合处理“同一页面、同一查询、同一时间窗”的可比数据,不适合处理需要判断意图、品牌归属或内容质量的项目。要防止人工判断被替代,做法不是关掉自动评分,而是把每个待查项目拆成“机器可判字段”和“人工裁决字段”,并让自动结果只作为线索、不直接作为结论。下面以你手里的一份页面清单为例,说明具体怎么落地。
拿你清单里的第一条记录,问三个问题:这个查询的意图是否唯一?这个页面的归属是否明确?评分标准是否能用一句话写清?三个都“是”,才适合交给自动评分。只要有一个“否”,就必须保留人工裁决位。
如果第一条记录三项都满足,就把它放进自动队列;只要有一项不满足,就在清单里给它标一个“人工”状态,并写清是哪一项不满足。这个动作会直接影响下一步:自动队列可以批量跑,人工队列必须逐条留痕。
常见的错误做法是“要么全自动,要么全人工”。更稳的结构是两层:自动层负责采集和初筛,人工层负责裁决和备注。自动层输出的是候选位置、可见字段和异常标记;人工层输出的是最终结论和依据。
假设你有一条记录,自动结果给出“目标页面未出现在前两页”。这个结果本身不能直接写成“排名下降”,因为它还有别的解释:查询词被拆分、结果页个性化、目标页被同主体其他页面替代、采集时页面尚未更新。这些解释里,有些能靠自动规则排除,有些必须人工看一眼。人工要做的不是重新查一遍,而是判断“未出现”属于哪一种,并把判断依据写进备注。
这样拆的好处是:自动层失败不会污染结论,人工层也不会被大量重复采集淹没。你可以规定,自动层只负责标记“需人工”的记录,人工层只处理被标记的记录。动作和结果之间的链条是:标记越准,人工处理量越小;人工备注越具体,下一次自动规则越容易收紧。
人工判断最怕口径漂移。同一个项目,今天由甲判、明天由乙判,结论可能不同。解决办法是写一份判定表,把“什么情况判为有效、什么情况判为无效、什么情况退回重查”写成可对照的条目。判定表不需要复杂,但要能覆盖你清单里反复出现的争议点。
判定表落地后,人工处理的产出就从“一个分数”变成“一个状态加一条依据”。这个变化很关键:分数无法解释自己,状态和依据可以。下一步无论是调整页面还是调整查询词,你都能从依据里找到线索,而不是对着一个数字猜。
防止被替代的最后一道闸,是优先级规则:当自动评分和人工裁决冲突时,以人工裁决为准,并且自动评分不得回写覆盖人工结论。实现方式可以很简单,在记录里保留两个字段,一个存自动结果,一个存人工结论,最终展示只取人工结论;没有人工结论时,才显示自动结果并标注“未复核”。
这里要说明适用条件:这条规则只适用于需要判断意图、归属或质量的记录。如果某个字段本身是纯客观的,比如页面是否可访问、标题是否为空,自动结果可以直接采用,不必强留人工位。把两类字段混在一起,才会出现“人工判断被自动评分替代”的问题。
还需要注意一点:自动结果归零、抓取量下降或某项统计变少,都不能单独证明人工处理正确。它们可能有其他合理解释,比如采集周期变化、查询词调整、结果页结构变动。判断处理是否正确,要看人工备注是否与判定表一致,而不是看某个数字是否好看。
现在回到你手里的页面清单。第一步,给每条记录补一个“判定类型”字段,取值只有自动、人工两种。第二步,把判定表贴在清单旁边,人工处理时逐条对照。第三步,跑一轮自动采集,只让它标记候选和异常,不生成最终结论。第四步,人工只处理被标记的记录,写下状态和依据。第五步,检查冲突记录,确认人工结论没有被自动结果覆盖。
完成这五步后,你会得到一份能解释自己的清单:每条结论都能追溯到是自动采集还是人工裁决,依据是什么,下一次该收紧哪条规则。如果自动结果与人工结论大面积冲突,说明判定类型分错了,应该回到第一步重新划分,而不是调高自动评分的权重。把人工判断留在它该在的位置,自动评分才能真正帮上忙,而不是替你做决定。