要让需要人工判断的项目不被自动评分替代,关键不是拒绝工具,而是把工具输出降级为“证据之一”,并给每个评分附上可核对的事实来源。具体做法:当分歧涉及事实认定(如某段文字是否算重复、某处是否算关键词堆砌)时,用人工核对替代自动分数;当分歧只涉及排序偏好(如哪段更该优先处理)时,可以保留自动评分作为初筛。下面按这两种条件分别说明选择依据、实施动作和例外。
自动评分擅长给一个数字,但不擅长说明“这个数字对应哪条事实”。当多个角色对同一事实有不同理解,例如同一段文案被一人认为自然、被另一人认为堆砌,自动评分的差异往往来自分词方式、统计口径或阈值设定,而不是事实本身。此时如果继续用分数高低决定谁对,分歧会从“事实之争”变成“工具之争”。
实施动作:把自动评分拆成可逐条核对的项目。例如针对“关键词密度工具”给出的密度值,要求同时列出:统计范围(正文还是含标题与导航)、分词依据(按字还是按词)、重复单元(单次出现还是连续短语)。这三项中任何一项不同,密度值就不可直接比较。把这三项写进核对表后,让每个角色分别标注自己认可的项,分歧会收敛到具体条目,而不是停留在总分。
这一步的结果会直接影响下一步:如果核对后发现分歧集中在分词依据,那么后续讨论应改为统一分词口径,而不是继续争论分数高低;如果分歧集中在统计范围,则应先界定页面哪些区域纳入统计,再重新生成评分。评分只有在口径一致后才有比较意义。
有些分歧并不涉及事实对错,只涉及“先处理哪个”。例如同一批页面中,哪个更该优先修改,不同角色可能各有偏好。这种情况下自动评分可以作为初筛,因为它能快速给出一致顺序,减少逐条讨论的成本。但要注意,初筛结果只能用于排序,不能用于定性。把“排在前面的页面”直接说成“问题更严重的页面”,就是把排序偏好偷换成事实判断,这正是人工判断被自动评分替代的常见路径。
实施动作:在使用自动评分排序后,要求对前若干项逐条给出人工理由。理由必须指向可核对的事实,例如“该段连续出现同一短语三次”或“该标题与正文主题不一致”,而不是“分数高所以问题大”。如果某一条无法给出事实理由,就把它从优先处理清单中移除,或降级为待观察项。这个动作的结果是:优先清单变短,但每条都有依据,后续修改不会因为分数波动而反复推翻。
判断一个项目是否适合保留人工判断,可以看三点:第一,评分是否依赖未公开的口径;第二,同一事实是否有多方不同理解;第三,评分变化是否无法用页面内容变化解释。三点中满足任意两点,就应把该项目从自动评分中取出,改为人工核对。
这里需要说明一个例外:如果评分变化确实伴随页面内容修改,也不能直接断定是修改导致的。内容修改、统计口径调整、页面模板变化都可能同时发生,需要逐项排除。把相关当成因果,是自动评分替代人工判断的另一种形式。
假设某团队用同一款关键词密度工具检查同一篇文章,甲得到密度值 2.1%,乙得到 3.4%。两人都认为自己的结果正确。此时不应比较哪个数字更“准”,而应核对三项:甲是否排除了导航文字,乙是否包含;甲按词统计,乙按字统计;甲只统计正文,乙统计全文。假设核对后发现差异主要来自统计范围,那么下一步动作是统一范围后重新生成结果,而不是让两人继续争论。如果统一范围后数值仍不同,再检查分词依据。这个例子说明:人工判断的作用不是否定工具,而是把工具输出还原成可核对的条件。
完成上述动作后,用两个问题检查是否仍存在自动评分替代人工判断的情况:第一,当前优先清单中的每一项,是否都能指向一条可核对的事实;第二,当评分变化时,是否先排除了口径变化再讨论内容。如果第一个问题有否定答案,说明还有项目被分数直接决定;如果第二个问题有否定答案,说明评分仍被当作事实本身。调整方式是把无法核对的项目移出清单,或补充口径说明后重新评估。这样做的结果不是让评分消失,而是让评分只在它成立的条件下参与决策。