能不能防止自动评分替代人工,取决于一个条件:这个项目是否存在可被规则完整描述、且所有角色都同意的判定标准。如果存在,自动评分可以承担初筛,人工只做抽查;如果不存在,自动评分只能作为线索,不能作为结论。判断方法不是看分数高低,而是看同一份事实交给不同角色时,他们会不会得出不同结论——会,就说明这个项目必须保留人工判断入口。
自动评分擅长处理可枚举、可对齐、可复算的项,例如链接是否可访问、字段是否缺失、同一份数据两次抓取是否一致。它不擅长处理需要语境才能定性的项,例如一段内容是否真正回答了用户问题、一个页面的意图是否与查询匹配、某个改动是否属于合理优化还是刻意操纵。
可以用一个简单测试区分:把判定标准写成规则后,交给两个没有沟通的角色分别执行,看他们是否给出相同结论。如果两人对同一份材料给出不同判断,说明标准里存在未被写明的假设,这类项目就属于需要人工判断的项目。这个测试不依赖任何特定工具,只需要一份材料副本和一次独立判断。
反过来,如果两个角色对同一份材料总能得到相同结论,且差异只来自数据本身,那么自动评分反而更稳定,人工介入只会增加不一致。
多个角色对同一事实理解不同时,常见做法是让多数人投票或取平均分。这在需要人工判断的项目上会掩盖真正的问题:分歧本身可能指向标准缺失,而不是某一方判断错误。更有效的做法是把分歧拆成可核对的项目,让每个项目都能被独立验证。
可以按下面顺序处理:
这样做的结果是,自动评分负责可核对部分,人工判断负责不可核对部分,两者边界清晰。下一步动作是把这套边界写进交付前的检查项,而不是每次重新讨论。
假设有一份页面材料,自动评分给出中等分数,理由是标题与查询词部分重合、正文长度达标;人工复核给出偏低判断,理由是正文虽然覆盖了查询词,但没有回答查询背后的限定条件,用户仍需再查一次。
这两个结论并不矛盾,它们回答的是不同问题:自动评分回答“形式特征是否接近常见模式”,人工判断回答“是否真正解决了查询意图”。如果直接把自动评分当作最终结论,就会漏掉意图不匹配这一项;如果完全放弃自动评分,又会把可核对的形式项也交给人工,增加不必要的判断成本。
这个例子的数字只用于说明比较方法,不代表任何工具的实际输出。它的价值在于说明:当自动评分和人工判断给出不同结论时,先确认两者回答的是不是同一个问题,再决定哪一个结论进入下一步。
上述结论有一个明确的反例。如果项目的判定标准已经被完整写成规则,且所有角色对规则本身没有分歧,那么自动评分不仅不会替代人工判断,反而比人工更可靠,因为人工在重复执行同一规则时会产生疲劳和漂移。
例如,检查一批链接是否返回同一状态码,这类项目人工复核的价值很低,自动评分的结果可以直接采用。此时若仍坚持人工逐条判断,反而会把判断力消耗在不需要判断的项目上,导致真正需要人工判断的项目被草率处理。
所以防止自动评分替代人工,不等于在所有项目上排斥自动评分,而是把自动评分限制在它成立的条件下,把人工判断保留在标准尚未对齐的项目上。
实际可执行的动作是:选一份当前正在使用的评分结果,让两个角色分别标注哪些项目他们能独立复算出相同结论,哪些项目他们需要讨论才能定论。把需要讨论的项目单独列出,作为人工判断入口;其余项目继续由自动评分处理。
这个动作的结果会直接影响下一步:如果讨论项很少且集中在少数几类,可以尝试把其中一部分规则化,缩小人工范围;如果讨论项分散且每次不同,说明当前标准还不稳定,应先固定判断依据,而不是急着扩大自动评分范围。无论哪种结果,都不必立刻改动工具配置,先让边界可见,再决定是否调整。