深入 · 定义力

评测集与判分器把「内容合格」变成可判定的标准

这是我认为最值钱的一块:不是写了个脚本,而是把「什么叫好」定义清楚了, 并且用双向验证证明定义是可执行的。

判分口径(6 条约束)

编号约束判定方式等级
C1类比必须来自知识库代码判(三档:命中/疑似改写待复核/确认违规)确认违规=一票否决
C3不引入未经验证的数据事实代码判 + 人工复核(比对知识库原文)一票否决
C4结构完整性(一条主线+6 个小论点)机器抽取 + 人工判「论点是否服务主线」回归检查(非否决)
C5前后话题一致,不跑题人工 + LLM 双评扣分(严重转人工)
C6口语通俗、术语必配解释人工 + LLM 双评扣分
C2类比与概念结构一一对应人工 + LLM 双评扣分

为什么只有两条配一票否决:因为它们的误放代价不可逆——库外自创类比等于对外输出未验证的知识,编造事实是事故。 其余是质量问题,可靠重试与人工兜底收敛。

判分器实测发现并修掉的 5 个问题

#问题类型与危害
1引用识别把段落标题当成了出处标记假阴性——只要按规范写标题,所有无出处数字都被豁免,一票否决项完全失效
2数字识别把口语量词(「一个」)当成数据假阳性——告警被淹没,久了没人看
3严格字符串匹配把类比的合规改写判成违规字面/语义混淆——把好稿拦下
4拿「7 段骨架」当判定对象判定对象错误——测了生产中不存在的问题
5把「时长 40 秒」等制作参数当成事实数据判定范围错误——一份正常脚本判出 46 条假违规

由此得出两条结论:一票否决项的判分器必须双向验证;判定对象与范围必须来自生产事实,不能来自设计文档的假设。

方法论要点

要点做法
能代码判的绝不用模型判C1/C3/C4 走规则,保证可复现、可解释、能定向重试
LLM 判必须先验证人工标 10 条,一致率 ≥80% 才放量
主观项写 rubric「类比要贴切」不可判;「覆盖概念 3 个关键属性」可判
低置信度护栏违规比例 >60% 时判「结果不可用」——护栏的作用是拦住一个会误导决策的分数

已知局限

← 返回