深入 · 定义力
评测集与判分器把「内容合格」变成可判定的标准
这是我认为最值钱的一块:不是写了个脚本,而是把「什么叫好」定义清楚了,
并且用双向验证证明定义是可执行的。
判分口径(6 条约束)
| 编号 | 约束 | 判定方式 | 等级 |
| C1 | 类比必须来自知识库 | 代码判(三档:命中/疑似改写待复核/确认违规) | 确认违规=一票否决 |
| C3 | 不引入未经验证的数据事实 | 代码判 + 人工复核(比对知识库原文) | 一票否决 |
| C4 | 结构完整性(一条主线+6 个小论点) | 机器抽取 + 人工判「论点是否服务主线」 | 回归检查(非否决) |
| C5 | 前后话题一致,不跑题 | 人工 + LLM 双评 | 扣分(严重转人工) |
| C6 | 口语通俗、术语必配解释 | 人工 + LLM 双评 | 扣分 |
| C2 | 类比与概念结构一一对应 | 人工 + LLM 双评 | 扣分 |
为什么只有两条配一票否决:因为它们的误放代价不可逆——库外自创类比等于对外输出未验证的知识,编造事实是事故。
其余是质量问题,可靠重试与人工兜底收敛。
判分器实测发现并修掉的 5 个问题
| # | 问题 | 类型与危害 |
| 1 | 引用识别把段落标题当成了出处标记 | 假阴性——只要按规范写标题,所有无出处数字都被豁免,一票否决项完全失效 |
| 2 | 数字识别把口语量词(「一个」)当成数据 | 假阳性——告警被淹没,久了没人看 |
| 3 | 严格字符串匹配把类比的合规改写判成违规 | 字面/语义混淆——把好稿拦下 |
| 4 | 拿「7 段骨架」当判定对象 | 判定对象错误——测了生产中不存在的问题 |
| 5 | 把「时长 40 秒」等制作参数当成事实数据 | 判定范围错误——一份正常脚本判出 46 条假违规 |
由此得出两条结论:一票否决项的判分器必须双向验证;判定对象与范围必须来自生产事实,不能来自设计文档的假设。
方法论要点
| 要点 | 做法 |
| 能代码判的绝不用模型判 | C1/C3/C4 走规则,保证可复现、可解释、能定向重试 |
| LLM 判必须先验证 | 人工标 10 条,一致率 ≥80% 才放量 |
| 主观项写 rubric | 「类比要贴切」不可判;「覆盖概念 3 个关键属性」可判 |
| 低置信度护栏 | 违规比例 >60% 时判「结果不可用」——护栏的作用是拦住一个会误导决策的分数 |
已知局限
- 首轮跑分未做:原始样本在另一台设备,口径与 30 条用例已就绪,缺的是输入
- 阈值中 C1 的 0.25 是实测标定;C5/C6 阈值仍是初始值
- 类比库是示范样本,完整语料在另一台设备——库越小,C1 假阳性越高