这张卡讲清 LLM 评 LLM 这个方法什么时候可信、什么时候翻车。
核心拆解:模型即裁判用一个大模型按评分标准给输出打分,把人工评测的成本降一个数量级。三条铁律决定可信度:先与人工标注校准一致率再启用;警惕位置偏差、长度偏差与自我偏好;上线后持续抽检漂移。最常见的误用是拿一个通用提示词直接当裁判,连评分标准都没写清,打分自然随风摆。
增量判断:国内私有化语境有个额外约束——裁判模型必须与业务模型同域部署,客户不接受数据出域送评。FDE 的增量视角是把评分标准当成正式交付物:它和黄金数据集一样需要业务方确认,争议时刻它就是验收口径本身。
行动建议:先抽五十条输出做人工与裁判模型的一致率对照,达标再让裁判上岗。一致率不达标先改评分标准再重测,千万别急着让裁判上岗独立计分与排序。一致性数据要留档备查。
—— FDEChina编辑部 · 架构师视角
定义
模型即裁判(LLM-as-a-Judge)指用一个按评分标准配置的大模型,对另一个系统的输出进行打分、排序或判定通过与否的方法,用于以可控成本替代部分人工评测。
展开
它的价值是把人工评测的成本降一个数量级,让大规模评测在交付周期内可执行;风险是裁判本身会出错且有系统性偏差:偏好更长的答案、偏好排在后面的候选、偏好自己的风格。三条铁律:先校准——抽样本让人工与裁判背对背打分,一致率达标再启用;防偏差——成对比较时轮换顺序、评分标准里明确长度中性;常抽检——定期抽样复核,裁判模型升级后重跑校准。最常见的误用是拿一句「请判断这个回答好不好」当裁判提示词,标准含糊则分数随风摆。与人工评测的分工是裁判筛大头、人裁决疑难与边界样本;与在线评测的分工是裁判服务离线迭代,线上真实效果仍要看业务指标。评分标准应经业务方确认并留档,它就是验收口径本身。