LLM评测基准存在法官偏见
Tessl 最新研究发现,使用单一 LLM 作为评分法官会带来系统性偏差。同一评测由 Sonnet、GPT-5.5、Opus-4-7 三个法官分别打分,结果排名大幅变动,某模型单项得分波动 47 个百分点。核心发现如下:
- 模型家族内部存在自评偏好:Opus 自评比另两个法官平均高出 4.6 分。
- 仅 opus-4-7 在所有法官下保持第一,其余模型排名均受法官选择影响。
- 建议:运行多个法官取平均,设计二元可验证的评分标准(如“文件是否删除”)以提升结果可靠性。
原文
#开发者 #工具
📢 频道:@DevToolboxHub
Post #579
1

