AI圈报
论文研究普通

无中立基准:配置变化致模型排名大幅波动

信息来源:X:DAIR.AI (@dair_ai)·
原始标题:// There Is No Neutral Harness // Great work discussing some of the issues in harness evaluation. …

内容摘要

一项研究让12个开源权重模型在26种同等合理的基准配置下回答ARC、HellaSwag、MMLU和TruthfulQA的3,679道题,仅改变选项顺序、提示词措辞及答案读取方式。gemma4-31b的得分随配置在31%至89%间波动,四个模型在某种配置下排名第一。配置敏感题目承载了相邻模型间95.7%的差距,基准压缩方法筛选出的题目恰是最易受配置影响的。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:DAIR.AI (@dair_ai)
站内情报编号intel-e8c5a792977356a92cc7702f