论文研究普通
智能体排行榜分数为何难以信任:评测 harness 影响远超模型本身
原始标题:Great paper on why agent leaderboard comparisons are hard to trust. It's on the hot topic of how mu…
内容摘要
一篇论文指出智能体排行榜分数难以信任,因评测 harness(模型与任务间的中介层)对分数影响巨大。控制实验中,更换 harness 使 GLM-5.1 分数波动 13.0 分,而固定 harness 换模型仅波动 3.0/2.5/5.0 分;harness 引发的方差是模型的 7.8 倍,9 组模型对比中 6 组排名因 harness 翻转。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Elvis Saravia (@omarsar0, DAIR.AI)
站内情报编号intel-376949c200741cd2a7e1b01f