AI圈报
论文研究普通

SWE-bench Science:编码智能体难解科学缺陷

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:Coding agents fix the symptom you show them far more often than the defect underneath. Agents are g…

内容摘要

新基准 SWE-bench Science 用开源科学仓库的真实缺陷测试编码智能体,发现它们擅长消除可见故障,却难以恢复底层科学逻辑,且领域知识帮助有限。最佳配置 Claude Code 配 Opus-5 通过 96.64% 公开测试,但 Pass@1 仅 47.90%。瓶颈在于验证而非知识:智能体无法将科学解释与可执行证据对照时,会锚定解释而非检验它。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-ec99d30062719b05d2f0596f