论文研究普通
PACE-Bench:动态物理环境下智能体代码自适应评测
原始标题:Executable Python code can define a vehicle that works on high-friction ground yet spins uselessly o…
内容摘要
清华NLP团队推出PACE-Bench,评测智能体在物理参数突变后修改代码重新适应的能力,含36个基础任务和144组源→目标环境对。最佳成绩为Reflexion+Qwen3-14B的35.9% Pass@2,GPT-5.5达66.7%但仍失败三分之一。基准显示,基于最新模拟结果的反馈比单纯"多思考"更有效,且更多信息并不能消除重新设计的瓶颈。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:面壁智能 OpenBMB (@OpenBMB)
站内情报编号intel-40b370041be56b52eac97d45