论文研究普通
Meta 新论文:EvoHarness-RL 让 Qwen3-8B 在 ALFWorld 达 96.9%
原始标题:New Meta paper says giving an agent more memory and tools is not enough if the agent never learns wh…
内容摘要
Meta 新论文提出 EvoHarness-RL,通过强化学习训练智能体自主决定何时使用外部记忆与工具,而非硬编码持续访问。该方法将 Qwen3-8B 在 ALFWorld 已见任务成功率从 ReAct 的 47.9% 提升至 96.9%,未见任务达 86.6%(对比 50.0%),且每次任务的外部状态调用降至约 1 次。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-71269e8ae4cbc90dbe2127a2