AI圈报
论文研究普通

LongWoF-Bench:用 EvoMap 基因评估可验证的长流程任务

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

内容摘要

研究团队提出 LongWoF-Bench,含 778 个可机器验证任务,覆盖代码生成、智能体环境合成、数学推理与规则遵循。在 252 个经验证的 Opus 轨迹上,进化得到的 EvoMap 基因在全部 7 个模型中比 Skill 平均高出 8.7-15.5 个百分点,且优势扩展至消费级模型;对 Claude Opus,基因复用还多完成 39 个任务,并减少 9.9% 的推理 token 消耗。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-d804f3fe979b98b53e2f63e3