论文研究普通
理解用于 LLM 推理的进化策略:比 GRPO 覆盖更广的推理能力
原始标题:Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
内容摘要
一项研究系统考察了进化策略(ES)在 LLM 推理后训练中的优化行为,从理论和实证上证明 ES 比 GRPO 能带来更广的推理覆盖,从而更好利用预训练 LLM 的推理能力。与 GRPO 出现熵坍缩不同,ES 在提升 Pass@1 的同时获得更高 Pass@K;研究还发现 ES 的性能提升仅来自少量大幅更新,且所需种群规模随模型增大而减小。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-e42fcc5faee35c4d20330acb