论文研究普通
无 CoT 数据下,Next-Chunk 推理 RL 真的优于 SFT 吗?混合 SFT 以 60 倍更低算力取得更高 RLVR 上限
原始标题:Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
内容摘要
一项对照研究重新审视了 next-chunk reasoning RL 在无 CoT 数据上的训练策略,发现简单的 Mixed SFT(单阶段联合训练 no-CoT 与 long-CoT 数据)在 post-RLVR 准确率上限上明显高于 next-chunk reasoning RL,且训练算力需求降低超过 60 倍。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-af3d75764cc8955e6e7acbc3