AI圈报
论文研究普通

TailSFT:微软提出过滤式SFT提升RL性能

信息来源:X:DAIR.AI (@dair_ai)·
原始标题:Interesting technical work from Microsoft. Provides a better understanding on SFT and how to levera…

内容摘要

微软研究指出标准SFT会持续在模型已拟合的序列上消耗梯度,收窄了后续RL所需的探索分布。TailSFT在训练中过滤这些序列,专注学习数据中欠拟合的尾部。在OLMo-3 7B上,pass@16在编程任务上最高提升16.8个绝对点,数学提升3.1点;经GRPO后最终pass@1最高提升3.9点,部分场景早期奖励提升速度快2.5倍。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:DAIR.AI (@dair_ai)
站内情报编号intel-5ca6fde6a4fd5e38d552eefb