论文研究普通
OPDVR:无需额外超参数的无监督策略蒸馏与可验证奖励结合方法
原始标题:On-policy Distillation with Verifiable Reward
内容摘要
研究者提出 On-policy Distillation with Verifiable Reward(OPDVR),将基于可验证奖励的强化学习(RLVR)与在线策略蒸馏(OPD)无缝结合,无需引入任何额外超参数。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-b250c738efe0ab3ba2e1a076