AI圈报
论文研究普通

超越稳定性-探索困境:面向LLM策略优化的环境正则化方法

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

内容摘要

针对大语言模型策略优化中的稳定性-探索权衡问题,研究提出环境正则化策略优化(ERPO),将正则化从动作侧移至输入侧,通过Query-KL项约束查询分布漂移,同时保留探索能力。ERPO可无缝接入GRPO/PPO/REINFORCE等流程,无需额外前向传播。在六个数学推理基准上,ERPO替代标准Policy-KL正则化,在高温解码和长时训练下实现更强准确率和更稳定行为。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-5dd528e17d0ef51054b3d917