AI圈报
观点 / 方法精选

腾讯混元发布UniRL:统一多模态强化学习基础设施

信息来源:X:腾讯混元 (@TencentHunyuan)·
原始标题:🚀Introducing UniRL, an RL infra for unified multimodal models. Together with two new RL algorithms:…

内容摘要

腾讯混元推出UniRL,一个支持统一多模态模型的强化学习基础设施,并发布两个新算法DRPO和Flow-DPPO。UniRL通过单个后训练循环(生成→评分→优势→更新→同步)覆盖扩散/流匹配模型、LLM/VLM及统一多模态模型(如Hunyuan-Image 3和Bagel)。模型与算法作为独立轴,可实现模型×算法的组合覆盖。框架支持可插拔rollout引擎(训练侧/SGLang/vLLM-Omni)、FSDP2分片和三种部署模式。FlowDPPO针对流/扩散模型引入基于精确散度的信任域策略优化;DRPO为LLM RL提供平滑的优势加权二次正则化方法。代码已开源。
内容分类AI 观点与方法
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:腾讯混元 (@TencentHunyuan)
站内情报编号intel-5f47a829c3ef86c68232f7c4