一个 RL 循环统管所有模型:腾讯混元开源 UniRL,扩散、LLM、VLM 全搞定
强化学习(RL)正在成为大模型后训练的核心引擎。但问题是——每个模型类型(扩散、自回归、视觉语言)都需要一套独立的 RL 训练流程。腾讯混元团队开源的 UniRL 框架,用一个统一的 RL 循环解决了这个”碎片化”难题。
一、为什么需要 UniRL?
强化学习已经证明了它在大模型后训练中的价值——从 ChatGPT 的 RLHF 到 DeepSeek 的 GRPO,RL 驱动的对齐和推理增强已经成为标配。
但问题在于:不同类型的模型需要不同的 RL 训练流程。
图像扩散模型(如 Stable Diffusion)需要 DiffusionNFT 或 DanceGRPO
视频扩散模型(如 WAN 2.1)需要 Flow-DPPO
自回归 LLM(如 Qwen3)需要 GRPO 或 PPO
视觉语言模型(如 Qwen-VL)需要多模态奖励模型
统一模型(如 HunyuanImage3)需要同时处理 AR 和扩散
这意味着每个模型家族都要维护一套独立的训练基础设施,代码重复、算法不可复用、新模型上手成本高。

UniRL 的核心洞察是:模型和算法是两个独立的可组合维度。就像 GPU 和 CUDA 的关系——硬件是硬件,软件是软件,两者可以自由组合。
二、UniRL 的统一架构
UniRL 的设计哲学是:一个 RL 循环统管所有模型。
这个循环的 5 个步骤:
生成样本(Generate):从当前策略采样输出
评分(Score):用奖励模型或规则打分
计算优势(Advantage):计算每个 token/步骤的优势值
更新策略(Update):用 RL 算法更新模型参数
同步权重(Sync):将更新后的权重同步到推理引擎
这 5 个步骤对所有模型类型都适用——无论是扩散模型还是自回归模型。区别只在于每个步骤的具体实现。

分层架构
UniRL 是一个分层、可组合的系统:
┌─────────────────────────────────────────────┐ │ Entrypoint 层 │ │ train_diffusion / train_ar / train_pe / ... │ ├─────────────────────────────────────────────┤ │ Trainer 层 │ │ DiffusionTrainer / ARTrainer / PETrainer │ ├────────────────────────────────藏─────────────┤ │ 模块层(可插拔) │ │ Rollout 引擎 │ 算法 │ 模型 │ 奖励 │ 同步 │ ├─────────────────────────────────────────────┤ │ 运行时层 │ │ Ray DevicePool / FSDP / Transfer Queue │ └─────────────────────────────────────────────┘
每一层都是可替换的。想换算法?只改算法模块。想换模型?只改模型模块。不需要重写整个训练流程。
三、四种训练模式
UniRL 支持四种训练模式,覆盖几乎所有主流多模态模型:
1. 扩散模式(Diffusion)
训练图像和视频扩散模型。
| 模型 | 模态 | 状态 |
|---|---|---|
| Stable Diffusion 3 / 3.5 | 文生图 | ✅ |
| FLUX.2-Klein | 文生图 | ✅ |
| Qwen-Image | 文生图 | ✅ |
| WAN 2.1 / 2.2 | 文/图生视频 | ✅ |
| HunyuanVideo 1.0 / 1.5 | 文生视频 | ✅ |
2. 自回归模式(AR)
训练 LLM 和 VLM。
| 模型 | 模态 | 状态 |
|---|---|---|
| Qwen3 | 文本 LLM | ✅ |
| Qwen-VL | 视觉语言 | ✅ |
3. Prompt-Enhancer 模式(PE)
训练”提示词增强器”——先用 LLM 优化提示词,再用扩散模型生成图像。
| 模型 | 模态 | 状态 |
|---|---|---|
| Prompt-Enhancer | 文→文→图 | ✅ |
4. 统一模型模式(Unified)
训练同时包含 AR 和扩散组件的统一模型。
| 模型 | 模态 | 状态 |
|---|---|---|
| HunyuanImage3 | 文生图 | ✅ |
| Bagel | 文生图 | ✅ |
四、自研算法:DRPO 和 Flow-DPPO
UniRL 的最大亮点是两个自研算法,这也是腾讯混元团队的核心贡献。
DRPO:LLM RL 的”软约束”
论文:Rethinking the Divergence Regularization in LLM RL[1]
传统 LLM RL(如 PPO、GRPO)用比率裁剪(ratio clipping)来控制策略偏移。但这种方法在长尾词汇分布下容易失效——因为重要性比率(importance ratio)对分布偏移的估计不够准确。
DPPO 改进了这一点,用基于散度的掩码替代比率裁剪。但它仍然用硬掩码——一旦 token 超出信任域边界,梯度直接丢弃,而不是修正。
DRPO 的创新在于:用平滑的优势加权二次正则器替代硬掩码。
同样的信任域几何
有界的、连续的梯度权重
对偏离的更新进行衰减
在边界之外仍提供修正信号
效果:在不同模型规模、架构和精度设置下,DRPO 都提升了 LLM RL 训练的稳定性和效率。
Flow-DPPO:扩散模型的”精确信任域”
论文:Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models[2]
扩散模型的 RL 训练和 LLM 不同——它不是逐 token 的,而是连续流匹配(flow matching)的。传统方法用启发式的方式近似信任域,不够精确。
Flow-DPPO 为流匹配模型提供了精确的基于散度的信任域掩码:
直接在流空间中定义信任域
不需要启发式近似
与扩散模型的训练范式天然兼容
效果:在图像和视频生成任务上,Flow-DPPO 比现有方法更稳定、更高效。
五、标准算法集成
除了自研算法,UniRL 还集成了业界主流的标准算法:
| 算法 | 适用模型 | 来源 |
|---|---|---|
| GRPO | LLM | DeepSeek |
| DiffusionNFT | 扩散模型 | 业界标准 |
| DanceGRPO | 扩散模型 | 业界标准 |
| MixGRPO | 扩散模型 | 业界标准 |
关键点:算法和模型是正交的。任何扩散算法都可以跑在任何扩散模型上,任何 AR 算法都可以跑在任何 AR 模型上。这意味着 UniRL 覆盖的”模型 × 算法”组合远超示例数量。
六、技术依赖与生态
UniRL 建立在开源推理和 RL 生态之上:
推理引擎:vLLM、SGLang
分布式训练:FSDP、Ray DevicePool
RL 框架:verl、slime
配置管理:Hydra
运行时支持:
单节点训练
多节点分布式训练
LoRA 微调和全权重训练
权重同步(Transfer Queue)
七、怎么用?
安装
# 克隆仓库 git clone https://github.com/Tencent-Hunyuan/UniRL.git cd UniRL # 安装依赖 pip install -e .
跑一个示例
# 扩散模型训练(Stable Diffusion 3) python -m unirl.train_diffusion \ --config-name=diffusion/sd3_trainside \ --cfg job --resolve # LLM 训练(Qwen3 + DRPO) python -m unirl.train_ar \ --config-name=ar/qwen3_drpo_4b_base_dapo_sglang \ --cfg job --resolve
添加自己的模型
UniRL 的架构设计使得添加新模型变得简单:
在对应 domain 下添加模型配置
实现模型的 rollout 接口
选择一个已有的算法即可
八、这意味着什么?
对研究者
UniRL 提供了一个统一的实验平台,可以在相同框架下比较不同算法在不同模型上的表现。模型和算法的正交性使得消融实验变得简单。
对开发者
不用再为每个模型维护独立的 RL 训练流程。UniRL 的可组合架构意味着你可以用最小的代码改动尝试新算法或新模型。
对行业
RL 正在从”后训练的可选步骤”变成”模型进化的必经之路”。UniRL 的出现,降低了多模态 RL 的门槛,让更多团队能够参与到这个方向中来。
结语
UniRL 的核心价值不在于它做了多少个模型或算法,而在于它证明了一件事:RL 的训练循环可以是模型无关的。
当模型和算法成为两个独立的可组合维度时,创新的速率会显著提升——因为你可以用最小的代价尝试新的组合。
这就像乐高积木:积木块是标准化的,但你可以拼出无限种形状。
相关链接
UniRL GitHub 仓库[3]
UniRL 项目主页[4]
DRPO 论文[5]
Flow-DPPO 论文[6]
引用链接
[1]Rethinking the Divergence Regularization in LLM RL: https://arxiv.org/abs/2606.09821
[2]Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models: https://arxiv.org/abs/2606.11025
[3]UniRL GitHub 仓库: https://github.com/Tencent-Hunyuan/UniRL
[4]UniRL 项目主页: https://unirl-project.github.io/unirl/
[5]DRPO 论文: https://arxiv.org/abs/2606.09821
[6]Flow-DPPO 论文: https://arxiv.org/abs/2606.11025