SevenTnewS

AI 研究

图像生成的强化学习:Qwen-Image-2.0-RL 获得复合奖励系统

Qwen-Image-2.0-RL 报告详细描述了一条结合 RLHF、同策略蒸馏和复合奖励模型的后训练管道,用于提升文本到图像和图像编辑质量。该方法在审美质量、指令遵循和人脸身份保留方面均可衡量地改进。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-20 · 阅读需 5 分钟

图像生成的强化学习:Qwen-Image-2.0-RL 获得复合奖励系统
来源 : Qwen-Image-2.0-…

人类反馈强化学习,一种以对齐大型语言模型而闻名的技术,现在正直接应用于扩散模型。Qwen 团队于 6 月 25 日在 arXiv 上发表的最新技术报告描述了 Qwen-Image-2.0-RL,这是一条后训练管道,使用 RLHF 和同策略蒸馏来改进现有 Qwen-Image-2.0 模型的视觉质量和指令遵循能力。

团队解决的核心挑战是,生成模型的后训练通常依赖于监督微调,这可能导致“奖励黑客行为”:模型学会利用训练信号而非真正改进。强化学习通过直接针对奖励函数进行优化提供了一种规避方法,但为图像生成构建可靠的奖励系统比文本更难,因为图像质量是主观且多维的。

复合奖励模型

为了提供所需的信号,研究人员构建了特定任务的复合奖励模型,使用点式评分范式和思维链推理微调现有的视觉-语言模型。对于文本到图像生成,奖励系统涵盖三个维度:提示对齐(图像与文本的匹配程度)、审美质量(主观吸引力和构图)和肖像保真度(面部的渲染效果)。对于图像编辑任务,奖励模型评估指令遵循准确性和人脸身份保留,这两个方面是扩散模型经常难以处理的,特别是在要求修改特定特征同时保持人物可识别性的情况下。

构建这一奖励框架需要调整视觉-语言模型,使其为每张图像输出数值评分,并配合思维链推理步骤,使评分部分透明。报告指出,这种评分范式在一致性和可靠性方面优于成对偏好。

示意图:Qwen-Image-2.0-RL 后训练管道
如 Qwen 团队技术报告所述,管道从基础 Qwen-Image-2.0 模型开始,使用复合奖励模型指导 GRPO 训练生成两个专门的 RL 策略,然后通过同策略蒸馏将其合并为最终的 Qwen-Image-2.0-RL 模型。

可扩展的 GRPO 训练

在奖励系统就位后,团队开发了一个基于近端策略优化分组变体(GRPO)的可扩展训练框架,该比较的是完成组而非单个完成。管道包含三项工程决策,旨在保持预训练知识的同时学习新行为:

  • 混合无分类器引导(CFG):模型在训练期间在 RL 训练和冻结的 CFG 尺度之间切换,以避免忘记原始分布,这是从头开始将 RL 应用于扩散模型时已知的问题。
  • 组内奖励范围过滤:提示级别的生成质量各不相同,同一提示的批次中可能包含优秀和糟糕的输出。团队通过组内奖励范围过滤提示,丢弃那些所有变体得分相似或分布过于狭窄以致无法提供有用梯度的提示。
  • 按类别奖励权重校准:并非所有奖励维度对每个提示都同等重要。系统根据提示类别动态调整对齐、审美与肖像保真度的权重分配,防止任何单一指标主导训练信号。

报告未披露模型大小或训练计算量,但该方法旨在应用于现有预训练和监督微调的扩散模型之上,这意味着与从头训练相比,强化学习阶段增加了边际成本。

同策略蒸馏合并两个策略

一个值得注意的设计决策是训练阶段的分开。团队首先训练了两个独立的 RL 策略,一个专用于文本到图像生成,另一个用于图像编辑,然后通过同策略蒸馏将其合并为一个单一模型。这个最后阶段将两个专门模型视为教师,并将基础模型的新副本作为学生,训练其匹配教师的轨迹级速度,即每一步更新的方向和幅度,而不仅仅是最终输出。这避免了在多任务上顺序微调单个模型时常发生的灾难性遗忘。

由此产生的学生模型 Qwen-Image-2.0-RL 在团队自己的基准套件 Qwen-Image-Bench 上进行了评估,总体得分为 57.84,比基础 Qwen-Image-2.0 模型提高了 2.61 分。在文本到图像领域,它获得了 1193 的 Elo 评分(+78),在图像编辑领域获得了 1349 的 Elo 评分(+93)。

编辑领域的 Elo 增益是两者中较大的,这可能反映出引导编辑(修改现有图像的特定区域而不破坏其余部分)仍然是扩散模型的较难问题之一,因此通过基于强化学习的后训练提供了更多改进空间。

开放性问题

该报告是技术论文而非产品发布,且几个问题仍未解答。复合奖励模型是基于未公开的人类偏好数据集微调的,所有评估指标均为 Qwen 团队内部使用。独立验证,特别是在图像编辑基准方面(在人脸编辑中身份保留很难自动评估),将增强这些声明的可信度。

此外,也没有与应用于扩散模型的其他后训练方法如直接偏好优化(DPO)进行比较。报告简要提及尝试过 DPO 风格的损失函数,但未提供定量对比。鉴于 DPO 在视觉领域日益流行,直接比较将帮助社区确定何时值得投入 GRPO 的额外复杂性。

该技术本身存在报告框架中指出的领域特定限制。用于肖像保真度的奖励模型假设面容是主要主题;对于无人脸的场景,该维度权重设为零。更广泛地说,为任意提示(尤其是涉及抽象概念或不寻常美学的提示)构建鲁棒的奖励模型仍未解决,系统性能在远离微调分布的提示上可能下降。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。