RLHF
2 published articles
大语言模型与模型Featured5 min read
AI 研究
图像生成的强化学习:Qwen-Image-2.0-RL 获得复合奖励系统
Qwen-Image-2.0-RL 报告详细描述了一条结合 RLHF、同策略蒸馏和复合奖励模型的后训练管道,用于提升文本到图像和图像编辑质量。该方法在审美质量、指令遵循和人脸身份保留方面均可衡量地改进。
2026-07-20
实验室与研究Featured4 min read
AI研究
强化学习自我破坏问题的两词解法
多任务强化学习有一个难以启齿的秘密:驱动对齐的奖励信号常常相互冲突。一个国际团队刚刚发表了一种方法,可以防止系统自我对抗,而且将其添加到现有管线中几乎不增加成本。
2026-07-19