Recherche en IA
Apprentissage par renforcement pour la génération d'images : Qwen-Image-2.0-RL adopte un système de récompense composite
Le rapport Qwen-Image-2.0-RL détaille un pipeline de post-entraînement combinant RLHF, distillation sur politique et modèles de récompense composites pour améliorer la qualité de la génération texte-image et de l'édition d'images. L'approche produit des gains mesurables en qualité esthétique, respect des instructions et préservation de l'identité faciale.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-20 · 5 min de lecture

L'apprentissage par renforcement à partir de feedback humain, une technique principalement connue pour aligner les grands modèles de langage, est désormais appliqué directement aux modèles de diffusion. Le dernier rapport technique de l'équipe Qwen, publié sur arXiv le 25 juin, décrit Qwen-Image-2.0-RL, un pipeline de post-entraînement qui utilise RLHF et la distillation sur politique pour améliorer à la fois la qualité visuelle et le respect des instructions dans le modèle Qwen-Image-2.0 existant.
Le défi central que l'équipe a relevé est que le post-entraînement pour les modèles génératifs repose généralement sur l'apprentissage supervisé fin, ce qui peut conduire à un « contournement de la récompense » : le modèle apprend à exploiter le signal d'apprentissage plutôt qu'à s'améliorer réellement. L'apprentissage par renforcement offre un moyen de contourner ce problème en optimisant directement une fonction de récompense, mais construire un système de récompense fiable pour la génération d'images est plus difficile que pour le texte, car la qualité de l'image est subjective et multidimensionnelle.
Modèles de récompense composites
Pour fournir les signaux nécessaires, les chercheurs ont construit des modèles de récompense composites spécifiques aux tâches, en affinant des modèles de langage-vision existants avec un paradigme de notation ponctuelle et un raisonnement par chaîne de pensée. Pour la génération texte-image, le système de récompense couvre trois dimensions : l'alignement de la requête (à quel point l'image correspond au texte), la qualité esthétique (attrait subjectif et composition) et la fidélité du portrait (qualité du rendu des visages). Pour les tâches d'édition d'images, les modèles de récompense évaluent la précision du suivi des instructions et la préservation de l'identité faciale, deux aspects où les modèles de diffusion peinent souvent, en particulier lorsqu'il s'agit de modifier des caractéristiques spécifiques tout en conservant une personne reconnaissable.
La construction de cet échafaudage de récompenses a nécessité d'adapter les modèles de langage-vision pour produire un score numérique par image, ainsi qu'une étape de raisonnement par chaîne de pensée qui rend la notation partiellement transparente. Le rapport note que ce paradigme de notation a surpassé les préférences par paires en termes de cohérence et de fiabilité.

Entraînement GRPO évolutif
Avec le système de récompense en place, l'équipe a développé un cadre d'entraînement évolutif basé sur l'optimisation de politique relative par groupe (GRPO), une variante de l'apprentissage par renforcement qui compare des groupes de complétions plutôt que des complétions individuelles. Le pipeline intègre trois choix d'ingénierie visant à préserver les connaissances pré-entraînées tout en apprenant de nouveaux comportements :
- Guidage hybride sans classifieur (CFG) : Le modèle alterne entre des échelles CFG entraînées par RL et gelées pendant l'entraînement pour éviter d'oublier la distribution originale, un problème connu lors de l'application de RL aux modèles de diffusion à partir de zéro.
- Filtrage de la plage de récompenses intra-groupe : La qualité de génération au niveau des requêtes varie, et un lot peut contenir des sorties excellentes et mauvaises pour la même requête. L'équipe filtre les requêtes par la plage de récompenses au sein de leur groupe, en écartant celles où toutes les variantes obtiennent des scores similaires ou où l'étendue est trop étroite pour fournir un gradient utile.
- Calibrage du poids de récompense par catégorie : Toutes les dimensions de récompense n'ont pas la même importance pour chaque requête. Le système ajuste dynamiquement le poids attribué à l'alignement par rapport à l'esthétique par rapport à la fidélité du portrait en fonction de la catégorie de la requête, empêchant ainsi une seule métrique de dominer le signal d'apprentissage.
Le rapport ne divulgue ni la taille du modèle ni la puissance de calcul d'entraînement, mais l'approche est conçue pour être appliquée par-dessus un modèle de diffusion existant, pré-entraîné et affiné par apprentissage supervisé, ce qui signifie que l'étape RL ajoute un coût marginal par rapport à un entraînement depuis zéro.
La distillation sur politique fusionne deux politiques
Une décision de conception notable est la séparation de l'étape d'entraînement. L'équipe a d'abord entraîné deux politiques RL séparées, une spécialisée dans la génération texte-image, une dans l'édition d'images, puis les a fusionnées en un seul modèle en utilisant la distillation sur politique. Cette dernière étape traite les deux modèles spécialisés comme des enseignants et une copie fraîche du modèle de base comme l'élève, l'entraînant à correspondre à la vélocité au niveau de la trajectoire des enseignants, essentiellement, la direction et l'ampleur des mises à jour à chaque étape, plutôt que les sorties finales. Cela évite l'oubli catastrophique qui se produit souvent lors de l'affinage séquentiel d'un seul modèle sur deux tâches différentes.
Le modèle élève résultant, Qwen-Image-2.0-RL, a été évalué sur Qwen-Image-Bench, la propre suite de benchmarks de l'équipe, où il a obtenu un score global de 57,84, une amélioration de +2,61 par rapport au modèle de base Qwen-Image-2.0. Dans le domaine de la génération texte-image, il a obtenu un classement Elo de 1193 (+78) et dans le domaine de l'édition d'images, 1349 (+93).
Le gain Elo dans le domaine de l'édition est le plus grand des deux, reflétant peut-être le fait que l'édition guidée, modifier une région spécifique d'une image existante sans dégrader le reste, reste l'un des problèmes les plus difficiles pour les modèles de diffusion et offre donc plus de marge d'amélioration grâce au post-entraînement basé sur RL.
Questions ouvertes
Le rapport est un article technique plutôt qu'un lancement de produit, et plusieurs questions restent sans réponse. Les modèles de récompense composites ont été affinés sur un ensemble de données non divulgué de préférences humaines, et les métriques d'évaluation sont toutes internes à l'équipe Qwen. Une vérification indépendante, en particulier sur le benchmark d'édition, où la préservation de l'identité faciale sous édition est notoirement difficile à évaluer automatiquement, renforcerait les affirmations.
Il n'y a pas non plus de comparaison avec d'autres méthodes de post-entraînement alternatives comme l'optimisation de préférence directe (DPO) appliquée aux modèles de diffusion. Le rapport mentionne brièvement avoir essayé des pertes de style DPO mais ne fournit pas de comparaisons quantitatives. Compte tenu de la popularité croissante de la DPO dans le domaine de la vision, une comparaison directe aiderait la communauté à déterminer quand la complexité supplémentaire de la GRPO en vaut la peine.
La technique fait face à des limitations spécifiques au domaine dans le propre cadrage du rapport. Les modèles de récompense pour la fidélité du portrait supposent que les visages sont un sujet principal ; pour les scènes où aucun visage humain n'apparaît, cette dimension est simplement pondérée à zéro. Plus largement, la construction de modèles de récompense robustes pour des requêtes arbitraires, en particulier celles impliquant des concepts abstraits ou des esthétiques inhabituelles, reste un problème non résolu, et la performance du système se dégrade probablement sur des requêtes éloignées de la distribution d'affinage.
- Source : Qwen-Image-2.0-RL Technical Report
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.