Investigación en IA
Aprendizaje por refuerzo para generación de imágenes: Qwen-Image-2.0-RL obtiene un sistema de recompensa compuesto
El informe técnico de Qwen-Image-2.0-RL detalla un pipeline de post-entrenamiento que combina RLHF, destilación on-policy y modelos de recompensa compuestos para mejorar la calidad de texto a imagen y edición de imágenes. El enfoque produce mejoras medibles en calidad estética, seguimiento de instrucciones y preservación de identidad facial.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-20 · 5 min de lectura

El aprendizaje por refuerzo a partir de retroalimentación humana, una técnica conocida principalmente para alinear modelos de lenguaje grandes, ahora se aplica directamente a modelos de difusión. El último informe técnico del equipo de Qwen, publicado en arXiv el 25 de junio, describe Qwen-Image-2.0-RL, un pipeline de post-entrenamiento que utiliza RLHF y destilación on-policy para mejorar tanto la calidad visual como el seguimiento de instrucciones en el modelo existente Qwen-Image-2.0.
El desafío central que abordó el equipo es que el post-entrenamiento para modelos generativos generalmente se basa en ajuste fino supervisado, lo que puede llevar a "reward hacking", el modelo aprende a explotar la señal de entrenamiento en lugar de mejorar genuinamente. RL ofrece una solución optimizando directamente contra una función de recompensa, pero construir un sistema de recompensa confiable para generación de imágenes es más difícil que para texto, ya que la calidad de la imagen es subjetiva y multidimensional.
Modelos de recompensa compuestos
Para proporcionar las señales necesarias, los investigadores construyeron modelos de recompensa compuestos específicos para cada tarea, ajustando finamente modelos de lenguaje-visión existentes con un paradigma de puntuación por punto y razonamiento de cadena de pensamiento. Para la generación de texto a imagen, el sistema de recompensa cubre tres dimensiones: alineación con la indicación (qué tan bien la imagen coincide con el texto), calidad estética (atractivo subjetivo y composición) y fidelidad del retrato (cómo se representan los rostros). Para tareas de edición de imágenes, los modelos de recompensa evalúan la precisión en el seguimiento de instrucciones y la preservación de la identidad facial, dos aspectos donde los modelos de difusión a menudo tienen dificultades, particularmente cuando se les pide modificar características específicas mientras se mantiene reconocible a una persona.
Construir este andamiaje de recompensa requirió adaptar los modelos de lenguaje-visión para generar una puntuación numérica por imagen, junto con un paso de razonamiento de cadena de pensamiento que hace la puntuación parcialmente transparente. El informe señala que este paradigma de puntuación superó a las preferencias por pares en consistencia y confiabilidad.

Entrenamiento GRPO escalable
Con el sistema de recompensa en su lugar, el equipo desarrolló un marco de entrenamiento escalable basado en Group Relative Policy Optimization (GRPO), una variante del aprendizaje por refuerzo que compara grupos de completaciones en lugar de individuales. El pipeline incorpora tres decisiones de ingeniería destinadas a preservar el conocimiento preentrenado mientras se aprenden nuevos comportamientos:
- Guía híbrida sin clasificador (CFG): El modelo alterna entre escalas CFG entrenadas con RL y congeladas durante el entrenamiento para evitar olvidar la distribución original, un problema conocido al aplicar RL a modelos de difusión desde cero.
- Filtrado de rango de recompensa intra-grupo: La calidad de generación a nivel de indicación varía, y un lote puede contener resultados excelentes y pobres para la misma indicación. El equipo filtra las indicaciones según el rango de recompensas dentro de su grupo, descartando aquellas donde todas las variantes obtienen puntuaciones similares o donde la dispersión es demasiado estrecha para proporcionar un gradiente útil.
- Calibración de pesos de recompensa por categoría: No todas las dimensiones de recompensa importan igual para cada indicación. El sistema ajusta dinámicamente el peso asignado a la alineación frente a la estética frente a la fidelidad del retrato según la categoría de la indicación, evitando que una sola métrica domine la señal de entrenamiento.
El informe no divulga el tamaño del modelo ni el cómputo de entrenamiento, pero el enfoque está diseñado para aplicarse sobre un modelo de difusión existente preentrenado y ajustado finamente de manera supervisada, lo que significa que la etapa de RL añade un costo marginal en relación con el entrenamiento desde cero.
La destilación on-policy fusiona dos políticas
Una decisión de diseño notable es la separación de la etapa de entrenamiento. El equipo primero entrenó dos políticas RL separadas, una especializada en generación de texto a imagen y otra en edición de imágenes, y luego las fusionó en un solo modelo mediante destilación on-policy. Esta última etapa trata los dos modelos especializados como profesores y una copia nueva del modelo base como estudiante, entrenándolo para igualar la velocidad a nivel de trayectoria de los profesores, esencialmente, la dirección y magnitud de las actualizaciones en cada paso, en lugar de solo los resultados finales. Esto evita el olvido catastrófico que a menudo ocurre al ajustar finamente un solo modelo secuencialmente en dos tareas diferentes.
El modelo estudiante resultante, Qwen-Image-2.0-RL, fue evaluado en Qwen-Image-Bench, el conjunto de pruebas propio del equipo, donde obtuvo 57.84 en general, una mejora de +2.61 sobre el modelo base Qwen-Image-2.0. En el ámbito de texto a imagen, logró una calificación Elo de 1193 (+78), y en el ámbito de edición de imágenes, 1349 (+93).
La ganancia Elo en el ámbito de edición es la mayor de las dos, lo que quizás refleja el hecho de que la edición guiada, modificar una región específica de una imagen existente sin degradar el resto, sigue siendo uno de los problemas más difíciles para los modelos de difusión y, por lo tanto, ofrece más margen de mejora a través del post-entrenamiento basado en RL.
Preguntas abiertas
El informe es un artículo técnico más que un lanzamiento de producto, y varias preguntas quedan sin respuesta. Los modelos de recompensa compuestos se ajustaron finamente en un conjunto de datos no revelado de preferencias humanas, y las métricas de evaluación son todas internas del equipo de Qwen. La verificación independiente, particularmente en el punto de referencia de edición, donde la preservación de la identidad facial bajo edición es notoriamente difícil de evaluar automáticamente, fortalecería las afirmaciones.
Tampoco hay comparación con métodos de post-entrenamiento alternativos como Direct Preference Optimization (DPO) aplicado a modelos de difusión. El informe menciona brevemente haber probado pérdidas de estilo DPO, pero no proporciona comparaciones cuantitativas. Dada la creciente popularidad de DPO en el espacio de visión, una comparación directa ayudaría a la comunidad a determinar cuándo vale la pena la complejidad adicional de GRPO.
La técnica enfrenta limitaciones específicas del dominio en el propio marco del informe. Los modelos de recompensa para la fidelidad del retrato asumen que los rostros son un sujeto principal; para escenas donde no aparecen rostros humanos, esa dimensión simplemente tiene peso cero. De manera más general, construir modelos de recompensa robustos para indicaciones arbitrarias, especialmente aquellas que involucran conceptos abstractos o estéticas inusuales, sigue sin resolverse, y el rendimiento del sistema probablemente se degrada en indicaciones alejadas de la distribución de ajuste fino.
- Fuente : Qwen-Image-2.0-RL Technical Report
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.