RLHF
2 published articles
LLMs y ModelosFeatured5 min read
Investigación en IA
Aprendizaje por refuerzo para generación de imágenes: Qwen-Image-2.0-RL obtiene un sistema de recompensa compuesto
El informe técnico de Qwen-Image-2.0-RL detalla un pipeline de post-entrenamiento que combina RLHF, destilación on-policy y modelos de recompensa compuestos para mejorar la calidad de texto a imagen y edición de imágenes. El enfoque produce mejoras medibles en calidad estética, seguimiento de instrucciones y preservación de identidad facial.
2026-07-20
Laboratorios e InvestigaciónFeatured4 min read
Investigación en IA
La solución de dos palabras para el problema de autosabotaje del aprendizaje por refuerzo
El aprendizaje por refuerzo multitarea tiene un secreto: las señales de recompensa que impulsan la alineación a menudo trabajan en contra. Un equipo internacional acaba de publicar un método que evita que el sistema se enfrente a sí mismo, y cuesta casi nada añadirlo a los procesos existentes.
2026-07-19