Inteligencia Artificial
El modelo de imágenes de 4 mil millones de parámetros de Microsoft se ejecuta en un único A100 y desafía a sistemas de 30 mil millones
Mage-Flow de Microsoft es un modelo compacto de generación y edición de imágenes de 4 mil millones de parámetros que iguala a sistemas abiertos más grandes como Qwen-Image y FLUX.2 mientras se ejecuta en una única GPU A100 a velocidades interactivas. Su innovación clave es un tokenizador ligero que reduce los costos de codificación en 12 veces.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-26 · 4 min de lectura

Los modelos generativos de imágenes han ido aumentando de tamaño cada año, con sistemas de última generación que se acercan a los 30 o 40 mil millones de parámetros. Pero un nuevo artículo de Microsoft Research sugiere que más grande no siempre es mejor.
Mage-Flow, una plataforma de 4 mil millones de parámetros para generación de texto a imagen y edición de imágenes basada en instrucciones, iguala o supera sustancialmente a sistemas abiertos más grandes, incluyendo Qwen-Image (20B), Z-Image (6B), FLUX.2 (32B) y FireRed-Image-Edit (20B), según el artículo publicado en arXiv. El modelo se ejecuta en una única GPU NVIDIA A100 a velocidades interactivas: 0.59 segundos por imagen a una resolución de 1024×1024 para la variante Turbo, o 1.02 segundos para una edición.
Ese tipo de eficiencia es posible porque el equipo de Microsoft Research Asia y sus colaboradores rediseñaron el tokenizador, no solo la red troncal. El resultado es un modelo que no requiere múltiples GPU o costosas configuraciones de inferencia para producir imágenes de alta resolución.
El tokenizador que cambia el cuello de botella
La mayoría de los generadores basados en difusión utilizan un Autoencoder Variacional (VAE) para comprimir imágenes en un espacio latente, y luego decodificar esos latentes de vuelta a píxeles. El VAE suele ser el cuello de botella en altas resoluciones: necesita muchas operaciones de cómputo por píxel, y la codificación y decodificación consumen tiempo de inferencia y memoria.

Mage-VAE, el tokenizador personalizado del artículo, utiliza codificación y decodificación de estilo difusión en un solo paso con una técnica llamada regularización de anclaje latente. Los autores informan que iguala la fidelidad de reconstrucción de FLUX.2-VAE mientras utiliza aproximadamente 12 veces menos operaciones de multiplicación-acumulación (MAC) para la codificación y 22 veces menos para la decodificación. Esto elimina efectivamente el VAE como factor limitante al generar imágenes de alta resolución.
Esto significa que un único punto de control de Mage-Flow puede manejar resoluciones de 512 a 2048 píxeles en cualquier relación de aspecto, incluidos formatos extremos como 512×2048 o 2048×512, sin necesidad de modelos separados para diferentes resoluciones.
Codiseño a nivel de sistema
La plataforma combina Mage-VAE con un Transformer de Difusión Multimodal de Resolución Nativa de 4B (NR-MMDiT) entrenado con ajuste de flujo rectificado. Los autores afirman que el codiseño a nivel de sistema, empaquetado de resolución nativa con FlashAttention, incrustaciones posicionales 2D RoPE por muestra y kernels CUDA fusionados, logra aproximadamente 2.5 veces más rendimiento de entrenamiento en comparación con las implementaciones estándar. La guía libre de clasificador ejecuta ambas ramas condicional e incondicional en un único pase hacia adelante empaquetado.
La familia viene en tres variantes por tarea: Base, alineada con RL (que utiliza una técnica Diffusion-NFT para mejorar el seguimiento de instrucciones y el renderizado de texto) y modelos Turbo de 4 pasos destilados con guía perceptual adversaria para inferencia de baja latencia. El pico de memoria se sitúa en torno a 18-20 GB, el más bajo entre los sistemas comparables citados en el artículo.
Rendimiento y puntos de referencia
En puntos de referencia estándar, las variantes Base y RL de Mage-Flow alcanzan puntuaciones competitivas frente a modelos mucho más grandes. El artículo no afirma superioridad absoluta en todas las métricas, y los puntos de referencia que reporta son académicos estándar (FID, puntuación CLIP, etc.) en lugar de un conjunto propio. Serán necesarias pruebas independientes para validar las afirmaciones, pero los números que presentan los autores sitúan al modelo de 4B en la misma categoría que sistemas de 5 a 8 veces su tamaño.
La variante de edición, Mage-Flow-Edit, admite ediciones de contenido semántico, transformaciones de apariencia, restauración de imágenes y salidas conscientes de la estructura dentro de una única arquitectura unificada condicionada por imagen y texto.
Microsoft ha lanzado los modelos en Hugging Face, incluyendo las variantes Turbo. El artículo está disponible en arXiv, aunque los autores no mencionan una licencia de código abierto para el código o los pesos más allá de la página de distribución de Hugging Face.
Compensaciones y preguntas abiertas
La eficiencia tiene un costo, y el artículo aún deja preguntas. Los modelos Turbo intercambian pasos por latencia, lo que puede degradar la calidad en casos extremos; los autores señalan que la guía perceptual ayuda pero no cierra completamente la brecha con la variante Base de múltiples pasos en todos los puntos de referencia. La etapa de alineación RL utiliza un modelo de recompensa entrenado específicamente para esta tarea, y el artículo no detalla qué tan bien se generaliza ese modelo de recompensa a instrucciones fuera de distribución.
Aun así, la dirección es útil. Si el diseño del tokenizador se mantiene bajo verificación independiente, abre un camino hacia la generación de imágenes de alta resolución en hardware de consumo o gama media. Eso importa más que el recuento de parámetros.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.