SevenTnewS

Generación de imágenes

El modelo Qwen-Image-3.0 de Alibaba convierte el renderizado de texto en un argumento de productividad

El equipo Qwen de Alibaba lanzó Qwen-Image-3.0, un modelo de generación de imágenes de tercera generación que prioriza el contenido denso y la usabilidad práctica sobre el pulido estético. El modelo maneja indicaciones de 4500 tokens, renderiza texto de 10 píxeles de forma legible y genera páginas completas de periódicos o infografías de múltiples celdas en una sola pasada.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-23 · 3 min de lectura

El modelo Qwen-Image-3.0 de Alibaba convierte el renderizado de texto en un argumento de productividad
Fuentes : Qwen Blog: Qwen…

La mayoría de los modelos de generación de imágenes quieren ser artistas. El equipo Qwen de Alibaba quiere que su último modelo sea una línea de producción.

Qwen-Image-3.0, anunciado el 21 de julio, es la tercera generación de la serie de imágenes Qwen, y su posicionamiento es un alejamiento silencioso de la dirección del campo. Donde DALL-E y Midjourney persiguen el pulido visual y la gama estilística, Qwen-Image-3.0 persigue la densidad, la precisión y la utilidad. El modelo acepta indicaciones de hasta 4500 tokens, renderiza texto de tan solo 10 píxeles y genera diseños complejos como periódicos, exámenes e infografías de varios paneles en una sola generación, no unidos a partir de resultados separados.

Gráfico: Capacidad de tokens por indicación · Idiomas admitidos para renderizado de texto
Qwen-Image-3.0 acepta hasta 4500 tokens por indicación, en comparación con 4000 para DALL-E 3 y aproximadamente 1000 para Midjourney, según el artículo. El artículo afirma que Qwen-Image-3.0 renderiza texto de forma nativa en 12 idiomas, mientras que DALL-E 3 y Midjourney están efectivamente limitados al inglés.

La publicación del blog de demostración, escrita por el equipo Qwen, proporciona numerosos ejemplos. Uno de los más sorprendentes es una cuadrícula de 3x3 de infografías que cubren temas desde seguridad en túneles hasta teoría de grupos y diagramas médicos, todas generadas en una sola pasada a partir de una indicación de 3700 tokens. Cada celda es una infografía independiente con su propio texto, fórmulas y diseño. El modelo también demuestra lo que el equipo llama profundidad "imagen dentro de imagen": una sola indicación genera una ventana de VSCode que contiene una interfaz de Qwen Chat, que a su vez contiene una pantalla de WeChat que muestra un cartel de café pour-over, con cada capa conservando su propio estilo y texto.

El énfasis en el renderizado de texto es deliberado. El modelo afirma renderizar texto de hasta 10 píxeles de forma legible, y los ejemplos proporcionados incluyen una página completa de un artículo de geometría algebraica con densas fórmulas LaTeX, subíndices y superíndices, y numeración de teoremas. Otro ejemplo muestra una página de periódico con múltiples columnas y titulares. Una demostración de edición de antes y después agrega anotaciones manuscritas realistas a una página de libro de texto, con subrayados, flechas y notas al margen en cursiva de aspecto natural.

El propio pipeline de edición se ha ampliado. Qwen-Image-3.0 puede restaurar pinturas tradicionales dañadas, reemplazar elementos en composiciones existentes y generar infografías complejas superponiéndolas sobre una fotografía real. El equipo muestra una pintura a tinta de águilas en combate dañada restaurada a su forma original, con manchas de moho eliminadas y el trazo igualado al estilo del artista original.

El soporte de idiomas es otro diferenciador declarado. El modelo renderiza texto de forma nativa en 12 idiomas, con ejemplos de demostración en japonés, coreano y español. También puede simular interfaces de usuario convencionales, incluyendo páginas web, salas de transmisión en vivo y pantallas de juegos, y la publicación incluye un pronóstico del tiempo generado para Hangzhou recuperado de la web, una sala de transmisión en vivo con Qi Baishi y Van Gogh presentando el producto, y una infografía financiera superpuesta a un gráfico de acciones real.

Qwen-Image-3.0 está disponible a través de Qwen Studio, la plataforma unificada de la compañía para chat, imagen, video y procesamiento de documentos, y a través de su API. La publicación del blog enmarca el lanzamiento como una evolución natural desde la "Precisión" de la primera generación y la "Precisión, Variedad, Completitud, Belleza y Autenticidad" de la segunda generación, hasta la única palabra clave de la tercera generación: "Real", deletreada en chino como 实, que significa práctico, sólido y fundamentado.

El modelo no se posiciona como un competidor de la dirección artística de Midjourney o la versatilidad estilística de DALL-E. Se dirige a flujos de trabajo de producción donde la precisión del texto, la complejidad del diseño y la densidad de la información importan más que el atractivo visual. Eso incluye el diseño de periódicos, la creación de exámenes, los diagramas académicos, los carteles de comercio electrónico y la creación de prototipos de interfaz de usuario. Queda por ver si el modelo puede cumplir esas promesas a escala, y si el mercado de generación de imágenes con mucho texto es lo suficientemente grande como para justificar la inversión. Pero la elección es deliberada, y convierte a Qwen-Image-3.0 en uno de los lanzamientos de generación de imágenes más interesantes de este año precisamente porque no intenta ganar en estética.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.