SevenTnewS

Génération d'images

Le Qwen-Image-3.0 d'Alibaba fait du rendu de texte un argument de productivité

L'équipe Qwen d'Alibaba a publié Qwen-Image-3.0, un modèle de génération d'images de troisième génération qui privilégie le contenu dense et l'utilisabilité pratique plutôt que le polissage esthétique. Le modèle accepte des prompts allant jusqu'à 4 500 tokens, rend le texte lisible à 10 pixels et génère des pages complètes de journaux ou des infographies multi-cellules en un seul passage.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-23 · 3 min de lecture

Le Qwen-Image-3.0 d'Alibaba fait du rendu de texte un argument de productivité
Sources : Qwen Blog: Qwen…

La plupart des modèles de génération d'images veulent être des artistes. L'équipe Qwen d'Alibaba veut que son dernier modèle soit une chaîne de production.

Qwen-Image-3.0, annoncé le 21 juillet, est la troisième génération de la série d'images Qwen, et son positionnement est un écart discret par rapport à la direction du domaine. Là où DALL-E et Midjourney recherchent le polissage visuel et l'étendue stylistique, Qwen-Image-3.0 recherche la densité, la précision et l'utilité. Le modèle accepte des prompts allant jusqu'à 4 500 tokens, rend le texte aussi petit que 10 pixels et produit des mises en page complexes comme des journaux, des feuilles d'examen et des infographies multipanels en une seule génération, et non assemblées à partir de sorties distinctes.

Graphique : Capacité de tokens par invite · Langues prises en charge pour le rendu de texte
Qwen-Image-3.0 accepte jusqu'à 4 500 tokens par invite, contre 4 000 pour DALL-E 3 et environ 1 000 pour Midjourney, selon l'article. L'article indique que Qwen-Image-3.0 rend nativement le texte en 12 langues, tandis que DALL-E 3 et Midjourney sont effectivement limités à l'anglais.

Le billet de blog de démonstration, rédigé par l'équipe Qwen, fournit de nombreux exemples. L'un des plus frappants est une grille 3x3 d'infographies couvrant des sujets allant de la sécurité des tunnels à la théorie des groupes en passant par les diagrammes médicaux, le tout généré en un seul passage à partir d'une invite de 3 700 tokens. Chaque cellule est une infographie autonome avec son propre texte, ses formules et sa mise en page. Le modèle démontre également ce que l'équipe appelle la profondeur « image dans l'image » : une invite unique génère une fenêtre VSCode contenant une interface Qwen Chat, qui contient à son tour un écran WeChat affichant une affiche de café filtre, chaque couche conservant son propre style et son propre texte.

L'accent mis sur le rendu du texte est délibéré. Le modèle revendique un rendu lisible du texte jusqu'à 10 pixels, et les exemples fournis incluent une page complète d'un article de géométrie algébrique avec des formules LaTeX denses, des indices et exposants, et une numérotation de théorèmes. Un autre exemple montre une page de journal avec plusieurs colonnes et titres. Une démonstration de montage avant-après ajoute des annotations manuscrites réalistes à une page de manuel, avec des soulignements, des flèches et des notes marginales dans une cursive d'aspect naturel.

Le pipeline d'édition lui-même a été élargi. Qwen-Image-3.0 peut restaurer des peintures traditionnelles endommagées, remplacer des éléments dans des compositions existantes et générer des infographies complexes en superposant une photographie réelle. L'équipe montre une peinture à l'encre endommagée représentant un combat d'aigle restaurée dans sa forme originale, avec des taches de moisissure supprimées et un coup de pinceau adapté au style de l'artiste original.

La prise en charge linguistique est un autre différenciateur revendiqué. Le modèle rend nativement le texte en 12 langues, avec des exemples de démonstration en japonais, coréen et espagnol. Il peut également simuler des interfaces utilisateur grand public, notamment des pages Web, des salles de diffusion en direct et des écrans de jeu, et le billet comprend une prévision météo pour Hangzhou récupérée sur le Web, une salle de diffusion en direct avec Qi Baishi et Van Gogh présentant le produit, et une infographie financière superposée à un véritable graphique boursier.

Qwen-Image-3.0 est disponible via Qwen Studio, la plateforme unifiée de l'entreprise pour le chat, l'image, la vidéo et le traitement de documents, et via son API. Le billet de blog présente la sortie comme une évolution naturelle de la « Précision » de la première génération et de la « Précision, Variété, Complétude, Beauté et Authenticité » de la deuxième génération vers le mot-clé unique de la troisième génération : « Réel », épelé en chinois comme 实, signifiant pratique, solide et concret.

Le modèle ne se positionne pas comme un concurrent de la direction artistique de Midjourney ou de la polyvalence stylistique de DALL-E. Il cible les flux de production où la précision du texte, la complexité de la mise en page et la densité de l'information comptent plus que l'attrait visuel. Cela inclut la mise en page de journaux, la création d'examens, les diagrammes académiques, les affiches de commerce électronique et le prototypage d'interfaces utilisateur. Reste à savoir si le modèle peut tenir ces promesses à grande échelle et si le marché de la génération d'images riches en texte est suffisamment vaste pour justifier l'investissement. Mais le choix est délibéré et fait de Qwen-Image-3.0 l'une des sorties les plus intéressantes de génération d'images cette année précisément parce qu'il n'essaie pas de gagner sur l'esthétique.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.