SevenTnewS

IA générative

CO2Jump de Google marie la génération de texte et d'image en un seul passage qui s'auto-corrige à la volée

Google présente CO2Jump, un sampler sans entraînement pour la génération conjointe de texte et d'image. Il utilise un processus de saut de Markov auto-correcteur où les scores de confiance de chaque modalité guident les mises à jour de l'autre en temps réel, produisant des sorties multimodales cohérentes en un seul passage. La méthode apporte également trois nouveaux ensembles de données de référence pour l'évaluation de la génération conjointe.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-14 · Dernière mise à jour : 2026-07-19 · 4 min de lecture

CO2Jump de Google marie la génération de texte et d'image en un seul passage qui s'auto-corrige à la volée

Les humains ne pensent pas dans des voies séparées. Lorsqu'un enseignant dessine un diagramme sur un tableau blanc, l'explication orale et le croquis évolutif se façonnent mutuellement en temps réel. Les systèmes d'IA multimodaux actuels évitent principalement ce type de couplage. Ils génèrent du texte, puis une image à partir de ce texte, ou entrelacent les deux sur des étapes de débruitage séparées, mais chaque modalité n'a accès qu'à la sortie précédente de l'autre, pas à ses décisions en cours.

Cet écart est important car il signifie que les contradictions inter-modales passent inaperçues jusqu'à la sortie finale. Un modèle pourrait générer une légende disant « un carré divisé en quatre quadrants » alors que l'image qu'il produit montre un cercle. Il n'y a aucun mécanisme interne au processus de génération pour détecter et corriger l'incohérence.

Une équipe de chercheurs de Google, dirigée par des auteurs de la division recherche de l'entreprise, a proposé un framework qui tente de fermer cette boucle. Le résultat est CO2Jump, abréviation de Self-Correcting Coupled Jump, un sampler sans entraînement qui modifie la trajectoire de débruitage standard des modèles de diffusion masqués (MDMs) afin que les mises à jour du texte et de l'image se produisent de manière couplée et auto-correctrice à chaque étape.

Comment ça marche : pondération des scores inter-modaux

L'idée centrale repose sur les modèles de diffusion masqués, une classe de modèles génératifs qui apprennent à inverser un processus de corruption appliqué à des jetons discrets. CO2Jump enveloppe les MDMs dans un « processus de saut de Markov couplé auto-correcteur » (SC-CMJP). En termes simples, les probabilités de transition qui déterminent si un jeton passe de masqué à non masqué dépendent non seulement de la vraisemblance de ce jeton, mais aussi du score de confiance de la région correspondante dans l'autre modalité, pondéré par une carte d'attention inter-modale.

Schéma : CO2Jump self-correcting coupled generation
CO2Jump modifie la trajectoire de débruitage standard d'un modèle de diffusion masqué en couplant les branches texte et image via une pondération des scores inter-modaux et en ajoutant un saut de remasquage pour l'auto-correction, basé sur l'article.

Si la branche de génération d'image est incertaine concernant une région, la branche texte ralentit ses décisions de démasquage pour les jetons qui se rapportent à cette région, et vice versa. C'est là le couplage proprement dit. De plus, un saut de remasquage permet au système de rétracter un démasquage antérieur si le score de confiance de l'autre modalité pour la même région sémantique tombe en dessous d'un seuil plus tard dans la trajectoire.

Les chercheurs décrivent le sampler comme étant sans entraînement car il ne nécessite pas de fine-tuning du MDM sous-jacent. Il utilise le même modèle pré-entraîné et modifie uniquement la manière dont les étapes de débruitage sont orchestrées.

Trois nouveaux benchmarks pour la génération conjointe

Pour évaluer l'approche, l'équipe a créé trois grands corpus de génération multimodale conjointe, qu'ils prévoient de publier publiquement. JEdit-1M contient un million de paires image-texte conçues pour des tâches de compréhension et d'édition conjointes. JMaze-200K et JNono-200K contiennent chacun 200 000 puzzles de labyrinthes et de nonogrammes respectivement, avec des descriptions textuelles correspondantes, destinés à tester le raisonnement visuel dans un cadre structuré basé sur des règles. Des variantes intra-distribution et hors-distribution sont incluses pour les trois ensembles de données.

Selon l'article, CO2Jump atteint les meilleures performances conjointes en compréhension d'image, édition d'image et dans les deux tâches de raisonnement visuel par rapport aux échantillonneurs entrelacés et parallèles existants. Les auteurs rapportent que les performances augmentent de manière monotone avec le nombre d'étapes de débruitage, ce qui signifie que les effets positifs du couplage inter-modal se cumulent sur des trajectoires plus longues plutôt que de plafonner ou de se dégrader.

Pourquoi cela est important pour la génération multimodale

L'implication plus large est que la qualité de la génération conjointe, où le texte et l'image sont produits comme un artefact cohérent unique, pourrait ne pas nécessiter une architecture fondamentalement nouvelle. Cela pourrait seulement nécessiter un sampler plus intelligent qui respecte les dépendances mutuelles entre les modalités pendant la génération elle-même. La plupart des pipelines actuels soit génèrent une image à partir d'une invite de texte fixe (qui ne peut pas réagir à l'image), soit alternent les générations sur plusieurs étapes, ce qui introduit de la latence et ne corrige pas rétroactivement les erreurs inter-modales.

CO2Jump résout les deux problèmes en un seul passage. Le saut de remasquage sert en quelque sorte de critique interne : si la branche image décide qu'une partie d'une scène devrait être différente de ce que la branche texte a déjà établi, la branche texte peut revenir sur sa décision antérieure et essayer un jeton différent.

La question de savoir si l'approche peut s'étendre à plus de deux modalités, par exemple en ajoutant l'audio ou la vidéo, reste ouverte. L'article se concentre sur la paire image-texte, mais le framework SC-CMJP est spécifié dans un langage indépendant de la modalité, laissant cette porte ouverte.

La page du projet avec le code et les ensembles de données est disponible à l'adresse https://coupled-jump.github.io.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.