SevenTnewS

IA Generativa

CO2Jump de Google combina generación de texto e imagen en un solo paso que se autocorrige sobre la marcha

Google presenta CO2Jump, un muestreador sin entrenamiento para la generación conjunta de texto e imagen. Utiliza un proceso de salto Markoviano autocorrectivo donde las puntuaciones de confianza de cada modalidad guían las actualizaciones de la otra en tiempo real, produciendo resultados multimodales coherentes en un solo paso. El método también incluye tres nuevos conjuntos de datos de referencia para evaluar la generación conjunta.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-14 · Última actualización: 2026-07-19 · 4 min de lectura

CO2Jump de Google combina generación de texto e imagen en un solo paso que se autocorrige sobre la marcha

Los humanos no piensan en carriles separados. Cuando un profesor dibuja un diagrama en una pizarra, la explicación oral y el boceto en evolución se moldean mutuamente en tiempo real. Los sistemas de IA multimodales actuales evitan en su mayoría este tipo de acoplamiento. Generan texto, luego una imagen a partir de ese texto, o intercalan ambos en pasos de denoising separados, pero cada modalidad solo tiene acceso a la salida anterior de la otra, no a sus decisiones en curso.

Esa brecha importa porque significa que las contradicciones entre modalidades pasan desapercibidas hasta la salida final. Un modelo podría generar un pie de foto que diga "un cuadrado dividido en cuatro cuadrantes" mientras la imagen que produce muestra un círculo. No hay ningún mecanismo dentro del proceso de generación para detectar el desajuste y corregirlo.

Un equipo de investigadores de Google, liderado por autores de la división de investigación de la empresa, ha propuesto un marco que intenta cerrar este ciclo. El resultado es CO2Jump, abreviatura de Self-Correcting Coupled Jump (Salto Acoplado Autocorrectivo), un muestreador sin entrenamiento que modifica la trayectoria de denoising estándar de los modelos de difusión enmascarados (MDMs) para que las actualizaciones de texto e imagen ocurran de manera acoplada y autocorrectiva dentro de cada paso.

Cómo funciona: ponderación de puntuaciones entre modalidades

La idea central se basa en los Modelos de Difusión Enmascarados (MDMs), una clase de modelos generativos que aprenden a revertir un proceso de corrupción aplicado a tokens discretos. CO2Jump envuelve los MDMs en un "Proceso de Salto Markoviano Acoplado Autocorrectivo" (SC-CMJP). En términos simples, las probabilidades de transición que determinan si un token cambia de enmascarado a desenmascarado dependen no solo de la probabilidad de ese token, sino también de la puntuación de confianza de la región correspondiente en la otra modalidad, ponderada por un mapa de atención entre modalidades.

Esquema: Generación acoplada autocorrectiva CO2Jump
CO2Jump modifica la trayectoria de denoising estándar de un modelo de difusión enmascarado acoplando las ramas de texto e imagen mediante ponderación de puntuaciones entre modalidades y añadiendo un salto de reenmascarado para la autocorrección, basado en el artículo.

Si la rama de generación de imágenes no está segura sobre una región, la rama de texto ralentiza sus decisiones de desenmascarado para los tokens que atienden a esa región, y viceversa. Esto es el acoplamiento propiamente dicho. Además, un salto de reenmascarado permite al sistema retirar un desenmascarado anterior si la puntuación de confianza de la otra modalidad para la misma región semántica cae por debajo de un umbral más adelante en la trayectoria.

Los investigadores describen el muestreador como sin entrenamiento porque no requiere ajustar el MDM subyacente. Utiliza el mismo modelo preentrenado y solo modifica cómo se organizan los pasos de denoising.

Tres nuevos puntos de referencia para la generación conjunta

Para evaluar el enfoque, el equipo creó tres corpus de generación multimodal conjunta a gran escala, todos los cuales planean publicar públicamente. JEdit-1M contiene un millón de pares de imagen y texto diseñados para tareas de comprensión y edición conjuntas. JMaze-200K y JNono-200K contienen cada uno 200,000 rompecabezas de laberintos y nonogramas respectivamente, con descripciones de texto coincidentes, destinados a probar el razonamiento visual en un entorno estructurado y basado en reglas. Se incluyen variantes dentro de la distribución y fuera de la distribución para los tres conjuntos de datos.

Según el artículo, CO2Jump logra el mejor rendimiento conjunto en comprensión de imágenes, edición de imágenes y ambas tareas de razonamiento visual en comparación con los muestreadores intercalados y paralelos existentes. Los autores informan que el rendimiento escala de manera monótona con el número de pasos de denoising, lo que significa que los efectos positivos del acoplamiento entre modalidades se acumulan en trayectorias más largas en lugar de estabilizarse o degradarse.

Por qué esto es importante para la generación multimodal

La implicación más amplia es que la calidad de la generación conjunta, donde el texto y la imagen se producen como un único artefacto coherente, puede no requerir una arquitectura fundamentalmente nueva. Puede que solo requiera un muestreador más inteligente que respete las dependencias mutuas entre las modalidades durante la propia generación. La mayoría de los pipelines actuales generan una imagen a partir de un prompt de texto fijo (que no puede reaccionar a la imagen) o alternan generaciones a lo largo de los pasos, lo que introduce latencia y no corrige retroactivamente los errores entre modalidades.

CO2Jump aborda ambos problemas en un solo paso. El salto de reenmascarado sirve como una especie de crítico interno: si la rama de imagen decide que parte de una escena debería verse diferente a lo que la rama de texto ya ha comprometido, la rama de texto puede retirar su decisión anterior e intentar un token diferente.

Si el enfoque puede escalar a más de dos modalidades, por ejemplo, añadiendo audio o video, sigue siendo una cuestión abierta. El artículo se centra en el par imagen-texto, pero el marco SC-CMJP está especificado en un lenguaje agnóstico a la modalidad, dejando esa puerta abierta.

La página del proyecto con código y conjuntos de datos está disponible en https://coupled-jump.github.io.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.