Investigación en IA
VideoCoCo corrige la física rota de los videos de IA pensando en código de Blender
VideoCoCo trata el código ejecutable de Blender como una cadena de pensamiento: un agente de codificación programa una escena, un simulador la reproduce y un motor de video hace que el resultado sea fotorrealista. Esta división ataca el problema de la física del texto a video y logra las mejores puntuaciones medias en PhyGenBench y VBench-2.0.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-30 · Última actualización: 2026-08-02 · 4 min de lectura

Mira un clip de texto a video el tiempo suficiente y notarás la señal. Una taza se inclina, una tela se pliega, una pelota rebota y, en algún lugar cerca del tercer segundo, los píxeles dejan de obedecer a la física. Los fotogramas se ven casi fotorrealistas. La dinámica, a menudo, no lo es. El artículo detrás de la última ronda de cifras de benchmarks sostiene que esto no es un problema de renderizado. Es un problema de razonamiento.
VideoCoCo, publicado en arXiv el 29 de julio bajo Computer Vision and Pattern Recognition, parte de un diagnóstico específico. Un modelo de texto a video tiene que inferir implícitamente la evolución temporal de una escena a partir de un prompt de texto altamente comprimido, y es en esa inferencia implícita donde muere la consistencia física. El artículo también explica por qué los intentos anteriores de cadenas de pensamiento no lo resolvieron. Los planes intermedios y los estados visuales que producen suelen ser no ejecutables o temporalmente dispersos. Un modelo puede insinuar lo que debería suceder. Nada lo ejecuta.
Cómo hacer ejecutable la cadena de pensamiento
VideoCoCo es un framework de doble motor basado en agentes, y el diseño solo tiene sentido si se rastrea qué parte hace qué. Un agente de codificación toma el prompt y sintetiza un programa de Blender que especifica explícitamente la escena y su evolución en el tiempo. Un motor de simulación ejecutable ejecuta ese programa para producir un borrador espacio-temporal determinista, una versión concreta del movimiento resuelta antes de que se dibuje cualquier píxel. Un motor de video generativo transforma entonces el borrador en un clip fotorrealista mediante edición condicionada al borrador. El agente de codificación no describe la escena con palabras y espera. Escribe un programa que establece qué existe y qué cambia.
El punto es la descomposición. El razonamiento a nivel de proceso, decidir cómo se comporta la escena, vive en código ejecutable y puede ejecutarse, inspeccionarse y corregirse como cualquier programa. La realización visual de alta fidelidad, hacer que parezca cine, queda en manos del motor generativo. Ninguna de las dos mitades tiene que ser buena en el trabajo de la otra. El motor generativo ya no tiene que inventar la física a partir de los píxeles. Tiene que hacer que una simulación honesta parezca cine, que es una tarea más acotada y manejable.
Para que el motor de video se sienta cómodo con la entrada simulada, los investigadores crearon VideoCoCo-3K, un conjunto de datos curado de tripletas borrador-instrucción-objetivo que adapta el editor a los borradores que produce el simulador. La entrada muestra actualmente 64 votos positivos en Hugging Face.
Leyendo el marcador
Luego, las cifras. En PhyGenBench, VideoCoCo mejora la línea base de OmniWeaving de 0.475 a 0.558. En VBench-2.0, pasa de 52.18 a 77.88, un salto de 25.7 puntos, y el artículo reporta la mejor puntuación media en ambos benchmarks.
| Benchmark | Línea base de OmniWeaving | VideoCoCo |
|---|---|---|
| PhyGenBench | 0.475 | 0.558 |
| VBench-2.0 | 52.18 | 77.88 |
Las puntuaciones viven en escalas diferentes, PhyGenBench en fracciones y VBench-2.0 en puntos, por lo que las dos mejoras no deben compararse directamente. Las cifras de los benchmarks también merecen una nota al pie antes de convertirse en titulares. Estas suites evalúan una porción definida de comportamiento, y los resultados son cifras de un solo equipo provenientes de su propia evaluación, a la espera de una replicación independiente. Pero el salto aparece en ambas suites, lo cual no es poca cosa. Le da al argumento central margen para ser tomado en serio.
La apuesta estructural es más interesante que la puntuación. Si un simulador resuelve la física, el modo de fallo práctico del video de IA cambia. En lugar de un modelo que no puede razonar sobre el mundo, obtienes un borrador que puedes depurar. El mismo prompt produce la misma simulación, y editar el script de Blender se convierte en una forma de dirigir el resultado. Determinista e inspeccionable es un punto de operación genuinamente diferente para el texto a video.
Lo que el resumen deja abierto
Tres vacíos merecen mencionarse. El pipeline inserta una etapa completa de simulación antes de la generación, y el resumen no dice nada sobre lo que eso cuesta en cómputo o latencia. Los borradores de Blender son geometría determinista, y no está demostrado si un motor de video entrenado con ellos puede alcanzar aún movimiento expresivo o estilizado. Y los resultados son un solo grupo, dos benchmarks, sin verificación independiente todavía. Así es como comienzan la mayoría de los buenos resultados.
La apuesta de VideoCoCo es que la coherencia en el video de IA pasa por una suite 3D, no por prompts más aventurados. En sus propios benchmarks, la apuesta dio resultados. Si se sostiene más allá de ellos es una cuestión de replicación, y es la que vale la pena observar.
- Fuente : VideoCoCo fixes AI video's broken physics by thinking in Blender code — 2026-07-29
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.