SevenTnewS

Visión por computadora, modelos del mundo e investigación en IA

PhiZero: enseñar a la IA de video a pensar en física antes de renderizar

PhiZero, un modelo del mundo de CASIA, aprende un compacto "lenguaje físico" discreto a partir de video sin procesar y lo usa para razonar sobre cómo evolucionará una escena antes de renderizar fotogramas. Los autores sostienen que este diseño de razonar-luego-renderizar produce video más físicamente coherente que la predicción directa de píxeles.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-31 · Última actualización: 2026-08-02 · 4 min de lectura

PhiZero: enseñar a la IA de video a pensar en física antes de renderizar

Los modelos de generación de video tienen un problema de física. Dale un fotograma inicial y puede producir una secuencia perfectamente plausible en la que una pelota cae hacia arriba, una taza atraviesa una mesa o un brazo se dobla en la dirección equivocada. Un nuevo artículo de CASIA sostiene que el fallo es estructural: los modelos actuales predicen píxeles directamente, y nada en ese flujo representa las reglas del mundo que se está representando.

La solución propuesta es inusual. PhiZero no intenta hacer más inteligente al predictor visual. En cambio, se aleja por completo de los píxeles: primero traduce la evolución esperada de una escena a lo que los autores llaman "lenguaje físico", una representación discreta y compacta de las transiciones de estado del mundo, y luego renderiza esa descripción en video. Primero razonar, luego pintar.

El problema de predecir píxeles

Los modelos físicos del mundo existentes, señala el artículo, operan típicamente en el espacio de píxeles: toman un fotograma o un prompt y predicen fotogramas futuros, dejando "la dinámica subyacente del mundo implícita dentro de predictores visuales de alta dimensión", como dice el resumen. Eso funciona para clips cortos y llamativos. No funciona de manera evidente para escenas que necesitan mecánica consistente, porque nunca se le exige al modelo que exponga lo que cree que está sucediendo, solo lo que cree que parece.

La premisa de PhiZero es que los humanos hacemos algo diferente. Abstrayemos la estructura predictiva de la experiencia visual y la organizamos en enunciados aproximadamente similares al lenguaje sobre cómo cambian las cosas. El artículo trata esa observación como una restricción de diseño, no como una cuestión filosófica.

Esquema: flujo razonar-luego-renderizar de PhiZero
El flujo sigue el diseño razonar-luego-renderizar del artículo: PhiZero aprende un lenguaje físico discreto a partir de video sin etiquetar, infiere transiciones futuras de estado del mundo en ese lenguaje y solo entonces renderiza los fotogramas de video.

Lenguaje físico, aprendido en el mundo real

El "lenguaje" no es una ontología hecha a mano. PhiZero lo aprende de videos del mundo real mediante autosupervisión, sin etiquetas ni anotaciones, como una representación discreta y compacta de los cambios de estado. Qué codifica exactamente una unidad de ese lenguaje no se detalla en el resumen del preprint. La intención es bastante clara: obligar al modelo a comprometerse con una descripción de lo que cambiará antes de que se le permita dibujar nada.

Razonar, luego renderizar

La arquitectura sigue un paradigma de dos etapas que los autores llaman razonar-luego-renderizar. La primera etapa infiere la evolución futura del mundo como una secuencia en lenguaje físico. La segunda etapa renderiza esas transiciones inferidas en fotogramas de video reales. Esa división del trabajo es lo que distingue a PhiZero de los enfoques que incrustan la dinámica en un predictor de alta dimensión y esperan que reaparezca en el momento de la inferencia.

Lo que afirma el artículo

Los autores informan de extensos experimentos en benchmarks de generación y comprensión que validan, en palabras del resumen, la "evolución del mundo físicamente coherente". También afirman su potencial para tres cosas que importan más allá de las puntuaciones de los benchmarks: modelado del mundo realista e interactivo, simulación condicionada por acciones de grano fino y transferencia de movimiento zero-shot, es decir, un patrón de movimiento aprendido en un objeto puede aplicarse a otro sin reentrenamiento.

El preprint fue enviado a arXiv el 30 de julio de 2026 y la página del proyecto está disponible en phi-zero.github.io. El artículo ha recibido 155 votos positivos en Hugging Face al momento de redactar esta nota. Eso es un interés moderado de la comunidad, no un veredicto sobre la ciencia.

Preguntas sin responder

Las preguntas abiertas son reales, y el artículo las invita. ¿Qué significa "coherente" operativamente en los benchmarks? ¿Cómo escala una representación discreta cuando las escenas se vuelven largas y concurridas? ¿Y es "lenguaje" la metáfora correcta, o un elaborado cuello de botella discreto con un nombre halagador? El resumen no resuelve nada de eso. La afirmación más fuerte, que el razonamiento explícito supera a la predicción directa de píxeles, necesitará benchmarks de terceros y una reproducción del flujo razonar-luego-renderizar con datos ajenos antes de que signifique mucho.

Nada de eso hace que la dirección sea menos interesante. Los modelos del mundo están siendo arrastrados en dos direcciones a la vez: hacia contextos más grandes y horizontes de predicción más largos, o hacia representaciones internas más estructuradas. PhiZero apuesta por la segunda: que un modelo capaz de decir lo que sucederá antes de mostrar lo que sucederá terminará entendiendo el mundo mejor que uno que simplemente lo renderiza.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.