Vision & Diffusion4 min read
Vision par ordinateur, modèles du monde et recherche en IA
PhiZero : apprendre à l'IA vidéo à raisonner en physique avant le rendu
PhiZero, un modèle du monde du CASIA, apprend un « langage physique » discret et compact à partir de vidéos brutes et l'utilise pour raisonner sur la manière dont une scène va évoluer avant de générer les images. Les auteurs soutiennent que cette conception « raisonner puis rendre » produit des vidéos physiquement plus cohérentes que la prédiction directe des pixels.
2026-07-31