vision par ordinateur
3 published articles
Vision par ordinateur, modèles du monde et recherche en IA
PhiZero : apprendre à l'IA vidéo à raisonner en physique avant le rendu
PhiZero, un modèle du monde du CASIA, apprend un « langage physique » discret et compact à partir de vidéos brutes et l'utilise pour raisonner sur la manière dont une scène va évoluer avant de générer les images. Les auteurs soutiennent que cette conception « raisonner puis rendre » produit des vidéos physiquement plus cohérentes que la prédiction directe des pixels.
2026-07-31
Modélisation 3D
Les dents manquantes des modèles de visage paramétriques : GNM Head les ajoute
GNM Head modélise l'ensemble de la tête humaine, y compris les dents, les yeux, la langue et le cou, construit à partir de scans haute résolution et disponible en open source.
2026-07-30
Génération vidéo et moteurs de jeu
Ce qu'un moteur de jeu peut apprendre à l'IA pour garder son monde cohérent
Les modèles génératifs vidéo sont souvent appelés la prochaine génération de moteurs de jeu. Mais sans suivi solide des états, ils oublient ce qui s'est passé il y a deux images. Un nouvel article dissèque le problème et propose un ensemble de données de plus de 90 heures de jeu de Black Myth: Wukong comme ressource pour le résoudre.
2026-07-23