Vision & Diffusion
Génération d'images et de vidéos et modèles multimodaux.
8 published articles
Recherche en IA vidéo
Comment la distillation contextuellement alignée empêche les enseignants vidéo de voir l'avenir
La distillation vidéo a longtemps formé des étudiants causaux contre des enseignants qui notent des clips entiers avec une connaissance du futur. CMD remplace cette notation par un enseignant causal, ajoute des cibles notées par préfixe et rapporte des résultats de pointe parmi les méthodes autorégressives.
2026-08-14
Outils de design IA
Échangez un élément, et les Templates de Reve redessinent le reste
Les Templates de Reve transforment une seule photo de produit en un design complet : échangez le produit ou le texte et le reste du modèle se met à jour automatiquement. La fonctionnalité est disponible sur Reve.com.
2026-08-08
Vision par ordinateur
CABiNet reste à moins de 2 points de YOLO26x pour un huitième de la puissance de calcul
Le VDD Semantic Segmentation Model Zoo apporte sur Hugging Face des modèles YOLO26 et CABiNet entraînés sur des images de drones variées. YOLO26x-sem mène avec 78.83% de mIoU, mais les 77.76% de CABiNet-Large à 54.8 GFLOPs plaident en faveur de l'efficacité.
2026-08-07
Génération vidéo par IA
Wan3.0-Video facturé à la seconde : un clip de 30 secondes coûte 6 $
Le Wan3.0-Video d'Alibaba est facturé à la seconde sur DashScope, un clip de 30 secondes en 1080P coûtant 6 $ par génération. Nous décomposons les paliers de prix, le flux de travail multi-entrées et les questions que la fiche laisse sans réponse.
2026-08-07
Génération d'images par IA
Reve 2.1 atteint la deuxième place sur Arena avec un dixième de la puissance de calcul
Reve 2.1 revendique la deuxième place au classement général d'Arena tout en étant entraîné avec moins d'un dixième du calcul des laboratoires qui l'entourent. L'entreprise détaille également la sortie 4K, les régions adressables et le rendu de texte multilingue.
2026-08-05
Vision par ordinateur, modèles du monde et recherche en IA
PhiZero : apprendre à l'IA vidéo à raisonner en physique avant le rendu
PhiZero, un modèle du monde du CASIA, apprend un « langage physique » discret et compact à partir de vidéos brutes et l'utilise pour raisonner sur la manière dont une scène va évoluer avant de générer les images. Les auteurs soutiennent que cette conception « raisonner puis rendre » produit des vidéos physiquement plus cohérentes que la prédiction directe des pixels.
2026-07-31
Recherche IA
VideoCoCo répare la physique défaillante des vidéos IA en pensant en code Blender
VideoCoCo traite le code Blender exécutable comme une chaîne de pensée : un agent de codage scénarise une scène, un simulateur la déroule, et un moteur vidéo rend le résultat photoréaliste. Cette répartition cible le problème de la physique en texte-à-vidéo et obtient les meilleurs scores moyens sur PhyGenBench et VBench-2.0.
2026-07-30
Génération d'images par IA
L'outil chinois d'IA générative d'images qui a corrigé ce que Midjourney ne pouvait pas faire
GLM-Image de Zhipu AI corrige un angle mort flagrant de la génération d'images par IA : le rendu précis du texte chinois, gratuitement, sans limites ni filigranes. Un outil pratique pour les créateurs chinois.
2026-07-17