SevenTnewS

Vision & Diffusion

Génération d'images et de vidéos et modèles multimodaux.

8 published articles

Featured5 min read

Recherche en IA vidéo

Comment la distillation contextuellement alignée empêche les enseignants vidéo de voir l'avenir

La distillation vidéo a longtemps formé des étudiants causaux contre des enseignants qui notent des clips entiers avec une connaissance du futur. CMD remplace cette notation par un enseignant causal, ajoute des cibles notées par préfixe et rapporte des résultats de pointe parmi les méthodes autorégressives.

2026-08-14

3 min read

Outils de design IA

Échangez un élément, et les Templates de Reve redessinent le reste

Les Templates de Reve transforment une seule photo de produit en un design complet : échangez le produit ou le texte et le reste du modèle se met à jour automatiquement. La fonctionnalité est disponible sur Reve.com.

2026-08-08

4 min read

Vision par ordinateur

CABiNet reste à moins de 2 points de YOLO26x pour un huitième de la puissance de calcul

Le VDD Semantic Segmentation Model Zoo apporte sur Hugging Face des modèles YOLO26 et CABiNet entraînés sur des images de drones variées. YOLO26x-sem mène avec 78.83% de mIoU, mais les 77.76% de CABiNet-Large à 54.8 GFLOPs plaident en faveur de l'efficacité.

2026-08-07

Featured3 min read

Génération vidéo par IA

Wan3.0-Video facturé à la seconde : un clip de 30 secondes coûte 6 $

Le Wan3.0-Video d'Alibaba est facturé à la seconde sur DashScope, un clip de 30 secondes en 1080P coûtant 6 $ par génération. Nous décomposons les paliers de prix, le flux de travail multi-entrées et les questions que la fiche laisse sans réponse.

2026-08-07

Featured3 min read

Génération d'images par IA

Reve 2.1 atteint la deuxième place sur Arena avec un dixième de la puissance de calcul

Reve 2.1 revendique la deuxième place au classement général d'Arena tout en étant entraîné avec moins d'un dixième du calcul des laboratoires qui l'entourent. L'entreprise détaille également la sortie 4K, les régions adressables et le rendu de texte multilingue.

2026-08-05

4 min read

Vision par ordinateur, modèles du monde et recherche en IA

PhiZero : apprendre à l'IA vidéo à raisonner en physique avant le rendu

PhiZero, un modèle du monde du CASIA, apprend un « langage physique » discret et compact à partir de vidéos brutes et l'utilise pour raisonner sur la manière dont une scène va évoluer avant de générer les images. Les auteurs soutiennent que cette conception « raisonner puis rendre » produit des vidéos physiquement plus cohérentes que la prédiction directe des pixels.

2026-07-31

4 min read

Recherche IA

VideoCoCo répare la physique défaillante des vidéos IA en pensant en code Blender

VideoCoCo traite le code Blender exécutable comme une chaîne de pensée : un agent de codage scénarise une scène, un simulateur la déroule, et un moteur vidéo rend le résultat photoréaliste. Cette répartition cible le problème de la physique en texte-à-vidéo et obtient les meilleurs scores moyens sur PhyGenBench et VBench-2.0.

2026-07-30

3 min read

Génération d'images par IA

L'outil chinois d'IA générative d'images qui a corrigé ce que Midjourney ne pouvait pas faire

GLM-Image de Zhipu AI corrige un angle mort flagrant de la génération d'images par IA : le rendu précis du texte chinois, gratuitement, sans limites ni filigranes. Un outil pratique pour les créateurs chinois.

2026-07-17