SevenTnewS

Recherche en IA

La génération vidéo devient 120 fois plus rapide sur un seul GPU : au cœur de l'avancée de Nvidia sur l'attention hybride

La SANA-Video 2.0 de Nvidia Research combine l'attention linéaire et softmax périodique dans un ratio 3:1 pour fonctionner 120 fois plus vite que Wan 2.2 sur un seul H100. La conception hybride retrouve une expressivité de plein rang tout en maintenant une inférence à 13 secondes pour un clip 720p. Les réserves : les benchmarks s'arrêtent à 720p et intègrent le changement d'attention avec des optimisations propriétaires.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-31 · 3 min de lecture

La génération vidéo devient 120 fois plus rapide sur un seul GPU : au cœur de l'avancée de Nvidia sur l'attention hybride

Le coût de la génération vidéo a toujours été l'attention. Pas celle que vous payez pour des clics, mais le mécanisme d'auto-attention à l'intérieur des transformeurs de diffusion. Chaque image ajoute plus de tokens, et l'attention softmax complète fait que chaque token regarde tous les autres tokens. Cette mise à l'échelle quadratique transforme un court clip en une longue attente.

La SANA-Video 2.0 de Nvidia Research, publiée en préimpression en juillet 2026, tente de décomposer ce coût. Elle mélange l'attention linéaire avec des étapes softmax périodiques dans un rapport 3:1, et l'article affirme que le résultat fonctionne 120 fois plus vite que Wan 2.2-A14B sur un seul H100 pour des clips 720p de 5 secondes. Ce chiffre est frappant, mais le détailler montre l'ingénierie nécessaire pour combler l'écart entre la théorie et la pratique.

Le mécanisme d'attention hybride

L'architecture évite la pénalité quadratique en remplaçant la plupart des opérations softmax par une alternative linéaire à portes. Un pas d'attention sur quatre conserve le softmax, agissant comme une ancre de plein rang. L'idée est que l'attention purement linéaire perd en expressivité car les tokens interagissent indirectement. Les étapes softmax périodiques restaurent l'interaction directe. L'article appelle cela l'Attention Hybride Linéaire-Softmax, et il combine un chemin linéaire à portes pour un mélange O(N) avec des ancres softmax périodiques dans un rapport 3:1.

Pour pousser ces représentations rafraîchies à travers le réseau, les Résidus d'Attention par Bloc (AttnRes) acheminent les résumés de blocs terminés vers les couches ultérieures. L'article rapporte une augmentation d'environ 12 % du rang effectif des couches profondes. Le modèle a été entraîné à partir de zéro pour apprendre directement le motif hybride, évitant la dégradation qui peut se produire lors de la linéarisation d'un transformeur pré-entraîné.

La pile d'optimisation

En plus du backbone, Nvidia a appliqué sa pile d'optimisation Sol-Engine, qui comprend la fusion de noyaux, la mise en cache et l'attention creuse. L'article indique que cette couche supplémentaire accélère le backbone favorable au matériel de 3,58x supplémentaires. En combinant les deux améliorations, le pipeline de 5 milliards de paramètres atteint 13,06 secondes pour un clip 720p de 5 secondes sur un seul H100. En 720p et 60 secondes, la passe avant DiT compilée est 3,2 fois plus rapide qu'une ligne de base softmax complète comparable, et l'écart se creuse avec des vidéos plus longues.

Benchmarks et comparaisons

La qualité est mesurée sur VBench, où SANA-Video 2.0 obtient un score de 84,30 en 480p avec 40 étapes d'échantillonnage, en 13,2 secondes sur un seul H100. Les auteurs affirment que cela est compétitif avec des DiTs vidéo softmax complets beaucoup plus grands. En 720p et 5 secondes, le pipeline complet est environ 120 fois plus rapide que Wan 2.2-A14B. L'écart augmente avec la durée de la vidéo, ce qui est important pour la génération de longs formats.

MétriqueSANA-Video 2.0 (5B)
Score VBench (480p, 40 étapes)84,30
Temps d'inférence (480p, 40 étapes)13,2 s sur 1 H100
Temps d'inférence (720p, 5 s, pipeline complet)13,06 s sur 1 H100
Accélération de la passe avant DiT vs ligne de base softmax complet (720p/60s)3,2x
Accélération vs Wan 2.2-A14B (720p/5s, pipeline complet)120x sur 1 H100

Questions ouvertes et compromis

L'article teste en 480p et 720p jusqu'à 60 secondes. Il n'explore pas le 1080p ni les séquences plus longues. Le ratio de softmax de 25 % a été choisi à partir d'études proxy à plus basse résolution, et on ne sait pas si le même ratio tient pour des résolutions plus élevées ou un contexte plus long. Les chiffres d'accélération regroupent le changement d'attention avec Sol-Engine, rendant difficile l'isolement de la contribution de chaque composant. Et la comparaison avec Wan 2.2, un modèle différent avec une architecture et un entraînement différents, laisse place au débat sur la mesure dans laquelle le facteur 120x est généralisable au-delà du matériel Nvidia.

Ce ne sont pas des défauts fatals, mais ce sont de vraies réserves pour quiconque évalue si cette approche est adaptée à son propre pipeline. L'ingénierie est impressionnante. Les affirmations sont ambitieuses. Mais comme pour toute préimpression, les détails comptent plus que le titre.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.