SevenTnewS

IA Open Source

L'AV-Flamingo de Nvidia s'attaque à la compréhension des longues vidéos là où la plupart des modèles échouent

Nvidia publie AV-Flamingo, un grand modèle de langage audiovisuel open source conçu pour la compréhension de vidéos longues et complexes. Il utilise un programme d'apprentissage en trois étapes et un cadre de chaîne de pensée horodatée pour gérer le raisonnement temporel et cross-modal qui fait trébucher la plupart des modèles.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-28 · 5 min de lecture

L'AV-Flamingo de Nvidia s'attaque à la compréhension des longues vidéos là où la plupart des modèles échouent
Sources : Audio-Visual Fl…

La compréhension vidéo est un problème résolu seulement si par vidéo vous entendez un clip de cinq secondes d'un chat sur une planche à roulettes. Dès que vous demandez à un modèle de suivre une conversation à travers un enregistrement de réunion de dix minutes ou de reconstituer ce qui s'est passé dans un flux de surveillance s'étalant sur plusieurs minutes, la plupart des systèmes actuels cessent d'être utiles.

Nvidia, en collaboration avec des chercheurs de plusieurs institutions, a publié AV-Flamingo, un grand modèle de langage audiovisuel entièrement open source qui prend un pari différent. Au lieu d'optimiser pour les courts clips qui dominent la plupart des benchmarks, le modèle est formé dès le départ pour des vidéos longues, complexes et réelles qui combinent audio, visuel et structure temporelle.

Ce qui rend la vidéo longue difficile

Le problème central de la vidéo longue est qu'elle aggrave toutes les faiblesses des LLM. Les informations visuelles arrivent à des fréquences d'images élevées. Les pistes audio contiennent des discours qui se chevauchent, du bruit ambiant et des silences. Et ce qui intéresse une question, une action spécifique, un changement de ton, l'apparition d'un objet en arrière-plan, peut se produire à la seconde 3 et ne se résoudre qu'à la seconde 47. Les modèles qui fonctionnent bien sur des clips courts ont tendance à perdre le fil passé trente secondes car leurs mécanismes d'attention n'ont pas été entraînés pour couvrir autant de temps.

AV-Flamingo résout ce problème grâce à trois contributions principales, documentées dans l'article de recherche publié sur arXiv et lié à partir de la page Hugging Face du projet.

Un jeu de données construit pour le raisonnement, pas la reconnaissance

Graphique : Performance de AV-Flamingo vs. autres modèles
AV-Flamingo est en tête ou performant sur les benchmarks de vidéo longue et omni-modaux par rapport à des modèles de taille similaire, selon l'article.

Le premier est Audio-Visual-Skills, un jeu de données à grande échelle d'environ 7 millions d'instances d'entraînement de légendes et de questions-réponses issues de vidéos réelles. Le jeu de données est conçu pour forcer le raisonnement temporel, compositionnel et cross-modal, les types de tâches où un modèle doit relier ce qui est entendu à un moment donné avec ce qui est vu à un autre. C'est une rupture délibérée avec les nombreux jeux de données vidéo qui traitent chaque image comme grossièrement indépendante et testent principalement la reconnaissance d'objets.

Programme d'apprentissage en trois étapes

La deuxième contribution est un programme d'apprentissage en trois étapes qui augmente progressivement la complexité de ce que le modèle traite. La première étape se concentre sur la perception à courte portée, en alignant les signaux audio et visuels sur de brèves périodes. La deuxième étape passe à des clips de longueur moyenne avec des limites d'événements simples. La troisième étape pousse le raisonnement multi-événements à long terme, où le modèle doit suivre un fil narratif entier à travers plusieurs minutes de séquences.

Cette approche par étapes est importante car sauter directement dans des vidéos longues avec une initialisation aléatoire est une recette pour des sorties incohérentes. Le modèle apprend à marcher avant de courir, et l'article de recherche montre que chaque étape améliore de manière mesurable les performances sur la suivante.

Chaîne de pensée avec horodatages

La troisième pièce est la Chaîne de Pensée Entrelacée Audiovisuelle Temporelle, un cadre de raisonnement qui force le modèle à ancrer ses étapes de raisonnement intermédiaires à des horodatages spécifiques. Au lieu de produire une réponse finale basée sur un mélange flou de tout ce qu'il a vu et entendu, le modèle doit dire, en effet : à la seconde 12, j'ai entendu ceci, à la seconde 14, j'ai vu cela, donc la réponse est ceci.

Cela rend les sorties du modèle plus interprétables et, selon l'article, améliore l'alignement temporel : le modèle est moins susceptible de confondre des événements qui se sont produits à des moments différents lorsqu'il doit s'engager sur des horodatages en cours de route.

Résultats des benchmarks face aux modèles ouverts et fermés

Type de benchmarkAV-Flamingo (ouvert, taille comparable)Meilleur modèle ouvert comparableModèles ouverts/fermés plus grands
Compréhension audiovisuelle (vidéo longue)En tête ou compétitifDistancé par des marges clairesCompétitif, parfois surpassé
Benchmarks omni-modauxFortSimilaireCompétitif
Tâches audio uniquementFortSimilaireCompétitif
Tâches vision uniquementSolideComparableEn retard sur certains

Sur plus de 15 benchmarks couvrant les tâches audiovisuelles, omni-modales, audio et vision, AV-Flamingo surpasse les modèles ouverts de taille similaire avec des marges claires. Il tient tête à des modèles beaucoup plus grands, y compris les modèles fermés, en particulier sur les tâches de compréhension vidéo longues et complexes pour lesquelles il a été conçu. L'article ne le présente pas comme le meilleur modèle sur chaque benchmark, certains systèmes spécialisés sont toujours en tête sur des tests de vision uniquement étroits, mais sur la combinaison de la compréhension audiovisuelle et du raisonnement temporel sur des vidéos longues, il établit une nouvelle barre parmi les modèles à poids ouverts.

Le fossé de l'utilité réelle

Les scores de benchmark ne racontent qu'une partie de l'histoire. L'article souligne qu'AV-Flamingo se transfère bien à des tâches inédites et démontre une forte utilité dans le monde réel. C'est une affirmation plus difficile à quantifier mais cruciale : de nombreux modèles qui réussissent des benchmarks contraints s'effondrent lorsqu'on les confronte à des vidéos désordonnées et non scénarisées avec une qualité audio variable, des coupures inattendues et du bruit de fond. La formation d'AV-Flamingo sur des séquences réelles plutôt que sur des clips soigneusement sélectionnés est la différence clé ici.

Poids ouverts, jeu de données ouvert, avenir ouvert

Nvidia a publié les poids du modèle, le jeu de données Audio-Visual-Skills et le code sur Hugging Face sous l'espace de nom du projet nvidia/av-skills. Les chercheurs peuvent reproduire les résultats, affiner le modèle sur leurs propres données, ou construire sur le programme d'apprentissage en trois étapes pour des problèmes connexes.

Cette publication s'inscrit dans une tendance plus large chez Nvidia à publier des modèles ouverts performants parallèlement à ses gammes de produits fermés, et elle met la pression sur les laboratoires qui ont gardé leurs meilleurs modèles de compréhension vidéo derrière des API ou des paywalls. Pour les praticiens qui ont besoin d'analyser de longues vidéos avec du son, des enregistrements de réunions, des archives de cours, des séquences de sécurité, des collections documentaires, AV-Flamingo est désormais l'option ouverte la plus viable disponible.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.