Recherche en IA
Kling publie deux benchmarks qui révèlent à quel point la vidéo générative est en réalité médiocre
KlingTeam présente MultiRef-Compass et KeyFrame-Compass, deux benchmarks qui poussent les modèles de génération vidéo au-delà du texte vers la vidéo et vers des tâches multi-références et conditionnées par images clés. Les premiers tests sur respectivement huit et neuf systèmes montrent des échecs systématiques dans la liaison des entités, la préservation de l’ordre temporel et la gestion de contraintes denses.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-26 · 3 min de lecture

Les benchmarks de génération vidéo ont surtout testé une chose : la capacité d’un modèle à transformer une phrase en clip. Les deux nouveaux articles de KlingTeam, publiés le même jour, examinent plutôt des problèmes plus difficiles.
Le premier, MultiRef-Compass, cible ce que les auteurs appellent la génération multi-référence vers audio-vidéo, ou MR2AV. Au lieu d’une seule invite textuelle, le modèle reçoit plusieurs images de référence ainsi que des instructions, et doit produire un audio et une vidéo synchronisés qui respectent chaque référence. Le benchmark comprend 350 échantillons couvrant la préservation multi-vue des sujets, la liaison multi-entités et la composition humain-objet-scène.
Les tests sur huit systèmes MR2AV représentatifs montrent qu’aucun d’entre eux ne gère bien la tâche. L’article définit quatre dimensions d’évaluation, Qualité de base, Cohérence des références, Cohérence audiovisuelle et Suivi des instructions, avec 14 sous-métriques. Les modèles obtiennent systématiquement les scores les plus bas sur la cohérence des références et le suivi des instructions, qui sont précisément les dimensions les plus importantes pour une utilisation pratique.

Le second benchmark, KeyFrame-Compass, aborde la génération vidéo conditionnée par images clés. Les créateurs utilisent de plus en plus des storyboards, une séquence d’images de référence, pour guider un modèle vidéo. Le benchmark comprend 386 échantillons répartis sur trois domaines d’application, deux structures vidéo, deux granularités d’invite, deux formats de conditionnement et quatre densités d’images clés.
La conclusion clé ici est un compromis qui s’avère fondamental : les modèles qui exécutent fidèlement les images clés produisent une vidéo moins naturelle, et les modèles qui produisent une vidéo naturelle ignorent les images clés. Les performances se dégradent à mesure que la densité des images clés augmente. La plupart des modèles open source échouent également à interpréter les entrées de storyboard en grille comme des séquences temporelles ordonnées, les modèles traitent une grille d’images comme un composite unique au lieu d’une chronologie.
Les deux benchmarks utilisent un cadre d’évaluation MLLM-en-tant-que-Juge avec rejugement amélioré. Cela signifie que le jugement lui-même est effectué par un grand modèle multimodal, avec un second passage qui corrige les erreurs de notation. L’approche est évolutive et vérifiable, mais cela signifie aussi que ces benchmarks reposent sur la même technologie que celle qu’ils testent contre d’autres modèles.
KlingTeam a publié les benchmarks sur arXiv le 15 juillet 2026. Les articles ont reçu respectivement 31 et 34 votes positifs sur Hugging Face au moment de la rédaction, ce qui représente un intérêt modeste pour un laboratoire de recherche qui a produit des modèles vidéo très médiatisés. L’accueil pourrait refléter le fait que les mauvaises nouvelles pour le domaine sont moins partageables qu’une nouvelle démo.
Les résultats sont cohérents avec un schéma visible depuis les premières démos de Sora : une évaluation contrôlée révèle des échecs que des clips promotionnels soigneusement sélectionnés cachent. La qualité texte-vers-vidéo s’est considérablement améliorée au cours des deux dernières années. Le conditionnement multi-référence et par images clés n’a pas suivi le rythme.
Pour quiconque construit des pipelines de production sur ces modèles, les benchmarks suggèrent d’ajuster les attentes. Un modèle qui produit des clips impressionnants en un seul essai à partir d’une invite unique peut produire des déchets lorsqu’on lui demande de préserver l’apparence d’un personnage à travers les coupes, ou de respecter une séquence exacte d’images de storyboard. Le compromis entre fidélité et naturel n’est pas près de disparaître dans la génération actuelle d’architectures.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.