SevenTnewS

Investigación en IA

Kling publica dos benchmarks que exponen lo deficiente que es realmente la generación de video

KlingTeam presenta MultiRef-Compass y KeyFrame-Compass, dos benchmarks que llevan a los modelos de generación de video más allá del texto a video y hacia tareas de múltiples referencias y condicionamiento por fotogramas clave. Las pruebas iniciales en ocho y nueve sistemas respectivamente muestran fallos consistentes en la vinculación de entidades, la preservación del orden temporal y el manejo de restricciones densas.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-26 · 3 min de lectura

Kling publica dos benchmarks que exponen lo deficiente que es realmente la generación de video
Fuentes : MultiRef-Compas…·KeyFrame-Compas…

Los benchmarks de generación de video han evaluado principalmente una cosa: qué tan bien convierte un modelo una frase en un clip. Los dos nuevos artículos de KlingTeam, publicados el mismo día, abordan problemas más difíciles.

El primero, MultiRef-Compass, se centra en lo que los autores llaman generación de video-audio con múltiples referencias, o MR2AV. En lugar de un solo prompt de texto, el modelo recibe varias imágenes de referencia más instrucciones, y debe producir audio y video sincronizados que respeten cada referencia. El benchmark incluye 350 muestras que cubren preservación de sujetos multivista, vinculación de múltiples entidades y composición humano-objeto-escena.

Las pruebas en ocho sistemas MR2AV representativos muestran que ninguno maneja bien la tarea. El artículo define cuatro dimensiones de evaluación: Calidad Básica, Consistencia de Referencia, Consistencia Audiovisual y Seguimiento de Instrucciones, con 14 sub-métricas. Los modelos obtienen puntuaciones consistentemente más bajas en consistencia de referencia y seguimiento de instrucciones, que son precisamente las dimensiones que más importan para el uso práctico.

Gráfico: Los sistemas MR2AV obtienen las puntuaciones más bajas en consistencia de referencia y seguimiento de instrucciones
Según el benchmark MultiRef-Compass de KlingTeam, los modelos obtienen consistentemente las puntuaciones más bajas en consistencia de referencia y seguimiento de instrucciones entre cuatro dimensiones de evaluación.

El segundo benchmark, KeyFrame-Compass, aborda la generación de video condicionada por fotogramas clave. Los creadores utilizan cada vez más storyboards (una secuencia de imágenes de referencia) para guiar un modelo de video. El benchmark incluye 386 muestras en tres dominios de aplicación, dos estructuras de video, dos granularidades de prompt, dos formatos de condicionamiento y cuatro densidades de fotogramas clave.

El hallazgo clave aquí es un equilibrio que resulta ser fundamental: los modelos que ejecutan fielmente los fotogramas clave producen un video menos natural, y los modelos que producen video natural ignoran los fotogramas clave. El rendimiento se degrada a medida que aumenta la densidad de fotogramas clave. La mayoría de los modelos de código abierto también fallan al interpretar las entradas de cuadrícula de storyboard como secuencias ordenadas temporalmente: los modelos tratan una cuadrícula de imágenes como un solo compuesto en lugar de una línea de tiempo.

Ambos benchmarks utilizan un marco de evaluación MLLM-como-Juez mejorado con re-evaluación. Esto significa que el propio juicio lo realiza un modelo multimodal grande, con una segunda pasada que detecta errores de puntuación. El enfoque es escalable y auditable, pero también significa que estos benchmarks dependen de la misma tecnología contra la que están probando otros modelos.

KlingTeam publicó los benchmarks en arXiv el 15 de julio de 2026. Los artículos recibieron 31 y 34 votos a favor en Hugging Face respectivamente al momento de escribir este artículo, lo que es un interés modesto para un laboratorio de investigación que ha producido modelos de video de alto perfil. La recepción puede reflejar el hecho de que las malas noticias para el campo son menos compartibles que una nueva demostración.

Los resultados son consistentes con un patrón que ha sido visible desde las primeras demostraciones de Sora: la evaluación controlada revela fallos que los clips promocionales cuidadosamente seleccionados ocultan. La calidad del texto a video ha mejorado drásticamente en los últimos dos años. El condicionamiento de múltiples referencias y fotogramas clave no ha seguido el ritmo.

Para cualquiera que construya pipelines de producción sobre estos modelos, los benchmarks sugieren ajustar las expectativas. Un modelo que produce clips impresionantes de un solo disparo a partir de un solo prompt puede producir basura cuando se le pide que preserve la apariencia de un personaje a través de cortes, o que obedezca una secuencia exacta de fotogramas de storyboard. El equilibrio entre fidelidad y naturalidad no desaparecerá en la generación actual de arquitecturas.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.