IA de código abierto
AV-Flamingo de Nvidia aborda la comprensión de videos largos donde la mayoría de los modelos fallan
Nvidia lanza AV-Flamingo, un modelo de lenguaje grande audiovisual abierto diseñado para la comprensión de videos largos y complejos. Utiliza un plan de estudios de tres etapas y un marco de cadena de pensamiento con marcas de tiempo para manejar el razonamiento temporal y multimodal que desconcierta a la mayoría de los modelos.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-28 · 5 min de lectura

La comprensión de video es un problema resuelto solo si por video te refieres a un clip de cinco segundos de un gato en un monopatín. En el momento en que le pides a un modelo que rastree una conversación a lo largo de una grabación de una reunión de diez minutos o que reconstruya lo que sucedió en una transmisión de vigilancia que abarca varios minutos, la mayoría de los sistemas actuales dejan de ser útiles.
Nvidia, en colaboración con investigadores de múltiples instituciones, ha lanzado AV-Flamingo, un modelo de lenguaje grande audiovisual completamente abierto que apuesta por un enfoque diferente. En lugar de optimizar para los clips cortos que dominan la mayoría de los puntos de referencia, el modelo se entrena desde cero para videos largos, complejos y del mundo real que combinan audio, imágenes y estructura temporal.
Qué hace que un video largo sea difícil
El problema central del video largo es que agrava todas las debilidades de los LLM. La información visual llega a altas velocidades de fotogramas. Las pistas de audio contienen superposición de voz, ruido ambiental y silencios. Y lo que le importa a una pregunta, una acción específica, un cambio en el tono de alguien, un objeto que aparece en el fondo, puede ocurrir en el segundo 3 y no resolverse hasta el segundo 47. Los modelos que funcionan bien en clips cortos tienden a perder el hilo después de treinta segundos porque sus mecanismos de atención no fueron entrenados para abarcar tanto tiempo.
AV-Flamingo aborda esto a través de tres contribuciones principales, documentadas en el artículo de investigación publicado en arXiv y enlazado desde la página del proyecto en Hugging Face.
Un conjunto de datos diseñado para el razonamiento, no para el reconocimiento

El primero es Audio-Visual-Skills, un conjunto de datos a gran escala de aproximadamente 7 millones de instancias de entrenamiento de subtítulos y preguntas-respuestas extraídas de videos del mundo real. El conjunto de datos está diseñado para forzar el razonamiento temporal, compositivo y multimodal, los tipos de tareas en las que un modelo tiene que conectar algo escuchado en un momento con algo visto en otro. Es una ruptura deliberada con muchos conjuntos de datos de video que tratan cada fotograma como aproximadamente independiente y prueban principalmente el reconocimiento de objetos.
Entrenamiento curricular de tres etapas
La segunda contribución es un plan de estudios de tres etapas que aumenta gradualmente la complejidad de lo que el modelo maneja. La etapa uno se centra en la percepción de corto alcance, alineando señales de audio y visuales en lapsos breves. La etapa dos pasa a clips de longitud media con límites de eventos simples. La etapa tres avanza hacia el razonamiento de múltiples eventos a largo plazo, donde el modelo debe rastrear un hilo narrativo completo a lo largo de minutos de material de archivo.
Este enfoque por etapas es importante porque saltar directamente a videos largos con una inicialización aleatoria es una receta para resultados incoherentes. El modelo aprende a caminar antes de correr, y el artículo de investigación muestra que cada etapa mejora mediblemente el rendimiento en la siguiente.
Cadena de pensamiento con marcas de tiempo
La tercera pieza es Temporal Audio-Visual Interleaved Chain-of-Thought, un marco de razonamiento que obliga al modelo a fundamentar sus pasos de razonamiento intermedios en marcas de tiempo específicas. En lugar de producir una respuesta final basada en una mezcla difusa de todo lo que vio y escuchó, el modelo tiene que decir, en efecto: en el segundo 12 escuché esto, en el segundo 14 vi aquello, por lo tanto, la respuesta es esta.
Esto hace que las salidas del modelo sean más interpretables y, según el artículo, mejora la alineación temporal, el modelo es menos propenso a confundir eventos que ocurrieron en diferentes momentos cuando tiene que comprometerse con marcas de tiempo en el camino.
Resultados de referencia frente a modelos abiertos y cerrados
| Tipo de benchmark | AV-Flamingo (abierto, tamaño comparable) | Mejor modelo abierto comparable | Modelos abiertos/cerrados más grandes |
|---|---|---|---|
| Comprensión audiovisual (video largo) | Lidera o es competitivo | Superado por márgenes claros | Competitivo, a veces supera |
| Benchmarks multimodales | Fuerte | Similar | Competitivo |
| Tareas solo de audio | Fuerte | Similar | Competitivo |
| Tareas solo de visión | Sólido | Comparable | Detrás en algunos |
En más de 15 puntos de referencia que cubren tareas audiovisuales, multimodales, de audio y de visión, AV-Flamingo supera a modelos abiertos de tamaño similar por márgenes claros. Se mantiene firme frente a modelos mucho más grandes, incluidos los cerrados, particularmente en las tareas de comprensión de video largo y complejo para las que fue construido. El artículo no lo presenta como el mejor modelo en todos y cada uno de los puntos de referencia, algunos sistemas especializados aún lideran en pruebas de solo visión estrechas, pero en la combinación de comprensión audiovisual y razonamiento temporal sobre videos largos, establece un nuevo estándar entre los modelos de peso abierto.
La brecha de utilidad en el mundo real
Las puntuaciones de los benchmarks solo cuentan parte de la historia. El artículo enfatiza que AV-Flamingo se transfiere bien a tareas no vistas y exhibe una fuerte utilidad en el mundo real. Esa es una afirmación más difícil de cuantificar pero crucial: muchos modelos que sobresalen en puntos de referencia restringidos fallan cuando se enfrentan a videos desordenados y sin guion con calidad de audio variable, cortes inesperados y ruido de fondo. El entrenamiento de AV-Flamingo en imágenes del mundo real en lugar de clips seleccionados es la diferencia clave aquí.
Peso abierto, conjunto de datos abierto, futuro abierto
Nvidia lanzó los pesos del modelo, el conjunto de datos Audio-Visual-Skills y el código en Hugging Face bajo el espacio de nombres del proyecto nvidia/av-skills. Los investigadores pueden reproducir los resultados, ajustar el modelo con sus propios datos o construir sobre el plan de estudios de tres etapas para problemas relacionados.
El lanzamiento es parte de un patrón más amplio en Nvidia de publicar modelos abiertos capaces junto con sus líneas de productos cerrados, y presiona a los laboratorios que han mantenido sus mejores modelos de comprensión de video detrás de API o muros de pago. Para los profesionales que necesitan analizar videos largos con audio, grabaciones de reuniones, archivos de conferencias, imágenes de seguridad, colecciones de documentales, AV-Flamingo es ahora la opción completamente abierta más viable disponible.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.