SevenTnewS

Investigación en IA

La generación de video se vuelve 120 veces más rápida en una GPU: el avance de Nvidia en atención híbrida

El SANA-Video 2.0 de Nvidia Research combina atención lineal y softmax periódica en una proporción 3:1 para funcionar 120 veces más rápido que Wan 2.2 en una H100. El diseño híbrido recupera la expresividad de rango completo mientras mantiene la inferencia en 13 segundos para un clip en 720p. Las advertencias: los benchmarks se detienen en 720p y combinan el cambio de atención con optimizaciones propietarias.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-31 · 3 min de lectura

La generación de video se vuelve 120 veces más rápida en una GPU: el avance de Nvidia en atención híbrida

El costo de generar video siempre ha sido la atención. No la atención que se paga por clics, sino el mecanismo de autoatención dentro de los transformadores de difusión. Cada fotograma añade más tokens, y la atención softmax completa hace que cada token mire a todos los demás. Esa escala cuadrática convierte un clip corto en una larga espera.

El SANA-Video 2.0 de Nvidia Research, publicado como preprint en julio de 2026, intenta desglosar ese costo. Mezcla atención lineal con pasos softmax periódicos en una proporción 3:1, y el artículo afirma que el resultado funciona 120 veces más rápido que Wan 2.2-A14B en una sola H100 para clips de 5 segundos en 720p. Esa cifra es llamativa, pero desglosarla muestra cuánta ingeniería se invirtió para cerrar la brecha entre la teoría y la práctica.

El mecanismo de atención híbrida

La arquitectura evita la penalización cuadrática reemplazando la mayoría de las operaciones softmax con una alternativa lineal con compuerta. Cada cuarto paso de atención retiene softmax, actuando como un ancla de rango completo. La idea es que la atención puramente lineal pierde expresividad porque los tokens interactúan indirectamente. Los pasos softmax periódicos restauran la interacción directa. El artículo denomina a esto Atención Híbrida Lineal-Softmax, y combina una ruta lineal con compuerta para mezcla O(N) con anclas softmax periódicas en una proporción 3:1.

Para impulsar esas representaciones actualizadas a través de la red, los Residuales de Atención por Bloques (AttnRes) enrutan resúmenes de bloques completados a capas posteriores. El artículo reporta un aumento en el rango efectivo de capas profundas de aproximadamente un 12%. El modelo fue entrenado desde cero para aprender el patrón híbrido directamente, evitando la degradación que puede ocurrir al linealizar un transformador preentrenado.

La pila de optimización

Además del backbone, Nvidia aplicó su pila de optimización Sol-Engine, que incluye fusión de kernels, almacenamiento en caché y atención dispersa. El artículo dice que esta capa adicional acelera el backbone amigable con el hardware en un factor adicional de 3.58x. Apilando ambas mejoras, el pipeline de 5 mil millones de parámetros alcanza 13.06 segundos para un clip de 5 segundos en 720p en una H100. En 720p y 60 segundos, el paso forward del DiT compilado es 3.2 veces más rápido que una línea base softmax completa equivalente, y la brecha se amplía con videos más largos.

Benchmarks y comparaciones

La calidad se mide en VBench, donde SANA-Video 2.0 obtiene una puntuación de 84.30 en 480p usando 40 pasos de muestreo, completándose en 13.2 segundos en una sola H100. Los autores dicen que esto es competitivo con DiTs de video softmax completos mucho más grandes. En 720p y 5 segundos, el pipeline completo es aproximadamente 120 veces más rápido que Wan 2.2-A14B. La brecha crece con la duración del video, lo cual es importante para la generación de formato largo.

MétricaSANA-Video 2.0 (5B)
Puntuación VBench (480p, 40 pasos)84.30
Tiempo de inferencia (480p, 40 pasos)13.2s on 1 H100
Tiempo de inferencia (720p, 5s, pipeline completo)13.06s on 1 H100
Aceleración del paso forward del DiT vs línea base softmax completa (720p/60s)3.2x
Aceleración vs Wan 2.2-A14B (720p/5s, pipeline completo)120x on 1 H100

Preguntas abiertas y compensaciones

El artículo prueba en 480p y 720p hasta 60 segundos. No explora 1080p ni secuencias más largas. La proporción de softmax del 25% fue elegida a partir de estudios proxy a menor resolución, y no está claro si la misma proporción se mantiene para resoluciones más altas o contextos más largos. Las cifras de aceleración combinan el cambio de atención con Sol-Engine, dificultando aislar la contribución de cada componente. Y la comparación con Wan 2.2, un modelo diferente con arquitectura y entrenamiento distintos, deja espacio para el debate sobre cuánto del factor 120x es generalizable más allá del hardware de Nvidia.

Estos no son defectos fatales, pero son advertencias reales para cualquiera que evalúe si este enfoque es adecuado para su propio pipeline. La ingeniería es impresionante. Las afirmaciones son grandes. Pero como con cualquier preprint, los detalles importan más que el titular.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.