SevenTnewS

Inteligencia Artificial

480 ms de latencia, precisión a nivel de Whisper, una receta abierta: Nvidia Canary redefine el ASR en tiempo real

Los modelos Nemo Canary de Nvidia alcanzan la precisión de Whisper en LibriSpeech y Common Voice mientras transmiten con una latencia de 480ms. El lanzamiento de código abierto incluye scripts de entrenamiento y pesos, convirtiéndolo en un raro contendiente reproducible en ASR en tiempo real.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-26 · 2 min de lectura

480 ms de latencia, precisión a nivel de Whisper, una receta abierta: Nvidia Canary redefine el ASR en tiempo real
Fuentes : NVIDIA Nemo Can…

Whisper ha sido el estándar para la transcripción desde 2022, pero su diseño fuera de línea implica esperar la intervención completa. Los modelos Nemo Canary de Nvidia, lanzados como código abierto esta semana, afirman igualar la precisión de Whisper mientras transmiten en tiempo real con 480 ms de latencia.

Arquitectura: por qué la transmisión en tiempo real ya no es perjudicial

Canary utiliza un transductor FastConformer con un decodificador de múltiples tokens que predice seis tokens por paso. Este diseño, común en la generación de imágenes pero raro en ASR, permite que el modelo emita unidades sub-palabra más rápido sin esperar la ventana de audio completa. Un decodificador invocable permite a los usuarios controlar el estilo de salida, la puntuación, las mayúsculas, la predicción de marcas de tiempo, sin necesidad de reentrenamiento.

La familia incluye tres tamaños: Canary-180M, Canary-1B y Canary-1B-Code. Las variantes de 1B soportan cuatro idiomas (inglés, alemán, francés, español) e incluyen un modo de cambio de código para transmisiones bilingües. El modelo de 180M sacrifica algo de precisión por velocidad, apuntando a dispositivos de borde, un patrón visto en otros modelos orientados al borde como Mistral Nano.

Evaluaciones comparativas: igualando a Whisper cara a cara

En LibriSpeech clean, Canary-1B obtiene una tasa de error de palabras del 1.9%, idéntica a Whisper medium y dentro del 0.3% de Whisper large. En Common Voice English, la brecha se reduce aún más: Canary-1B con un WER del 5.8% frente a Whisper large con 5.6%. La latencia de transmisión, medida de extremo a extremo, es de 480 milisegundos, aproximadamente el tiempo que lleva decir la palabra "hola". Whisper large necesita 3.2 segundos en la misma GPU, una brecha que destaca tendencias donde los modelos más pequeños rivalizan con los más grandes mediante refinamiento iterativo.

ModeloWER en LibriSpeech clean (%)WER en Common Voice English (%)Latencia (ms)
Canary-1B1.95.8480
Whisper medium1.96.22600
Whisper large1.65.63200

Reproducibilidad como factor diferenciador

Las cifras de precisión son impresionantes. Lo que más importa para la comunidad es que Nvidia publicó la receta de entrenamiento completa dentro del framework NeMo, incluyendo los pasos de preprocesamiento del conjunto de datos. El artículo de Whisper omitió esos detalles, lo que dificulta que la comunidad los verifique o mejore. El entrenamiento de Canary es reproducible desde cero, un punto que se alinea con los esfuerzos para simplificar la infraestructura de implementación.

"Queríamos demostrar que el ASR de última generación no requiere magia negra", afirma el PDF. "Cada archivo de configuración está en NeMo". Esa afirmación, si se verifica, reduce el trabajo inicial para los equipos que necesitan ajustes específicos de dominio, como habla médica, legal o con acento, sin comenzar desde cero.

Lo que falta

Canary cubre solo cuatro idiomas. Whisper soporta 99. El modo de cambio de código se limita al inglés emparejado con otro idioma, no es una mezcla verdaderamente multilingüe. Y la latencia de 480 ms supone una sola GPU con tamaño de lote 1; las implementaciones en producción en hardware compartido a menudo estiran esas cifras.

Aún así, la comunidad de código abierto ahora tiene una alternativa creíble de transmisión en tiempo real a Whisper, una que iguala al líder en precisión mientras reduce la latencia por un factor de seis. La siguiente prueba será si la comunidad lo adopta y lo extiende, siguiendo el camino de otros modelos de pesos abiertos que alcanzaron una adopción masiva.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.