reconocimiento de voz
4 published articles
Investigación en IA
Voice Memory: un archivo de 776 bytes que le dice al reconocimiento de voz cuándo no hacer nada
Un nuevo esquema de solo inferencia para el reconocimiento de voz aprende a contenerse: un corrector congelado lee un archivo de memoria por dominio y decide cuándo abstenerse. La corrección sin restricciones rompe tokens correctos en hasta el 64 % de las ediciones; Voice Memory lo reduce al 35 % y baja el WER ponderado del 8,36 % al 7,52 %.
2026-08-06
Inteligencia Artificial
480 ms de latencia, precisión a nivel de Whisper, una receta abierta: Nvidia Canary redefine el ASR en tiempo real
Los modelos Nemo Canary de Nvidia alcanzan la precisión de Whisper en LibriSpeech y Common Voice mientras transmiten con una latencia de 480ms. El lanzamiento de código abierto incluye scripts de entrenamiento y pesos, convirtiéndolo en un raro contendiente reproducible en ASR en tiempo real.
2026-07-26
IA de código abierto
480 milisegundos y código abierto: Voxtral Realtime desafía a Whisper en su propio terreno
Voxtral Realtime iguala la calidad de transcripción fuera de línea con una latencia inferior al segundo y es de código abierto. El modelo de 13 idiomas utiliza un codificador de audio causal novedoso y se entrena de extremo a extremo para streaming en lugar de adaptarse de sistemas offline.
2026-07-17
Inteligencia Artificial
El nuevo modelo de audio de Nvidia hace cinco trabajos a la vez y supera a los especialistas en su propio juego
Audex de Nvidia unifica la comprensión de audio, la generación y el razonamiento textual en un solo modelo, igualando o superando a los sistemas especializados en pruebas de referencia de voz y audio sin sacrificar el rendimiento textual.
2026-07-09