ASR
2 published articles
Recherche en IA
Voice Memory : un fichier de 776 octets qui dit à la reconnaissance vocale quand ne rien faire
Un nouveau schéma d'inférence seule pour la reconnaissance vocale apprend la retenue : un correcteur figé lit un fichier mémoire par domaine et décide quand s'abstenir. La correction non contrainte casse les jetons corrects dans jusqu'à 64 % des modifications ; Voice Memory réduit ce taux à 35 % et abaisse le WER pondéré de 8,36 % à 7,52 %.
2026-08-06
Intelligence artificielle
Latence de 480 ms, précision au niveau de Whisper, une recette ouverte : Canary de Nvidia redéfinit la reconnaissance vocale en temps réel
Les modèles Nemo Canary de Nvidia atteignent une précision équivalente à Whisper sur LibriSpeech et Common Voice avec une latence de 480 ms en streaming. La version open source inclut des scripts d'entraînement et des poids, ce qui en fait un concurrent rarement reproductible dans le domaine de la reconnaissance vocale en temps réel.
2026-07-26