reconnaissance vocale
4 published articles
Recherche en IA
Voice Memory : un fichier de 776 octets qui dit à la reconnaissance vocale quand ne rien faire
Un nouveau schéma d'inférence seule pour la reconnaissance vocale apprend la retenue : un correcteur figé lit un fichier mémoire par domaine et décide quand s'abstenir. La correction non contrainte casse les jetons corrects dans jusqu'à 64 % des modifications ; Voice Memory réduit ce taux à 35 % et abaisse le WER pondéré de 8,36 % à 7,52 %.
2026-08-06
Intelligence artificielle
Latence de 480 ms, précision au niveau de Whisper, une recette ouverte : Canary de Nvidia redéfinit la reconnaissance vocale en temps réel
Les modèles Nemo Canary de Nvidia atteignent une précision équivalente à Whisper sur LibriSpeech et Common Voice avec une latence de 480 ms en streaming. La version open source inclut des scripts d'entraînement et des poids, ce qui en fait un concurrent rarement reproductible dans le domaine de la reconnaissance vocale en temps réel.
2026-07-26
IA Open Source
480 millisecondes et open source : Voxtral Realtime défie Whisper sur son propre terrain
Voxtral Realtime atteint une qualité de transcription hors ligne avec une latence inférieure à la seconde et est open source. Le modèle multilingue (13 langues) utilise un nouvel encodeur audio causal et est entraîné de bout en bout pour le flux continu, plutôt que d'être adapté à partir de systèmes hors ligne.
2026-07-17
Intelligence artificielle
Le nouveau modèle audio de Nvidia fait cinq choses à la fois et bat les spécialistes sur leur propre terrain
Audex de Nvidia unifie la compréhension audio, la génération et le raisonnement textuel en un seul modèle, égalant ou battant les systèmes spécialisés dans les benchmarks de parole et d'audio sans sacrifier les performances textuelles.
2026-07-09