SevenTnewS

reconnaissance vocale

4 published articles

NLP & ML4 min read

Recherche en IA

Voice Memory : un fichier de 776 octets qui dit à la reconnaissance vocale quand ne rien faire

Un nouveau schéma d'inférence seule pour la reconnaissance vocale apprend la retenue : un correcteur figé lit un fichier mémoire par domaine et décide quand s'abstenir. La correction non contrainte casse les jetons corrects dans jusqu'à 64 % des modifications ; Voice Memory réduit ce taux à 35 % et abaisse le WER pondéré de 8,36 % à 7,52 %.

2026-08-06

IAFeatured2 min read

Intelligence artificielle

Latence de 480 ms, précision au niveau de Whisper, une recette ouverte : Canary de Nvidia redéfinit la reconnaissance vocale en temps réel

Les modèles Nemo Canary de Nvidia atteignent une précision équivalente à Whisper sur LibriSpeech et Common Voice avec une latence de 480 ms en streaming. La version open source inclut des scripts d'entraînement et des poids, ce qui en fait un concurrent rarement reproductible dans le domaine de la reconnaissance vocale en temps réel.

2026-07-26

Open SourceFeatured3 min read

IA Open Source

480 millisecondes et open source : Voxtral Realtime défie Whisper sur son propre terrain

Voxtral Realtime atteint une qualité de transcription hors ligne avec une latence inférieure à la seconde et est open source. Le modèle multilingue (13 langues) utilise un nouvel encodeur audio causal et est entraîné de bout en bout pour le flux continu, plutôt que d'être adapté à partir de systèmes hors ligne.

2026-07-17

LLM & Modèles3 min read

Intelligence artificielle

Le nouveau modèle audio de Nvidia fait cinq choses à la fois et bat les spécialistes sur leur propre terrain

Audex de Nvidia unifie la compréhension audio, la génération et le raisonnement textuel en un seul modèle, égalant ou battant les systèmes spécialisés dans les benchmarks de parole et d'audio sans sacrifier les performances textuelles.

2026-07-09