SevenTnewS

Intelligence artificielle

Latence de 480 ms, précision au niveau de Whisper, une recette ouverte : Canary de Nvidia redéfinit la reconnaissance vocale en temps réel

Les modèles Nemo Canary de Nvidia atteignent une précision équivalente à Whisper sur LibriSpeech et Common Voice avec une latence de 480 ms en streaming. La version open source inclut des scripts d'entraînement et des poids, ce qui en fait un concurrent rarement reproductible dans le domaine de la reconnaissance vocale en temps réel.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-26 · 2 min de lecture

Latence de 480 ms, précision au niveau de Whisper, une recette ouverte : Canary de Nvidia redéfinit la reconnaissance vocale en temps réel
Sources : NVIDIA Nemo Can…

Whisper est la référence en matière de transcription depuis 2022, mais sa conception hors ligne implique d'attendre l'énoncé complet. Les modèles Nemo Canary de Nvidia, publiés en open source cette semaine, prétendent égaler la précision de Whisper tout en diffusant en continu avec un délai de 480 ms.

Architecture : pourquoi le streaming ne pénalise plus

Canary utilise un transducteur FastConformer avec un décodeur multi-tokens qui prédit six tokens par étape. Cette conception, courante dans la génération d'images mais rare en reconnaissance vocale, permet au modèle d'émettre des unités sous-mots plus rapidement sans attendre la fenêtre audio complète. Un décodeur pilotable par requête permet aux utilisateurs de contrôler le style de sortie, la ponctuation, la capitalisation et la prédiction des horodatages, sans réentraînement.

La famille comprend trois tailles : Canary-180M, Canary-1B et Canary-1B-Code. Les variantes 1B prennent en charge quatre langues (anglais, allemand, français, espagnol) et incluent un mode de changement de code pour les flux bilingues. Le modèle 180M échange une partie de la précision contre la vitesse, ciblant les appareils périphériques, un schéma observé dans d'autres modèles destinés aux périphériques comme Mistral Nano.

Benchmarks : Canary face à Whisper

Sur LibriSpeech clean, Canary-1B obtient un taux d'erreur de mot de 1,9 %, identique à Whisper medium et à moins de 0,3 % de Whisper large. Sur Common Voice anglais, l'écart se réduit encore : Canary-1B à 5,8 % de WER contre 5,6 % pour Whisper large. La latence de streaming, mesurée de bout en bout, est de 480 millisecondes, soit à peu près le temps de dire le mot « hello ». Whisper large nécessite 3,2 secondes sur le même GPU, un écart qui met en évidence les tendances où les petits modèles rivalisent avec les plus grands grâce à un raffinement itératif.

ModèleWER LibriSpeech clean (%)WER Common Voice English (%)Latence (ms)
Canary-1B1.95.8480
Whisper medium1.96.22600
Whisper large1.65.63200

La reproductibilité comme facteur différenciant

Les chiffres de précision sont impressionnants. Ce qui compte davantage pour la communauté, c'est que Nvidia a publié la recette complète d'entraînement dans le framework NeMo, y compris les étapes de prétraitement des ensembles de données. L'article de Whisper avait omis ces détails, rendant difficile pour la communauté de vérifier ou d'améliorer. L'entraînement de Canary est reproductible à partir de zéro, un point qui s'aligne avec les efforts visant à simplifier l'infrastructure de déploiement.

« Nous voulions montrer que la reconnaissance vocale de pointe ne nécessite pas de magie noire », indique le PDF. « Tous les fichiers de configuration sont dans NeMo. » Cette affirmation, si elle est vérifiée, réduit le travail initial pour les équipes qui ont besoin d'un réglage fin spécifique au domaine, médical, juridique ou pour la parole accentuée, sans repartir de zéro.

Ce qui manque

Canary ne couvre que quatre langues. Whisper en prend en charge 99. Le mode de changement de code est limité à l'anglais associé à une autre langue, pas à un véritable mélange multilingue. Et la latence de 480 ms suppose un seul GPU avec une taille de lot de 1 ; les déploiements en production sur du matériel partagé étirent souvent ces chiffres.

Néanmoins, la communauté open source dispose désormais d'une alternative crédible en streaming à Whisper, qui égale le leader en précision tout en réduisant la latence d'un facteur six. Le prochain défi sera de voir si la communauté l'adopte et l'étend, suivant la voie d'autres modèles open-weight qui ont atteint une adoption massive.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.