Agents vocaux
Pourquoi Grok 4.1 Fast bat des modèles plus intelligents au téléphone
Les classements généraux choisissent les mauvais LLM pour les appels vocaux. Le classement 2026 de BenchLM place la latence en premier : Grok 4.1 Fast répond en 0.54s tandis que Claude Opus 4.6, le meilleur scoreur, a besoin de 1.78s. Les modèles rapides mènent la conversation ; les modèles de raisonnement restent sur les appels d'outils en arrière-plan.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-05 · 5 min de lecture

Les tableaux de classement et les appels téléphoniques pénalisent des qualités différentes. Le modèle qui trône en tête d'un classement général est souvent le dernier que l'on souhaite dans l'oreille d'un appelant, car la métrique qui décide si une conversation survit est le temps de première réponse, et c'est ce chiffre que la plupart des classements enterrent ou omettent.
Le rapport 2026 de BenchLM sur les agents vocaux démontre ce point avec des données d'exécution en direct. Son tableau de bord de vitesse montre que Claude Opus 4.6, le meilleur scoreur global avec 86, met 1.78 seconde à produire une première réponse. Grok 4.1 Fast, avec 68, répond en 0.54 seconde. Sur un appel en direct, l'un de ces modèles fonctionne et l'autre est perçu comme une ligne coupée.
Pourquoi les classements échouent sur un appel
Environ 70 % du délai ressenti par un appelant provient de l'inférence du LLM, ce qui fait du choix du modèle le levier de latence le plus important dont dispose un développeur. Une réponse qui commence en moins de 800 millisecondes semble naturelle. À environ 1.5 seconde, elle donne une impression de lenteur. Au-delà de trois secondes, les appelants supposent que la ligne est morte et se mettent à parler par-dessus l'agent.
Cette contrainte disqualifie discrètement la plupart des modèles de raisonnement. Leur phase de réflexion porte le temps de première réponse entre 10 et 150 secondes sur le tableau de bord de BenchLM, et aucun score de benchmark ne survit à une pause de 30 secondes dans un appel téléphonique. Le seuil pratique est d'environ 1.5 seconde : tout ce qui est plus lent est un travailleur d'arrière-plan, pas un interlocuteur.
Les modèles les plus rapides qui franchissent la barre
Voici les modèles à plus faible latence qui franchissent encore une barre de qualité utilisable, d'après les données d'exécution en direct de BenchLM :
| Modèle | Première réponse | Vitesse de sortie | Type | Score global |
|---|---|---|---|---|
| Grok 4.1 Fast | 0.54s | 138 t/s | Non-raisonnement | 68 |
| Claude Opus 4.5 | 1.01s | 46 t/s | Non-raisonnement | 75 |
| GPT-4.1 | 1.02s | 108 t/s | Non-raisonnement | 56 |
| GLM-4.7 | 1.10s | 82 t/s | Raisonnement | 68 |
| Gemini 3 Flash | 1.19s | 159 t/s | Non-raisonnement | 55 |
| Claude Sonnet 4.6 | 1.48s | 44 t/s | Non-raisonnement | 80 |
| GLM-5 | 1.64s | 74 t/s | Non-raisonnement | 66 |
| Claude Opus 4.6 | 1.78s | 40 t/s | Non-raisonnement | 86 |
| MiMo-V2-Flash | 2.14s | 129 t/s | Raisonnement | 59 |
| Kimi K2.5 | 2.38s | 45 t/s | Non-raisonnement | 63 |
Le temps de première réponse est mesuré de bout en bout, y compris la phase de réflexion complète pour les modèles de raisonnement. La vitesse de sortie est le nombre médian de tokens par seconde. Les minuscules modèles sub-1B peuvent afficher une latence plus faible, mais tombent sous la barre de qualité pour tout ce qui dépasse une simple IVR.
Ce que les données désignent réellement
Grok 4.1 Fast est la vedette : une demi-seconde avant la première réponse tout en franchissant un score global dans le milieu de la soixantaine, la combinaison rare dont la voix a réellement besoin. Les déclinaisons Gemini Flash l'emportent sur le plan du débit brut, et la vitesse de sortie compte une fois que le modèle commence à parler, car elle détermine la vitesse à laquelle l'audio peut être diffusé. Gemini 3 Flash affiche le débit le plus rapide du tableau, à 159 tokens par seconde.
GPT-4.1 conjugue environ une seconde de latence avec un contexte de 1M de tokens et un appel de fonction fiable. Claude Sonnet 4.6 est le choix à faire lorsque vous êtes prêt à échanger quelques centaines de millisecondes contre un suivi d'instructions nettement meilleur sur un persona complexe ; son score global de 80 est le meilleur du tableau parmi les modèles sous le plafond de 1.5 seconde. Claude Opus 4.6, le meilleur scoreur du tableau avec 86, se trouve du mauvais côté de cette ligne.
Les capacités comptent toujours, mais pas de la façon dont les classements les évaluent. Un agent vocal vit dans un prompt système qui définit le persona, les garde-fous et les limites de longueur de sortie, et les modèles qui s'écartent des instructions cessent peu à peu de ressembler à votre produit et se mettent à lire des listes et des URL à voix haute. La discipline de longueur en est l'illustration la plus nette : à l'écran, une réponse trop longue est un défilement ; sur un appel, ce sont dix secondes pendant lesquelles l'appelant attend de pouvoir interrompre.
Remarquez ce qui manque dans le tableau : les modèles de raisonnement phares qui dominent le classement général. C'est tout l'intérêt de l'exercice. Les modèles phares ont leur place en arrière-plan, pas dans l'oreille de l'appelant.
Le schéma du cerveau divisé
Les agents vocaux en production en 2026 utilisent rarement un seul modèle. Ils en utilisent deux : un modèle rapide mène la conversation, et un modèle de raisonnement est réservé aux questions réellement difficiles, généralement derrière un appel d'outil. Les équipes le découvrent généralement à leurs dépens, après avoir déployé un seul modèle phare et avoir vu le taux d'abandon des appels grimper en flèche à chaque tour de parole qui déclenche une longue réflexion.
Où s'inscrit le choix du modèle
Le LLM est l'un des trois composants, et la plateforme dans laquelle vous l'intégrez détermine la part de ce choix que vous conservez. L'API Realtime d'OpenAI est un pipeline natif de speech-to-speech, la voie la plus rapide vers une démo fonctionnelle, mais elle vous verrouille sur les modèles OpenAI : pas de Grok 4.1 Fast, pas de modèle open-weight auto-hébergé. Les couches d'orchestration comme Retell et Vapi vous fournissent la tuyauterie et vous laissent choisir le cerveau. ElevenLabs, que le rapport qualifie de standard de production en 2026, ajoute lui-même la couche vocale, avec un faible délai avant la première audio qui s'ajoute à la latence de votre LLM, des voix stables sur de longues sessions et une offre gratuite pour le prototypage.
Choisir selon le cas d'usage
- Agent téléphonique orienté client : prenez le modèle le plus rapide qui franchit votre barre de suivi d'instructions, c'est-à-dire Grok 4.1 Fast ou une déclinaison Gemini Flash. Un écart de deux points au benchmark est invisible pour un appelant ; une pause d'une seconde ne l'est pas.
- Assistant vocal interne : tolérant à la latence, il peut miser sur Claude Sonnet 4.6 ou une déclinaison de raisonnement légère pour obtenir un meilleur usage des outils et un meilleur suivi des instructions. Jusqu'à environ deux secondes de première réponse est supportable lorsque les utilisateurs savent qu'ils parlent à une machine.
- Voix avec un travail backend complexe : le schéma du cerveau divisé, avec un audio de remplissage qui couvre le temps de réflexion.
- Multilingue : vérifiez le classement par langue pour le cerveau, puis confirmez que la couche TTS couvre les mêmes langues. Un modèle qui maîtrise une langue que votre couche vocale ne peut pas parler est l'un des échecs de production les plus courants.
La règle de BenchLM est courte : choisissez le modèle le plus rapide qui franchit votre barre de suivi d'instructions et d'utilisation d'outils, et ignorez le classement général. Sur les données actuelles, cela signifie un modèle rapide dans la conversation, un modèle de raisonnement sur les appels d'outils en arrière-plan, des tokens diffusés en continu directement dans la couche TTS, et un budget de latence couvrant toute la chaîne vocale. Faites ces quatre choses correctement et un modèle de milieu de gamme semble humain. Faites-les de travers et le meilleur modèle du monde semble cassé.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.