Un modèle à 158 ms vient de réécrire le livre de jeu vitesse-qualité
Le modèle à 158 ms qui a brisé la règle vitesse-qualité
Celeris-1 obtient 75.9% sur MMLU-Pro avec une latence de 158 ms, huit fois plus rapide que GPT-5 mini tout en ne perdant que 2.6 points de précision. L'analyse examine la méthodologie du benchmark et ce que ce compromis vitesse-qualité signifie pour les applications d'IA en temps réel.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-25 · 1 min de lecture

La frontière vitesse-qualité
La sagesse conventionnelle dit que vous ne pouvez pas avoir à la fois vitesse et précision. Les meilleurs modèles sur les classements de raisonnement prennent des secondes. Les modèles rapides perdent trop d'intelligence. Celeris-1, publié par une équipe non affiliée, vise à briser ce compromis. Ses chiffres MMLU-Pro : 75,9% de précision à un temps de réponse médian de 158 ms. Pas le meilleur score, mais à une fraction de la latence des leaders. La conception axée sur la latence a déjà donné des résultats ailleurs : Mistral Nano a atteint 85% du raisonnement de son grand frère sur des appareils avec moins de 1 Go de RAM.
Contexte : GPT-5 obtient 81,9% sur le même test mais prend 2,0 secondes. Gemini 3.5 Flash Lite mène avec 83,0% mais nécessite 1,2 seconde. Celeris-1 échange environ 5 à 7 points de précision pour un avantage de vitesse de 8 à 16x. Pour les applications où chaque milliseconde compte, ce compromis est le bon. Le modèle est conçu pour le chemin chaud : chaque tour de conversation, chaque étape dans une boucle d'agent, chaque frappe de touche.
Les résultats du benchmark
L'équipe Celeris a exécuté l'ensemble complet du test MMLU-Pro dans une configuration de chaîne de pensée à cinq exemples avec un scoring strict, en fixant le budget de raisonnement à zéro pour chaque modèle qui le permettait. Mercury 2 a fonctionné en mode instantané. Le tableau ci-dessous montre la précision et le temps de réponse pour les six modèles.
| Modèle | Précision | Temps de réponse (p50) | Base de chronométrage |
|---|---|---|---|
| Celeris-1 | 75,9% | 158 ms | rapporté par le serveur |
| Gemini 3.5 Flash Lite | 83,0% | 1 232 ms | de bout en bout, colocalisé |
| GPT-5 | 81,9% | 2 046 ms | rapporté par le serveur |
| GPT-5 mini | 78,5% | 2 495 ms | rapporté par le serveur |
| Gemini 2.5 Flash | 73,0% | 2 600 ms | de bout en bout, colocalisé |
| Inception / Mercury 2 | 63,7% | 257 ms | rapporté par le serveur |
Celeris-1 se situe à 75,9%, derrière GPT-5 mini de 2,6 points mais 16 fois plus rapide. Il bat Mercury 2, le seul autre modèle dans la même classe de latence, de plus de 12 points tout en répondant 100 millisecondes plus tôt. Gemini 3.5 Flash Lite reste le plus
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.