SevenTnewS

Un modèle à 158 ms vient de réécrire le livre de jeu vitesse-qualité

Le modèle à 158 ms qui a brisé la règle vitesse-qualité

Celeris-1 obtient 75.9% sur MMLU-Pro avec une latence de 158 ms, huit fois plus rapide que GPT-5 mini tout en ne perdant que 2.6 points de précision. L'analyse examine la méthodologie du benchmark et ce que ce compromis vitesse-qualité signifie pour les applications d'IA en temps réel.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-25 · 1 min de lecture

Le modèle à 158 ms qui a brisé la règle vitesse-qualité
Sources : How we test Cel…

La frontière vitesse-qualité

La sagesse conventionnelle dit que vous ne pouvez pas avoir à la fois vitesse et précision. Les meilleurs modèles sur les classements de raisonnement prennent des secondes. Les modèles rapides perdent trop d'intelligence. Celeris-1, publié par une équipe non affiliée, vise à briser ce compromis. Ses chiffres MMLU-Pro : 75,9% de précision à un temps de réponse médian de 158 ms. Pas le meilleur score, mais à une fraction de la latence des leaders. La conception axée sur la latence a déjà donné des résultats ailleurs : Mistral Nano a atteint 85% du raisonnement de son grand frère sur des appareils avec moins de 1 Go de RAM.

Contexte : GPT-5 obtient 81,9% sur le même test mais prend 2,0 secondes. Gemini 3.5 Flash Lite mène avec 83,0% mais nécessite 1,2 seconde. Celeris-1 échange environ 5 à 7 points de précision pour un avantage de vitesse de 8 à 16x. Pour les applications où chaque milliseconde compte, ce compromis est le bon. Le modèle est conçu pour le chemin chaud : chaque tour de conversation, chaque étape dans une boucle d'agent, chaque frappe de touche.

Les résultats du benchmark

L'équipe Celeris a exécuté l'ensemble complet du test MMLU-Pro dans une configuration de chaîne de pensée à cinq exemples avec un scoring strict, en fixant le budget de raisonnement à zéro pour chaque modèle qui le permettait. Mercury 2 a fonctionné en mode instantané. Le tableau ci-dessous montre la précision et le temps de réponse pour les six modèles.

ModèlePrécisionTemps de réponse (p50)Base de chronométrage
Celeris-175,9%158 msrapporté par le serveur
Gemini 3.5 Flash Lite83,0%1 232 msde bout en bout, colocalisé
GPT-581,9%2 046 msrapporté par le serveur
GPT-5 mini78,5%2 495 msrapporté par le serveur
Gemini 2.5 Flash73,0%2 600 msde bout en bout, colocalisé
Inception / Mercury 263,7%257 msrapporté par le serveur

Celeris-1 se situe à 75,9%, derrière GPT-5 mini de 2,6 points mais 16 fois plus rapide. Il bat Mercury 2, le seul autre modèle dans la même classe de latence, de plus de 12 points tout en répondant 100 millisecondes plus tôt. Gemini 3.5 Flash Lite reste le plus

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.