Un modelo de 158 ms acaba de reescribir el manual de velocidad-calidad
El modelo de 158 ms que rompió la regla de velocidad-calidad
Celeris-1 obtiene un 75.9% en MMLU-Pro con una latencia de 158 ms, ocho veces más rápido que GPT-5 mini mientras pierde solo 2.6 puntos de precisión. El análisis examina la metodología del benchmark y lo que esta compensación entre velocidad y calidad significa para aplicaciones de IA en tiempo real.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-25 · 1 min de lectura

La frontera velocidad-calidad
La sabiduría convencional dice que no se puede tener velocidad y precisión al mismo tiempo. Los mejores modelos en los rankings de razonamiento tardan segundos. Los modelos rápidos pierden demasiada inteligencia. Celeris-1, publicado por un equipo no afiliado, pretende romper esa compensación. Sus números en MMLU-Pro: 75.9% de precisión con un tiempo de respuesta mediano de 158 ms. No es la puntuación más alta, pero a una fracción de la latencia de los líderes. El diseño centrado en la latencia ya ha dado resultados en otros lugares: Mistral Nano logró el 85% del razonamiento de su hermano mayor en dispositivos con menos de 1GB de RAM.
Contexto: GPT-5 obtiene un 81.9% en la misma prueba pero tarda 2.0 segundos. Gemini 3.5 Flash Lite lidera con un 83.0% pero necesita 1.2 segundos. Celeris-1 intercambia aproximadamente de 5 a 7 puntos de precisión por una ventaja de velocidad de 8 a 16 veces. Para aplicaciones donde cada milisegundo cuenta, esa compensación es la correcta. El modelo está diseñado para la ruta crítica: cada turno de una conversación, cada paso en un bucle de agente, cada pulsación de tecla.
Los resultados del benchmark
El equipo de Celeris ejecutó el conjunto completo de pruebas MMLU-Pro en una configuración de cadena de pensamiento de cinco disparos con puntuación estricta, estableciendo el presupuesto de razonamiento a cero para cada modelo que lo permitiera. Mercury 2 se ejecutó en su modo instantáneo. La tabla a continuación muestra la precisión y el tiempo de respuesta de los seis modelos.
| Modelo | Precisión | Tiempo de respuesta (p50) | Base de medición |
|---|---|---|---|
| Celeris-1 | 75.9% | 158 ms | reportado por servidor |
| Gemini 3.5 Flash Lite | 83.0% | 1,232 ms | e2e, colocalizado |
| GPT-5 | 81.9% | 2,046 ms | reportado por servidor |
| GPT-5 mini | 78.5% | 2,495 ms | reportado por servidor |
| Gemini 2.5 Flash | 73.0% | 2,600 ms | e2e, colocalizado |
| Inception / Mercury 2 | 63.7% | 257 ms | reportado por servidor |
Celeris-1 se sitúa en un 75.9%, detrás de GPT-5 mini por 2.6 puntos pero 16 veces más rápido. Supera a Mercury 2, el único otro modelo en la misma clase de latencia, por más de 12 puntos, respondiendo 100 milisegundos antes. Gemini 3.5 Flash Lite sigue siendo el más
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.