SevenTnewS

Un modelo de 158 ms acaba de reescribir el manual de velocidad-calidad

El modelo de 158 ms que rompió la regla de velocidad-calidad

Celeris-1 obtiene un 75.9% en MMLU-Pro con una latencia de 158 ms, ocho veces más rápido que GPT-5 mini mientras pierde solo 2.6 puntos de precisión. El análisis examina la metodología del benchmark y lo que esta compensación entre velocidad y calidad significa para aplicaciones de IA en tiempo real.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-25 · 1 min de lectura

El modelo de 158 ms que rompió la regla de velocidad-calidad
Fuentes : How we test Cel…

La frontera velocidad-calidad

La sabiduría convencional dice que no se puede tener velocidad y precisión al mismo tiempo. Los mejores modelos en los rankings de razonamiento tardan segundos. Los modelos rápidos pierden demasiada inteligencia. Celeris-1, publicado por un equipo no afiliado, pretende romper esa compensación. Sus números en MMLU-Pro: 75.9% de precisión con un tiempo de respuesta mediano de 158 ms. No es la puntuación más alta, pero a una fracción de la latencia de los líderes. El diseño centrado en la latencia ya ha dado resultados en otros lugares: Mistral Nano logró el 85% del razonamiento de su hermano mayor en dispositivos con menos de 1GB de RAM.

Contexto: GPT-5 obtiene un 81.9% en la misma prueba pero tarda 2.0 segundos. Gemini 3.5 Flash Lite lidera con un 83.0% pero necesita 1.2 segundos. Celeris-1 intercambia aproximadamente de 5 a 7 puntos de precisión por una ventaja de velocidad de 8 a 16 veces. Para aplicaciones donde cada milisegundo cuenta, esa compensación es la correcta. El modelo está diseñado para la ruta crítica: cada turno de una conversación, cada paso en un bucle de agente, cada pulsación de tecla.

Los resultados del benchmark

El equipo de Celeris ejecutó el conjunto completo de pruebas MMLU-Pro en una configuración de cadena de pensamiento de cinco disparos con puntuación estricta, estableciendo el presupuesto de razonamiento a cero para cada modelo que lo permitiera. Mercury 2 se ejecutó en su modo instantáneo. La tabla a continuación muestra la precisión y el tiempo de respuesta de los seis modelos.

ModeloPrecisiónTiempo de respuesta (p50)Base de medición
Celeris-175.9%158 msreportado por servidor
Gemini 3.5 Flash Lite83.0%1,232 mse2e, colocalizado
GPT-581.9%2,046 msreportado por servidor
GPT-5 mini78.5%2,495 msreportado por servidor
Gemini 2.5 Flash73.0%2,600 mse2e, colocalizado
Inception / Mercury 263.7%257 msreportado por servidor

Celeris-1 se sitúa en un 75.9%, detrás de GPT-5 mini por 2.6 puntos pero 16 veces más rápido. Supera a Mercury 2, el único otro modelo en la misma clase de latencia, por más de 12 puntos, respondiendo 100 milisegundos antes. Gemini 3.5 Flash Lite sigue siendo el más

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.