SevenTnewS

Carrera de modelos

El ranking de LiveBench es un estudio de rendimientos decrecientes

GPT-5.6 Sol se lleva la corona general en LiveBench con un promedio de 82.4, pero Claude Fable 5 lo sigue por solo 1.6 puntos a casi el triple de costo. La verdadera historia es cómo el grupo inferior se ha reducido.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-22 · 4 min de lectura

El ranking de LiveBench es un estudio de rendimientos decrecientes
Fuentes : LiveBench

LiveBench publicó su última actualización, y la forma del ranking es reveladora. La cima está dominada por dos laboratorios, GPT-5.6 Sol de OpenAI y Claude Fable 5 de Anthropic, separados por un error de redondeo en la puntuación compuesta, pero a años luz en precio.

GPT-5.6 Sol Max Effort obtiene un promedio general de 82.4. Claude Fable 5 Max Effort se sitúa en 80.8. Esa brecha de 1.6 puntos cuesta casi 2.7 veces más por token si usas la configuración superior de Anthropic. GPT-5.6 Terra, la variante más barata de la misma familia, alcanza 79.8, más cercano al Claude de la cima que la brecha entre Sol y Fable. Los rendimientos marginales de gastar más son mínimos y se comprimen rápidamente.

Qué hace bien cada modelo

El promedio general oculta divergencias reales a nivel de categoría. Claude Fable 5 domina en escritura con 90.7, empatado con GPT-5.5 Thinking y Claude 4.8 Opus Thinking, y supera por 3 puntos a GPT-5.6 Sol con 87.7. Si tu carga principal es prosa, Claude Fable es la opción clara, y la variante GPT más cercana (5.5 Thinking) cuesta $0.53 por token frente a los $1.57 de Fable.

Gráfico: Puntuaciones compuestas de los mejores modelos · Puntuaciones por categoría: GPT vs Claude · Curva precio-rendimiento
Los tres mejores modelos en la puntuación compuesta de LiveBench se agrupan dentro de 2.6 puntos, según el artículo. Divergencia a nivel de categoría entre los dos mejores modelos, según datos de LiveBench reportados en el artículo. Puntuaciones compuestas en niveles de precio, que muestran rendimientos decrecientes cerca de la cima según los datos del artículo.

El razonamiento es una historia más difícil. GPT-5.6 Sol alcanza 96.2 en benchmarks de razonamiento, ligeramente por delante de Claude Fable con 96.0 y GPT-5.5 Thinking con 95.9. Todos están dentro del margen de ruido. La verdadera caída ocurre después de los cuatro primeros: Gemini 3.1 Pro Preview obtiene 91.0 y Claude 4.7 Opus Thinking llega a 92.9. Más allá, los números bajan rápidamente a los 80.

Las matemáticas siguen siendo un punto fuerte de la línea GPT. GPT-5.6 Sol lidera con 91.7, seguido de GPT-5.6 Terra con 90.6 y GPT-5.5 Thinking con 89.7. Claude Fable 5 iguala la puntuación de GPT-5.5 con 89.7, pero Claude 4.8 Opus Thinking también se queda en 89.7, idéntico sobre el papel. La variación es lo suficientemente pequeña como para que una sola semilla defectuosa pueda invertir el orden.

Los resultados de codificación muestran una mayor dispersión. GPT-5.6 Sol obtiene 83.9 en codificación. Claude Fable 5 alcanza 86.0. Varias variantes de la línea Claude superan a GPT en codificación: Claude Sonnet 5 con 80.7 y Claude 4.6 Opus Thinking con 78.2, pero ninguna iguala a las dos primeras. El ranking de codificación es la única categoría donde un modelo fuera del duopolio, Gemini 3.1 Pro Preview con 76.5, se acerca al siguiente escalón.

La zona económica: modelos abiertos y externos

Por debajo de 75 en general, el campo se llena de opciones interesantes. DeepSeek V4 Pro, de pesos abiertos, obtiene un promedio de 71.6 a $0.05 por token, aproximadamente 30 veces más barato que Claude Fable 5 por aproximadamente el 89% del rendimiento compuesto. Kimi K3, también abierto, alcanza 78.5 a $0.379, lo que lo convierte en la mejor relación calidad-precio en la banda de los 70 altos. Qwen 3.7 Max con 73.1 y $0.182 es competitivo con GPT-5.4 Nano con 69.6 y $0.091 en el mismo rango de precio.

Grok 4.5 con 76.3 y $0.128 es un recién llegado que vale la pena observar: supera a varias variantes más caras de Claude y GPT en el compuesto mientras cobra una fracción del costo. Su debilidad es la escritura (68.6) y la codificación (70.8), pero el razonamiento con 90.8 es genuinamente de primer nivel. Si xAI itera sobre las debilidades, esta línea podría escalar rápidamente en el ranking.

La contracción en la cima

La característica más sorprendente de esta actualización es cómo los cuatro mejores modelos se agrupan dentro de 2.2 puntos entre sí, mientras que todo lo demás cae suavemente. Esta no es la curva de progreso exponencial que a los laboratorios de IA les gusta proyectar. Es una larga cola de ganancias incrementales a un costo exponencial. La diferencia entre GPT-5.6 Sol y GPT-5.4 Nano es de 12.8 puntos en el compuesto, pero la diferencia de precio es de aproximadamente 6.5 veces. Pagar más te da más, pero la curva se está aplanando.

Para cualquiera que implemente a escala, el punto óptimo probablemente esté en el rango de $0.10 a $0.20, donde viven modelos como Grok 4.5, DeepSeek V4 Pro y Qwen 3.7 Max. Son lo suficientemente buenos para la mayoría de las cargas de producción, y la diferencia de costo frente a la cima financia muchas ejecuciones de evaluación antes de alcanzar el punto de equilibrio en las ganancias de precisión.

Los datos de LiveBench no dicen qué modelo es el mejor, eso depende de tu tarea y tu presupuesto. Sí dicen que la brecha entre lo mejor y lo muy bueno se está reduciendo, y que lo mejor se está volviendo caro más rápido de lo que mejora.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.