Evaluaciones de IA
19 published articles
IA de código abierto: Alibaba abre el nivel Max
Qwen 3.8-Max: el modelo más potente de Alibaba ya se puede descargar gratis
Alibaba está publicando como código abierto Qwen 3.8-Max, su modelo más capaz hasta la fecha: un MoE de 2,4 billones de parámetros que supera a GPT-5.6 Sol en SWE-bench Pro, PaperBench e IFBench. Analizamos las salvedades de los benchmarks y lo que significa un modelo insignia abierto con 95 mil millones de parámetros activos para los desarrolladores.
2026-08-16
IA de código abierto
Qwen3.8-Max superó a 458 equipos humanos en 24 horas, trabajando solo
Qwen3.8-Max superó a 458 de 526 equipos humanos en un concurso de 24 horas mientras trabajaba solo, y Alibaba publicará sus pesos como código abierto la próxima semana. Por ahora, todas las cifras son autodeclaradas, lo cual es exactamente por lo que las afirmaciones de autonomía merecen ser examinadas.
2026-08-03
Informe Especial: Evaluación de IA
Estado de la evaluación comparativa de IA en 2026: el colapso de las pruebas estáticas y los sistemas que las reemplazan
Un recorrido completo por el panorama de los benchmarks de IA en 2026: por qué se rompieron MMLU, GSM8K y HumanEval, cómo los benchmarks dinámicos y exámenes de expertos como HLE y GPQA Diamond los reemplazaron, qué revelan las pruebas de inteligencia agéntica y desigual, y cómo la preferencia humana, los jueces LLM y la observabilidad en producción completan ahora la pila de evaluación.
2026-08-03
Análisis de referencia
LiveBench se niega a quedarse quieto. Ese es el punto
LiveBench reemplaza una clave de respuestas fija por un conjunto continuamente renovado de problemas de programación, repositorios y preguntas de predicción, evitando la contaminación que socavó a MMLU y GSM8K. Es parte de un cambio más amplio hacia la evaluación dinámica junto con LiveCodeBench, ForecastBench y LLMEval-Fair.
2026-08-03
Análisis de Benchmark
5 Millones de Votos, 25 Puntos Elo: Dentro del Leaderboard de Chatbot Arena que Nadie Puede Sacudir
LMSYS Chatbot Arena clasifica modelos por preferencia humana ciega en una escala Elo, con casi cinco millones de votos que ahora agrupan los principales laboratorios en una banda de 25 puntos. Los métodos LLM-as-a-Judge que escalan este tipo de evaluación tienen sus propios sesgos documentados hacia la verbosidad y la posición.
2026-08-02
Análisis de benchmarks
En SWE-bench Verified, los mejores modelos alcanzan el 96%. En código privado de empresas, apenas superan el 23%
SWE-bench Verified hace que los modelos fronterizos parezcan estar cerca de resolver la ingeniería de software del mundo real, con puntuaciones superiores al 95%. SWE-bench Pro, ejecutado en repositorios privados de empresas, reduce esos mismos modelos al 23% o menos, exponiendo cuánto dependía la puntuación de Verified de la exposición a datos públicos.
2026-08-02
Análisis de benchmark
GPQA Diamond se construyó para ser a prueba de Google. Los modelos frontera ahora superan el 95% de todos modos
GPQA Diamond fue diseñado para que los humanos equipados con búsqueda no puedan responder de manera confiable sus preguntas de ciencias a nivel experto. Los modelos frontera ahora superan del 89% al 96%, llevando el benchmark hacia la misma saturación que retiró a MMLU.
2026-08-01
Análisis de Benchmark
El Último Examen de la Humanidad comenzó con un puntaje del 2.7%. Los mejores modelos aún no superan el 65%
El Último Examen de la Humanidad fue creado por CAIS y Scale AI para suceder a MMLU como el benchmark general de LLM más difícil. Dos años después, incluso el puntaje líder de Claude Opus 5 del 64.7% está muy por debajo del 90% de referencia de expertos humanos.
2026-07-31
Análisis de Benchmark
HumanEval Medía si la IA Podía Programar. Nunca Preguntó si el Código Era Trabajo Real
Los 164 problemas de finalización de funciones de HumanEval se convirtieron en la prueba estándar para la capacidad de codificación de la IA, pero la memorización y su alcance limitado dejaron una amplia brecha entre aprobar el benchmark y manejar una base de código real, una brecha que SWE-bench fue construido para exponer.
2026-07-30
Análisis de benchmarks
Lo que tres benchmarks de IA se equivocaron sobre el rendimiento real
Los benchmarks de IA como MMLU son el estándar para comparar modelos, pero tres casos recientes muestran que omiten dimensiones críticas. El Nemotron-4 de Nvidia carece de verificación independiente, Celeris-1 intercambia precisión por velocidad, y el mejor agente de IA para vigilancia de patógenos solo completa la mitad de las tareas. La evidencia apunta a la necesidad de marcos de evaluación que midan lo que realmente importa en la práctica.
2026-07-29
Análisis de benchmark
Se suponía que GSM8K evaluaría matemáticas de primaria. Hasta el 42% de sus preguntas no lo hacen
GSM8K se convirtió en una prueba estándar de razonamiento aritmético en LLMs, pero auditorías han encontrado tasas de error en su conjunto de preguntas de hasta el 42%, socavando lo que sus puntuaciones realmente miden.
2026-07-29
Análisis de benchmarks
MMLU dominó la evaluación de IA durante años. Luego los modelos empezaron a acertar la clave de respuestas
MMLU definió una generación de evaluación comparativa de IA, pero la contaminación de datos de entrenamiento y una clave de respuestas defectuosa han empujado a los laboratorios de frontera hacia sucesores dinámicos como HLE y GPQA Diamond.
2026-07-28