Pruebas y Benchmarks
Comparaciones, pruebas de rendimiento y evaluaciones de modelos.
23 published articles
Benchmark de razonamiento financiero
Los LLM conocen las fórmulas contables. FinIndices demuestra que no saben aplicarlas
Los LLM pueden recitar fórmulas contables, pero FinIndices, un benchmark construido sobre estados financieros reales de empresas chinas, demuestra que les cuesta aplicarlas. La precisión de Gemini-3.1-Pro cayó del 70.70% al 38.22% al eliminar las pistas de fórmulas, y la generación de tablas degradó activamente el razonamiento de los modelos.
2026-08-20
IA en la Educación
Los tutores de IA sobreayudan por diseño. Un nuevo benchmark lo cuantifica
Un benchmark construido sobre 462 sesiones reales de tutoría encuentra que los tutores de IA tienden por defecto a hacer el trabajo por los estudiantes. La instrucción explícita ayuda, pero los modelos todavía tienen dificultades con la decisión de juicio central: cuándo presionar, cuándo proporcionar andamiaje, cuándo dar un paso atrás.
2026-08-10
Agentes de voz
Por qué Grok 4.1 Fast supera a modelos más inteligentes en una llamada telefónica
Las clasificaciones generales eligen los LLM equivocados para las llamadas de voz. La clasificación de 2026 de BenchLM pone la latencia primero: Grok 4.1 Fast responde en 0.54s, mientras que Claude Opus 4.6, el mejor puntuado, necesita 1.78s. Los modelos rápidos se llevan la conversación; los modelos de razonamiento se quedan en las llamadas a herramientas en segundo plano.
2026-08-05
Evaluación de IA
Los antiguos benchmarks de IA se rompieron. Esto es lo que los reemplazó.
Los benchmarks estáticos como MMLU y GSM8K están saturados y contaminados. La industria se ha movido hacia la regeneración dinámica, exámenes a nivel experto y entornos de tareas agénticas para obtener una medida real de la capacidad de la IA.
2026-08-04
Informe Especial: Evaluación de IA
Estado de la evaluación comparativa de IA en 2026: el colapso de las pruebas estáticas y los sistemas que las reemplazan
Un recorrido completo por el panorama de los benchmarks de IA en 2026: por qué se rompieron MMLU, GSM8K y HumanEval, cómo los benchmarks dinámicos y exámenes de expertos como HLE y GPQA Diamond los reemplazaron, qué revelan las pruebas de inteligencia agéntica y desigual, y cómo la preferencia humana, los jueces LLM y la observabilidad en producción completan ahora la pila de evaluación.
2026-08-03
Evaluación comparativa
Los modelos de visión AI de frontera fallan en percepción básica, según nuevo benchmark
PerceptionBench evalúa diez capacidades visuales atómicas en 3.000 preguntas. Ningún modelo de frontera superó el 60%, y puntuaciones generales similares ocultan perfiles de debilidad muy diferentes.
2026-08-03
Análisis de referencia
LiveBench se niega a quedarse quieto. Ese es el punto
LiveBench reemplaza una clave de respuestas fija por un conjunto continuamente renovado de problemas de programación, repositorios y preguntas de predicción, evitando la contaminación que socavó a MMLU y GSM8K. Es parte de un cambio más amplio hacia la evaluación dinámica junto con LiveCodeBench, ForecastBench y LLMEval-Fair.
2026-08-03
Análisis de Benchmark
5 Millones de Votos, 25 Puntos Elo: Dentro del Leaderboard de Chatbot Arena que Nadie Puede Sacudir
LMSYS Chatbot Arena clasifica modelos por preferencia humana ciega en una escala Elo, con casi cinco millones de votos que ahora agrupan los principales laboratorios en una banda de 25 puntos. Los métodos LLM-as-a-Judge que escalan este tipo de evaluación tienen sus propios sesgos documentados hacia la verbosidad y la posición.
2026-08-02
Análisis de benchmarks
En SWE-bench Verified, los mejores modelos alcanzan el 96%. En código privado de empresas, apenas superan el 23%
SWE-bench Verified hace que los modelos fronterizos parezcan estar cerca de resolver la ingeniería de software del mundo real, con puntuaciones superiores al 95%. SWE-bench Pro, ejecutado en repositorios privados de empresas, reduce esos mismos modelos al 23% o menos, exponiendo cuánto dependía la puntuación de Verified de la exposición a datos públicos.
2026-08-02
Análisis de benchmark
GPQA Diamond se construyó para ser a prueba de Google. Los modelos frontera ahora superan el 95% de todos modos
GPQA Diamond fue diseñado para que los humanos equipados con búsqueda no puedan responder de manera confiable sus preguntas de ciencias a nivel experto. Los modelos frontera ahora superan del 89% al 96%, llevando el benchmark hacia la misma saturación que retiró a MMLU.
2026-08-01
Evaluaciones
Los agentes de escritorio con IA fallan en la prueba de antes-después el 35% de las veces
DDB prueba tareas de ordenamiento y pares antes-después en 2,013 instancias. El mejor modelo alcanzó un 65.1% de coincidencia exacta en secuencias sin señuelo y 65.7% con señuelos, exponiendo una brecha en cómo los agentes verifican los cambios de estado.
2026-08-01
Análisis de Benchmark
El Último Examen de la Humanidad comenzó con un puntaje del 2.7%. Los mejores modelos aún no superan el 65%
El Último Examen de la Humanidad fue creado por CAIS y Scale AI para suceder a MMLU como el benchmark general de LLM más difícil. Dos años después, incluso el puntaje líder de Claude Opus 5 del 64.7% está muy por debajo del 90% de referencia de expertos humanos.
2026-07-31