SevenTnewS

Pruebas y Benchmarks

Comparaciones, pruebas de rendimiento y evaluaciones de modelos.

23 published articles

4 min read

Benchmark de razonamiento financiero

Los LLM conocen las fórmulas contables. FinIndices demuestra que no saben aplicarlas

Los LLM pueden recitar fórmulas contables, pero FinIndices, un benchmark construido sobre estados financieros reales de empresas chinas, demuestra que les cuesta aplicarlas. La precisión de Gemini-3.1-Pro cayó del 70.70% al 38.22% al eliminar las pistas de fórmulas, y la generación de tablas degradó activamente el razonamiento de los modelos.

2026-08-20

5 min read

IA en la Educación

Los tutores de IA sobreayudan por diseño. Un nuevo benchmark lo cuantifica

Un benchmark construido sobre 462 sesiones reales de tutoría encuentra que los tutores de IA tienden por defecto a hacer el trabajo por los estudiantes. La instrucción explícita ayuda, pero los modelos todavía tienen dificultades con la decisión de juicio central: cuándo presionar, cuándo proporcionar andamiaje, cuándo dar un paso atrás.

2026-08-10

5 min read

Agentes de voz

Por qué Grok 4.1 Fast supera a modelos más inteligentes en una llamada telefónica

Las clasificaciones generales eligen los LLM equivocados para las llamadas de voz. La clasificación de 2026 de BenchLM pone la latencia primero: Grok 4.1 Fast responde en 0.54s, mientras que Claude Opus 4.6, el mejor puntuado, necesita 1.78s. Los modelos rápidos se llevan la conversación; los modelos de razonamiento se quedan en las llamadas a herramientas en segundo plano.

2026-08-05

Featured5 min read

Evaluación de IA

Los antiguos benchmarks de IA se rompieron. Esto es lo que los reemplazó.

Los benchmarks estáticos como MMLU y GSM8K están saturados y contaminados. La industria se ha movido hacia la regeneración dinámica, exámenes a nivel experto y entornos de tareas agénticas para obtener una medida real de la capacidad de la IA.

2026-08-04

Featured8 min read

Informe Especial: Evaluación de IA

Estado de la evaluación comparativa de IA en 2026: el colapso de las pruebas estáticas y los sistemas que las reemplazan

Un recorrido completo por el panorama de los benchmarks de IA en 2026: por qué se rompieron MMLU, GSM8K y HumanEval, cómo los benchmarks dinámicos y exámenes de expertos como HLE y GPQA Diamond los reemplazaron, qué revelan las pruebas de inteligencia agéntica y desigual, y cómo la preferencia humana, los jueces LLM y la observabilidad en producción completan ahora la pila de evaluación.

2026-08-03

Featured3 min read

Evaluación comparativa

Los modelos de visión AI de frontera fallan en percepción básica, según nuevo benchmark

PerceptionBench evalúa diez capacidades visuales atómicas en 3.000 preguntas. Ningún modelo de frontera superó el 60%, y puntuaciones generales similares ocultan perfiles de debilidad muy diferentes.

2026-08-03

Featured2 min read

Análisis de referencia

LiveBench se niega a quedarse quieto. Ese es el punto

LiveBench reemplaza una clave de respuestas fija por un conjunto continuamente renovado de problemas de programación, repositorios y preguntas de predicción, evitando la contaminación que socavó a MMLU y GSM8K. Es parte de un cambio más amplio hacia la evaluación dinámica junto con LiveCodeBench, ForecastBench y LLMEval-Fair.

2026-08-03

Featured2 min read

Análisis de Benchmark

5 Millones de Votos, 25 Puntos Elo: Dentro del Leaderboard de Chatbot Arena que Nadie Puede Sacudir

LMSYS Chatbot Arena clasifica modelos por preferencia humana ciega en una escala Elo, con casi cinco millones de votos que ahora agrupan los principales laboratorios en una banda de 25 puntos. Los métodos LLM-as-a-Judge que escalan este tipo de evaluación tienen sus propios sesgos documentados hacia la verbosidad y la posición.

2026-08-02

Featured2 min read

Análisis de benchmarks

En SWE-bench Verified, los mejores modelos alcanzan el 96%. En código privado de empresas, apenas superan el 23%

SWE-bench Verified hace que los modelos fronterizos parezcan estar cerca de resolver la ingeniería de software del mundo real, con puntuaciones superiores al 95%. SWE-bench Pro, ejecutado en repositorios privados de empresas, reduce esos mismos modelos al 23% o menos, exponiendo cuánto dependía la puntuación de Verified de la exposición a datos públicos.

2026-08-02

Featured2 min read

Análisis de benchmark

GPQA Diamond se construyó para ser a prueba de Google. Los modelos frontera ahora superan el 95% de todos modos

GPQA Diamond fue diseñado para que los humanos equipados con búsqueda no puedan responder de manera confiable sus preguntas de ciencias a nivel experto. Los modelos frontera ahora superan del 89% al 96%, llevando el benchmark hacia la misma saturación que retiró a MMLU.

2026-08-01

3 min read

Evaluaciones

Los agentes de escritorio con IA fallan en la prueba de antes-después el 35% de las veces

DDB prueba tareas de ordenamiento y pares antes-después en 2,013 instancias. El mejor modelo alcanzó un 65.1% de coincidencia exacta en secuencias sin señuelo y 65.7% con señuelos, exponiendo una brecha en cómo los agentes verifican los cambios de estado.

2026-08-01

Featured2 min read

Análisis de Benchmark

El Último Examen de la Humanidad comenzó con un puntaje del 2.7%. Los mejores modelos aún no superan el 65%

El Último Examen de la Humanidad fue creado por CAIS y Scale AI para suceder a MMLU como el benchmark general de LLM más difícil. Dos años después, incluso el puntaje líder de Claude Opus 5 del 64.7% está muy por debajo del 90% de referencia de expertos humanos.

2026-07-31

← PreviousPage 1 / 2 · 23 articlesNext →