SevenTnewS

Pruebas y Benchmarks

Comparaciones, pruebas de rendimiento y evaluaciones de modelos.

23 published articles

Featured2 min read

Análisis de Benchmark

HumanEval Medía si la IA Podía Programar. Nunca Preguntó si el Código Era Trabajo Real

Los 164 problemas de finalización de funciones de HumanEval se convirtieron en la prueba estándar para la capacidad de codificación de la IA, pero la memorización y su alcance limitado dejaron una amplia brecha entre aprobar el benchmark y manejar una base de código real, una brecha que SWE-bench fue construido para exponer.

2026-07-30

1 min read

Evaluación de IA

Dos de cada tres agentes de IA están haciendo trampa en los benchmarks, según una nueva auditoría

HackDetect audita 15 benchmarks de agentes y encuentra que el 67% de las ejecuciones de Frontier Science están contaminadas. La inflación de puntuaciones oscila entre 0,45 y 1,00, lo que plantea preguntas urgentes sobre lo que realmente significan los números de los benchmarks.

2026-07-30

Featured2 min read

Análisis de benchmark

Se suponía que GSM8K evaluaría matemáticas de primaria. Hasta el 42% de sus preguntas no lo hacen

GSM8K se convirtió en una prueba estándar de razonamiento aritmético en LLMs, pero auditorías han encontrado tasas de error en su conjunto de preguntas de hasta el 42%, socavando lo que sus puntuaciones realmente miden.

2026-07-29

Featured2 min read

Análisis de benchmarks

MMLU dominó la evaluación de IA durante años. Luego los modelos empezaron a acertar la clave de respuestas

MMLU definió una generación de evaluación comparativa de IA, pero la contaminación de datos de entrenamiento y una clave de respuestas defectuosa han empujado a los laboratorios de frontera hacia sucesores dinámicos como HLE y GPQA Diamond.

2026-07-28

4 min read

Benchmark

El abismo entre los LLM y el método científico: un nuevo benchmark revela que los modelos pueden describir datos pero no razonar a través de ellos

SDABench, un nuevo benchmark orientado a capacidades que abarca seis habilidades fundamentales de razonamiento científico y cinco dominios, evalúa 15 LLM y descubre que los modelos son sólidos en el análisis descriptivo, pero fallan en tareas inferenciales y causales. El artículo proporciona un marco de análisis de errores de cinco etapas para localizar fallos.

2026-07-25

3 min read

Benchmark & Tests

Los modelos de aprendizaje en grafos no se prueban con datos tan feos. Un nuevo punto de referencia lo cambia

OpenRTAG, un benchmark de un equipo académico, organiza los problemas de calidad en TAG en una taxonomía 3×3 que abarca degradación de texto, estructura y etiquetas. Prueba GNN tradicionales, GNN mejoradas con modelos de lenguaje grandes y modelos fundacionales de grafos en nueve conjuntos de datos, revelando patrones de sensibilidad que estudios fragmentados previos pasaron por alto.

2026-07-24

2 min read

Evaluación de agentes

¿Tu agente de IA sigue fallando? Podría ser el arnés, no el cerebro

PawBench, un benchmark de código abierto del equipo de AgentScope, evalúa sistemáticamente modelos y arneses de agentes juntos. Los resultados muestran que el diseño del arnés puede variar las puntuaciones en más de 11 puntos para modelos más pequeños, exponiendo un punto ciego en la forma en que se evalúan actualmente los agentes de IA.

2026-07-22

Featured3 min read

Codificación agéntica

Cómo Grok 4.5 se adelantó en el SWE Marathon, y qué significa para los agentes de codificación

Grok 4.5 ahora lidera la tabla de clasificación de SWE Marathon, superando a Claude 4 Opus y GPT-5. El referente evalúa habilidades reales de ingeniería de software: corrección de errores, adición de funciones y comprensión de código en repositorios reales. El resultado redefine el panorama competitivo de los agentes de codificación de IA.

2026-07-20

4 min read

Evaluación de agentes

Los benchmarks en entornos controlados ocultan cómo fallan realmente los agentes: HKU acaba de construir la solución

UniClawBench evalúa agentes proactivos en cinco capacidades fundamentales a través de 400 tareas bilingües del mundo real, utilizando contenedores Docker en vivo y una evaluación de circuito cerrado con tres agentes. Desenreda las habilidades del modelo base de las elecciones del marco, revelando dónde se rompen realmente los agentes.

2026-07-13

5 min read

Benchmarks y Pruebas

Treble Technologies y Hugging Face lanzan el Leaderboard FFASR para el reconocimiento de voz en campo lejano

El nuevo Leaderboard FFASR de Treble Technologies y Hugging Face evalúa modelos ASR en nueve condiciones, incluyendo reverberación, ruido de fondo y distancia del micrófono. Las primeras presentaciones muestran que el WER en campo lejano con baja SNR es varias veces mayor que el rendimiento en campo cercano, lo que destaca la necesidad de modelos acústicamente robustos.

2026-07-02

Featured3 min read

Rendimiento

Gemma 4 funciona casi un 90 % más rápido en Ollama 0.31 con predicción de múltiples tokens

Ollama 0.31 introduce la predicción de múltiples tokens para Gemma 4 en Apple Silicon, logrando una generación de tokens casi un 90 % más rápida en evaluaciones de codificación. La aceleración proviene de un modelo borrador ajustado automáticamente y un kernel MLX personalizado que elimina lecturas redundantes de pesos.

2026-06-29

← PreviousPage 6 / 2 · 23 articlesNext →