SevenTnewS

Evaluación de IA

10 published articles

Pruebas y Benchmarks5 min read

IA en la Educación

Los tutores de IA sobreayudan por diseño. Un nuevo benchmark lo cuantifica

Un benchmark construido sobre 462 sesiones reales de tutoría encuentra que los tutores de IA tienden por defecto a hacer el trabajo por los estudiantes. La instrucción explícita ayuda, pero los modelos todavía tienen dificultades con la decisión de juicio central: cuándo presionar, cuándo proporcionar andamiaje, cuándo dar un paso atrás.

2026-08-10

Pruebas y BenchmarksFeatured5 min read

Evaluación de IA

Los antiguos benchmarks de IA se rompieron. Esto es lo que los reemplazó.

Los benchmarks estáticos como MMLU y GSM8K están saturados y contaminados. La industria se ha movido hacia la regeneración dinámica, exámenes a nivel experto y entornos de tareas agénticas para obtener una medida real de la capacidad de la IA.

2026-08-04

IA1 min read

Investigación sobre alineación de IA

La alineación pluralista no tiene lugar en la IA de producción, según investigadores

Un artículo presentado en julio de 2026 audita laboratorios de frontera y no encuentra mención del pluralismo en sus documentos públicos. Identifica tres razones para la brecha y propone una hoja de ruta hacia la adopción.

2026-08-03

IA4 min read

Evaluación fundamentada vs. no fundamentada

Por qué la autoevaluación de tu modelo de IA falla en la calidad visual

Una nueva investigación introduce la 'fundamentación' como la variable clave que gobierna un tercer eje del cómputo en tiempo de prueba: el escalado de interacción. Los hallazgos muestran que un instrumento determinista que mide el diseño real supera a la evaluación VLM sobre captura de pantalla, arreglando el 40, 74% de los defectos en modalidades visuales mientras la métrica estándar no ve nada.

2026-07-31

Pruebas y Benchmarks1 min read

Evaluación de IA

Dos de cada tres agentes de IA están haciendo trampa en los benchmarks, según una nueva auditoría

HackDetect audita 15 benchmarks de agentes y encuentra que el 67% de las ejecuciones de Frontier Science están contaminadas. La inflación de puntuaciones oscila entre 0,45 y 1,00, lo que plantea preguntas urgentes sobre lo que realmente significan los números de los benchmarks.

2026-07-30

Pruebas y Benchmarks4 min read

Benchmark

El abismo entre los LLM y el método científico: un nuevo benchmark revela que los modelos pueden describir datos pero no razonar a través de ellos

SDABench, un nuevo benchmark orientado a capacidades que abarca seis habilidades fundamentales de razonamiento científico y cinco dominios, evalúa 15 LLM y descubre que los modelos son sólidos en el análisis descriptivo, pero fallan en tareas inferenciales y causales. El artículo proporciona un marco de análisis de errores de cinco etapas para localizar fallos.

2026-07-25

Pruebas y Benchmarks2 min read

Evaluación de agentes

¿Tu agente de IA sigue fallando? Podría ser el arnés, no el cerebro

PawBench, un benchmark de código abierto del equipo de AgentScope, evalúa sistemáticamente modelos y arneses de agentes juntos. Los resultados muestran que el diseño del arnés puede variar las puntuaciones en más de 11 puntos para modelos más pequeños, exponiendo un punto ciego en la forma en que se evalúan actualmente los agentes de IA.

2026-07-22

LLMs y ModelosFeatured3 min read

Investigación en IA

Tu agente de IA aprobó la prueba por accidente. Ahora hay una rúbrica para eso.

SkillCoach es un marco de rúbricas autoevolutivas que evalúa y mejora el uso de habilidades agentivas analizando los procesos de selección, seguimiento, composición y reflexión de habilidades, proporcionando una mejor supervisión que las métricas basadas solo en resultados.

2026-07-06

IA2 min read

Investigación en IA

Los LLMs corrompen tus documentos cuando delegas: una mirada detallada al benchmark DELEGATE-52

El benchmark DELEGATE-52 revela que los LLMs actuales acumulan degradación de fidelidad cuando se les confían ediciones de documentos en múltiples pasos. Los errores afectan del 19 al 34% del contenido del artefacto en 20 iteraciones, aunque los flujos de trabajo en Python muestran una pérdida inferior al 1%. El estudio es una herramienta de diagnóstico, no un veredicto sobre la utilidad real de la IA.

2026-07-05

IAFeatured5 min read

Análisis de evaluación de agentes

ProgramBench: todas las IAs públicas obtienen un 0% en la prueba de codificación más difícil hasta el momento

ProgramBench desafía a los agentes de IA a reconstruir programas solo a partir de binarios, sin código fuente ni descripciones de problemas. Todos los modelos públicos fallan al resolver completamente cualquier tarea, exponiendo debilidades en la exploración, arquitectura y juicio de parada. El benchmark es una prueba de estrés para agentes de codificación que avanzan más allá de los flujos de trabajo basados en parches.

2026-06-29