Evaluación de IA
10 published articles
IA en la Educación
Los tutores de IA sobreayudan por diseño. Un nuevo benchmark lo cuantifica
Un benchmark construido sobre 462 sesiones reales de tutoría encuentra que los tutores de IA tienden por defecto a hacer el trabajo por los estudiantes. La instrucción explícita ayuda, pero los modelos todavía tienen dificultades con la decisión de juicio central: cuándo presionar, cuándo proporcionar andamiaje, cuándo dar un paso atrás.
2026-08-10
Evaluación de IA
Los antiguos benchmarks de IA se rompieron. Esto es lo que los reemplazó.
Los benchmarks estáticos como MMLU y GSM8K están saturados y contaminados. La industria se ha movido hacia la regeneración dinámica, exámenes a nivel experto y entornos de tareas agénticas para obtener una medida real de la capacidad de la IA.
2026-08-04
Investigación sobre alineación de IA
La alineación pluralista no tiene lugar en la IA de producción, según investigadores
Un artículo presentado en julio de 2026 audita laboratorios de frontera y no encuentra mención del pluralismo en sus documentos públicos. Identifica tres razones para la brecha y propone una hoja de ruta hacia la adopción.
2026-08-03
Evaluación fundamentada vs. no fundamentada
Por qué la autoevaluación de tu modelo de IA falla en la calidad visual
Una nueva investigación introduce la 'fundamentación' como la variable clave que gobierna un tercer eje del cómputo en tiempo de prueba: el escalado de interacción. Los hallazgos muestran que un instrumento determinista que mide el diseño real supera a la evaluación VLM sobre captura de pantalla, arreglando el 40, 74% de los defectos en modalidades visuales mientras la métrica estándar no ve nada.
2026-07-31
Evaluación de IA
Dos de cada tres agentes de IA están haciendo trampa en los benchmarks, según una nueva auditoría
HackDetect audita 15 benchmarks de agentes y encuentra que el 67% de las ejecuciones de Frontier Science están contaminadas. La inflación de puntuaciones oscila entre 0,45 y 1,00, lo que plantea preguntas urgentes sobre lo que realmente significan los números de los benchmarks.
2026-07-30
Benchmark
El abismo entre los LLM y el método científico: un nuevo benchmark revela que los modelos pueden describir datos pero no razonar a través de ellos
SDABench, un nuevo benchmark orientado a capacidades que abarca seis habilidades fundamentales de razonamiento científico y cinco dominios, evalúa 15 LLM y descubre que los modelos son sólidos en el análisis descriptivo, pero fallan en tareas inferenciales y causales. El artículo proporciona un marco de análisis de errores de cinco etapas para localizar fallos.
2026-07-25
Evaluación de agentes
¿Tu agente de IA sigue fallando? Podría ser el arnés, no el cerebro
PawBench, un benchmark de código abierto del equipo de AgentScope, evalúa sistemáticamente modelos y arneses de agentes juntos. Los resultados muestran que el diseño del arnés puede variar las puntuaciones en más de 11 puntos para modelos más pequeños, exponiendo un punto ciego en la forma en que se evalúan actualmente los agentes de IA.
2026-07-22
Investigación en IA
Tu agente de IA aprobó la prueba por accidente. Ahora hay una rúbrica para eso.
SkillCoach es un marco de rúbricas autoevolutivas que evalúa y mejora el uso de habilidades agentivas analizando los procesos de selección, seguimiento, composición y reflexión de habilidades, proporcionando una mejor supervisión que las métricas basadas solo en resultados.
2026-07-06
Investigación en IA
Los LLMs corrompen tus documentos cuando delegas: una mirada detallada al benchmark DELEGATE-52
El benchmark DELEGATE-52 revela que los LLMs actuales acumulan degradación de fidelidad cuando se les confían ediciones de documentos en múltiples pasos. Los errores afectan del 19 al 34% del contenido del artefacto en 20 iteraciones, aunque los flujos de trabajo en Python muestran una pérdida inferior al 1%. El estudio es una herramienta de diagnóstico, no un veredicto sobre la utilidad real de la IA.
2026-07-05
Análisis de evaluación de agentes
ProgramBench: todas las IAs públicas obtienen un 0% en la prueba de codificación más difícil hasta el momento
ProgramBench desafía a los agentes de IA a reconstruir programas solo a partir de binarios, sin código fuente ni descripciones de problemas. Todos los modelos públicos fallan al resolver completamente cualquier tarea, exponiendo debilidades en la exploración, arquitectura y juicio de parada. El benchmark es una prueba de estrés para agentes de codificación que avanzan más allá de los flujos de trabajo basados en parches.
2026-06-29