SevenTnewS

Corpus Messier

957,253 registros no pueden ocultar la brecha: los agentes de IA avanzan en programación pero se estancan donde las empresas los necesitan

El corpus Messier, con 957,253 registros en 30 puntos de referencia, revela un progreso desigual de los agentes de IA: la llamada a funciones está saturada, la programación mejora más rápido y los flujos de trabajo empresariales se quedan atrás. También muestra que la agregación estricta de aprobación total puede ocultar ganancias y alterar los rankings de las tablas de clasificación.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-02 · 5 min de lectura

957,253 registros no pueden ocultar la brecha: los agentes de IA avanzan en programación pero se estancan donde las empresas los necesitan

Durante años, cualquiera que intentara comparar agentes de IA en diferentes puntos de referencia se enfrentaba a un desorden de tareas incompatibles, andamios personalizados, verificadores únicos y reglas de puntuación diseñadas de forma aislada. Un solo agente podría triunfar en una tabla de clasificación y fracasar en otra sin forma alguna de saber si la diferencia era capacidad real o simplemente diseño de evaluación. Esa fragmentación hacía casi imposible responder la única pregunta que importa: ¿dónde están mejorando realmente los agentes?

El corpus Messier, publicado en arXiv el 28 de julio de 2026, intenta responder esa pregunta a gran escala. Consolida 957,253 registros que abarcan 30 puntos de referencia, 714 agentes, 11,891 tareas y 74,205 verificadores. Cada registro está estandarizado por modelo, andamio, entorno, tarea, verificador y regla de agregación, y anotado con códigos ocupacionales y de industria. El resultado es la primera mirada de alta resolución entre puntos de referencia de lo que los agentes de IA pueden y no pueden hacer, y el panorama no es uniformemente brillante.

El problema de la fragmentación

El panorama de evaluación existente está notoriamente balcanizado. Diferentes grupos de investigación crean entornos personalizados, definen sus propios criterios de éxito y ejecutan agentes en andamios incompatibles. Incluso cuando dos puntos de referencia prueban habilidades similares, los resultados rara vez son comparables porque el arnés, el verificador o la regla de agregación desplazan la puntuación de maneras que no tienen nada que ver con el agente en sí. Un punto de referencia reciente, OpenRTAG, organizó problemas de calidad en datos de grafos en una taxonomía 3×3 y encontró que diferentes clases de familias de modelos (GNN tradicionales vs. GNN mejoradas con LLM vs. modelos fundacionales de grafos) muestran diferentes patrones de sensibilidad, otro recordatorio de que las elecciones de diseño de los puntos de referencia influyen profundamente en los resultados. Mientras tanto, la propia auditoría de Mistral de su OCR 4 reveló que los puntos de referencia estándar pueden penalizar resultados que son factualmente correctos pero formateados fuera del esquema esperado, creando ruido que oscurece las ganancias reales. Y el estudio MosaicLeaks mostró que los agentes de investigación profunda pueden filtrar datos privados a través de consultas web incluso cuando ninguna consulta individual es incriminatoria, una preocupación de capacidad que ningún punto de referencia estándar mide actualmente.

Frontera desigual

El corpus Messier confirma que el progreso del campo es dramáticamente desigual en las categorías de puntos de referencia. El artículo identifica tres zonas distintas:

  • Llamada a funciones, saturada. El rendimiento de los agentes en puntos de referencia de llamada a funciones se ha estancado, lo que sugiere que los modelos actuales han aprendido la mecánica de invocación de herramientas tan bien como las pruebas existentes pueden medir.
  • Programación, en auge. Los puntos de referencia de codificación ven la mejora más rápida, impulsada por avances en generación de código y edición a nivel de repositorio. Esto se alinea con un estudio separado de julio de 2024 del equipo HSCodeComp de Alibaba, que encontró que los mejores agentes aún alcanzan solo un 49.4% de precisión en clasificación arancelaria frente al 95% de los expertos humanos, pero ese techo es estructural, no simplemente una cuestión de cómputo. Las tareas de programación que requieren razonamiento sobre reglas del mundo real siguen siendo difíciles.
  • Flujos de trabajo empresariales, rezagados. Las categorías de puntos de referencia que simulan procesos empresariales de múltiples pasos, cadenas de aprobación y uso de herramientas específicas de dominio siguen siendo las más desafiantes. Este hallazgo coincide con la estrategia más amplia de Alibaba, que se centra en encerrar a las empresas en una pila de IA integrada en lugar de ganar puntos de referencia de modelos individuales, y con la evaluación de Gartner de que los agentes de codificación de IA empresarial como Cursor lideran en integridad de visión, pero que la estadística de adopción del 70% en Fortune 500 aún deja fuera cuántas de esas implementaciones son pilotos a escala limitada.

La trampa de la aprobación total

Quizás el hallazgo más importante del artículo de Messier es metodológico. Cuando una tarea involucra múltiples verificadores, por ejemplo, verificar que un agente recuperó el documento correcto, extrajo el campo correcto y lo formateó según un esquema, muchos puntos de referencia utilizan una regla estricta de agregación de aprobación total: el agente recibe crédito solo si pasa cada verificador. El equipo de Messier realizó ejercicios de recalificación contrafactual y encontró que esta regla de aprobación total subestima sistemáticamente el progreso, especialmente en tareas más difíciles con múltiples verificadores, y puede alterar artificialmente las clasificaciones de los agentes. Un agente que pasa nueve de cada diez verificaciones se ve idéntico a uno que pasa cero. Esto se hace eco de hallazgos del estudio anterior PawBench, que mostró que el diseño del arnés puede alterar las puntuaciones en más de 11 puntos para modelos más pequeños, exponiendo un punto ciego en cómo el campo evalúa los pipelines de agentes.

Escalas de capacidad que se mantienen

Si las puntuaciones de diferentes puntos de referencia no se pueden comparar directamente, ¿podemos al menos derivar una escala de capacidad general? El equipo de Messier hizo exactamente eso. A partir de los registros estandarizados, calcularon escalas de capacidad y las validaron contra el Índice de Capacidad de Evaluación de Epoch. La alineación es fuerte: una correlación de rango de Spearman de 0.81. Esto sugiere que el corpus captura algo real sobre la capacidad relativa de los agentes, incluso en diversos entornos de evaluación. Las escalas también pueden especializarse por dominio, ocupación, espacio de acción o tipo de verificador, lo que las hace útiles para auditorías específicas, por ejemplo, preguntar si los agentes son mejores en ingeniería de software que en razonamiento legal, o si los modelos pequeños están cerrando la brecha en ciertas categorías de uso de herramientas.

Lo que Messier significa para la próxima generación de puntos de referencia

El corpus Messier no es en sí mismo un punto de referencia. Es una infraestructura de metaevaluación, una forma de auditar los puntos de referencia existentes en busca de sesgos, zonas muertas y artefactos de puntuación. El artículo lo presenta como "una infraestructura fundamental y reutilizable para la escalabilidad de la capacidad de los agentes, la auditoría de puntos de referencia y el análisis detallado de fallos de evaluación". Su publicación llega junto con un creciente reconocimiento de que el campo necesita estándares compartidos. El reciente artículo ¿Miden los puntos de referencia de agentes la capacidad? argumentó que la validez del protocolo, es decir, si el protocolo de evaluación realmente prueba la capacidad prevista, requiere evidencia explícita, y que sin ella, las puntuaciones corren el riesgo de carecer de significado. Messier proporciona exactamente la base de evidencia entre puntos de referencia necesaria para hacer posibles esas comprobaciones de validez del protocolo. Para los compradores empresariales que intentan decidir qué agente implementar, o para los investigadores que intentan decidir dónde invertir, Messier ofrece algo que el campo ha estado perdiendo: un mapa único y estandarizado de la capacidad de los agentes de IA, con virtudes y defectos.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.