SevenTnewS

Evaluación de agentes

¿Tu agente de IA sigue fallando? Podría ser el arnés, no el cerebro

PawBench, un benchmark de código abierto del equipo de AgentScope, evalúa sistemáticamente modelos y arneses de agentes juntos. Los resultados muestran que el diseño del arnés puede variar las puntuaciones en más de 11 puntos para modelos más pequeños, exponiendo un punto ciego en la forma en que se evalúan actualmente los agentes de IA.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-22 · 4 min de lectura

¿Tu agente de IA sigue fallando? Podría ser el arnés, no el cerebro

Cuando un agente de IA falla al completar una tarea de múltiples pasos, el instinto natural es culpar al modelo. Pero un nuevo benchmark del equipo de AgentScope sugiere que el verdadero problema podría estar en el andamiaje que lo rodea. the-1115-problem-when-ai-writing-challenges-become-a-test-of-editorial-integrity

PawBench, lanzado hoy como parte del ecosistema OpenJudge, mide cómo los modelos de lenguaje grandes y los arneses que los orquestan trabajan juntos como una unidad. Ejecuta 9 modelos en 3 arneses en 150 tareas seleccionadas, produciendo 4,050 celdas de prueba que buscan desentrañar dónde comienzan realmente las fallas de los agentes.

El modelo versus el arnés

La mayoría de los benchmarks evalúan modelos de forma aislada, alimentándolos con indicaciones y puntuando las salidas. Así no es como se despliegan los agentes en el mundo real. En la práctica, el modelo establece el límite superior de lo que un agente podría hacer, y el arnés decide si esa capacidad se traduce de manera confiable en la ejecución exitosa de la tarea. El arnés de agente CUGA de código abierto de IBM se…

PawBench formaliza esto como una función: Rendimiento del agente es igual a f(Modelo, Arnés). El lanzamiento v1.0 incluye tareas extraídas de seis benchmarks de agentes de alta calidad: claweval, qwenclawbench, pinchbench, qwenpawbench, skillsbench y wildclawbench. Cada tarea se etiqueta en cinco dimensiones: escenario de aplicación, capacidad atómica, complejidad, modalidad de entrada y entorno de ejecución.

Todas las tareas se ejecutan dentro de entornos aislados de Docker con trazabilidad completa, lo que permite conectar las puntuaciones del benchmark con el comportamiento de ejecución real. La puntuación final combina calificadores automatizados, comprobaciones de reglas y sub-afirmaciones, con LLM como juez para salidas más semánticas. Ifbench: el nuevo benchmark que evalúa el seguimiento…

Las brechas del arnés son reales y medibles

El hallazgo principal en las 4,050 celdas es que el diseño del arnés puede introducir una variación significativa en el rendimiento. Dos extremos ilustran el punto. Claude Opus 4.6 muestra una dispersión de solo 2.3 puntos en diferentes arneses. El modelo Qwen3.6-35B-A3B se desplaza 11.5 puntos completos dependiendo únicamente del arnés.

El análisis de trazas apunta a tres fuentes comunes de fallo: el modelo pierde la pista del directorio de trabajo actual, juzga mal si un archivo fue realmente escrito, o elige la primera herramienta incorrecta cuando la lista de herramientas es demasiado grande. Los modelos más grandes parecen mejores para compensar la falta de contexto; infieren rutas, filtran listas de herramientas grandes y verifican si los artefactos fueron realmente producidos. Los modelos más pequeños son más frágiles.

La conclusión no es que los modelos pequeños sean débiles. Es que dependen más de la estructura del arnés. Un arnés bien diseñado puede reducir la brecha considerablemente.

Las habilidades y la búsqueda web revelan nuevos patrones de fallo

PawBench incluye dos categorías de tareas que exponen dinámicas de fallo distintas. La primera son las tareas relacionadas con habilidades, que simulan desarrolladores que almacenan habilidades específicas del proyecto directamente dentro de su espacio de trabajo. En los tres arneses, las tareas de habilidad fueron consistentemente más difíciles que el uso de herramientas, la planificación o el razonamiento. MiniMax lanza el modelo M2.7 con sólidas habilidades en…

Dos problemas destacan: el arnés debe mostrar las habilidades claramente (nombre, alcance, uso) y el modelo debe decidir de manera confiable invocarlas. Si alguno de los lados falla, el modelo evita la habilidad e intenta resolver la tarea con razonamiento general, a menudo fallando.

Las tareas de búsqueda web prueban la capacidad del modelo para buscar en la web, obtener contenido y realizar investigaciones más profundas. PawBench recrea la experiencia predeterminada del desarrollador, clonando una versión fija, agregando la clave LLM y ejecutando, sin asumir que cada clave de API de búsqueda está preconfigurada. Los resultados mostraron que algunos modelos simplemente ignoraban las salidas rotas de las herramientas, mientras que otros caían en bucles al intentar volver a ejecutar herramientas fallidas. Los modelos fuertes pueden sortear herramientas faltantes; los modelos más débiles dependen del arnés para mantener la ruta de búsqueda estable y explícita.

Cuatro principios para un mejor diseño de arnés

Basándose en los resultados del benchmark, el equipo de AgentScope propone cuatro principios para arneses efectivos. Primero, ser explícito: los modelos no pueden actuar sobre información que no tienen. Dígale al modelo dónde está, qué recursos existen y qué resultados se esperan. Nunca asuma que el modelo inferirá estos detalles.

Segundo, mantener las herramientas suficientes y eficientes. Proporcione las herramientas que importan, asegúrese de que las herramientas críticas sean utilizables por defecto, pero evite abrumar al modelo con opciones innecesarias.

Tercero, verificar, no confiar. No confíe únicamente en lo que dice el modelo. Verifique artefactos, archivos, salidas y resultados de ejecución en lugar de solo confiar en el autoinforme del agente.

Cuarto, incorporar capacidad de recuperación. Muchos fallos son recuperables si el marco proporciona comentarios útiles y oportunidades de reintento. Proporcione información crítica como el estado actual, los requisitos faltantes y los artefactos existentes, y dé al modelo una oportunidad estructurada para recuperarse. La nueva plataforma de Microsoft brinda a los…

El resultado más importante de PawBench no es qué modelo ocupa el primer lugar. Es que el rendimiento del agente no es una propiedad solo del modelo. PawBench v1.0 es completamente de código abierto, y el equipo agradece nuevos arneses, modelos, tareas y contribuciones de la comunidad.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.