Pruebas y Benchmarks4 min read
Evaluación de agentes
¿Tu agente de IA sigue fallando? Podría ser el arnés, no el cerebro
PawBench, un benchmark de código abierto del equipo de AgentScope, evalúa sistemáticamente modelos y arneses de agentes juntos. Los resultados muestran que el diseño del arnés puede variar las puntuaciones en más de 11 puntos para modelos más pequeños, exponiendo un punto ciego en la forma en que se evalúan actualmente los agentes de IA.
2026-07-22