Tests & Benchmarks4 min read
Évaluation des agents
Votre agent IA échoue constamment ? Ce pourrait être le harnais, pas le cerveau
PawBench, un benchmark open-source de l'équipe AgentScope, évalue systématiquement les modèles et les harnais d'agents ensemble. Les résultats montrent que la conception du harnais peut faire varier les scores de plus de 11 points pour les modèles plus petits, exposant un angle mort dans la manière dont les agents IA sont actuellement jugés.
2026-07-22