évaluation comparative
2 published articles
Recherche en IA
Le goulot d'étranglement qui freine les agents d'IA n'est pas l'exploration, mais l'évaluation
Deux nouveaux articles de Hugging Face s'attaquent au même problème central depuis des directions opposées : comment rendre les agents d'IA capables d'évaluer leurs propres actions de manière fiable. AJ-Bench construit un benchmark pour des agents juges conscients de leur environnement, tandis que HeavySkill soutient que le meilleur juge réside à l'intérieur des paramètres du modèle.
2026-07-17
Évaluation des agents
Les benchmarks en sandbox cachent comment les agents échouent vraiment, l'Université de Hong Kong vient de résoudre ce problème
UniClawBench évalue les agents proactifs sur cinq capacités fondamentales dans 400 tâches bilingues réelles, en utilisant des conteneurs Docker en direct et une évaluation en boucle fermée impliquant trois agents. Il dissocie les capacités du modèle de base des choix de framework, révélant où les agents échouent vraiment.
2026-07-13