vérification
3 published articles
Agents LLM
La taxe de régression : pourquoi charger les agents LLM de compétences peut se retourner contre vous
Une nouvelle étude montre que l'ajout de compétences procédurales aux agents LLM n'aide pas toujours, cela peut introduire des régressions, où des tâches auparavant résolues sans compétences échouent après l'ajout de compétences. La recherche identifie trois causes et affirme que la fiabilité dépend davantage de l'ancrage et de la vérification que de la compétence elle-même.
2026-08-03
Intelligence Artificielle
Pourquoi la mémoire de travail de votre agent d'IA échoue dans les tâches longues
Un article académique présente StructAgent, un cadre centré sur l'état qui restructure la manière dont les agents numériques suivent la progression des tâches. Il atteint des résultats de pointe sur OSWorld-Verified avec des modèles ouverts, et se généralise à Minecraft. Les travaux identifient que l'historique brut des interactions est un goulot d'étranglement pour les tâches à long horizon, et proposent un état structuré associé à un flux de travail soutenu par un vérificateur comme solution.
2026-07-22
Recherche en IA
Le goulot d'étranglement qui freine les agents d'IA n'est pas l'exploration, mais l'évaluation
Deux nouveaux articles de Hugging Face s'attaquent au même problème central depuis des directions opposées : comment rendre les agents d'IA capables d'évaluer leurs propres actions de manière fiable. AJ-Bench construit un benchmark pour des agents juges conscients de leur environnement, tandis que HeavySkill soutient que le meilleur juge réside à l'intérieur des paramètres du modèle.
2026-07-17