Agents LLM
15 published articles
Raisonnement à long terme
Un nouveau cadre aide les agents IA à se souvenir de ce qu'ils ont fait il y a cinq minutes
PRO-LONG est un cadre minimal qui aide les agents LLM à conserver et à récupérer des informations sur de longues séquences d'actions. Sur le benchmark ARC-AGI-3, il a amélioré les taux de réussite moyens de 18 points de pourcentage sur les modèles de pointe tout en utilisant 4,2 à 5,8 fois moins de jetons que les harnais existants. Avec Fable 5, il a atteint 97,4 % best@2 pour un coût d'inférence total de 1 750 $.
2026-07-24
Recherche en IA
La technique bruyante qui empêche les agents LLM de s’effondrer en production
Les agents LLM actuels s’effondrent face à l’aléatoire du monde réel. NoisyAgent les expose à un bruit contrôlé pendant l’entraînement, améliorant à la fois la robustesse et les performances générales sur les benchmarks. L’article suggère que le domaine a surajusté des conditions parfaites.
2026-07-17
Recherche en IA
Votre agent IA a réussi le test par hasard. Maintenant, il existe une grille d'évaluation pour ça.
SkillCoach est un cadre de grilles d'évaluation auto-évolutives qui évalue et améliore l'utilisation des compétences agentiques en analysant les processus de sélection, de suivi, de composition et de réflexion des compétences, offrant une meilleure supervision que les métriques basées uniquement sur les résultats.
2026-07-06