Agents LLM
13 published articles
Fisher-R1 | Test d'hypothèses
Les agents IA produisent des statistiques sans faille et tirent pourtant de mauvaises conclusions
Les agents qui automatisent les tests d'hypothèses peuvent exécuter des analyses sans faille tout en parvenant à de mauvaises conclusions, car la plupart des benchmarks ne vérifient jamais si la valeur p est valide. Un benchmark de 425 tâches quantifie cet écart, et un modèle open-weight entraîné par RL en comble une partie.
2026-08-19
Agents IA
PsychoAgent a doté les agents d'IA d'une mémoire émotionnelle. Les évaluateurs n'ont trouvé aucun avantage
PsychoAgent donne aux agents LLM une mémoire affective distincte, de sorte que les traces conflictuelles et chargées d'émotion peuvent l'emporter sur celles simplement thématiques. Dans trois scénarios de conflit, il a récupéré plus de mémoires critiques pour le conflit que les deux références (0.933 contre 0.500 et 0.667), mais cinq évaluateurs en aveugle n'ont trouvé aucun avantage qualitatif significatif.
2026-08-19
Recherche IA
Fini le copier-coller des compétences : la correction sans évaluation de SkillZip pour les agents gonflés
Les agents auto-évolutifs ajoutent des correctifs jusqu'à ce que la même règle apparaisse dans plusieurs branches. SkillZip compresse leurs compétences sans rollouts d'évaluation, en trouvant la plus courte explication structurelle fidèle. Les modes one-shot et Zip-on-Write, et ce que le résumé laisse sans preuve.
2026-08-15
Agents IA
Traiter les SOP comme du code : un nouveau runtime à pagination par pile sépare les agents forts des faibles
De nouvelles recherches de Hong Kong et de Chine continentale démontrent que la compilation des SOP en pseudo-code exécutable et leur exécution sur une machine virtuelle à pagination par pile séparent clairement les agents capables des agents fragiles. Le travail donne une règle de déploiement précise : compiler d'abord, paginer seulement après une vérification de discipline au niveau du modèle.
2026-08-04
Agents LLM
La taxe de régression : pourquoi charger les agents LLM de compétences peut se retourner contre vous
Une nouvelle étude montre que l'ajout de compétences procédurales aux agents LLM n'aide pas toujours, cela peut introduire des régressions, où des tâches auparavant résolues sans compétences échouent après l'ajout de compétences. La recherche identifie trois causes et affirme que la fiabilité dépend davantage de l'ancrage et de la vérification que de la compétence elle-même.
2026-08-03
Intelligence Artificielle
La génération d'idées de recherche s'améliore de 3,89x avec IDEAgent
IDEAgent utilise des lignées, des retours multi-objectifs et une mémoire séquentielle pour équilibrer qualité et diversité dans les idées de recherche générées par LLM. Testé sur 32 sujets dans 8 domaines de l'informatique, il atteint 3,89x le Yield (idées diverses au-dessus d'un seuil de qualité) des méthodes antérieures.
2026-08-02
IA industrielle
AgentRCA : analyse de cause racine zero-shot qui explique son propre raisonnement
Un framework agentique zero-shot appelé AgentRCA utilise un jumeau numérique et un LLM pour diagnostiquer les défauts d'usine sans données étiquetées, atteignant une précision de niveau supervisé avec une transparence totale.
2026-08-01
Recherche
Six mots qui pourraient remodeler la manière dont les agents d'IA explorent et restent en sécurité : perturber, valider, courtier
Une architecture novatrice de cohorte d'agents hétérogènes sépare l'exploration divergente, le filtrage de sécurité à l'exécution et la récupération de connaissances inter-domaines en rôles spécialisés. Le Perturbateur génère des propositions à haute entropie, le Validateur impose des vérifications strictes des appels d'outils, et le Courtier importe des analogies hors domaine via une récupération de nouveauté contrastive. Les échecs d'exécution sont compilés en correctifs de contrainte signés appelés Scars, mis en cache pour les générations futures. Dans les évaluations, la cohorte a atteint 95% de découverte de cibles distantes, zéro violation exécutée, et 15,1% d'économies de jetons grâce aux Scars, avec une réduction de 55,9% des coûts sous contraintes de ressources via une allocation de bande passante basée sur le crédit.
2026-07-30
Recherche en IA
L'évolution des harnais semble impressionnante jusqu'à ce qu'on la teste sur des tâches inédites
L'évolution automatique des harnais est censée améliorer les agents LLM, mais un nouvel article soutient que de nombreux gains rapportés pourraient provenir d'un surapprentissage sur l'ensemble de test public. Dans les expériences, des méthodes simples de test-time scaling ont égalé ou surpassé l'évolution, et les harnais évolués ont montré une généralisation limitée à des tâches inédites.
2026-07-27
Recherche
Le fossé de supervision en RL agentique vient d'être comblé par le regard rétrospectif
SEED (Self-Evolving On-Policy Distillation) permet à un LLM d'analyser ses propres trajectoires passées, d'en extraire des compétences réutilisables en langage naturel après coup, puis de distiller ces leçons dans sa politique pendant le RL. Le résultat : une supervision plus dense et en politique qui améliore l'efficacité d'échantillonnage et se généralise à des tâches inédites.
2026-07-25
Raisonnement à long terme
Un nouveau cadre aide les agents IA à se souvenir de ce qu'ils ont fait il y a cinq minutes
PRO-LONG est un cadre minimal qui aide les agents LLM à conserver et à récupérer des informations sur de longues séquences d'actions. Sur le benchmark ARC-AGI-3, il a amélioré les taux de réussite moyens de 18 points de pourcentage sur les modèles de pointe tout en utilisant 4,2 à 5,8 fois moins de jetons que les harnais existants. Avec Fable 5, il a atteint 97,4 % best@2 pour un coût d'inférence total de 1 750 $.
2026-07-24
Recherche en IA
La technique bruyante qui empêche les agents LLM de s’effondrer en production
Les agents LLM actuels s’effondrent face à l’aléatoire du monde réel. NoisyAgent les expose à un bruit contrôlé pendant l’entraînement, améliorant à la fois la robustesse et les performances générales sur les benchmarks. L’article suggère que le domaine a surajusté des conditions parfaites.
2026-07-17