Raisonnement à long terme
Un nouveau cadre aide les agents IA à se souvenir de ce qu'ils ont fait il y a cinq minutes
PRO-LONG est un cadre minimal qui aide les agents LLM à conserver et à récupérer des informations sur de longues séquences d'actions. Sur le benchmark ARC-AGI-3, il a amélioré les taux de réussite moyens de 18 points de pourcentage sur les modèles de pointe tout en utilisant 4,2 à 5,8 fois moins de jetons que les harnais existants. Avec Fable 5, il a atteint 97,4 % best@2 pour un coût d'inférence total de 1 750 $.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-24 · 4 min de lecture

La méthode standard pour construire un agent IA consiste à lui fournir une invite, un ensemble d'outils et un enregistrement complet de tout ce qu'il a fait jusqu'à présent. Cet enregistrement s'allonge à chaque étape, et finalement le modèle oublie ce qu'il a lu au début ou gaspille des jetons en relisant l'intégralité. C'est un problème que le benchmark ARC-AGI-3 expose impitoyablement : les modèles qui réussissent des énigmes isolées s'effondrent lorsque les énigmes s'enchaînent sur des dizaines d'étapes.
Le mur de contexte
Les harnais d'agents existants gèrent cela en compressant ou en élaguant l'historique. Résumer les tours plus anciens. Supprimer ceux qui semblent non pertinents. Le problème est qu'un détail qui semble inutile à l'étape 12 peut être crucial à l'étape 47, et une fois qu'il est perdu, l'agent ne peut pas le récupérer. Le compromis est intégré : préserver plus de contexte et la récupération devient coûteuse ; en préserver moins et l'agent travaille à l'aveuglette.
PRO-LONG, introduit dans une prépublication arXiv de juillet 2026, adopte une approche différente. Au lieu de décider quoi garder, il garde tout, mais structure le journal comme un enregistrement d'interactions consultable et s'appuie sur un modèle de génération de code pour l'interroger par programmation. L'idée est que les récentes améliorations des agents de code (modèles qui écrivent et exécutent du code pour résoudre des problèmes) rendent l'étape de recherche suffisamment bon marché pour que vous n'ayez pas à élaguer l'historique du tout.
Comment ça fonctionne

Le cadre ne modifie pas le LLM sous-jacent. Il l'enveloppe avec deux éléments : un enregistreur structuré qui écrit chaque observation et action dans un magasin versionné de type JSON, et un module de récupération qui, lorsque l'agent a besoin de se référer à un contexte passé, génère un extrait Python pour filtrer, joindre ou agréger le journal stocké. Parce que le journal est complet et lisible par machine, la récupération peut être précise : l'agent demande "le troisième état de grille de l'énigme que je résolvais il y a deux étapes" et obtient exactement cela, pas un résumé flou.
Les auteurs ont testé la configuration sur l'ensemble complet du jeu public ARC-AGI-3, qui comprend 200 énigmes d'entraînement nécessitant l'extraction de motifs, l'induction de règles et une transformation en plusieurs étapes. Ils ont comparé un agent de code fonctionnant avec et sans PRO-LONG sur quatre familles de modèles de pointe : GPT-4o, Claude 4 Sonnet, Gemini 2.5 Pro et Fable 5 (une version de modèle d'Anthropic non encore détaillée publiquement au moment de la rédaction).
Les chiffres
L'amélioration moyenne était de 18,0 points de pourcentage en pass@1 sur les modèles. Le meilleur résultat individuel est venu avec Fable 5 : un score best@2 de 97,4 %, atteint à un coût d'inférence total de 1 750 $. Par rapport aux harnais spécialisés de pointe qui sont ajustés manuellement pour ARC, PRO-LONG a égalé ou dépassé leur pass@1 (jusqu'à 76,1 %) tout en consommant 4,2 à 5,8 fois moins de jetons par exécution.
Ces économies de jetons sont importantes car le coût des jetons est le plafond pratique de la durée d'exécution qu'un laboratoire peut se permettre. Si un harnais brûle 50 $ par épisode sur un modèle de pointe, les tests systématiques restent hors de portée. L'efficacité de PRO-LONG provient du fait de décharger le travail de récupération sur un appel de génération de code peu coûteux plutôt que de repasser tout l'historique dans le modèle de raisonnement coûteux.
Ce que cela signifie pour la conception d'agents
PRO-LONG n'est pas un nouveau modèle. C'est une astuce d'échafaudage qui exploite le fait que les modèles de codage sont désormais assez bons pour écrire une requête de type SQL sur leur propre mémoire. L'implication est que le goulot d'étranglement dans les agents à long terme pourrait ne pas être la capacité du modèle mais la stratégie de gestion du contexte.
Cela correspond à des conclusions ailleurs. Une analyse distincte de juin 2026 estimait que l'historique brut des interactions est la principale contrainte pour les agents de travail de bureau : la tâche de tableur qui prend 15 étapes à un assistant s'effondre s'il ne peut pas se souvenir des en-têtes de colonnes qu'il a analysés à l'étape 2. Le flux de travail d'état structuré plus vérificateur proposé dans cette analyse partage le diagnostic de PRO-LONG : ne laissez pas l'historique se dégrader passivement ; rendez-le consultable.
Mises en garde
Le résultat de PRO-LONG est solide sur ARC-AGI-3, qui est un benchmark de puzzles. On ne sait pas encore si la même approche tient pour la génération de code ouverte, la navigation web multitour ou l'analyse de longs documents. Les auteurs ont publié le code et les journaux avec l'article, ce qui devrait aider d'autres à tester rapidement l'affirmation de portabilité.
Une deuxième mise en garde est que le cadre repose sur la capacité de génération de code du modèle. Sur les modèles qui sont faibles pour écrire du Python correct, les modèles plus petits à poids ouvert par exemple, l'étape de récupération elle-même pourrait échouer. L'article n'a testé que des modèles de pointe.
Néanmoins, le cadrage est provocateur. Si le chemin le moins cher vers de meilleurs agents est une meilleure gestion de la mémoire plutôt que des modèles plus grands, alors une grande partie de la direction actuelle du domaine (entraîner plus longtemps, passer à l'échelle plus fort) pourrait être optimisée pour la mauvaise chose. PRO-LONG est un point de données dans cet argument, et c'est un point solide.
- Source : A new framework helps AI agents remember what they did five minutes ago — 2026-07-22
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.