SevenTnewS

IA de recherche approfondie

Le nouvel agent de recherche de BAAI ne se contente pas de chercher plus longtemps, il vérifie ses propres devoirs

Les agents AREX de BAAI utilisent une boucle d'auto-amélioration récursive qui compresse les longs historiques de recherche, permettant un raffinement efficace axé sur la vérification. Entraînés avec une nouvelle recette de RL à long horizon, ils surpassent les bases de référence comparables sur BrowseComp, DeepSearchQA et HLE.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-31 · 3 min de lecture

Le nouvel agent de recherche de BAAI ne se contente pas de chercher plus longtemps, il vérifie ses propres devoirs

La recherche approfondie présente une asymétrie que la plupart des agents ignorent : trouver la bonne réponse est coûteux, mais vérifier un candidat est bon marché. BAAI, l'Académie de l'intelligence artificielle de Pékin, a construit une famille d'agents qui exploite cet écart. AREX, agents de recherche approfondie s'améliorant de manière récursive, ne se contente pas de chercher plus longtemps ; il cherche plus intelligemment en traitant ses propres sorties intermédiaires comme un travail en cours qui mérite un second regard.

L'architecture : une boucle qui inspecte sa propre boucle

AREX divise le processus de recherche en deux cycles imbriqués. La boucle interne recueille des preuves et assemble une réponse provisoire. La boucle externe vérifie ensuite cette réponse, en contrôlant chaque contrainte imposée par la question initiale. Lorsqu'elle trouve une affirmation non résolue ou un maillon faible, elle lance une recherche de suivi ciblée, non pas un vaste balayage, mais un retour concentré sur le gap spécifique.

Maintenir cela sur de longs horizons sans perdre la trace de ce qui a été vérifié est la partie difficile. AREX le résout avec un outil d'actualisation de contexte autonome appris qui comprime l'historique d'interaction croissant en un état d'amélioration compact. Crucialement, cette compression ne repose pas sur un modèle externe, l'agent apprend à gérer sa propre croissance. L'état d'amélioration préserve les preuves vérifiées et les contraintes non résolues, permettant à la boucle externe de reprendre exactement là où elle s'est arrêtée après chaque itération de recherche.

Entraînement pour l'endurance, pas seulement la précision

BAAI a entraîné AREX sur des tâches synthétiques vérifiées et des trajectoires de haute qualité en utilisant une recette en deux étapes. D'abord, un entraînement intermédiaire agentique enseigne au modèle à naviguer dans des environnements de recherche à plusieurs tours. Ensuite, l'apprentissage par renforcement à long horizon façonne l'agent pour maintenir une amélioration sur de nombreuses étapes.

L'apprentissage par renforcement avec des récompenses finales rares est notoirement difficile pour les longues séquences. AREX atténue cela en mettant l'accent sur les étapes clés, les moments où des preuves décisives sont acquises ou où l'agent corrige une direction de recherche erronée. Ce façonnage de récompense donne au modèle un signal d'entraînement plus dense sans avoir besoin d'un critique externe, similaire dans l'esprit aux travaux récents sur la distillation de compétences sur-politique pour le RL agentique.

Frapper au-dessus de son poids

AREX se décline en deux tailles : un modèle dense de 4 milliards de paramètres et une version Mixture-of-Experts de 122 milliards de paramètres qui n'active que 10 milliards de paramètres par token. Sur BrowseComp, WideSearch, DeepSearchQA et Humanity's Last Exam (HLE), l'article rapporte qu'AREX surpasse substantiellement les bases de référence d'échelle comparable et reste compétitif avec des modèles utilisant beaucoup plus de paramètres activés. Le modèle 4B, en particulier, offre un aperçu de ce qu'une architecture efficace et un entraînement intelligent peuvent accomplir sans les budgets de calcul massifs des laboratoires propriétaires.

Ce que cela signifie pour la course à la recherche approfondie

AREX arrive alors que l'élan open-source en provenance de l'Asie de l'Est s'accélère. BAAI rejoint DeepSeek, Baichuan et d'autres pour prouver que des agents de recherche capables d'atteindre les frontières peuvent être construits sans infrastructure propriétaire. La boucle d'auto-amélioration récursive, combinée à la compression de contexte apprise, offre un plan que d'autres laboratoires peuvent adopter ; le code et les poids du modèle de l'article sont disponibles sur la page du projet et sur Hugging Face.

Le signal plus large est que l'écart entre l'IA ouverte et fermée se réduit non pas parce que les modèles propriétaires stagnent, mais parce que les agents de recherche apprennent à obtenir plus avec moins. Le modèle 4B d'AREX remet en question l'hypothèse selon laquelle une recherche approfondie nécessite un cerveau de 500 milliards de paramètres. Si le raffinement guidé par la vérification devient un modèle standard, la prochaine vague d'agents de recherche pourrait être définie moins par leur taille et plus par leur capacité à inspecter leur propre travail.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.