SevenTnewS

Recherche RAG

BM25 bat le RAG agentique lorsque les corpus dépassent 10 millions de tokens

La recherche agentique gagne sur les petits corpus, mais une étude de muset-ai sur 28 niveaux imbriqués montre BM25 la dépassant vers 10 millions de tokens. L’agent consomme 39 fois plus de tokens de requête, et le RAG par graphe plafonne à la construction.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-08-07 · 3 min de lecture

BM25 bat le RAG agentique lorsque les corpus dépassent 10 millions de tokens

La recherche agentique est ce à quoi aspirent discrètement la plupart des piles RAG : un modèle qui parcourt un corpus, décide quoi ouvrir, et lit jusqu’à trouver la réponse. Une étude de montée en charge publiée sur arXiv fin juillet soutient que cet instinct inverse l’ordre des choses. Dès que les corpus dépassent environ 10 millions de tokens, BM25, un simple récupérateur lexical, bat la recherche agentique en précision à chaque taille de corpus supérieure testée par l’étude.

L’article vient de chercheurs de muset-ai et compare la récupération lexicale, la récupération dense, l’indexation par graphe et la recherche agentique sur 28 niveaux de corpus strictement imbriqués couvrant un facteur d’environ 450. Les questions et un socle fixe de documents pertinents et adverses restent inchangés. Un même modèle lecteur et un seul protocole de jugement évaluent chaque paradigme, et les auteurs consignent la précision, les tokens de construction, les tokens de requête et la latence. Comme les niveaux sont strictement imbriqués, chaque corpus plus grand contient tous les plus petits, si bien que les classements restent comparables entre les tailles au lieu de dériver avec l’ensemble de test. Cette configuration commune est tout l’intérêt : la plupart des paradigmes RAG sont évalués sur des corpus différents à une seule taille, ce qui a laissé leur rapport précision-coût à l’échelle flou.

Le croisement à 10 millions de tokens

Le résultat principal est un croisement dépendant de l’échelle, pas un gagnant inconditionnel. Un File-System Agent domine aux plus petits niveaux communs, où parcourir un petit arbre est peu coûteux. À mesure que l’espace de recherche grandit, cette stratégie séquentielle devient moins efficace, et vers 10 millions de tokens de corpus BM25 la dépasse. Ensuite BM25 domine à chaque niveau supérieur, avec une marge proche de 20 points de précision à pleine échelle.

Lues ensemble, les deux courbes racontent une histoire simple. Le classement global des candidats score tout le corpus en une seule passe et laisse les correspondances les plus fortes remonter en tête. L’exploration séquentielle passe mal à l’échelle car chaque document ouvert par l’agent coûte des tokens qu’un ranker ne dépenserait jamais. La récupération lexicale est le défaut scalable le plus robuste que l’étude trouve ; le raisonnement agentique est une seconde étape, pas une première.

La recherche agentique brûle des tokens avant de décliner

La courbe de coût rend le point plus net. Au niveau socle, l’exploration séquentielle du File-System Agent coûte 39 fois plus de tokens de requête. Sur un corpus assez grand pour avoir besoin d’une récupération, cet écart décide si l’étape de récupération coûte quelques centimes ou redessine toute la facture d’inférence.

Le cadrage des auteurs mérite une lecture attentive : le raisonnement agentique fonctionne le mieux après une découverte classée, plutôt qu’à sa place. Gardez un ranker global bon marché comme porte d’entrée, puis laissez l’agent lire la shortlist. Le jugement de l’agent compte toujours. Il ne devrait simplement pas faire la recherche lui-même.

Récupération dense et par graphe : efficace ou inachevée

La récupération dense reste efficace mais moins précise, constate l’étude. Le RAG par graphe se heurte à des murs de construction avant l’échelle de déploiement, et même ses variantes scalables restent sous BM25 aux niveaux communs. BM25 ancre aussi l’extrémité bas coût de la frontière de Pareto sans nécessiter de construction basée sur un LLM. Il n’y a ni embeddings à construire ni graphe à maintenir pour classer les candidats.

ParadigmeLà où il dominePrincipale faiblesse
BM25 (lexical)Chaque niveau à partir de ~10M tokens, de près de 20 points à pleine échelleDerrière l’agent sur les plus petits corpus
File-System Agent (agentique)Plus petits niveaux communs39x tokens de requête au socle ; s’efface à mesure que l’espace grandit
Récupération denseEfficacité de coûtMoins précise que BM25
RAG par grapheAucun aux niveaux communsMurs de construction avant le déploiement ; variantes scalables sous BM25

Les auteurs ne revendiquent aucun gagnant universel, et le résultat à petite échelle est la véritable réserve : sur les plus petits corpus, l’agent domine. Mais le croisement près de 10 millions de tokens se situe dans la plage de tailles où vivent déjà les déploiements réels. Pour les équipes qui montent des pipelines de récupération, la lecture pratique va à l’encontre du battage : commencez par l’index ennuyeux, et dépensez les tokens de l’agent sur les quelques documents auxquels le ranker fait confiance.

L’article avait recueilli 41 votes positifs sur Hugging Face au moment de la révision v2 le 30 juillet.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.