SevenTnewS

Investigación sobre RAG

BM25 supera al RAG agéntico cuando los corpus superan los 10 millones de tokens

La búsqueda agéntica gana en corpus pequeños, pero un estudio de muset-ai en 28 niveles anidados muestra que BM25 la supera cerca de los 10 millones de tokens. El agente consume 39 veces más tokens de consulta y el RAG gráfico se estanca en la construcción.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-07 · 3 min de lectura

BM25 supera al RAG agéntico cuando los corpus superan los 10 millones de tokens

La búsqueda agéntica es lo que la mayoría de las pilas de RAG aspiran silenciosamente a ser: un modelo que recorre un corpus, decide qué abrir y lee hasta encontrar la respuesta. Un estudio de escalado publicado en arXiv a finales de julio sostiene que este instinto tiene el orden invertido. Una vez que los corpus superan unos 10 millones de tokens, BM25, un simple recuperador léxico, supera a la búsqueda agéntica en precisión en todos los tamaños de corpus más grandes que probó el estudio.

El artículo proviene de investigadores de muset-ai y compara la recuperación léxica, la recuperación densa, la indexación basada en grafos y la búsqueda agéntica en 28 niveles de corpus estrictamente anidados que abarcan aproximadamente 450 veces. Las preguntas y una base fija de documentos relevantes y adversarios permanecen sin cambios. Un único modelo lector y un solo protocolo de evaluación puntúan cada paradigma, y los autores registran precisión, tokens de construcción, tokens de consulta y latencia. Debido a que los niveles están estrictamente anidados, cada corpus más grande contiene a todos los más pequeños, por lo que las clasificaciones se mantienen comparables entre tamaños en lugar de desviarse con el conjunto de prueba. Esa configuración compartida es el punto central: la mayoría de los paradigmas de RAG se evalúan en diferentes corpus con un solo tamaño, lo que ha dejado sin claridad su escalado de precisión y costo.

El cruce en los 10 millones de tokens

El resultado principal es un cruce dependiente de la escala, no un ganador incondicional. Un agente de sistema de archivos lidera en los niveles compartidos más pequeños, donde recorrer un árbol pequeño es barato. A medida que el espacio de búsqueda crece, esa estrategia secuencial pierde efectividad y, alrededor de los 10 millones de tokens de corpus, BM25 lo supera. A partir de ahí, BM25 lidera en todos los niveles más grandes, con un margen cercano a los 20 puntos de precisión a escala completa.

Leídas en conjunto, las dos curvas cuentan una historia sencilla. La clasificación global de candidatos puntúa todo el corpus en una sola pasada y permite que las coincidencias más fuertes suban a la cima. La exploración secuencial escala mal porque cada documento que el agente abre cuesta tokens que un clasificador nunca gastaría. La recuperación léxica es la opción predeterminada escalable más fuerte que encuentra el estudio; el razonamiento agéntico es un segundo paso, no un primero.

La búsqueda agéntica quema tokens antes de desvanecerse

La curva de costos hace el punto más nítido. En el nivel base, la exploración secuencial del agente de sistema de archivos cuesta 39 veces más tokens de consulta. En un corpus lo bastante grande como para necesitar recuperación, esa brecha decide si el paso de recuperación cuesta centavos o redefine toda la factura de inferencia.

El enfoque de los autores merece leerse con atención: el razonamiento agéntico funciona mejor después del descubrimiento clasificado, no en lugar de él. Mantenga un clasificador global barato como puerta de entrada y luego deje que el agente lea la lista corta. El juicio del agente sigue importando. Solo que no debería hacer la búsqueda en sí.

Recuperación densa y gráfica: eficiente o inconclusa

La recuperación densa sigue siendo eficiente pero menos precisa, según el estudio. El RAG basado en grafos choca con muros de construcción antes de la escala de despliegue, e incluso sus variantes escalables permanecen por debajo de BM25 en los niveles compartidos. BM25 también ancla el extremo de bajo costo de la frontera de Pareto sin requerir construcción basada en LLM. No hay incrustaciones que construir ni un grafo que mantener solo para clasificar candidatos.

ParadigmaDónde lideraPrincipal debilidad
BM25 (léxico)Cada nivel desde ~10M de tokens en adelante, por casi 20 puntos a escala completaVa detrás del agente en los corpus más pequeños
Agente de sistema de archivos (agéntico)Niveles compartidos más pequeños39x tokens de consulta en el nivel base; se desvanece a medida que el espacio crece
Recuperación densaEficiencia de costosMenos precisa que BM25
RAG basado en grafosNinguno en los niveles compartidosMuros de construcción antes del despliegue; variantes escalables por debajo de BM25

Los autores no proclaman un ganador universal, y el resultado a pequeña escala es la advertencia genuina: en los corpus más pequeños, el agente lidera. Pero el cruce cerca de los 10 millones de tokens se ubica dentro del rango de tamaños donde ya viven los despliegues reales. Para los equipos que montan pipelines de recuperación, la lectura práctica va contra el entusiasmo: Empiece con el índice aburrido y gaste los tokens del agente en los pocos documentos en los que el clasificador confía.

El artículo había recibido 41 votos positivos en Hugging Face para cuando se publicó la revisión v2 el 30 de julio.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.