IA de investigación profunda
El nuevo agente de investigación de BAAI no solo busca más tiempo, sino que revisa su propia tarea
Los agentes AREX de BAAI utilizan un bucle de auto-mejora recursiva que comprime historiales de investigación largos, permitiendo un refinamiento eficiente impulsado por la verificación. Entrenados con una novedosa receta de RL de horizonte largo, superan a las líneas base comparables en BrowseComp, DeepSearchQA y HLE.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-31 · 3 min de lectura

La investigación profunda tiene una asimetría que la mayoría de los agentes ignoran: encontrar la respuesta correcta es costoso, pero verificar un candidato es barato. BAAI, la Academia de Inteligencia Artificial de Pekín, construyó una familia de agentes que explota esta brecha. AREX, agentes de investigación profunda que se mejoran recursivamente a sí mismos, no solo busca más tiempo; busca de manera más inteligente al tratar sus propias salidas intermedias como trabajo en progreso que merece una segunda mirada.
La arquitectura: un bucle que inspecciona su propio bucle
AREX divide el proceso de investigación en dos ciclos anidados. El bucle interno recopila evidencia y ensambla una respuesta provisional. El bucle externo luego audita esa respuesta, verificando cada restricción que impone la pregunta original. Cuando encuentra una afirmación no resuelta o un vínculo débil, lanza una investigación de seguimiento dirigida, no un barrido amplio nuevamente, sino un retorno enfocado a la brecha específica.
Sostener esto durante horizontes largos sin perder el rastro de lo que se ha verificado es la parte difícil. AREX lo resuelve con una herramienta de actualización de contexto autónoma aprendida que comprime el historial de interacción creciente en un estado de mejora compacto. Crucialmente, esta compresión no depende de un modelo externo; el agente aprende a gestionar su propio crecimiento. El estado de mejora preserva la evidencia verificada y las restricciones no resueltas, permitiendo que el bucle externo retome exactamente donde lo dejó después de cada iteración de investigación.
Entrenamiento para la resistencia, no solo la precisión
BAAI entrenó AREX en tareas sintéticas verificadas y trayectorias de alta calidad utilizando una receta de dos etapas. Primero, el entrenamiento agéntico intermedio enseña al modelo a navegar entornos de investigación de múltiples turnos. Luego, el aprendizaje por refuerzo de horizonte largo moldea al agente para sostener la mejora a lo largo de muchos pasos.
El aprendizaje por refuerzo con recompensas finales dispersas es notoriamente difícil para secuencias largas. AREX mitiga esto enfatizando pasos clave, momentos en los que se adquiere evidencia decisiva o en los que el agente corrige una dirección de investigación errónea. Esta conformación de recompensas le da al modelo una señal de entrenamiento más densa sin necesidad de un crítico externo, similar en espíritu a trabajos recientes sobre destilación de habilidades on-policy para RL agéntico.
Golpeando por encima de su peso
AREX viene en dos tamaños: un modelo denso de 4 mil millones de parámetros y una versión de Mezcla de Expertos de 122 mil millones de parámetros que activa solo 10 mil millones de parámetros por token. En BrowseComp, WideSearch, DeepSearchQA y el Último Examen de la Humanidad (HLE), el artículo informa que AREX supera sustancialmente a las líneas base de escala comparable y se mantiene competitivo con modelos que utilizan parámetros activados sustancialmente mayores. El modelo de 4B, en particular, ofrece un vistazo de lo que la arquitectura eficiente y el entrenamiento inteligente pueden lograr sin los enormes presupuestos de cómputo de los laboratorios propietarios.
Qué significa esto para la carrera de investigación profunda
AREX llega mientras el impulso del código abierto desde el este de Asia se acelera. BAAI se une a DeepSeek, Baichuan y otros para demostrar que se pueden construir agentes de investigación de vanguardia sin infraestructura propietaria. El bucle de auto-mejora recursiva, combinado con la compresión de contexto aprendida, ofrece un modelo que otros laboratorios pueden adoptar; el código y los pesos del modelo del artículo están disponibles en la página del proyecto y en Hugging Face.
La señal más amplia es que la brecha entre la IA abierta y cerrada se está reduciendo, no porque los modelos propietarios se estanquen, sino porque los agentes de investigación están aprendiendo a obtener más con menos. El modelo de 4B de AREX desafía la suposición de que la investigación profunda requiere un cerebro de 500 mil millones de parámetros. Si el refinamiento guiado por verificación se convierte en un patrón estándar, la próxima ola de agentes de investigación puede definirse menos por su tamaño y más por lo bien que inspeccionan su propio trabajo.
- Fuente : BAAI's new research agent doesn't just search longer, it checks its own homework — 2026-07-23
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.