Razonamiento de largo alcance
Un nuevo marco ayuda a los agentes de IA a recordar lo que hicieron hace cinco minutos
PRO-LONG es un marco mínimo que ayuda a los agentes LLM a retener y recuperar información a lo largo de secuencias largas de acciones. En el benchmark ARC-AGI-3, mejoró las tasas de aprobación promedio en 18 puntos porcentuales entre los modelos fronterizos, utilizando entre 4.2 y 5.8 veces menos tokens que los arneses existentes. Con Fable 5, alcanzó un 97.4% best@2 con un costo total de inferencia de $1,750.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-24 · 4 min de lectura

La forma estándar de construir un agente de IA es proporcionarle un prompt, un conjunto de herramientas y una transcripción en curso de todo lo que ha hecho hasta ahora. Esa transcripción crece con cada paso, y eventualmente el modelo olvida lo que leyó al principio o desperdicia tokens releyendo todo. Es un problema que el benchmark ARC-AGI-3 expone despiadadamente: los modelos que resuelven puzzles aislados se desmoronan cuando los puzzles se encadenan a lo largo de docenas de pasos.
El muro de contexto
Los arneses de agentes existentes manejan esto comprimiendo o podando el historial. Resumir los turnos anteriores. Descartar los que parecen irrelevantes. El problema es que un detalle que parece inútil en el paso 12 puede ser crítico en el paso 47, y una vez que desaparece, el agente no puede recuperarlo. La compensación está implícita: conservar más contexto y la recuperación se vuelve costosa; conservar menos y el agente trabaja a ciegas.
PRO-LONG, presentado en un preprint de arXiv de julio de 2026, adopta un enfoque diferente. En lugar de decidir qué conservar, lo conserva todo, pero estructura el registro como un registro de interacciones buscable y se apoya en un modelo de generación de código para consultarlo programáticamente. La idea es que las mejoras recientes en los agentes de código (modelos que escriben y ejecutan código para resolver problemas) hacen que el paso de búsqueda sea lo suficientemente barato como para no necesitar podar el historial en absoluto.
Cómo funciona

El marco no altera el LLM subyacente. Lo envuelve con dos piezas: un registrador estructurado que escribe cada observación y acción en un almacén versionado similar a JSON, y un módulo de recuperación que, cuando el agente necesita consultar el contexto pasado, genera un fragmento de Python para filtrar, unir o agregar el registro almacenado. Debido a que el registro es completo y legible por máquina, la recuperación puede ser precisa: el agente solicita "el tercer estado de la cuadrícula del rompecabezas que estaba resolviendo hace dos pasos" y obtiene exactamente eso, no un resumen difuso.
Los autores probaron la configuración en el conjunto completo de juegos públicos de ARC-AGI-3, que incluye 200 rompecabezas de entrenamiento que requieren extracción de patrones, inducción de reglas y transformación en múltiples pasos. Compararon un agente de código que se ejecuta con y sin PRO-LONG en cuatro familias de modelos fronterizos: GPT-4o, Claude 4 Sonnet, Gemini 2.5 Pro y Fable 5 (una versión de modelo de Anthropic aún no detallada públicamente al momento de redactar este artículo).
Los números
La mejora promedio fue de 18.0 puntos porcentuales en pass@1 entre los modelos. El mejor resultado individual se logró con Fable 5: una puntuación best@2 del 97.4%, alcanzada con un costo total de inferencia de $1,750. Frente a los arneses especializados de última generación ajustados manualmente para ARC, PRO-LONG igualó o superó su pass@1 (hasta un 76.1%) mientras consumía entre 4.2 y 5.8 veces menos tokens por ejecución.
Esos ahorros de tokens importan porque el costo de los tokens es el límite práctico de cuánto tiempo de ejecución puede permitirse un laboratorio. Si un arnés consume $50 por episodio en un modelo fronterizo, las pruebas sistemáticas quedan fuera de alcance. La eficiencia de PRO-LONG proviene de delegar el trabajo de recuperación a una llamada barata de generación de código en lugar de pasar todo el historial de vuelta al costoso modelo de razonamiento.
Lo que esto significa para el diseño de agentes
PRO-LONG no es un modelo nuevo. Es un truco de andamiaje que explota el hecho de que los modelos de código ahora son lo suficientemente buenos como para escribir una consulta tipo SQL sobre su propia memoria. La implicación es que el cuello de botella en los agentes de largo alcance puede no ser la capacidad del modelo, sino la estrategia de gestión del contexto.
Eso coincide con hallazgos en otras partes. Un análisis separado de junio de 2026 estimó que el historial de interacción en bruto es la principal limitación para los agentes de trabajo de oficina; la tarea de hoja de cálculo que le toma a un asistente 15 pasos se derrumba si no puede recordar los encabezados de columna que analizó en el paso 2. El flujo de trabajo de estado estructurado más verificador propuesto en ese análisis comparte el diagnóstico de PRO-LONG: no dejes que el historial decaiga pasivamente; hazlo consultable.
Advertencias
El resultado de PRO-LONG es sólido en ARC-AGI-3, que es un benchmark de rompecabezas. Si el mismo enfoque se mantiene en la generación de código abierta, la navegación web de múltiples turnos o el análisis de documentos largos es una cuestión abierta. Los autores publicaron el código y los registros con el artículo, lo que debería ayudar a otros a probar rápidamente la afirmación de portabilidad.
Una segunda advertencia es que el marco se apoya en la capacidad de generación de código del modelo. En modelos que son débiles para escribir Python correcto, como modelos de peso abierto más pequeños, el propio paso de recuperación podría fallar. El artículo probó solo modelos fronterizos.
Aún así, el planteamiento es provocador. Si el camino más barato hacia mejores agentes es una mejor gestión de la memoria en lugar de modelos más grandes, entonces gran parte de la dirección actual del campo (entrenar más tiempo, escalar más fuerte) puede estar optimizada para lo incorrecto. PRO-LONG es un dato en ese argumento, y es sólido.
- Fuente : A new framework helps AI agents remember what they did five minutes ago — 2026-07-22
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.