Investigación
La brecha de supervisión en RL agéntico acaba de recibir una solución gracias a la retrospectiva
SEED (Destilación Autoevolutiva en Política) permite que un LLM analice sus propias trayectorias pasadas, extraiga habilidades retrospectivas reutilizables en lenguaje natural y luego destile esas lecciones de vuelta a su política durante el RL. El resultado: una supervisión más densa y en política que mejora la eficiencia de muestreo y se generaliza a tareas no vistas.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-25 · 4 min de lectura

El aprendizaje por refuerzo para grandes modelos de lenguaje tiene un punto ciego. Cuando un agente realiza veinte acciones y solo sabe si tuvo éxito o fracasó al final, la señal es demasiado escasa para enseñarle al modelo cuáles de esas decisiones importaron. El RL basado en resultados funciona, pero deja una brecha de supervisión entre la recompensa a nivel de episodio y la política a nivel de token que la produjo.
Un equipo de la Universidad de Hong Kong y el Laboratorio de Inteligencia Artificial de Shanghái propone una solución que parece casi demasiado obvia en retrospectiva: dejar que el modelo analice sus propias trayectorias completadas y escriba lo que aprendió. Luego, incorporar esas lecciones de vuelta a la política durante el entrenamiento. Lo llaman SEED (Destilación Autoevolutiva en Política), y el preprint publicado en arXiv el 16 de julio de 2026 muestra mejoras consistentes tanto en tareas agénticas basadas en texto como en visión.
De recompensa escasa a señal densa
La idea central es que un LLM, cuando se le pide que examine una trayectoria que acaba de completar, puede generar habilidades en lenguaje natural que capturen flujos de trabajo reutilizables, observaciones decisivas o reglas para evitar fallos. Estos no son plantillas estáticas escritas por un humano; surgen de lo que la política actual hace. Un modelo que tiende a pasarse en tareas de navegación podría generar una habilidad como "después de tres movimientos fallidos, verifica si el objetivo sigue en el área visible".
SEED luego utiliza esas habilidades para crear una señal densa a nivel de token. Vuelve a puntuar las mismas acciones bajo dos contextos: un contexto base y otro aumentado con las habilidades retrospectivas. La diferencia en las probabilidades de los tokens se convierte en un objetivo de destilación que empuja a la política hacia el comportamiento implícito en su propio análisis retrospectivo. Esta señal funciona junto con el objetivo de RL basado en resultados, por lo que el modelo no elige entre recompensas escasas e indicaciones densas; obtiene ambas.
Supervisión autoevolutiva

La parte autoevolutiva es importante porque la política que recolecta trayectorias hoy es mejor que la que las recolectó ayer. SEED no congela el módulo de análisis después de una primera pasada. El mismo modelo actúa tanto como actor como analista retrospectivo, por lo que a medida que la política mejora, las habilidades que extrae también mejoran. La señal de destilación se mantiene en política, lo que significa que refleja la distribución de trayectorias actual en lugar de una instantánea desactualizada.
Esto evita un problema común en trabajos previos sobre reetiquetado retrospectivo o extracción de habilidades, donde la supervisión auxiliar se desincroniza con el comportamiento que el modelo realmente está produciendo. El bucle de retroalimentación de SEED mantiene ambos alineados.
Qué muestran los experimentos
El artículo informa experimentos tanto en entornos basados en texto (ALFWorld, ScienceWorld) como basados en visión (Craftax, un punto de referencia de mazmorras). En todos los casos, SEED mejora tanto el RL puro basado en resultados como las líneas base que utilizan habilidades fijas preextraídas. Las ganancias son más pronunciadas en tareas de horizonte largo donde la brecha de supervisión es más amplia: las tareas de ScienceWorld que requieren quince o más pasos muestran una mejora del 22% en la tasa de éxito sobre la mejor línea base de solo RL.
La generalización a escenarios no vistos, probada reteniendo configuraciones de entorno durante el entrenamiento, también mejora. Los autores argumentan que las habilidades retrospectivas capturan patrones genuinamente reutilizables en lugar de memorización específica de la tarea, y el paso de destilación transfiere esos patrones a la política sin sobreajustarse a la distribución de entrenamiento.
Una tabla lo cuenta todo
En cuatro entornos y múltiples niveles de dificultad, SEED supera al siguiente mejor método en nueve de doce comparaciones informadas. Las únicas pérdidas ocurren en episodios muy cortos donde la brecha de supervisión es mínima de todos modos.
| Entorno | Métrica | Solo RL | Habilidades fijas | SEED |
|---|---|---|---|---|
| ALFWorld | Tasa de éxito | 57.3% | 61.8% | 68.1% |
| ScienceWorld | Tasa de éxito | 34.1% | 39.5% | 46.3% |
| Craftax (Visión) | Recompensa promedio | 57.2 | 62.3 | 71.0 |
Las mejoras no son lo suficientemente dramáticas como para llamarlas un gran avance, pero son consistentes y se acumulan en tareas más largas. Ese es el tipo de señal que importa a los profesionales: un método que mejora silenciosamente el rendimiento sin requerir una arquitectura fundamentalmente nueva o un presupuesto de entrenamiento mayor.
Preguntas abiertas
El artículo deja algunas preguntas sin responder. Las habilidades producidas por el módulo de análisis retrospectivo no son validadas por ninguna verificación externa; el modelo puede generar lecciones que suenan plausibles pero son incorrectas. Los autores señalan que la señal de destilación se calcula solo a partir del cambio de probabilidad, por lo que una habilidad incorrecta no contribuye con un gradiente útil en promedio, pero no analizan con qué frecuencia el modelo produce habilidades retrospectivas engañosas o si el modo de fallo es lo suficientemente común como para importar a escala.
El costo computacional de ejecutar el módulo de análisis en cada trayectoria durante el entrenamiento tampoco es trivial. El artículo informa que la sobrecarga es manejable porque el análisis es una sola pasada hacia adelante por trayectoria, pero en episodios muy largos en entornos complejos, esa pasada adicional se acumula.
Aún así, SEED es una de las propuestas más prácticas en la reciente cosecha de métodos de RL agéntico. No requiere anotación humana, mantiene su señal de supervisión fresca y funciona sobre pipelines de RL estándar sin modificaciones invasivas. Para equipos que entrenan modelos agénticos que luchan con tareas de horizonte largo, esto merece una conversación.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.