LLMs y ModelosFeatured4 min read
Investigación
La brecha de supervisión en RL agéntico acaba de recibir una solución gracias a la retrospectiva
SEED (Destilación Autoevolutiva en Política) permite que un LLM analice sus propias trayectorias pasadas, extraiga habilidades retrospectivas reutilizables en lenguaje natural y luego destile esas lecciones de vuelta a su política durante el RL. El resultado: una supervisión más densa y en política que mejora la eficiencia de muestreo y se generaliza a tareas no vistas.
2026-07-25