LLM & ModèlesFeatured4 min read
Recherche
Le fossé de supervision en RL agentique vient d'être comblé par le regard rétrospectif
SEED (Self-Evolving On-Policy Distillation) permet à un LLM d'analyser ses propres trajectoires passées, d'en extraire des compétences réutilisables en langage naturel après coup, puis de distiller ces leçons dans sa politique pendant le RL. Le résultat : une supervision plus dense et en politique qui améliore l'efficacité d'échantillonnage et se généralise à des tâches inédites.
2026-07-25