SevenTnewS

distillation on-policy

3 published articles

LLM & Modèles4 min read

Distillation des LLM

La distillation des LLM stagne quand le contexte devient statique. Ce papier le fait évoluer

Les contextes peuvent transporter les préférences de tâche dans l'entraînement des LLM, mais une fois distillés dans un étudiant, ils n'apportent qu'une supervision limitée. Le Flux-OPD de l'université de Pékin maintient le contexte en mouvement avec l'étudiant et utilise un terme de conflit pour pondérer les corrections des enseignants. Le résumé rapporte des gains par rapport aux paradigmes OPD existants sans citer de chiffres.

2026-07-31

LLM & ModèlesFeatured4 min read

Recherche

Le fossé de supervision en RL agentique vient d'être comblé par le regard rétrospectif

SEED (Self-Evolving On-Policy Distillation) permet à un LLM d'analyser ses propres trajectoires passées, d'en extraire des compétences réutilisables en langage naturel après coup, puis de distiller ces leçons dans sa politique pendant le RL. Le résultat : une supervision plus dense et en politique qui améliore l'efficacité d'échantillonnage et se généralise à des tâches inédites.

2026-07-25

LLM & ModèlesFeatured5 min read

Recherche en IA

Apprentissage par renforcement pour la génération d'images : Qwen-Image-2.0-RL adopte un système de récompense composite

Le rapport Qwen-Image-2.0-RL détaille un pipeline de post-entraînement combinant RLHF, distillation sur politique et modèles de récompense composites pour améliorer la qualité de la génération texte-image et de l'édition d'images. L'approche produit des gains mesurables en qualité esthétique, respect des instructions et préservation de l'identité faciale.

2026-07-20