Apprentissage par renforcement
L'apprentissage expérientiel de Microsoft donne aux modèles d'IA un coach, pas seulement une note
L'Apprentissage Expérientiel réutilise le LLM-comme-Juge en un LLM-comme-Coach qui extrait une connaissance transférable de chaque réponse et l'internalise via une distillation de contexte sur politique, surpassant le RL basé sur des grilles sur des tâches non vues et réduisant le piratage de récompense.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-30 · 3 min de lecture

L'apprentissage par renforcement pour les modèles de langage a un goulot d'étranglement que quiconque a déjà débogué un modèle de récompense connaît bien : le signal est trop fin. Une grille d'évaluation évalue une réponse, compresse cette évaluation en un scalaire unique, et jette tout le reste sur pourquoi une réponse était meilleure qu'une autre. Deux réponses ayant la même note peuvent avoir des profils de qualité très différents, mais le modèle n'apprend jamais la différence.
Un article de Microsoft Research Asia, publié sur arXiv cette semaine, propose une correction qui traite ce retour textuel perdu comme le signal principal plutôt que comme un déchet. L'Apprentissage Expérientiel (EL) remplace la récompense scalaire par ce que les auteurs appellent une connaissance expérientielle, un retour textuel structuré et transférable extrait par un modèle coach, puis distillé dans les poids du modèle de politique pendant l'entraînement.
L'idée centrale est simple : si vous avez déjà un modèle juge évaluant des réponses par rapport à une grille, ce juge dispose d'informations riches qu'il ne transmet jamais. Les auteurs le réutilisent en un coach qui produit une brève analyse en langage naturel de chaque réponse : ce qu'elle a bien fait, où elle a échoué, et à quoi ressemblerait une réponse plus forte. Ce texte conditionne ensuite un modèle enseignant qui génère des réponses de qualité de démonstration. Le modèle de politique apprend de ces démonstrations par distillation de contexte sur politique, lisant essentiellement le retour du coach et la réponse améliorée de l'enseignant tout en mettant à jour ses propres paramètres.

Ce n'est pas le même pipeline que le cadre On-Policy Skill Distillation que nous avons couvert plus tôt cette année, bien que les deux partagent l'intuition qu'un retour plus dense est important. L'OPID extrait une supervision rétrospective de trajectoires terminées ; l'EL l'extrait du texte d'évaluation du juge lui-même. Les deux pourraient être complémentaires.
L'article a testé EL sur deux familles de politiques, le Llama-3.1-8B-Instruct open-source et un modèle propriétaire, en utilisant un retour soit de la politique elle-même, soit de GPT-4o comme coach. Sur des tâches ouvertes non vues et inédites (le genre où des grilles existent mais l'espace de réponses est vaste), EL a constamment surpassé le RL standard basé sur des grilles.
Le résultat le plus intéressant est ce qui se produit en dehors de la distribution d'entraînement. Le RL basé sur des grilles a tendance à surapprendre sur les critères d'évaluation sur lesquels il a été entraîné ; avec une grille légèrement différente au moment du test, la performance chute. Les modèles d'EL ont mieux résisté, suggérant que le retour textuel a enseigné une compréhension plus générale de la qualité plutôt qu'un mappage mécanique de la grille à la note. Les auteurs rapportent également que l'EL a atténué le piratage de récompense, le phénomène où un modèle apprend à exploiter des failles dans la fonction de récompense plutôt qu'à résoudre réellement la tâche.
Cela importe car le piratage de récompense est un problème persistant dans l'alignement basé sur le RL. Le correctif en deux mots pour le problème d'auto-sabotage de l'apprentissage par renforcement que nous avons abordé récemment traitait le problème sous un angle différent, empêchant le processus d'optimisation de se combattre lui-même. L'EL le traite du côté des données : si le signal de récompense contient plus d'informations, il y a moins de place pour que le modèle découvre des raccourcis fragiles.
Le compromis est le calcul. Exécuter un modèle coach et un modèle enseignant sur chaque réponse sur politique ajoute au coût d'entraînement. L'article ne fournit pas de comparaisons de temps réel, mais le pipeline nécessite clairement plus de passages avant par étape d'entraînement qu'une boucle RL standard. La question est de savoir si l'amélioration de la généralisation et de la robustesse justifie la dépense supplémentaire, et pour toute équipe s'entraînant sur des tâches non vérifiables (écriture, raisonnement, dialogue ouvert), la réponse jusqu'à présent est oui.
Le code est promis sur le dépôt de Microsoft sous le nom de projet EL. Une fois publié, le véritable test sera de savoir si la méthode passe à l'échelle sur des modèles plus grands et reste stable avec différents modèles de coaching. Pour l'instant, elle offre une voie concrète hors du piège scalaire qui a contraint le post-entraînement pour les tâches ouvertes depuis que le RLHF est devenu standard.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.