IA4 min read
Apprentissage par renforcement
Des chercheurs de Meta et de l'UIUC entraînent des modèles vision-langage à vérifier leur propre travail et à repenser les mauvaises réponses
SVR-R1 transforme l'auto-verdict binaire d'un modèle vision-langage en un signal d'apprentissage. Testé sur des benchmarks de raisonnement sur graphiques et tableaux, il surpasse largement le GRPO standard tandis que le modèle réduit progressivement le nombre de tours de vérification, indiquant qu'il internalise l'auto-correction.
2026-07-25