raisonnement multimodal
2 published articles
Apprentissage par renforcement
Des chercheurs de Meta et de l'UIUC entraînent des modèles vision-langage à vérifier leur propre travail et à repenser les mauvaises réponses
SVR-R1 transforme l'auto-verdict binaire d'un modèle vision-langage en un signal d'apprentissage. Testé sur des benchmarks de raisonnement sur graphiques et tableaux, il surpasse largement le GRPO standard tandis que le modèle réduit progressivement le nombre de tours de vérification, indiquant qu'il internalise l'auto-correction.
2026-07-25
IA multimodale
Pourquoi les modèles vision-langage ont besoin d'une fenêtre de relais visuel pour arrêter de halluciner
De nouvelles recherches révèlent une redistribution stable en trois étapes de l'attention multimodale dans les VLM, opérationnalisée sous le nom de Fenêtre de Relais Visuel (VRW). Le cadre TRACE utilise des modules légers entraînés pour planifier cette fenêtre par tâche, améliorant les bancs d'essai sensibles à l'ancrage de 4,33 points en moyenne et jusqu'à 6,6 points.
2026-07-23