modèles vision-langage
2 published articles
Évaluation ancrée vs. non ancrée
Pourquoi l’auto-évaluation de votre modèle d’IA échoue sur la qualité visuelle
Une nouvelle recherche introduit l’« ancrage » comme variable clé régissant un troisième axe du calcul au moment du test : le dimensionnement par interaction. Les résultats montrent qu’un instrument déterministe mesurant la disposition réelle surpasse l’évaluation VLM sur capture d’écran, corrigeant 40 % des défauts sur les diapositives denses et 74 % des défauts sur les figures académiques, alors que la métrique standard ne voit rien.
2026-07-31
IA multimodale
Pourquoi les modèles vision-langage ont besoin d'une fenêtre de relais visuel pour arrêter de halluciner
De nouvelles recherches révèlent une redistribution stable en trois étapes de l'attention multimodale dans les VLM, opérationnalisée sous le nom de Fenêtre de Relais Visuel (VRW). Le cadre TRACE utilise des modules légers entraînés pour planifier cette fenêtre par tâche, améliorant les bancs d'essai sensibles à l'ancrage de 4,33 points en moyenne et jusqu'à 6,6 points.
2026-07-23