modèle vision-langage
4 published articles
CARE-X Medical AI
Dilatation aortique légère : 12% détectés à la première lecture, 93% avec un VLM de mesure
La dilatation aortique est rarement quantifiée sur les radiographies thoraciques, et les cas légers passent inaperçus : 5 sur 43 lors des premières lectures. Un VLM augmenté d'outils en a détecté 40. Les nouvelles recherches sur CARE-X expliquent pourquoi l'IA radiologique a besoin de règles, et pas seulement d'yeux.
2026-08-16
Intelligence artificielle
AutoVSR : un cadre IA qui relie les schémas de circuits aux expressions symboliques avec une approche de vérification prioritaire
AutoVSR utilise la perception visuelle, une représentation intermédiaire exécutable et des solveurs symboliques augmentés d'outils pour convertir de manière fiable des schémas de circuits en expressions symboliques valides. Les expériences sur cinq types de circuits montrent qu'il surpasse à la fois les VLM généralistes et les méthodes spécialisées, avec des améliorations de précision respectives de 30 à 59 % et de 42 à 52 %.
2026-08-04
Apprentissage par renforcement
Des chercheurs de Meta et de l'UIUC entraînent des modèles vision-langage à vérifier leur propre travail et à repenser les mauvaises réponses
SVR-R1 transforme l'auto-verdict binaire d'un modèle vision-langage en un signal d'apprentissage. Testé sur des benchmarks de raisonnement sur graphiques et tableaux, il surpasse largement le GRPO standard tandis que le modèle réduit progressivement le nombre de tours de vérification, indiquant qu'il internalise l'auto-correction.
2026-07-25
IA multimodale
Un modèle de 12B bat un modèle de 90B. L'orthodoxie du scaling est en difficulté
Pixtral-12B égale ou bat des modèles sept fois plus grands sur des benchmarks multimodaux, sans sacrifier les performances linguistiques. Mistral publie également un nouveau benchmark ouvert pour l'évaluation pratique vision-langage, remettant en cause l'idée que plus grand est toujours meilleur.
2026-07-17