Raisonnement 3D
2 published articles
LLM & Modèles3 min read
Raisonnement 3D
SceneActBench : Pourquoi même les meilleurs VLM échouent dans l'action 3D
SceneActBench teste onze configurations de VLM sur cinq tâches 3D dans une boucle d'agent unifiée. Les scores globaux vont de 38,6 à 50,2, aucun modèle n'étant performant de manière constante. Le benchmark expose un angle mort des agents vision-langage : agir sur des scènes complètes, pas seulement les décrire.
2026-07-31
IA4 min read
Référentiel
GauntletBench d'Oxford soumet les agents IA à 100 tâches réelles. Ils ont échoué dans 81 % d'entre elles.
Le GauntletBench d'Oxford soumet les agents IA à 100 tâches réelles difficiles. Les systèmes de pointe plafonnent à 19,1 % de succès, bien en dessous des performances humaines. Le référentiel cible des capacités négligées en perception temporelle, compréhension graphique et raisonnement 3D dans cinq applications professionnelles.
2026-07-01