interprétabilité
3 published articles
IA explicable
Le bouton que personne ne voulait tourner : dtControl2+ε permet de sacrifier l'optimalité pour la clarté
Une nouvelle extension de dtControl2 permet aux ingénieurs d'échanger une quantité précise de performance contre des arbres de décision plus petits et plus compréhensibles. L'outil, dtControl2+ε, garantit l'ε-optimalité tout en élaguant les arbres à des ordres de grandeur de nœuds en moins.
2026-08-05
Interprétabilité
Un score de reconstruction élevé ne signifie pas que vos explications d'IA sont vraies
Les autoencodeurs en langage naturel évaluent les explications par reconstruction, mais une nouvelle étude montre que ce test est réussi même lorsque 98 % des affirmations spécifiques sont fausses. Les auteurs introduisent RECAP, une méthode d'entraînement qui permet aux sondes de vérifier indépendamment le contenu désigné, surpassant la détection de mensonges adverses avec une AUC de 0,95 contre 0,51 pour les méthodes standard.
2026-07-24
Neurosciences
L'IA en neurosciences qui explique enfin ce que font réellement les parties du cerveau
Le test causal génératif (GCT) distille les modèles de prédiction cérébrale basés sur les LLM en explications verbales concises, puis utilise un LLM pour rédiger des histoires qui testent causalement ces affirmations en IRMf. Dans les expériences, le GCT a confirmé la sélectivité connue, a distingué des régions voisines de traitement des lieux, et a découvert de nouvelles micro-régions préfrontales accordées à des concepts comme le dialogue et les mesures.
2026-07-11