IA4 min read
Interprétabilité
Un score de reconstruction élevé ne signifie pas que vos explications d'IA sont vraies
Les autoencodeurs en langage naturel évaluent les explications par reconstruction, mais une nouvelle étude montre que ce test est réussi même lorsque 98 % des affirmations spécifiques sont fausses. Les auteurs introduisent RECAP, une méthode d'entraînement qui permet aux sondes de vérifier indépendamment le contenu désigné, surpassant la détection de mensonges adverses avec une AUC de 0,95 contre 0,51 pour les méthodes standard.
2026-07-24