IA4 min read
Interpretabilidad
Las puntuaciones altas de reconstrucción no significan que tus explicaciones de IA sean verdaderas
Los autoencodificadores de lenguaje natural puntúan las explicaciones mediante reconstrucción, pero un nuevo estudio muestra que esta prueba se supera incluso cuando el 98% de las afirmaciones específicas son falsas. Los autores presentan RECAP, un método de entrenamiento que permite a las sondas verificar de forma independiente el contenido designado, superando la detección adversarial de mentiras con un AUC de 0.95 frente al nivel aleatorio 0.51 de los métodos estándar.
2026-07-24