SevenTnewS

Interpretabilidad

Las puntuaciones altas de reconstrucción no significan que tus explicaciones de IA sean verdaderas

Los autoencodificadores de lenguaje natural puntúan las explicaciones mediante reconstrucción, pero un nuevo estudio muestra que esta prueba se supera incluso cuando el 98% de las afirmaciones específicas son falsas. Los autores presentan RECAP, un método de entrenamiento que permite a las sondas verificar de forma independiente el contenido designado, superando la detección adversarial de mentiras con un AUC de 0.95 frente al nivel aleatorio 0.51 de los métodos estándar.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-24 · 4 min de lectura

Las puntuaciones altas de reconstrucción no significan que tus explicaciones de IA sean verdaderas

Los investigadores en interpretabilidad confían en una apuesta simple: si puedes reconstruir la activación de una neurona a partir de una explicación legible por humanos, esa explicación debe haber capturado algo real. Un artículo publicado en arXiv el 22 de julio de 2026, Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations, sostiene que esa apuesta es estructuralmente insostenible.

Los autoencodificadores de lenguaje natural funcionan entrenando un codificador para convertir activaciones ocultas en palabras y un decodificador para regenerar la activación a partir de esas palabras. Una reconstrucción alta significa que la explicación pasa la prueba. El problema, como muestran los autores, es que la prueba se supera de dos maneras y solo una es fiel.

La esencia no es la verdad

Cuando un equipo liderado por Hiskias Dingeto Dr ejecutó la receta estándar contra un verbalizador Qwen-2.5-7B publicado, las explicaciones se reconstruyeron muy por encima del azar. Pero solo alrededor del 2% de las afirmaciones fácticas individuales en esas explicaciones dependían realmente de la reconstrucción, lo que significa que se podía cambiar el 98% de las afirmaciones y la reconstrucción apenas se movía. La puntuación rastreaba la esencia, no la verdad específica.

El hallazgo se hace eco de una tensión conocida en la interpretabilidad: el contenido semántico de alto nivel («esta neurona detecta concordancia sujeto-verbo») y la fidelidad de reconstrucción de bajo nivel pueden divergir. Trabajos anteriores de Anthropic y otros han demostrado que las explicaciones de activación pueden ser plausibles sin estar causalmente conectadas a lo que el modelo calcula. El nuevo artículo formaliza el modo de fallo en el entorno del autoencodificador y muestra que no es un caso marginal.

Códigos coadaptados en cada ejecución

Esquema: Comparativa del verbalizador estándar frente al pipeline RECAP

Los autores diseñaron una configuración sintética de verdad fundamental donde la explicación correcta para un conjunto de activaciones se conocía con exactitud. Al ejecutar la receta de entrenamiento estándar, las explicaciones lograron puntuaciones altas de reconstrucción, pero 5 de cada 5 ejecuciones independientes convergieron en códigos privados coadaptados: una redacción de la que el decodificador dependía pero que no correspondía al comportamiento real del modelo. Los códigos parecían inglés normal, pero eran funcionalmente un apretón de manos secreto entre el codificador y el decodificador, saltándose por completo el modelo objetivo.

Fijar los parámetros del modelo objetivo, una sugerencia común para estabilizar la interpretabilidad, no ayudó. El par codificador-decodificador simplemente ajustó su señalización privada para permanecer dentro de la variedad de salida del objetivo congelado. Esto sugiere que el fallo no es un artefacto de entrenamiento, sino una propiedad estructural del juego de reconstrucción tal como se juega actualmente.

RECAP: un enfoque alternativo

En lugar de intentar parchear la prueba de reconstrucción, el artículo propone una estrategia diferente. RECAP, Readable Encodings via Co-trained Auxiliary Predictors, entrena cabezales clasificadores lineales junto al modelo objetivo, manteniendo el contenido interno designado decodificable de forma independiente. Los nuevos verbalizadores entrenados en modelos preparados con RECAP declararon el contenido designado de forma veraz, y los códigos coadaptados desaparecieron. Los autores informan de un costo de +0.001 nats en perplejidad del modelo.

En un entorno de pruebas entrenado con verdad fundamental sintética, el verbalizador entrenado con RECAP logró una puntuación de veracidad comparable a la verdad fundamental conocida. El resultado se replica en un modelo Pythia-160M preentrenado: el contenido designado se volvió decodificable de forma fiable por la sonda. Un verbalizador nuevo lo transmitió solo en parte (puntuación de veracidad 0.44, 0.46 frente a un control casi nulo en la versión sin RECAP), lo que sugiere que el método no es una solución completa a gran escala, pero sí una mejora significativa.

Robustez adversarial

El resultado más sólido proviene del entorno adversarial. Los autores construyeron un adversario que edita la explicación de un verbalizador para maximizar la puntuación de reconstrucción mientras inserta mentiras, suprimiendo efectivamente alrededor del 87% de la penalización por afirmaciones falsas. El AUC de detección de una sonda estándar colapsó a 0.51, estadísticamente aleatorio. Pero una sonda entrenada con RECAP mantuvo un AUC de 0.95, detectando las mentiras suprimidas.

Las cifras son llamativas: AUC 0.95 frente a 0.51 contra el mismo adversario, en el mismo modelo, con las mismas ediciones. La sonda de control no puede distinguir si el verbalizador está mintiendo. La sonda RECAP ve a través de la mentira de manera consistente.

Lo que está en juego para la seguridad y la interpretabilidad

Para la comunidad de interpretabilidad, el mensaje principal del artículo es cauteloso: las puntuaciones altas de reconstrucción no certifican afirmaciones individuales. Un investigador que ejecute un verbalizador en un modelo crítico para la seguridad no puede confiar en la explicación solo porque la reconstrucción se vea bien. Para la seguridad de la IA, la implicación es diferente. RECAP hace que el contenido interno designado sea verificable de forma independiente mediante sondas, en lugar de depender de una prosa que el modelo pueda manipular. Una sonda independiente puntúa las afirmaciones verdaderas del verbalizador por encima de las falsas con un AUC de 0.96, frente a 0.82 sin RECAP.

El método no se presenta como plug-and-play: entrenar los cabezales lineales junto al modelo objetivo requiere modificar el pipeline de entrenamiento, y la replicación en Pythia muestra que un verbalizador nuevo captura solo alrededor de la mitad de la verdad. Pero la dirección es clara: en lugar de intentar arreglar la prueba de reconstrucción, construir un sistema donde los hechos designados sean decodificables a través de un canal separado que el verbalizador no pueda falsificar.

El artículo está disponible en arXiv (presentado el 22 de julio de 2026) junto con repositorios de código y datos.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.