Interpretabilidad Mecanicista
Lo que gemma-4 realmente sabe de física: un nuevo artículo descubre que las representaciones son reales
Una nueva investigación sobre gemma-4-E4B-it revela que las representaciones internas del modelo de los mecanismos de ciencia de materiales están causalmente vinculadas a sus respuestas. El estudio combina múltiples técnicas de sondeo e intervención para demostrar que el conocimiento físico se codifica en transformaciones de estado, no solo en patrones estáticos.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-29 · 3 min de lectura

Los modelos de lenguaje grandes pueden responder preguntas científicas, pero hasta ahora ha sido difícil saber si realmente comprenden la física o simplemente imitan patrones superficiales. Un preprint publicado en arXiv el 22 de julio de 2026 aborda esta cuestión de frente con el modelo de pesos abiertos google/gemma-4-E4B-it, utilizando una batería de técnicas de sondeo e intervención para determinar si los mecanismos de ciencia de materiales están presentes como representaciones legibles y causalmente activas.
Tres formas de representación
El artículo sostiene que la información mecánica adopta tres formas experimentalmente separables dentro del modelo: los conceptos son legibles en estados ocultos individuales, la orientación constitutiva es transportada por transformaciones controladas entre estados, y las representaciones internas seleccionadas controlan causalmente las respuestas de ingeniería. Los investigadores combinan lecturas de vocabulario directas y de Jacobiano, geometría de estado sin opciones, un benchmark contrafáctico de 60 leyes e intervenciones causales para establecer cada una.
En 50 descripciones de materiales reservadas, tres lentes de Jacobiano ajustadas de forma independiente reprodujeron los rangos de conceptos, y los conjuntos de palabras sin objetivo de ambas lecturas permitieron la identificación ciega de 9 de 10 familias de mecanismos. La décima familia fue un fallo, que los autores atribuyen a que está definida más por similitud léxica que por un concepto físico distinto.
La auditoría de grafos y la prueba de dirección

Un benchmark separado de 72 indicaciones produjo vecindarios de estado oculto específicos de mecanismos, pero una auditoría exacta de grafos mostró que esta aparente organización física se explicaba igualmente por comparación numérica. Este es un resultado cautelar: la estructura del espacio de estados puede parecer física cuando en realidad es solo aritmética.
Para sortear esto, el equipo comparó indicaciones por lo demás idénticas en las que solo se invertía la dirección de la entrada física, preguntando si el movimiento resultante del estado oculto seguía la ley constitutiva proporcionada. Estas transformaciones de estado orientaron correctamente 39 de 40 leyes direccionales, mientras que los controles léxicos estuvieron cerca del azar. Las leyes directas, físicamente neutras e inversas en 60 relaciones congeladas se ordenaron correctamente. La conclusión: las relaciones físicas son más visibles en cambios de estado controlados que solo en estados absolutos.
Intervenciones causales y contrafácticos
Las intervenciones bidireccionales desplazaron las probabilidades de respuesta hacia o desde el resultado físicamente apropiado en los 12 casos emparejados. Los parches de estado contrafácticos transfirieron señales de decisión opuestas a través de mecanismos y formatos de respuesta. Este es el tipo de evidencia causal que va más allá de la correlación: cuando la representación cambia de dirección, la respuesta la sigue.
El trabajo es relevante más allá de la ciencia de materiales. Sugiere una metodología general para probar si el conocimiento físico de un modelo es real o superficial, utilizando inversiones controladas de dirección e intervenciones dirigidas en lugar de solo sondeo estático. El énfasis en el movimiento sobre la posición es la innovación metodológica.
Lo que significa para la interpretabilidad
La investigación en interpretabilidad ha lidiado durante mucho tiempo con la cuestión de si los LLM contienen una comprensión científica genuina o simplemente un buen juego de coincidencia de patrones. Este artículo se inclina hacia el lado de "lo suficientemente genuino para dirigir". Las representaciones no están simplemente presentes de manera pasiva, son causalmente activas y direccionalmente consistentes.
La naturaleza de pesos abiertos de gemma-4-E4B-it hizo posible el experimento. Los modelos propietarios rara vez permiten a los investigadores sondear y parchear estados ocultos individuales a este nivel de granularidad. Esa es una ventaja estructural para el ecosistema de código abierto: artículos como este son más difíciles de escribir con modelos cerrados.
Sin embargo, hay una nota aleccionadora en el resultado de la auditoría de grafos. Los vecindarios del espacio de estados pueden engañar. Un modelo puede organizar sus representaciones de una manera que refleje la física sin usar realmente esa organización para razonar. La prueba de dirección encontró una estructura física real debajo, pero no todas las estructuras aparentes sobrevivieron al escrutinio.
El siguiente paso, sugieren los autores, es extender el método a otros dominios científicos y a modelos de pesos abiertos de varios tamaños para ver si los mismos patrones de representación se mantienen a lo largo de la escala.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.