SevenTnewSNoticias de IA y tecnología, explicadas

Interpretabilidad de LLM: preimpresión de arXiv, 10 sep 2026

Qwen, Llama y Gemma discrepan sobre cuándo un modelo deja de enrutar y empieza a responder

La preimpresión 'From Parameters to Answers' separa lo que un modelo puede leer temprano de lo que realmente dirige su salida. Entre Qwen, Llama y Gemma las trayectorias difieren, y una dirección de solicitud conserva un efecto tardío que una simple historia de temprano versus tardío no puede explicar.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-09-20 · 4 min de lectura

Qwen, Llama y Gemma discrepan sobre cuándo un modelo deja de enrutar y empieza a responder

Qué hizo realmente la preimpresión

La pregunta es mecánica: a medida que un modelo de lenguaje responde, ¿cómo cambia su dependencia de la información de enrutamiento de consultas en relación con su dependencia del conocimiento que respalda la respuesta? From Parameters to Answers, enviado a arXiv el 10 de septiembre de 2026, la aborda interviniendo sobre el estado oculto al final de la pregunta, capa por capa, en lugar de leer la salida del modelo y trabajar hacia atrás a partir de ella.

El equipo compara preguntas de país-continente con respuestas de sustantivo, adjetivo y código, manteniendo distintas varias mediciones ajustadas. Dos direcciones de solicitud reciben nombres. Una dirección de solicitud condicionada por pares describe qué país se consulta en preguntas naturales de un solo país. Una dirección de solicitud global describe solicitudes de primer versus segundo país en preguntas emparejadas. Candidatos de selección separados prueban el control entre contenidos ya disponibles en el estado oculto.

Los tres modelos aparecen solo como familias. El material nombra Qwen, Llama y Gemma, y ninguna variante, tamaño o checkpoint, por lo que nada aquí debe leerse como una afirmación sobre una versión específica.

Qwen, Llama y Gemma no cambian según el mismo calendario

Las trayectorias emparejadas de los tres modelos no son uniformes, y ese es el primer resultado que vale la pena extraer del artículo. Gemma muestra un perfil de contenido de enrutamiento de capa media parcialmente superpuesto, que el resumen informa sin más desglose. Llama no tiene una ventana sostenida de efecto de enrutamiento bajo las mismas condiciones.

Eso es una división en tipo, no en grado. Cualquiera que supusiera que las tres familias comparten un calendario por capas para el enrutamiento y el contenido se equivoca respecto de al menos una de ellas, y la preimpresión no dice qué diferencia de entrenamiento o arquitectónica produce la divergencia.

Familia de modeloLo que informa la preimpresión
QwenLa dirección de solicitud condicionada por pares se fortalece antes de que las intervenciones sobre ella alteren el conocimiento ajustado posterior; una comparación emparejada muestra que conserva un efecto tardío
GemmaPerfil de contenido de enrutamiento de capa media parcialmente superpuesto
LlamaNinguna ventana sostenida de efecto de enrutamiento bajo las mismas condiciones

Qwen llega por una ruta diferente. Su evidencia en el resumen proviene de un reanálisis diagnóstico de estados congelados de preguntas naturales, y conlleva la distinción más nítida del artículo.

La transferencia: la información de solicitud se desvanece, el contenido permanece

En el protocolo emparejado, la dependencia de la dirección de solicitud global disminuye a medida que el análisis pasa de conjuntos fijos de capas anteriores a posteriores, mientras que la dependencia del contenido ajustado persiste. El enrutamiento se debilita a través de la profundidad; el material detrás de la respuesta no.

El reanálisis de Qwen le da forma a ese cambio. La dirección de solicitud condicionada por pares se vuelve más fuerte antes de que las intervenciones sobre ella comiencen a alterar el conocimiento ajustado posterior, y la ventana causal se abre mientras el contenido que respalda la respuesta aún se está formando. Poder leer una dirección en una capa y poder cambiar el modelo a través de ella no son la misma propiedad, y las dos se separan a diferentes profundidades.

El límite que los autores trazan alrededor de su propio resultado

La comparación emparejada de Qwen evita que el hallazgo se extralimite: la dirección condicionada por pares conserva un efecto tardío. Por lo tanto, la transferencia operativa se refiere específicamente a la dirección ajustada global, no a la información de solicitud en su conjunto. Dirigir un modelo mediante una señal de país y dirigirlo mediante una señal de pregunta emparejada se comportan de manera diferente a las mismas profundidades.

El resumen no cuantifica nada de esto. No informa tamaños del efecto, ni recuentos de capas, ni una comparación del efecto tardío condicionado por pares con el anterior. Esa brecha deja abierto cuánto de la transferencia es una señal fuerte y cuánto es una dirección que simplemente deja de importar.

Por qué cuatro mediciones superan a una

La afirmación metodológica del artículo es que cuatro propiedades que a menudo se informan juntas deben mantenerse separadas: legibilidad temprana, fuerza natural, control causal y dependencia del contenido posterior. Una dirección puede ser legible en un estado oculto sin ser lo que mueve la salida, y una dirección puede dirigir una salida en un conjunto de capas mientras algo más transporta la respuesta en otro.

Esa separación es lo que hace que los resultados de Llama y Gemma sean comparables con el de Qwen, y también es donde residen los límites de la preimpresión. Con el protocolo disponible solo en forma de resumen, su afirmación más trasladable es negativa: una dirección que se lee claramente en una capa no es automáticamente la dirección que decide la respuesta en esa capa.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.