Investigación sobre alineación de IA en arXiv, 10 de septiembre de 2026
Dar a la IA un «ello artificial» podría arreglar el control, o afianzar el fracaso
El preprint sostiene que la alineación debería ser una propiedad de un sistema agéntico en continuidad y no de una única respuesta de un modelo, y que las comprobaciones por respuesta no pueden eliminar una mala estrategia que sobrevive hasta la siguiente tarea. Su evidencia es un controlador demasiado pequeño para razonar.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-09-21 · 5 min de lectura

El controlador del experimento que Yakov Shkolnikov describe en un preprint del 10 de septiembre es demasiado pequeño para razonar. No se le asigna ningún objetivo conductual específico de tarea. Aun así desarrolla un control útil, porque los comportamientos que persisten mejor que otros quedan seleccionados, y el controlador es lo que persiste.
El artículo, «Artificial Id: Drive and Persistent Alignment in Agentic AI», propone un impulso interno que decide si un comportamiento debe continuar, detenerse o cambiar. El planteamiento es más ambicioso que el experimento, que es una placa de Petri virtual.
Un impulso que nadie especificó
El resumen parte de un cambio ya en marcha: los sistemas agénticos pasan de la ejecución acotada de tareas a sistemas que retienen estado con consecuencias, siguen operando y se adaptan a través de las fronteras entre tareas. Eso crea un problema de control que los arneses actuales resuelven en gran medida a mano. Los objetivos, los reintentos, la verificación, las reglas de parada y otras transiciones de comportamiento se especifican fuera del agente y se aplican desde ahí. El modo de fallo del otro lado ya está documentado: una memoria que sigue siendo recuperable después de dejar de ser cierta es peor que no tener memoria alguna, como encontró el estudio de TEPA sobre la memoria obsoleta de los agentes.
Un ello artificial trasladaría parte de eso hacia dentro. El artículo lo define como un impulso interno adaptativo que determina si un comportamiento debe continuar, detenerse o cambiar. La afirmación interesante no es que los agentes actúen, algo que el montaje da por supuesto. Es que puede emerger una dirección útil sin que se escriba en ninguna parte como objetivo conductual.
El nombre lleva un eco freudiano: una fuerza interna que desea antes de razonar. El mecanismo descrito aquí es más modesto: persistencia diferencial en lugar de apetito.
Lo que la placa de Petri muestra en realidad
La evidencia está deliberadamente acotada. El experimento es mínimo y virtual, y su controlador se describe como demasiado pequeño para realizar razonamiento de propósito general. Esa restricción hace un trabajo real en el argumento. Si el comportamiento de control emergió en un componente que no podría haber llegado a la respuesta por razonamiento, entonces algo distinto del razonamiento lo produjo.
El artículo reporta dos resultados. El controlador selecciona una estrategia física no prevista cuando ese comportamiento persiste mejor. Después reemplaza un mapeo de sensores aprendido cuando cambia el significado ambiental de ese mapeo. Ambos llegan como resultados, no como demostraciones.
| Lo que afirma el resumen | Lo que omite |
|---|---|
| Un controlador demasiado pequeño para el razonamiento de propósito general, al que no se le da ningún objetivo específico de tarea | Su tamaño, arquitectura o método de entrenamiento |
| Un experimento mínimo de placa de Petri virtual | Número de ejecuciones, líneas base, métrica de éxito |
| Una estrategia física no prevista, seleccionada porque persiste mejor | En qué consistía la estrategia y cómo se midió «mejor» |
| Un mapeo de sensores aprendido, reemplazado cuando cambia su significado | Qué sensores, y si el reemplazo se mantuvo |
| Una frontera sobre observaciones, estado, autoridad, identidad, procedencia y restricciones | Cualquier implementación o prueba de esa frontera |
Esas lagunas marcan el límite de lo que este documento puede sustentar. El mecanismo se muestra a una escala lo bastante pequeña como para enunciarla en una frase, y el artículo señala su propia extrapolación con un condicional: un ello artificial escalable transportaría estado con consecuencias e impulso adaptativo a través de esas fronteras.
El mismo mecanismo también conserva los errores
La persistencia es la bisagra del artículo y su advertencia. La propiedad que permite a un controlador encontrar una estrategia viable sin que se la indiquen es la misma que permite que una mala estrategia siga funcionando. El resumen lo dice sin rodeos: la desalineación, el estado corrupto y el comportamiento no previsto pueden persistir a través de las fronteras entre tareas por la misma razón por la que lo hace el comportamiento adaptativo. Las habilidades de los agentes muestran la misma asimetría desde la dirección opuesta: las correcciones que se acumulan pueden dejar a un agente peor de como empezó, el impuesto de regresión que documenta este estudio sobre habilidades procedimentales.
El contraste con la práctica actual está en las propias palabras del artículo. La alineación pasaría a ser una propiedad del sistema agéntico en continuidad y no de una respuesta del modelo o de una única trayectoria, lo que implica que las comprobaciones por respuesta son el punto en el que estamos ahora. Una salida dañina que muere al final de una tarea es una mala respuesta. Una estrategia dañina que sobrevive hasta la siguiente tarea es una condición permanente, y ningún filtrado por respuesta la elimina. Esa descoincidencia entre la llamada individual y la tarea completa no es exclusiva de la alineación: los sistemas de enrutamiento también se han topado con ella, y por eso TRACE-Router trabaja en cambio a nivel del éxito de la tarea.
La alineación como propiedad del sistema, no de la respuesta
¿Qué reemplazaría a la comprobación por respuesta? El resumen enumera el terreno que tendría que cubrir una frontera de alineación persistente: observaciones fiables, canales de consecuencias, estado persistente, autoridad, identidad, procedencia y restricciones duras. Eso es una especificación de lo que hay que proteger, no un diseño para protegerlo. En el resumen no aparece ninguna implementación, modelo de amenazas ni método de evaluación de esa frontera. La mitad de esa lista dedicada a la procedencia tiene un precedente funcional en otro lugar: la máquina de estados de confianza que propone AgentToolMO para redes de agentes con múltiples proveedores en las que una herramienta comprometida sigue siendo invocada.
Tampoco nombra ningún sistema previo ni enfoque competidor. Quien espere situar este trabajo frente a los esfuerzos existentes sobre estado persistente de agentes tendrá que hacer ese mapeo por su cuenta.
Qué lo falsificaría
La afirmación es contrastable, algo que no puede decirse de la mayoría de los documentos de planteamiento. Tres preguntas resolverían buena parte del asunto. ¿Sobrevive el impulso cuando la persistencia deja de compensar, o se lleva consigo la adaptación útil? ¿Puede eliminarse una estrategia no prevista mientras el comportamiento adaptativo del que surgió permanece intacto? ¿Una frontera sobre el estado y la identidad realmente detecta el estado corrupto, o solo marca el lugar donde se detectaría?
Ninguna de ellas se responde en un solo resumen, y este no está revisado por pares. No es razón para descartarlo. Es razón para tratar la afirmación sobre la persistencia como estructural y el lenguaje sobre sistemas escalables como la parte que aún debe evidencias. La contribución puede ser más estrecha de lo que sugiere el título: una demostración de que la dirección puede surgir de persistir, y una advertencia de que persistir no comprueba lo que arrastra.
- Fuente : Giving AI an "artificial id" could fix control, or entrench failure — 2026-09-10
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.