SevenTnewS

Agentes de IA

Tratar los SOP como código: un nuevo runtime con paginación de pila separa a los agentes fuertes de los débiles

Una nueva investigación de Hong Kong y China continental demuestra que compilar SOP en pseudocódigo ejecutable y ejecutarlos en una máquina virtual con pila paginada separa limpiamente a los agentes capaces de los frágiles. El trabajo produce una regla de implementación precisa: compilar primero, paginar solo después de una verificación de disciplina a nivel de modelo.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-04 · 5 min de lectura

Tratar los SOP como código: un nuevo runtime con paginación de pila separa a los agentes fuertes de los débiles
Fuentes : Compile, Then P…

Un agente de un centro de llamadas bancario debe seguir un procedimiento operativo estándar: verificar la identidad del cliente, comprobar el estado de la cuenta, evaluar la elegibilidad y luego procesar la solicitud o rechazarla. Cada agente empresarial se enfrenta a esta tarea. El enfoque dominante introduce todo el SOP en la indicación como texto, lo que tiene modos de fallo bien conocidos: la prosa residente de aproximadamente 10 000 caracteres por turno compite con el diálogo por la atención, y la verbalización elimina la estructura ejecutable, como el orden alternativo y los cortocircuitos de compuerta.

Un nuevo artículo de la Universidad Politécnica de Hong Kong, la Universidad de Hong Kong y la Universidad Normal de Zhejiang, titulado "Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents", adopta un enfoque diferente. Los autores tratan el SOP como un programa en lugar de texto. Un compilador determinista fuera de línea traduce las restricciones de dependencia legibles por máquina del punto de referencia en un programa de pseudocódigo de dos capas: funciones de proceso para cada objetivo del usuario y subrutinas de reglas que emparejan cada restricción con una receta de verificación y un retorno con evidencia. Un runtime guiado por programa (PG) en línea ejecuta esto como una máquina virtual de dos capas, donde una máquina de pila simbólica maneja el mantenimiento de registros (pila, cursor, variables, recuperación) y pagina solo el marco activo en el contexto, mientras que el LLM conversa, llama a herramientas y juzga la evidencia.

El diseño de tres brazos

El estudio utiliza un diseño de tres brazos en SOPBench, un punto de referencia que trata el cumplimiento de SOP como tareas de uso de herramientas sobre simuladores de dominio. Los tres brazos (texto oficial, texto compilado y programa compilado más runtime) separan la representación del runtime en tareas idénticas en seis modelos que abarcan niveles de capacidad.

  • offtext: el texto de restricción verbalizada oficial del punto de referencia, residente en cada turno (la línea base de SOP como indicación).
  • flat: el texto completo del programa compilado, residente en cada turno (representación compilada sin el runtime).
  • pg: el mismo programa compilado ejecutado por el runtime PG con paginación de instrucciones justo a tiempo.

Los resultados en Bank, el dominio de atribución principal (125 tareas limpias), muestran que reemplazar el texto oficial del SOP con el texto del programa compilado eleva la tasa de aprobación de DeepSeek-V4-Flash del 70,4% al 86,4% (+16,0 puntos; 26:6, p < 0,001). Habilitar el runtime PG en el mismo programa agrega otros 6,4 puntos, alcanzando el 92,8% en el subconjunto limpio, con un 100% de corrección en el rechazo (86/86). La descomposición revela que la compilación y la paginación principalmente compran un comportamiento de rechazo correcto del modelo fuerte: la ejecución se mueve poco (74,4% a 71,8% a 76,9%), mientras que el rechazo sube del 68,6% al 93,0% al 100%.

Surge una puerta de capacidad

En seis modelos, el efecto del runtime no es ruido alrededor de cero. Abarca un rango con signo de +6,4 (DeepSeek-V4-Flash, p = 0,021) y +3,2 (n.s.) para modelos fuertes, a través de un par de sondas del mismo proveedor en lados opuestos de cero, hasta -14,4 (p = 0,011) para Qwen2.5-7B y -26,4 (GPT-4o-mini, p < 0,001). Agrupar los dos modelos fuertes da 15:3 discordantes (p = 0,016); los dos modelos débiles son independientemente significativos negativos. Las repeticiones de configuración idéntica mantienen a cada modelo en el mismo lado de cero.

El patrón se extiende a los siete dominios. Para los modelos fuertes V4 y Plus, los discordantes agrupados alcanzan 58:19 (p alrededor de 10-5) y 75:31 (p = 2,3 x 10-5), sin que ningún dominio invierta su signo significativamente. Los modelos débiles se ven perjudicados en todo momento, agrupándose a 59:237 para el 7B (p alrededor de 10-26).

Desacoplar la compilación: contenido vs. formato

La compilación agrega contenido (recetas de verificación, cierre de compuerta verificadora, disciplina de evidencia) y reformatea la política como código. Un diseño 2x2 (contenido oficial o compilado x prosa o código) separa los dos. El efecto del formato cambia de signo: resintactizar la prosa oficial en código gana al modelo fuerte +14,4 puntos, pero le cuesta al modelo débil -12,8 puntos. El efecto del contenido en formato de prosa fija es +17,6 para el modelo fuerte, pero no se detecta para el débil (+2,4, n.s.). Una vez que el contenido está compilado, el formato deja de importar (plano vs. c-prosa: -1,6 y +0,8, ambos n.s.). Para los profesionales: la representación compilada nunca perjudica significativamente; el contenido aislado paga por encima de una línea de baja capacidad; la sintaxis de código debe reservarse para modelos a los que claramente ayuda.

Por qué el runtime está cercado: disciplina, no reconstrucción

Las sondas de reconstrucción de estado dirigidas puntúan a los cuatro modelos sondados cerca del techo (0,91 a 0,99), incluidos ambos perdedores del runtime. La puerta no es la incapacidad de reconstruir el estado cuando se les pide. Una auditoría no provocada, que mide las llamadas de dominio medias emitidas después de que la acción objetivo ya haya tenido éxito, separa a los perjudicados de los no perjudicados con una regla de signo único: los dos modelos significativamente perjudicados son exactamente aquellos con firmas positivas (+0,37, +0,57); los cuatro no perjudicados llevan valores negativos (-0,14 a -0,49). La capacidad de reconstrucción está presente dondequiera que se sonda; la disciplina de estado espontánea es lo que rastrea la puerta del runtime.

Las mediciones a nivel de atención confirman la brecha. DeepSeek-V4-Flash concede espontáneamente a su marco del 2,1% del contexto una participación a la par (1,05 frente a 0,96 del plano), y ablacionar todo el historial de diálogo eleva la log-probabilidad de la acción dorada en 1,9 nats. Qwen2.5-7B concede al marco solo 0,15x de paridad en sus propias trayectorias, pero 0,87 presentado limpiamente. Esa es una brecha de capacidad-implementación a nivel de atención.

Guía de implementación

Los resultados rechazan la idea de que más andamiaje siempre es mejor. Compilar cuando la prosa oficial tiene un rendimiento inferior; usar sintaxis de código solo después de una verificación a nivel de modelo, y paginación solo después de una verificación de disciplina. Los modelos fuertes se benefician de la prominencia del marco activo (la mayor parte de la ganancia en rechazo se puede recuperar colocando el marco activo primero mientras se retiene el programa completo), con una ganancia más pequeña centrada en el rechazo de la visibilidad selectiva. Para los modelos débiles, usar el arnés de ejecución fuerte sin guía de marco activo. La paginación es suave y auditable, por lo que las acciones irreversibles aún requieren protecciones duras a nivel de herramienta.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.