Investigación en IA
Por qué la probabilidad logarítmica de los tokens es la señal equivocada para monitorear modelos de razonamiento de IA
Novelis Research demuestra que la probabilidad logarítmica de los tokens falla como monitor de decodificador para modelos de razonamiento cuantizados, siendo ciega a los bucles confiados. Introducen un controlador e-CUSUM calibrado que combina señales de incertidumbre y repetición, logrando selectividad en GSM8K con DeepSeek-R1-Distill-Qwen-1.5B.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-03 · 3 min de lectura

La cuantización de baja precisión hace que los modelos de razonamiento pequeños sean baratos de implementar, pero degrada su razonamiento en cadena de pensamiento. Un instinto natural es monitorear el decodificador e intervenir cuando la generación falla. Pero un nuevo estudio de Novelis Research sostiene que el observable más obvio, la probabilidad logarítmica de los tokens, es la base incorrecta para tal monitor.
Por qué falla la probabilidad logarítmica
El estudio, liderado por El Hassane Ettifouri y colegas, muestra que centrar la probabilidad logarítmica de un token bajo la ley de muestreo del propio modelo produce una martingala válida. Pero esa martingala mide la autoconsistencia del muestreo, no la salud de la trayectoria. Cuando un modelo entra en un bucle de repetición confiado, el token tiene probabilidad cercana a 1, probabilidad logarítmica cercana a 0 y entropía cercana a 0. El monitor se queda en silencio justo cuando el modelo se equivoca con confianza.
En una verificación de cordura controlada, la martingala de probabilidad logarítmica activó alarmas en el 63% de los flujos saludables, una tasa de falsas alarmas que la descalifica como detector, sin embargo, detectó bucles confiados solo el 42% de las veces. El detector e-CUSUM calibrado capturó el 100% de los bucles confiados y los regímenes de deriva-colapso sin falsas alarmas en texto saludable.
El reemplazo e-CUSUM calibrado
Los investigadores construyeron un controlador de decodificador sin entrenamiento a partir de dos partes. Primero, una puntuación de alarma consciente de degeneración que fusiona la incertidumbre del token con una señal explícita de repetición textual. Segundo, un detector secuencial basado en procesos e calibrado que convierte el proceso de producto bruto en una estadística con base CUSUM para la detección de cambios.
La calibración fue decisiva. Una línea base no calibrada (μ0=0.15) hizo que el detector se activara en el 93-95% de todas las generaciones, volviéndolo inútil. Establecer μ0 en el percentil 90 de las trazas FP16 saludables (0.41) lo convirtió en un detector selectivo con una precisión de alrededor de 0.6 y phi alrededor de 0.3, frente a una tasa base de 0.38 de trazas malas.
Hallazgos empíricos en GSM8K
Usando DeepSeek-R1-Distill-Qwen-1.5B en 100 problemas de prueba GSM8K, el estudio encontró que los bucles textuales son raros, como máximo el 4% de los tokens incluso en trazas fallidas. El modo de fallo dominante es la no terminación: hasta el 49% de las trazas INT4 incorrectas agotan el presupuesto de 2048 tokens. Esto coincide con los hallazgos de Lotfi et al. (2026) de que los modelos cuantizados sobreproducen marcadores como 'espera' y 'pero' en posiciones de alta entropía.
El controlador redujo las señales de degeneración textual. La repetición consecutiva media en INT4 cayó de 0.010 a 0.003, los bucles severos del 1% al 0%, y la truncación del 22% al 19%. La precisión se movió en la dirección correcta, más 6 puntos en INT4 y más 4 en FP16, pero las diferencias no fueron estadísticamente significativas (McNemar p=0.18 para INT4 con n=100). El costo en tokens fue de más 28%, y el tiempo de ejecución aumentó un 30%.
Implicaciones metodológicas
La contribución perdurable del estudio es metodológica: una explicación clara de por qué un observable tentador es inadecuado, más un reemplazo calibrado y evaluado honestamente. El proceso de producto bruto tiene una garantía genuina de falsas alarmas uniforme en el tiempo al estilo de Ville bajo un nulo condicional, pero la estadística CUSUM implementada se reporta a través de puntos operativos empíricos en lugar de como una garantía matemática estricta.
Los investigadores publican todo el código, las herramientas de calibración y las trazas para respaldar estudios a mayor escala que la cuestión de la precisión necesita en última instancia. Recomiendan que el trabajo futuro se centre en puntos de referencia más difíciles donde la no terminación y la deriva sean más frecuentes, y en ablaciones que separen la contribución de las señales solo de entropía frente a solo de repetición en la puntuación de alarma.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.