LLMs y Modelos3 min read
Investigación en IA
Por qué la probabilidad logarítmica de los tokens es la señal equivocada para monitorear modelos de razonamiento de IA
Novelis Research demuestra que la probabilidad logarítmica de los tokens falla como monitor de decodificador para modelos de razonamiento cuantizados, siendo ciega a los bucles confiados. Introducen un controlador e-CUSUM calibrado que combina señales de incertidumbre y repetición, logrando selectividad en GSM8K con DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03