SevenTnewS

Inteligencia Artificial

Por qué la cadena de pensamiento de tu IA está desperdiciando tokens y cómo el parada óptima lo soluciona

Investigadores del MIT proponen OS-Pruner, un complemento que detiene dinámicamente el razonamiento de cadena de pensamiento cuando una mayor computación no vale el costo de tokens. Las pruebas muestran una reducción de longitud del 20 al 60% con un sacrificio mínimo de precisión.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-29 · 4 min de lectura

Por qué la cadena de pensamiento de tu IA está desperdiciando tokens y cómo el parada óptima lo soluciona
Fuentes : OS-Pruner: Prun…

Cada vez que un modelo de lenguaje grande resuelve un problema matemático o escribe código, produce una cadena de pensamiento, un rastro de pasos de razonamiento que puede extenderse a miles de tokens. Pero no todos esos tokens sirven para la respuesta final. Los modelos suelen pensar en exceso: reafirmando conclusiones, verificando puntos ya resueltos o persiguiendo callejones sin salida. El costo es real: mayor latencia, mayores facturas de inferencia y, paradójicamente, a veces menor precisión.

Pensar en exceso como un impuesto computacional

El fenómeno está bien documentado. DeepSeek-R1, diseñado para escalar la computación en tiempo de prueba mediante largas trazas de razonamiento, a menudo continúa generando después de que la solución correcta ha sido decodificada. El mismo comportamiento aparece en GPT-OSS-20B y modelos destilados como DeepSeek-R1-Distill-Qwen-7B. Estudios de O1-Pruner y DRPO han demostrado que hasta el 60% de los tokens generados pueden ser redundantes.

Los intentos anteriores de podar este desperdicio se dividen en tres categorías. Los métodos del lado del modelo, como O1-Pruner y DRPO, reentrenan el modelo base para producir trazas más cortas, lo cual es efectivo pero costoso y corre el riesgo de degradar el rendimiento en tareas fuera de la distribución. Los métodos de control de presupuesto, como el forzado de presupuesto de s1, imponen un límite de tokens fijo externamente, ignorando que algunos problemas necesitan más razonamiento. Y los clasificadores de salida temprana basados en entrenamiento, HALT-CoT, Answer Convergence, FlashThink, tratan la parada como un umbral de confianza, lo que pasa por alto la naturaleza secuencial de la decisión.

OS-Pruner replantea el problema

El equipo del MIT detrás de OS-Pruner argumenta que la formulación estándar es incorrecta. De su artículo: "Argumentamos que la poda de CoT es más naturalmente un problema de decisión secuencial". Su idea clave es que después de cada paso de razonamiento, el sistema enfrenta una elección entre dos acciones: detenerse ahora y producir una respuesta final, o continuar razonando y pagar más tokens con la esperanza de mejorar. Esto es un problema de parada óptima, no de clasificación.

El marco aprende una cabeza de política ligera, solo una capa lineal más el ajuste fino de las últimas dos capas del transformador, que mapea cada prefijo de razonamiento a una probabilidad de detenerse. La función de recompensa equilibra explícitamente precisión y longitud: "r(y≤i|x) = A(y≤i|x) - λL(y≤i)". Un escalar λ único controla la agresividad de la poda, permitiendo a los usuarios ajustar el punto de operación deseado en la frontera de precisión-eficiencia.

Por qué los métodos de clasificación se quedan cortos

El artículo proporciona razones tanto teóricas como empíricas. Los autores demuestran el Teorema 1: la clasificación basada en umbrales puede perder un valor arbitrariamente grande en comparación con la parada óptima. La intuición es que dos cadenas de razonamiento parcial con la misma corrección estimada pueden tener valores de continuación muy diferentes, una podría estar al borde de un avance, la otra atrapada en un bucle. Un clasificador las trata de manera idéntica; la parada óptima ve la diferencia.

En evaluaciones comparativas con DeepSeek-R1-Distill-Qwen-7B, GPT-OSS-20B y DRPO-7B, este último ya optimizado para brevedad mediante compresión del lado del modelo, OS-Pruner supera consistentemente a los métodos de referencia en la Puntuación de Eficiencia de Precisión (AES). Las mayores ganancias se dan en problemas más fáciles donde el exceso de pensamiento es más rampante: 59.3% de reducción de longitud en GSM8K, 52.8% en MATH-500, con cambios de precisión de -0.7% y +2.7% respectivamente.

Eficiencia de entrenamiento como principio de diseño

Debido a que el modelo base está congelado, OS-Pruner puede precomputar recompensas terminando el razonamiento en cada límite de párrafo y verificando si la respuesta sería correcta. No se necesitan costosos despliegues en política durante el entrenamiento. La cabeza de política procesa cada prefijo en paralelo durante la inferencia, invocándose solo en los límites de párrafo, una elección de diseño alineada con marcos de servicio modernos como vLLM.

El programa de entrenamiento progresivo aborda un desafío práctico: para valores bajos de λ, el entrenamiento ingenuo se queda atascado en un mínimo local trivial donde la política nunca se detiene. Comenzar con un λ alto y recocerlo periódicamente produce una frontera de Pareto limpia de compensaciones precisión-longitud.

Implicaciones para el despliegue

La naturaleza de complemento de OS-Pruner significa que se puede adjuntar a cualquier modelo de razonamiento congelado, incluso uno que ya haya sido comprimido. Los autores lo probaron en DRPO-7B, un modelo entrenado explícitamente para eficiencia de longitud, y aún registraron una mejora promedio del 20% en AES, con un 17% en AIME específicamente.

Para los profesionales que ejecutan tuberías de inferencia de alto volumen, los ahorros de tokens no son marginales. Una reducción del 50% en los tokens generados con una precisión casi idéntica reduce los costos de infraestructura y la latencia a la mitad. El parámetro λ proporciona una palanca calibrada: ajústelo alto para aplicaciones sensibles a la latencia, bajo para requisitos de precisión de alto riesgo.

Limitaciones y preguntas abiertas

El trabajo actual se centra en evaluaciones comparativas de razonamiento matemático. Los autores reconocen que escalar a codificación, razonamiento científico y modelos fronterizos de más de 20 mil millones de parámetros sigue siendo trabajo futuro. El estudio de ablación también revela una limitación clave: los modelos con mala capacidad de seguir instrucciones pueden continuar razonando en la sección de "respuesta" después de la parada forzada, socavando la poda. GPT-OSS-20B maneja esto bien; DeepSeek-R1-Distill-Qwen-7B no.

Aún así, OS-Pruner presenta un caso convincente de que el título del artículo, "Poda de Cadenas de Pensamiento de Modelos de Razonamiento mediante Parada Óptima", es más que una contribución metodológica. Es una herramienta práctica para una era donde cada token cuenta.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.