Investigación en IA
La espuma en la cadena de pensamiento: un nuevo benchmark revela por qué los LLMs desperdician tokens en razonamientos válidos pero inútiles
Los LLMs a menudo generan cadenas de razonamiento que son correctas pero rellenas con pasos innecesarios. Un nuevo benchmark de diagnóstico y un método de compresión muestran que los evaluadores actuales pasan por alto esta ineficiencia por completo y que la mitad de los pasos de razonamiento escritos por humanos podrían ser comprimibles.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-31 · 4 min de lectura

La cadena de pensamiento (CoT) se ha convertido en la forma estándar de obtener razonamiento de múltiples pasos de los grandes modelos de lenguaje. Divide un problema en pasos intermedios y la precisión del modelo aumenta. Pero un artículo de investigación de KT Corporation y la Universidad de Ciencia y Tecnología de Pohang (POSTECH) argumenta que el campo ha estado optimizando para la señal equivocada.
El artículo, titulado Valid ≠ Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought, identifica un punto ciego en la evaluación actual del razonamiento: los evaluadores que verifican la corrección y la validez lógica a menudo otorgan puntuaciones altas a pasos que son factualmente verdaderos pero funcionalmente inútiles. Los autores llaman a esto espuma informativa, y su trabajo sugiere que constituye una parte significativa de las trazas CoT estándar.
Los investigadores introducen RIV-GSM8K, un benchmark de diagnóstico derivado del conjunto de datos matemáticos GSM8K. RIV-GSM8K inyecta cinco tipos distintos de ineficiencia en las cadenas de razonamiento: Duplicación Simple (repetir un paso), Paráfrasis (reescribir la misma idea), Descomposición (dividir un solo paso en muchos micro-pasos), Razonamiento Circular (repetir sin progreso) e Irrelevante (tangentes que son matemáticamente válidas pero no relacionadas con la solución).
Cuando el artículo probó evaluadores de última generación, incluidos ReasonEval, ThinkPRM y Qwen2.5-Math-PRM, contra RIV-GSM8K, los resultados fueron contundentes. Los modelos existentes retuvieron entre el 70 y el 97 por ciento de los pasos ineficientes inyectados, lo que significa que no lograron marcar pasos que eran claramente redundantes o circulares. ReasonEval, a pesar de tener una puntuación explícita de redundancia, conservó aproximadamente el 70 por ciento de las duplicaciones simples. Incluso el modelo Qwen2.5-Math-PRM de 72 mil millones de parámetros mantuvo el 83 por ciento de ellos.
Para cerrar esta brecha, el artículo propone CAID (Context-Aware Information Density), una métrica libre de entrenamiento que combina cuatro señales: similitud local (redundancia), alineación con el objetivo global (relevancia), densidad de información (verbosidad) y delta semántico (progreso lógico). CAID utiliza solo 146 millones de parámetros en total, un modelo GPT-2 Small para la estimación de densidad y un codificador MiniLM para las incrustaciones, lo que lo hace órdenes de magnitud más pequeño que los evaluadores supervisados que supera.
En RIV-GSM8K, CAID logró una detección casi perfecta de duplicación (0.0 por ciento de preservación) y paráfrasis (1.7 por ciento de preservación). También detectó razonamiento circular (1.9 por ciento de preservación) y descomposición (20 por ciento de preservación), áreas donde las líneas de base tuvieron dificultades. De manera más provocativa, CAID marcó aproximadamente la mitad de los pasos originales escritos por humanos de GSM8K como comprimibles, no como eliminables, sino como expresables de manera más compacta. Solo el 1.5 por ciento de esos pasos marcados fueron señalados para su eliminación directa; el 98.5 por ciento restante se asignó a una acción de fusión, lo que indica que el razonamiento en sí era sólido pero el lenguaje era ineficiente.
Los investigadores validaron el poder de diagnóstico de CAID construyendo un pipeline de compresión llamado PACE (Pruning And Compression for Efficiency). PACE aplica las señales de CAID para comprimir las cadenas de razonamiento después de la generación. En GSM8K, StrategyQA y ARC-Challenge, PACE redujo el consumo de tokens entre un 31 y un 53 por ciento mientras mantenía o mejoraba la precisión. En ARC-Challenge, la precisión en realidad aumentó en 0.94 puntos junto con una reducción del 43.6 por ciento en tokens.
Experimentos de control separaron el efecto de PACE de la poda trivial. Eliminar aleatoriamente el 50 por ciento de los pasos de las cadenas de GSM8K causó que la precisión se desplomara del 82 por ciento al 66.7 por ciento. Incluso eliminar solo el último paso perjudicó el rendimiento. Por el contrario, la compresión selectiva de PACE preservó la precisión en 81.12 por ciento mientras reducía el 31 por ciento de los tokens. Cuando los investigadores reemplazaron CAID con potentes evaluadores PRM dentro del mismo pipeline de PACE, esos modelos centrados en la validez pudieron mantener la precisión pero lograron solo un 6 a 7 por ciento de compresión de tokens, muy por debajo del 31 por ciento de CAID.
Uno de los hallazgos más sorprendentes del artículo es que la noción de pasos dorados, pasos de razonamiento escritos por humanos que se suponen óptimos, puede ser en sí misma defectuosa. Las asignaciones de fusión de CAID sugieren que los conjuntos de datos estándar contienen ineficiencia latente: repeticiones verbosas, cálculos intermedios sobreexplicados y lógica fragmentada que podría expresarse de manera más concisa. Los investigadores argumentan que este contenido comprimible no contradice la validez del razonamiento, pero plantea preguntas sobre la calidad de los datos de entrenamiento y los supuestos de eficiencia implícitos en las prácticas de evaluación actuales.
Los autores reconocen limitaciones. PACE opera en un pipeline de generar y luego refinar, lo que significa que no reduce la latencia de la pasada de inferencia inicial. Es más adecuado para la construcción de conjuntos de datos fuera de línea o la compresión de contexto que para la aceleración en tiempo real. El paso de fusión depende de un reescritor LLM con restricciones de seguridad; los modelos más pequeños pueden simplificar en exceso el razonamiento complejo. Y el enfoque del dominio del artículo en razonamiento aritmético, de sentido común y científico significa que la noción de eficiencia puede diferir en tareas abiertas como la escritura creativa, donde la verbosidad tiene un propósito.
Aún así, el trabajo presenta un argumento sólido de que la evaluación del razonamiento ha estado luchando la guerra equivocada. Los modelos pueden producir cadenas lógicamente válidas que están rellenas con pasos factualmente correctos pero innecesarios. Los evaluadores actuales, optimizados para la corrección, recompensan ese relleno. CAID y RIV-GSM8K ofrecen un camino hacia métricas que midan no solo si un paso es verdadero, sino si es necesario.
El artículo fue liderado por Daeyeop Lee de KT Corporation y Hwanjo Yu de POSTECH, y fue apoyado por una subvención IITP del Ministerio de Ciencia y TIC de Corea.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.