SevenTnewS

Recherche en IA

L'écume dans le raisonnement en chaîne : un nouveau benchmark révèle pourquoi les LLM gaspillent des tokens sur des raisonnements valides mais inutiles

Les LLM génèrent souvent des chaînes de raisonnement correctes mais alourdies par des étapes inutiles. Un nouveau benchmark diagnostique et une méthode de compression montrent que les évaluateurs actuels ignorent totalement cette inefficacité et que la moitié des étapes de raisonnement rédigées par des humains pourraient être compressibles.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-31 · 4 min de lecture

L'écume dans le raisonnement en chaîne : un nouveau benchmark révèle pourquoi les LLM gaspillent des tokens sur des raisonnements valides mais inutiles
Sources : Valid ≠ Necessa…

Le chaînage de pensée (CoT) est devenu la méthode standard pour obtenir un raisonnement en plusieurs étapes des grands modèles de langage. Décomposez un problème en étapes intermédiaires, et la précision du modèle augmente. Mais un article de recherche de KT Corporation et de l'Université des sciences et technologies de Pohang (POSTECH) soutient que le domaine optimise pour le mauvais signal.

L'article, intitulé Valid ≠ Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought, identifie un angle mort dans l'évaluation actuelle du raisonnement : les évaluateurs qui vérifient la correction et la validité logique attribuent souvent des scores élevés à des étapes qui sont factuellement vraies mais fonctionnellement inutiles. Les auteurs appellent cela l'écume informationnelle, et leurs travaux suggèrent qu'elle constitue une part importante des traces CoT standard.

Les chercheurs introduisent RIV-GSM8K, un benchmark diagnostique dérivé du jeu de données mathématiques GSM8K. RIV-GSM8K injecte cinq types distincts d'inefficacité dans les chaînes de raisonnement : Simple duplication (répétition d'une étape), Paraphrase (reformulation de la même idée), Décomposition (division d'une seule étape en plusieurs micro-étapes), Raisonnement circulaire (répétition sans progrès) et Non pertinent (digressions mathématiquement valides mais sans rapport avec la solution).

Lorsque l'article a testé des évaluateurs de pointe, notamment ReasonEval, ThinkPRM et Qwen2.5-Math-PRM, face à RIV-GSM8K, les résultats ont été frappants. Les modèles existants ont conservé 70 à 97 % des étapes inefficaces injectées, ce qui signifie qu'ils n'ont pas réussi à signaler des étapes clairement redondantes ou circulaires. ReasonEval, malgré un score de redondance explicite, a conservé environ 70 % des duplications simples. Même le modèle Qwen2.5-Math-PRM de 72 milliards de paramètres en a conservé 83 %.

Pour combler cette lacune, l'article propose CAID (Context-Aware Information Density), une métrique sans entraînement qui combine quatre signaux : similarité locale (redondance), alignement global sur l'objectif (pertinence), densité informationnelle (verbosité) et delta sémantique (progrès logique). CAID n'utilise que 146 millions de paramètres au total, un modèle GPT-2 Small pour l'estimation de densité et un encodeur MiniLM pour les plongements, ce qui le rend des ordres de grandeur plus petit que les évaluateurs supervisés qu'il surpasse.

Sur RIV-GSM8K, CAID a atteint une détection quasi parfaite de la duplication (0,0 % de conservation) et de la paraphrase (1,7 % de conservation). Il a également détecté le raisonnement circulaire (1,9 % de conservation) et la décomposition (20 % de conservation), des domaines où les modèles de base peinaient. De façon plus provocante, CAID a signalé environ la moitié des étapes originales rédigées par des humains dans GSM8K comme compressibles, non pas comme supprimables, mais comme exprimables de manière plus concise. Seuls 1,5 % de ces étapes signalées ont été marquées pour une suppression complète ; les 98,5 % restants ont été assignés à une action de fusion, indiquant que le raisonnement lui-même était correct mais que le langage était inefficace.

Les chercheurs ont validé le pouvoir diagnostique de CAID en construisant un pipeline de compression appelé PACE (Pruning And Compression for Efficiency). PACE applique les signaux de CAID pour compresser les chaînes de raisonnement après génération. Sur GSM8K, StrategyQA et ARC-Challenge, PACE a réduit la consommation de tokens de 31 à 53 % tout en maintenant ou en améliorant la précision. Sur ARC-Challenge, la précision a même augmenté de 0,94 point parallèlement à une réduction de 43,6 % des tokens.

Des expériences de contrôle ont séparé l'effet de PACE d'un élagage trivial. La suppression aléatoire de 50 % des étapes des chaînes GSM8K a fait chuter la précision de 82 % à 66,7 %. Même la suppression de la seule dernière étape a nui à la performance. En revanche, la compression sélective de PACE a préservé la précision à 81,12 % tout en réduisant de 31 % les tokens. Lorsque les chercheurs ont remplacé CAID par des évaluateurs PRM puissants dans le même pipeline PACE, ces modèles axés sur la validité ont pu maintenir la précision mais n'ont obtenu qu'une compression de 6 à 7 % des tokens, bien inférieure aux 31 % de CAID.

L'une des conclusions les plus surprenantes de l'article est que la notion d'étapes en or, des étapes de raisonnement rédigées par des humains supposées optimales, pourrait elle-même être erronée. Les assignations de fusion de CAID suggèrent que les jeux de données standard contiennent une inefficacité latente : des reformulations verbeuses, des calculs intermédiaires trop expliqués et une logique fragmentée qui pourrait être exprimée de manière plus concise. Les chercheurs soutiennent que ce contenu compressible ne contredit pas la validité du raisonnement, mais soulève des questions sur la qualité des données d'entraînement et les hypothèses d'efficacité intégrées dans les pratiques d'évaluation actuelles.

Les auteurs reconnaissent des limites. PACE fonctionne dans un pipeline générer-puis-affiner, ce qui signifie qu'il ne réduit pas la latence de l'inférence initiale. Il est mieux adapté à la construction hors ligne de jeux de données ou à la compression de contexte qu'à l'accélération en temps réel. L'étape de fusion repose sur un réécrivain LLM avec des contraintes de sécurité ; des modèles plus petits peuvent simplifier à l'excès un raisonnement complexe. Et le focus de l'article sur les domaines arithmétiques, du sens commun et du raisonnement scientifique signifie que la notion d'efficacité peut différer dans des tâches ouvertes comme l'écriture créative, où la verbosité a une utilité.

Néanmoins, ces travaux démontrent solidement que l'évaluation du raisonnement a combattu la mauvaise guerre. Les modèles peuvent produire des chaînes logiquement valides mais alourdies par des étapes factuellement correctes mais inutiles. Les évaluateurs actuels, optimisés pour la correction, récompensent cet alourdissement. CAID et RIV-GSM8K offrent une voie vers des métriques qui mesurent non seulement si une étape est vraie, mais si elle est nécessaire.

L'article a été dirigé par Daeyeop Lee de KT Corporation et Hwanjo Yu de POSTECH, et a été soutenu par une subvention IITP du ministère coréen des Sciences et des TIC.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.