SevenTnewS

Recherche IA

Pourquoi la log-probabilité des tokens est le mauvais indicateur pour surveiller les modèles de raisonnement IA

Novelis Research montre que la log-probabilité des tokens échoue en tant que moniteur de décodeur pour les modèles de raisonnement quantifiés, étant aveugle aux boucles confiantes. Ils introduisent un contrôleur e-CUSUM calibré qui combine l'incertitude et les signaux de répétition, atteignant une sélectivité sur GSM8K avec DeepSeek-R1-Distill-Qwen-1.5B.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-08-03 · 3 min de lecture

Pourquoi la log-probabilité des tokens est le mauvais indicateur pour surveiller les modèles de raisonnement IA
Sources : Calibrated e-CU…

La quantification à faible bit rend les petits modèles de raisonnement peu coûteux à déployer, mais elle dégrade leur raisonnement par chaîne de pensée. Une réaction naturelle est de surveiller le décodeur et d'intervenir lorsque la génération déraille. Mais une nouvelle étude de Novelis Research soutient que l'observable la plus évidente, la log-probabilité des tokens, est la mauvaise base pour un tel moniteur.

Pourquoi la log-probabilité échoue

L'étude, menée par El Hassane Ettifouri et ses collègues, montre que centrer la log-probabilité des tokens sous la propre loi d'échantillonnage du modèle produit une martingale valide. Mais cette martingale mesure l'auto-cohérence de l'échantillonnage, pas la santé de la trajectoire. Lorsqu'un modèle entre dans une boucle de répétition confiante, le token a une probabilité proche de 1, une log-probabilité proche de 0 et une entropie proche de 0. Le moniteur devient silencieux au moment même où le modèle se trompe avec confiance.

Lors d'un test de vérification contrôlé, la martingale de log-probabilité a déclenché des alarmes sur 63 % des flux sains, un taux de fausses alarmes qui la disqualifie en tant que détecteur, mais n'a détecté les boucles confiantes que 42 % du temps. Le détecteur e-CUSUM calibré a capturé 100 % des boucles confiantes et des régimes de dérive puis d'effondrement sans fausses alarmes sur le texte sain.

Le remplacement e-CUSUM calibré

Les chercheurs ont construit un contrôleur de décodeur sans formation à partir de deux éléments. Premièrement, un score d'alarme sensible à la dégénérescence qui fusionne l'incertitude des tokens avec un signal explicite de répétition textuelle. Deuxièmement, un détecteur séquentiel basé sur un processus e calibré qui convertit le processus de produit brut en une statistique de type CUSUM pour la détection de changement.

La calibration a été décisive. Une ligne de base non calibrée (μ0=0,15) a fait que le détecteur s'est déclenché sur 93-95 % de toutes les générations, le rendant inutile. Fixer μ0 au 90e percentile des traces FP16 saines (0,41) l'a transformé en un détecteur sélectif atteignant une précision d'environ 0,6 et un phi d'environ 0,3, contre un taux de base de 0,38 de mauvaises traces.

Résultats empiriques sur GSM8K

En utilisant DeepSeek-R1-Distill-Qwen-1.5B sur 100 problèmes de test GSM8K, l'étude a constaté que les boucles textuelles sont rares, au maximum 4 % des tokens même sur les traces défaillantes. Le mode de défaillance dominant est la non-terminaison : jusqu'à 49 % des traces INT4 incorrectes épuisent le budget de 2048 tokens. Cela correspond aux résultats de Lotfi et al. (2026) selon lesquels les modèles quantifiés surproduisent des marqueurs comme 'wait' et 'but' aux positions à haute entropie.

Le contrôleur a réduit les signaux de dégénérescence textuelle. La répétition consécutive moyenne INT4 est passée de 0,010 à 0,003, les boucles sévères de 1 % à 0 %, et la troncature de 22 % à 19 %. La précision a évolué dans la bonne direction, plus 6 points en INT4 et plus 4 en FP16, mais les différences n'étaient pas statistiquement significatives (p de McNemar=0,18 pour INT4 à n=100). Le coût en tokens était de plus 28 %, et le temps d'horloge a augmenté de 30 %.

Implications méthodologiques

La contribution durable de l'étude est méthodologique : un compte-rendu clair de pourquoi un observable tentant est inadéquat, plus un remplacement calibré et honnêtement évalué. Le processus de produit brut a une véritable garantie de fausse alarme uniforme dans le temps de style Ville sous une condition nulle, mais la statistique CUSUM déployée est rapportée via des points opérationnels empiriques plutôt que comme une garantie mathématique stricte.

Les chercheurs publient tout le code, les outils de calibration et les traces pour soutenir des études à plus grande échelle dont la question de précision a finalement besoin. Ils recommandent que les travaux futurs se concentrent sur des benchmarks plus difficiles où la non-terminaison et la dérive sont plus fréquentes, et sur des ablations qui séparent la contribution des signaux uniquement d'entropie par rapport aux signaux uniquement de répétition dans le score d'alarme.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.