SevenTnewS

modèles de raisonnement

6 published articles

IA5 min read

Scaling au moment du test

Le routage CoBa égalise le vote majoritaire best-of-16 avec 58,9 % de jetons en moins

CoBa, une politique de routage à calcul équilibré issue d'un nouvel article arXiv, égalise le vote majoritaire best-of-16 à moins de 0,01 point près tout en réduisant de 58,9 % les jetons pondérés par paramètres. Sur 3 129 évaluations couvrant MATH-500, AIME et AMC, elle bat également nettement le décodage à échantillon unique, même si un léger avantage du best-of-16 subsiste lorsque le budget n'est pas une contrainte.

2026-08-19

Laboratoires & Recherche4 min read

Recherche en IA

Des chaînes de pensée plus longues butent sur un mur. ThinkRetrieve injecte le correctif en cours de raisonnement

Le test-time scaling séquentiel atteint souvent des rendements décroissants, voire négatifs, affirme une nouvelle prépublication. ThinkRetrieve récupère des exemples résolus en cours de raisonnement et les injecte dans la trace, rapportant des gains relatifs allant jusqu'à 60 % sur AIME 2025 sur cinq petits modèles de raisonnement.

2026-08-18

LLM & Modèles3 min read

Recherche IA

Pourquoi la log-probabilité des tokens est le mauvais indicateur pour surveiller les modèles de raisonnement IA

Novelis Research montre que la log-probabilité des tokens échoue en tant que moniteur de décodeur pour les modèles de raisonnement quantifiés, étant aveugle aux boucles confiantes. Ils introduisent un contrôleur e-CUSUM calibré qui combine l'incertitude et les signaux de répétition, atteignant une sélectivité sur GSM8K avec DeepSeek-R1-Distill-Qwen-1.5B.

2026-08-03

IA4 min read

Intelligence Artificielle

Pourquoi la chaîne de pensée de votre IA gaspille des jetons, et comment l'arrêt optimal y remédie

Des chercheurs du MIT proposent OS-Pruner, un plug-in qui arrête dynamiquement le raisonnement par chaîne de pensée lorsque des calculs supplémentaires ne valent pas le coût en jetons. Les tests montrent une réduction de longueur de 20 à 60 % avec un sacrifice de précision minime.

2026-07-29

IA3 min read

Analyse approfondie d’un benchmark

ARC-AGI-2 : Le benchmark qui mesure l’intelligence fluide des systèmes d’IA

ARC-AGI-2 teste les systèmes d’IA sur l’intelligence fluide à travers des puzzles en grille visuelle qui ne peuvent pas être résolus par mémorisation. Les modèles de pointe atteignent désormais 75-85 %, mais le grand prix de 700 000 $ reste non réclamé. Voici une analyse approfondie de la conception, du score et du classement actuel du benchmark.

2026-07-01

LLM & Modèles4 min read

Recherche sur la sécurité de l'IA

Les modèles d'IA ne peuvent pas s'empêcher de penser à voix haute. C'est à la fois une bonne nouvelle et un cauchemar pour la sécurité.

Claude Sonnet 4.5 ne peut contrôler son raisonnement en chaîne que 2,7 % du temps, contre 61,9 % pour les sorties finales. L'écart soulève des questions ouvertes sur la robustesse de la surveillance par CoT en tant que mécanisme de sécurité, et personne ne sait pourquoi il existe.

2026-03-09