modèles de raisonnement
6 published articles
Scaling au moment du test
Le routage CoBa égalise le vote majoritaire best-of-16 avec 58,9 % de jetons en moins
CoBa, une politique de routage à calcul équilibré issue d'un nouvel article arXiv, égalise le vote majoritaire best-of-16 à moins de 0,01 point près tout en réduisant de 58,9 % les jetons pondérés par paramètres. Sur 3 129 évaluations couvrant MATH-500, AIME et AMC, elle bat également nettement le décodage à échantillon unique, même si un léger avantage du best-of-16 subsiste lorsque le budget n'est pas une contrainte.
2026-08-19
Recherche en IA
Des chaînes de pensée plus longues butent sur un mur. ThinkRetrieve injecte le correctif en cours de raisonnement
Le test-time scaling séquentiel atteint souvent des rendements décroissants, voire négatifs, affirme une nouvelle prépublication. ThinkRetrieve récupère des exemples résolus en cours de raisonnement et les injecte dans la trace, rapportant des gains relatifs allant jusqu'à 60 % sur AIME 2025 sur cinq petits modèles de raisonnement.
2026-08-18
Recherche IA
Pourquoi la log-probabilité des tokens est le mauvais indicateur pour surveiller les modèles de raisonnement IA
Novelis Research montre que la log-probabilité des tokens échoue en tant que moniteur de décodeur pour les modèles de raisonnement quantifiés, étant aveugle aux boucles confiantes. Ils introduisent un contrôleur e-CUSUM calibré qui combine l'incertitude et les signaux de répétition, atteignant une sélectivité sur GSM8K avec DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
Intelligence Artificielle
Pourquoi la chaîne de pensée de votre IA gaspille des jetons, et comment l'arrêt optimal y remédie
Des chercheurs du MIT proposent OS-Pruner, un plug-in qui arrête dynamiquement le raisonnement par chaîne de pensée lorsque des calculs supplémentaires ne valent pas le coût en jetons. Les tests montrent une réduction de longueur de 20 à 60 % avec un sacrifice de précision minime.
2026-07-29
Analyse approfondie d’un benchmark
ARC-AGI-2 : Le benchmark qui mesure l’intelligence fluide des systèmes d’IA
ARC-AGI-2 teste les systèmes d’IA sur l’intelligence fluide à travers des puzzles en grille visuelle qui ne peuvent pas être résolus par mémorisation. Les modèles de pointe atteignent désormais 75-85 %, mais le grand prix de 700 000 $ reste non réclamé. Voici une analyse approfondie de la conception, du score et du classement actuel du benchmark.
2026-07-01
Recherche sur la sécurité de l'IA
Les modèles d'IA ne peuvent pas s'empêcher de penser à voix haute. C'est à la fois une bonne nouvelle et un cauchemar pour la sécurité.
Claude Sonnet 4.5 ne peut contrôler son raisonnement en chaîne que 2,7 % du temps, contre 61,9 % pour les sorties finales. L'écart soulève des questions ouvertes sur la robustesse de la surveillance par CoT en tant que mécanisme de sécurité, et personne ne sait pourquoi il existe.
2026-03-09