SevenTnewS

scale au moment du test

4 published articles

IA5 min read

Scaling au moment du test

Le routage CoBa égalise le vote majoritaire best-of-16 avec 58,9 % de jetons en moins

CoBa, une politique de routage à calcul équilibré issue d'un nouvel article arXiv, égalise le vote majoritaire best-of-16 à moins de 0,01 point près tout en réduisant de 58,9 % les jetons pondérés par paramètres. Sur 3 129 évaluations couvrant MATH-500, AIME et AMC, elle bat également nettement le décodage à échantillon unique, même si un léger avantage du best-of-16 subsiste lorsque le budget n'est pas une contrainte.

2026-08-19

Laboratoires & Recherche4 min read

Recherche en IA

Des chaînes de pensée plus longues butent sur un mur. ThinkRetrieve injecte le correctif en cours de raisonnement

Le test-time scaling séquentiel atteint souvent des rendements décroissants, voire négatifs, affirme une nouvelle prépublication. ThinkRetrieve récupère des exemples résolus en cours de raisonnement et les injecte dans la trace, rapportant des gains relatifs allant jusqu'à 60 % sur AIME 2025 sur cinq petits modèles de raisonnement.

2026-08-18

Outils & Frameworks3 min read

Recherche en IA

L'évolution des harnais semble impressionnante jusqu'à ce qu'on la teste sur des tâches inédites

L'évolution automatique des harnais est censée améliorer les agents LLM, mais un nouvel article soutient que de nombreux gains rapportés pourraient provenir d'un surapprentissage sur l'ensemble de test public. Dans les expériences, des méthodes simples de test-time scaling ont égalé ou surpassé l'évolution, et les harnais évolués ont montré une généralisation limitée à des tâches inédites.

2026-07-27

IAFeatured5 min read

Intelligence Artificielle

MiniMax M3 et l'art de fabriquer un modèle de preuve résistant à la triche

MiniMax détaille l'ingénierie derrière les capacités de preuve de M3 : un vérificateur en profondeur qui a survécu au mode de défaillance de piratage des récompenses du cycle M2, et MaxProof, un cadre de passage à l'échelle au niveau de la population qui transforme l'échantillonnage en recherche guidée. Sur l'IMO 2025 et l'USAMO 2026, M3 avec MaxProof dépasse le seuil de la médaille d'or humaine.

2026-07-16