AIME 2025
2 published articles
Laboratoires & Recherche4 min read
Recherche en IA
Des chaînes de pensée plus longues butent sur un mur. ThinkRetrieve injecte le correctif en cours de raisonnement
Le test-time scaling séquentiel atteint souvent des rendements décroissants, voire négatifs, affirme une nouvelle prépublication. ThinkRetrieve récupère des exemples résolus en cours de raisonnement et les injecte dans la trace, rapportant des gains relatifs allant jusqu'à 60 % sur AIME 2025 sur cinq petits modèles de raisonnement.
2026-08-18
IA4 min read
Benchmarks IA
GPT-5.4 en Tête du Classement des Benchmarks Mathématiques 2026 alors que les Scores de Frontière Saturent
GPT-5.4 devance ses rivaux en balayant les premières lignes de compétition mathématique, mais GPT-5.2 Pro égalise chaque cellule et GPT-5.3 Codex offre des scores presque identiques à moindre coût. Le véritable différenciateur : la performance des modèles sur les benchmarks de nouvelle génération comme FrontierMath et HMMT Fév 2026.
2026-07-01