gsm8k
2 published articles
LLM & Modèles3 min read
Recherche IA
Pourquoi la log-probabilité des tokens est le mauvais indicateur pour surveiller les modèles de raisonnement IA
Novelis Research montre que la log-probabilité des tokens échoue en tant que moniteur de décodeur pour les modèles de raisonnement quantifiés, étant aveugle aux boucles confiantes. Ils introduisent un contrôleur e-CUSUM calibré qui combine l'incertitude et les signaux de répétition, atteignant une sélectivité sur GSM8K avec DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
Tests & BenchmarksFeatured2 min read
Analyse de benchmark
GSM8K était censé tester les mathématiques de niveau primaire. Jusqu'à 42 % de ses questions ne sont pas valides
GSM8K est devenu un test standard de raisonnement arithmétique dans les LLM, mais des audits ont révélé des taux d'erreur dans son ensemble de questions atteignant 42 %, ce qui compromet ce que ses scores mesurent réellement.
2026-07-29