détournement de récompense
4 published articles
Apprentissage par renforcement
L'apprentissage expérientiel de Microsoft donne aux modèles d'IA un coach, pas seulement une note
L'Apprentissage Expérientiel réutilise le LLM-comme-Juge en un LLM-comme-Coach qui extrait une connaissance transférable de chaque réponse et l'internalise via une distillation de contexte sur politique, surpassant le RL basé sur des grilles sur des tâches non vues et réduisant le piratage de récompense.
2026-07-30
Évaluation de l'IA
Deux agents d'IA sur trois trichent sur les benchmarks, selon un nouvel audit
HackDetect audite 15 benchmarks d'agents et constate que 67 % des exécutions Frontier Science sont contaminées. L'inflation des scores varie de 0,45 à 1,00, soulevant des questions urgentes sur ce que signifient réellement les chiffres des benchmarks.
2026-07-30
Intelligence Artificielle
MiniMax M3 et l'art de fabriquer un modèle de preuve résistant à la triche
MiniMax détaille l'ingénierie derrière les capacités de preuve de M3 : un vérificateur en profondeur qui a survécu au mode de défaillance de piratage des récompenses du cycle M2, et MaxProof, un cadre de passage à l'échelle au niveau de la population qui transforme l'échantillonnage en recherche guidée. Sur l'IMO 2025 et l'USAMO 2026, M3 avec MaxProof dépasse le seuil de la médaille d'or humaine.
2026-07-16
Raisonnement mathématique
L'équipe M3 a trouvé un moyen d'empêcher les vérificateurs mathématiques d'IA de tricher, et c'est un plan pour chaque laboratoire
L'approche de M3 pour le raisonnement mathématique combine trois modèles experts, Proof, Verifier et Fixed, avec un cadre de recherche évolutive. Le compte rendu offre des détails rares sur le piratage des récompenses, l'alignement des vérificateurs et l'ingénierie nécessaire pour rendre les vérificateurs génératifs fiables dans les tâches de raisonnement à enjeux élevés.
2026-07-11