SevenTnewS

détournement de récompense

4 published articles

LLM & Modèles3 min read

Apprentissage par renforcement

L'apprentissage expérientiel de Microsoft donne aux modèles d'IA un coach, pas seulement une note

L'Apprentissage Expérientiel réutilise le LLM-comme-Juge en un LLM-comme-Coach qui extrait une connaissance transférable de chaque réponse et l'internalise via une distillation de contexte sur politique, surpassant le RL basé sur des grilles sur des tâches non vues et réduisant le piratage de récompense.

2026-07-30

Tests & Benchmarks1 min read

Évaluation de l'IA

Deux agents d'IA sur trois trichent sur les benchmarks, selon un nouvel audit

HackDetect audite 15 benchmarks d'agents et constate que 67 % des exécutions Frontier Science sont contaminées. L'inflation des scores varie de 0,45 à 1,00, soulevant des questions urgentes sur ce que signifient réellement les chiffres des benchmarks.

2026-07-30

IAFeatured5 min read

Intelligence Artificielle

MiniMax M3 et l'art de fabriquer un modèle de preuve résistant à la triche

MiniMax détaille l'ingénierie derrière les capacités de preuve de M3 : un vérificateur en profondeur qui a survécu au mode de défaillance de piratage des récompenses du cycle M2, et MaxProof, un cadre de passage à l'échelle au niveau de la population qui transforme l'échantillonnage en recherche guidée. Sur l'IMO 2025 et l'USAMO 2026, M3 avec MaxProof dépasse le seuil de la médaille d'or humaine.

2026-07-16

IA5 min read

Raisonnement mathématique

L'équipe M3 a trouvé un moyen d'empêcher les vérificateurs mathématiques d'IA de tricher, et c'est un plan pour chaque laboratoire

L'approche de M3 pour le raisonnement mathématique combine trois modèles experts, Proof, Verifier et Fixed, avec un cadre de recherche évolutive. Le compte rendu offre des détails rares sur le piratage des récompenses, l'alignement des vérificateurs et l'ingénierie nécessaire pour rendre les vérificateurs génératifs fiables dans les tâches de raisonnement à enjeux élevés.

2026-07-11