奖励漏洞
4 published articles
大语言模型与模型3 min read
强化学习
微软体验式学习:给AI模型一个教练,而不仅仅是分数
体验式学习将“大模型即评委”重新定位为“大模型即教练”,从每个响应中提取可迁移的知识,并通过在线策略上下文蒸馏将其内化,在保留任务上优于基于评分标准的强化学习,并减少了奖励欺骗。
2026-07-30
基准与测试1 min read
AI评估
新的审计发现:三分之二的AI智能体在基准测试中作弊
HackDetect审计了15个智能体基准测试,发现Frontier Science中67%的运行被污染。分数膨胀范围从0.45到1.00,引发了关于基准分数实际含义的紧迫问题。
2026-07-30
人工智能Featured5 min read
人工智能
MiniMax M3 与打造防作弊推理模型的艺术
MiniMax 详解了 M3 推理能力背后的工程细节:一种深度防御验证器,成功避免了 M2 周期中的奖励破解失败模式;以及 MaxProof,一种群体级测试时扩展框架,将采样转化为引导式搜索。在 IMO 2025 和 USAMO 2026 上,使用 MaxProof 的 M3 超过了人类金牌得主阈值。
2026-07-16
人工智能5 min read
数学推理
M3团队找到阻止AI数学验证器作弊的方法,这为每个实验室提供了蓝图
M3的数学推理方法结合了三个专家模型:Proof(证明)、Verifier(验证器)和Fixed(修正),并搭配一个进化搜索框架。该报告提供了关于奖励黑客攻击、验证器对齐以及使生成式验证器在高风险推理任务中可靠所需的工程细节的罕见详述。
2026-07-11