SevenTnewS

推理模型

6 published articles

人工智能5 min read

测试时扩展

CoBa路由以58.9%更少的token追平best-of-16投票

CoBa,一篇新arXiv论文中提出的计算平衡路由策略,在0.01个百分点内追平best-of-16多数投票,同时将参数加权token削减58.9%。在跨MATH-500、AIME和AMC的3,129次评估中,它还完全胜过单样本解码,不过在预算不受限时,best-of-16仍保持微弱优势。

2026-08-19

实验室与研究4 min read

AI 研究

更长的思维链碰壁。ThinkRetrieve 在推理中途注入修复

一篇新的预印本论文指出,顺序式的测试时扩展常常遭遇收益递减甚至负收益。ThinkRetrieve 在推理中途检索已解决的示例并将其注入推理轨迹,报告称在 AIME 2025 上对五个小型推理模型取得了最高 60% 的相对提升。

2026-08-18

大语言模型与模型3 min read

人工智能研究

为什么令牌对数概率不是监控AI推理模型的正确信号

Novelis Research表明,令牌对数概率作为量化推理模型的解码器监控器存在缺陷,无法察觉自信循环。他们引入了一种校准的e-CUSUM控制器,结合了不确定性和重复信号,在DeepSeek-R1-Distill-Qwen-1.5B上的GSM8K任务中实现了选择性。

2026-08-03

人工智能4 min read

人工智能

为什么你的AI思维链在浪费令牌,以及最优停止如何解决这个问题

麻省理工学院研究人员提出OS-Pruner,这是一个插件,能在后续计算不值得令牌成本时动态停止思维链推理。测试显示,在最小化准确率牺牲的情况下,长度减少20-60%。

2026-07-29

人工智能3 min read

基准深度解析

ARC-AGI-2:衡量AI系统流体智能的基准测试

ARC-AGI-2通过无法靠死记硬背解决的视觉网格谜题测试AI系统的流体智能。顶级前沿模型现得分75-85%,但70万美元的大奖尚未有人领取。本文深度解析该基准测试的设计、评分机制及当前排行榜。

2026-07-01

大语言模型与模型4 min read

AI安全研究

AI模型无法停止“边想边说”。这对安全性而言既是好消息,也是噩梦。

Claude Sonnet 4.5 仅有 2.7% 的时间能控制其思维链,而最终输出的可控性却高达 61.9%。这一差距引发了对思维链监控作为安全机制稳健性的开放性疑问,而无人知晓其存在的原因。

2026-03-09