SevenTnewS

小型模型竞赛

BananaMind 2 Micro:2.9M参数、75B Token,和一场极端的过度训练豪赌

BananaMind 2 Micro 将拥有2.9M参数,并在75B Token上进行训练,相当于每个参数约25,900个Token。训练将于8月3日开始,发布日期预计为8月4日至6日,BananaMind 2 Pro 的公开预览将在同一天上线。目前尚未分享任何基准测试结果。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-06 · 阅读需 4 分钟

BananaMind 2 Micro:2.9M参数、75B Token,和一场极端的过度训练豪赌

BananaMind 发布了 BananaMind 2 Micro,这是其 BananaMind 2 系列中最小的模型,但附带一个不同寻常的说明:该模型尚不存在。公告文章称,训练尚未开始,也没有发布任何内容。目前存在的只有一份规格说明,而这份规格本身就是故事的核心。BananaMind 2 Micro 将使用2.9M参数,并在75B Token上进行过度训练,用团队自己的话说,是为了“获得每个参数的最大智能”。

时间表也同样具体。训练将于8月3日开始,发布日期预计在8月4日至6日之间。BananaMind 表示,训练开始当天,它将发布 BananaMind 2 Pro 的公开预览,公告中仅提及该预览的名称。

数据一览:

模型参数训练Token每个参数的Token数
BananaMind 2 Micro2.9M75B~25,900
Gemma 4,最小配置2.3B
Gemma 3,上一代旗舰27B

每个参数25,900个Token,以及一种刻意的失衡

这两个关键数字应当放在一起解读。75B Token分摊到2.9M参数上,相当于模型中每个参数约有25,900个Token。对于如此小的模型,这一比例是刻意倾斜的。团队选择的“过度训练”一词表明,这种失衡是策略而非副作用:向一个极小的模型投喂海量数据,然后观察每个参数还能保留多少能力。

公告没有提供任何基准测试分数、评估结果或对比数据。目前,“每个参数的最大智能”这一承诺只是一种意图,没有任何可核查的公开依据。每个参数25,900个Token能否换来真实能力,只有8月份的训练才能回答。

以Muon替代AdamW,并引入来自TX4的门控

此次公告带来了三项技术变更。BananaMind 将弃用 AdamW,转而采用 Muon 优化器,据称该优化器可将收敛速度提升至多2倍,并能承受更高的学习率。学习率将调整为2.2e-2。该模型还引入了团队所称的来自 TX4 架构的 XSA 刷新门控,并集成到 BananaMind 自身的设计中。AdamW 一直是该领域近期大规模训练中默认的优化器,因此公开弃用这一选择,本身就表明团队正在同时优化每一个变量。

这就是所披露细节的全部。公告没有解释2倍收敛速度是如何测得的、刷新门控的作用是什么,也没有说明 TX4 架构的出处。每项声明都基于团队自己的描述,没有任何外部验证,日期也带有同样的提醒:发布窗口是估算值,而非承诺。

为小型模型竞赛而设的赌注

这一时机为公告提供了背景。Google DeepMind 表示,其 Gemma 4 代际中最小模型拥有2.3B参数,性能与 Gemma 3 的27B参数模型相当,在一代之内实现了10倍的参数效率提升,并且 Gemma 4 将思考模式引入了开放权重,而这此前是封闭模型的专属领域。BananaMind 2 Micro 的规模甚至比2.3B参数还低约800倍。这不是一个渐进式的下探,而是完全不同的量级,公告读起来像是一份针对这一量级刻意发布的定位声明。

缺口与野心同样明显。没有基准测试、没有演示、没有关于训练硬件或许可条款的任何说明。时间窗口很短:如果训练在8月3日开始,而发布日期落在预计的8月4日至6日之间,那么团队要么是在暗示一次只需数天即可完成的75B Token训练,要么是在暗示一个刻意留有余地的时间表。公告没有说明是哪一种。它确实表明的是,BananaMind 乐于在过度训练的极端上押注。如果一个拥有如此海量数据支撑的2.9M参数模型能够成功,小型模型的经济学将再次改变。如果失败,业界也会借此知道极限在哪里。无论哪种结果,8月3日都会解决部分争议。

BananaMind 2 Pro 在公告中仅以一个名称和一个日期出现。其公开预览将于8月3日上线。没有参数数量、没有功能说明、没有更多细节。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。