SevenTnewS

开源 AI

Boris-2 为其 125M 模型投入 900亿 tokens,250M 模型仅 600亿

Boris-2 预先宣布三个 token 预算不均的小模型:125M 获得 900亿 tokens,250M 仅有 600亿。训练从 8 月 12 日持续到 9 月 10 日,没有分享任何基准,只表达了达到 SmolLM2-135M 实力的野心。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-16 · 阅读需 3 分钟

Boris-2 为其 125M 模型投入 900亿 tokens,250M 模型仅 600亿

Boris-2 尚不存在,而公告文章对此并不避讳。该项目已为三个小模型, , 75M、125M 和 250M, , 制定了计划,训练窗口从 8 月 12 日持续到 9 月 10 日,token 预算看起来像是有人放弃了按规模排序。

最醒目的数字是中间那个。125M 模型计划训练 900亿 tokens,是 250M 模型 600亿 预算的 1.5 倍。文章在显而易见的问题被问出之前就给出了回答。“直接答案就是时间,”文中写道。训练更大的模型会消耗更多时间,而该项目预计 250M 无论如何都会凭借原始能力领先。

125M 模型 900亿 token 预算背后的数学

将这些预算换算为每个参数的 token 数,分配就更有趣了。75M 每参数约 347 个 token,总预算 260亿;125M 约为 720;250M 仅为 240。中端模型获得最丰厚的食粮,250M 最精简,75M 居中。这是有意为之。“这节省了时间,同时仍能让 250M 模型超越 125M 模型,”文章中解释道。

模型参数训练 tokens每参数 tokens预计开始
Boris-2-75M75M26B~3478月12日
Boris-2-125M125M90B7208月20日
Boris-2-250M250M60B2409月10日
BananaMind 2 Micro(参考)2.9M75B~25,9008月3日

另一个小模型项目 BananaMind 正在同一时间窗口内把这一比例推得远为激进。BananaMind 2 Micro 拥有 290万 参数和 750亿 token 预算,每个参数约 25,900 tokens,用团队的话说是“为了获得每个参数的最大智能”。Boris-2 最高的比例 720 远不及那种强度,因此该项目自身的卖点落在它所称正在尝试的“独特架构和分层方案”上。

由希望而非基准设定的目标

Boris-2 提供的衡量标准是 135M 级别的开源模型。该项目表示,它希望达到接近 SmolLM2-135M 的实力,“并处于 AxiomicLabs/GPT-X2.5-135M 或 BananaMind/BananaMind-2-Pro-Preview 的大致范围内”。“祈祷好运”是关键词。训练尚未开始,没有分享任何基准,目标被框定为一种期望而非结果。

这些日期是唯一明确的承诺。75M 预计于 8 月 12 日开始训练,125M 于 8 月 20 日,250M 于 9 月 10 日。这些都不是发布日,文章也没有说明模型可能何时推出。

过度训练浪潮波及最小模型

Boris-2 出现的时候,小型开源模型正被有意喂以超大数据食粮。BananaMind 在其 2 Micro 上也下了同样的赌注,训练定于 8 月 3 日开始,预计 8 月 4 日至 6 日发布,同时公开预览 BananaMind 2 Pro。那里同样没有分享任何基准。共同的赌注是数据密度可以替代规模,而两个项目都还没有证据将其兑现。

可以检验的是算术,而算术显示出两种不同的赌注。BananaMind 将每参数 token 数推向了极端。Boris-2 则不均衡地花费其 token 预算,偏向中端模型,同时希望架构能让三者都超越其参数数量所对应的表现。

变体,以及直到 8 月 12 日的漫长等待

路线图并未止步于三个基础规模。Boris-2 表示,后续将推出 Pro、Instruct 和 Pro-Instruct 变体。“更多信息即将发布,”文章结尾写道,这是除训练日期之外提供的唯一时间线。

在首次运行开始之前,Boris-2 只是一个附带日期的规格。数字是公开的,理由也是公开的,而结果完全未经证实。对于关注小模型的人来说,这正是关键所在:在哪怕一次训练运行之前就公开摊开的一场赌注。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。