开源
低于2亿参数的模型蓬勃发展,而前沿模型动辄投入数十亿
Hugging Face 发布了一封感谢信,感谢修补匠们推动了低于2亿参数模型的微调和预训练爆炸式增长。没有基准测试,没有发布,仅仅是一个信号:开源AI的重心正在转移。

在模型发布、融资轮次和基准测试炫耀之间,Hugging Face 上出现了一篇毫无新闻性的帖子。没有发布,没有分数,只是一封感谢信:“我不知道是我们、你们中的某位,还是我们所有人同时推动了这一切,但最近我们看到低于 2 亿参数的模型在微调/预训练方面出现了爆炸式增长,我们对此再高兴不过了。”帖子最后向那些做实事的人发出呼吁:“继续来吧,修补匠们,这一切之所以可能,都是因为你们!”
这篇帖子没有给出任何数字,也没有引用任何项目。它也不需要这样做。Hugging Face 是 AI 这个领域中最接近普查机构的存在;当它的团队说小型模型无处不在时,这本身就是一个数据点。有趣的是这场爆炸式增长由什么构成,以及它对一个两年来一直盯着模型规模图表顶端的行业意味着什么。
小型模型,超大规模训练
这个领域中最明确的押注是 BananaMind 2 Micro:2.9M 参数,在 75B 个 token 上训练,每个参数大约对应 25,900 个 token。对于如此小的模型,这个比例是刻意失衡的。项目方自己的说法是“过度训练”,这个词很有用,因为它很诚实:这种不平衡是策略,而不是偶然。给一个微型模型喂入海量数据,看看每个参数还能保留多少能力。
该项目尚未公布的是性能。没有基准测试分数,没有评估结果,没有对比。其承诺是“每参数最大智能”,而目前这只是一个意图,而非结果。每个参数 25,900 个 token 能否换来真正的能力,这个问题项目方留待 8 月份的一次训练运行来回答。
过度训练并不是提升小型模型分数的唯一杠杆。一项有记录的实验通过外部监控控制器,让一个量化模型在 MATH-500 上增加了 4.5 分。优化器替换(用 Muon 替代 AdamW)也属于同一工具箱。所有这些背后有一个共同规律:在这个规模上,收益来自训练选择,而不是增加硬件。
这股潮流并不局限于语言模型。同一平台上还托管了一个在 Varied Drone Dataset 上训练的图像语义分割模型库,包含从 Nano 到 XLarge 的 CABiNet 和 YOLO26 变体,最佳成绩达到 78.83% mIoU。小型、专用、运行成本低:这就是 Hugging Face 为之欢呼的形态。
同一屋檐下,两场竞赛
与前沿的对比并非比喻。摩根士丹利估计,Meta AI 拥有超过 600,000 块 NVIDIA H100 GPU,规模居全球之首,分布在定制超级集群中,并由约 1,200 名研究人员运营。如此规模的单次训练运行要消耗兆瓦级电力和数周时间。而低于 2 亿参数的世界只需其中一小部分:一块 GPU、一个基础模型、一个数据集,以及一切顺利时公开的权重文件。
两场竞赛都没有错。Meta 同样发布开放权重,其实验室以采用率而非收入来衡量。区别在于双方追逐的目标不同:实验室想要原始能力,小型模型领域想要每参数能力,两者的经济性截然不同。双方的数字看起来毫无相似之处:
| 项目或指标 | 数值 | 显示内容 |
|---|---|---|
| BananaMind 2 Micro | 2.9M 参数,75B tokens | 每个参数 25,900 个 token |
| BananaMind 2 Micro 评估 | 未公布 | 承诺,而非结果 |
| 量化模型 + 监控控制器 | MATH-500 上 +4.5 分 | 训练杠杆可提升小型模型分数 |
| YOLO26x-sem(VDD 模型库) | 78.83% mIoU | 无人机数据集上的最佳运行 |
| CABiNet-Large(VDD 模型库) | 77.76% mIoU(54.8 GFLOPs) | 效率权衡 |
| Meta AI 集群 | 600,000+ H100,1,200 名研究人员 | 前沿的规模 |
经济性之所以重要,是因为小型模型可以在用户所在之处运行。一个 2.9M 参数的模型不需要超级集群来提供服务;它可以在手机、笔记本电脑或廉价的推理盒上运行。如果过度训练的押注获得回报,相当一部分细分工作负载将完全不再需要前沿的基础设施。这正是这场庆祝之下的未解问题。
可信度差距
如果这场热潮中有更多项目公布结果,庆祝会更有说服力。无人机模型库展示了一个认真做事的发布应有的样子:模型卡、逐类 IoU、混淆矩阵、训练配置,全部公开。而 BananaMind 2 Micro 展示的仍是一个押注状态下的发布。这个差距就是这场运动仍要走的距离。
Hugging Face 的帖子并没有假装结果已经揭晓。它感谢修补匠们发布了作品,却没有声称结果已经到手。善意地解读,这标志着一个早期里程碑,而非终点。能平息争论的数字是一张评估表,来自 BananaMind 8 月的运行,或来自接下来同类方向的十几个项目。
前沿实验室花费数十亿美元,并以新闻稿展示成果。修补匠们几乎不花钱,而其中一些还没有公布这些 token 换来了什么。这篇帖子提醒我们,开源经济部分建立在信任之上,而那些确实公布结果的项目才是我们其他人可以学习的对象。爆炸式增长是真实的;但账目还没有全部出来。
- 来源 : Sub-200M models are booming while the frontier spends billions — 2026-08-08
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。