小型语言模型
4 published articles
开源5 min read
开源
低于2亿参数的模型蓬勃发展,而前沿模型动辄投入数十亿
Hugging Face 发布了一封感谢信,感谢修补匠们推动了低于2亿参数模型的微调和预训练爆炸式增长。没有基准测试,没有发布,仅仅是一个信号:开源AI的重心正在转移。
2026-08-18
大语言模型与模型3 min read
开源 AI
Boris-2 为其 125M 模型投入 900亿 tokens,250M 模型仅 600亿
Boris-2 预先宣布三个 token 预算不均的小模型:125M 获得 900亿 tokens,250M 仅有 600亿。训练从 8 月 12 日持续到 9 月 10 日,没有分享任何基准,只表达了达到 SmolLM2-135M 实力的野心。
2026-08-16
大语言模型与模型4 min read
小型模型竞赛
BananaMind 2 Micro:2.9M参数、75B Token,和一场极端的过度训练豪赌
BananaMind 2 Micro 将拥有2.9M参数,并在75B Token上进行训练,相当于每个参数约25,900个Token。训练将于8月3日开始,发布日期预计为8月4日至6日,BananaMind 2 Pro 的公开预览将在同一天上线。目前尚未分享任何基准测试结果。
2026-08-06
大语言模型与模型Featured5 min read
大语言模型与模型
Mistral 级联蒸馏:在不牺牲推理能力的前提下压缩大语言模型
Mistral 的级联蒸馏技术将大模型压缩为小模型,同时保留了推理和视觉能力。3B 变体所具备的能力过去需要十倍于其参数的模型才能实现,且全部采用 Apache 2.0 许可证。
2026-07-17