大语言模型训练
5 published articles
大语言模型与模型3 min read
开源 AI
Boris-2 为其 125M 模型投入 900亿 tokens,250M 模型仅 600亿
Boris-2 预先宣布三个 token 预算不均的小模型:125M 获得 900亿 tokens,250M 仅有 600亿。训练从 8 月 12 日持续到 9 月 10 日,没有分享任何基准,只表达了达到 SmolLM2-135M 实力的野心。
2026-08-16
开源6 min read
开源
一场租用 GPU 的接力赛以 200 美元训练出 NanoColibri 的 2.7B MoE
NanoColibri-Instruct 以大约 200 美元从空白权重变成了一个可用的 2.7B MoE。志愿者在 Hugging Face Hub 上传递训练接力棒,一次一台租用 GPU,通过比较并交换租约确保永远不会有两个人在同一段上训练。
2026-08-04
大语言模型与模型4 min read
LLM蒸馏
上下文一旦静止,LLM蒸馏便告停滞。这篇论文让它演化
上下文可以将任务偏好带入LLM训练,但一旦蒸馏进学生模型,它们便几乎不再提供监督。北京大学的Flux-OPD让上下文随学生一起移动,并用冲突项为教师修正加权。摘要报告称相较现有OPD范式有所提升,但没有给出数字。
2026-07-31
人工智能Featured3 min read
训练优化
Unsloth 声称新 Triton 内核与自动打包技术实现 5 倍 LLM 训练加速
Unsloth 最新更新引入了融合 QK RoPE Triton 内核,实现 2.3 倍旋转嵌入加速;int64 索引支持长上下文;以及自动免填充打包。基准测试显示,Qwen3-32B 模型吞吐量提升 1.7-3 倍,且准确率无损失。
2026-07-16
大语言模型与模型4 min read
合成数据策略
英伟达数据图谱显示:合成数据比模型权重更重要
英伟达的Nemotron Post-Training v3 Prompt Atlas提供了一张包含数十亿合成数据样本的交互式地图,凸显了开放合成数据是构建可靠AI智能体所缺失的关键层。该公司认为,智能体行为必须可审计,而开放发布的合成数据是唯一既能保留专有信号又不泄露商业机密的方式。
2026-07-12