开放权重推理
英伟达Nemotron-4:速度快、开放,直指Llama与GPT之间的鸿沟
英伟达的Nemotron-4系列以具有竞争力的MMLU分数和声称的推理成本降低30%挑战Llama 3.3和Mistral Large。其开放许可和双尺寸策略使其成为团队大规模运行智能体工作负载的实用替代方案。

英伟达今天发布了Nemotron-4,一款开放权重的语言模型,提供8B和34B参数两种版本。该公司声称,34B版本在MMLU基准测试中的得分仅比GPT-4低两分,同时推理计算量减少30%。该模型采用宽松的商业许可发布。
这些数据恰好落在开放模型市场一个竞争激烈的区域。Meta的Llama 3.3 70B、Mistral Large和Qwen 2.5 72B都集中在相似的精度范围内。让Nemotron-4与众不同的是英伟达关于推理成本的声明:在相同任务上计算量减少30%,其训练数据混合了合成数据和经过策划的网络数据。
英伟达正在攻击的差距
开放模型生态系统存在一个众所周知的问题。你可以选择一个像Qwen 2.5 7B这样的小型快速模型,它能在单GPU上运行,但在多步骤任务上会犯推理错误。或者你可以选择一个像Llama 3.3 70B这样的大型高性能模型,它在基准测试中得分很高,但需要多GPU和昂贵的批量推理。中间没有多少能在两方面都表现出色的模型。
Nemotron-4 34B正好位于这个中间带。如果MMLU的声明在独立验证下成立,它将成为其尺寸附近最强的开放模型之一。而较小的8B版本为团队提供了更便宜的选项,用于更简单的路由任务。
英伟达今年早些时候发布的嵌入模型已经表明该公司理解这个层次:足够强大以发挥作用,足够便宜以广泛部署。Nemotron-4系列将该逻辑延伸到了推理领域。
未明确标注的领域
消息来源没有指明英伟达是与哪一个GPT-4版本进行比较,也没有指明两分的差距是基于完整的MMLU测试集还是某个子集。这一点很重要,因为GPT-4的分数会因版本和具体测试条件而异。在标准MMLU基准测试上两分的差距约为1-2个百分点(取决于参考值),对于比较来说是真实的,但并非革命性的。
更大的问题是Nemotron-4在智能体任务上的表现如何。现有的英伟达关于智能体推理成本的研究表明该公司已经思考这个问题一段时间了。如果30%的计算节省在大规模下是真实的,那么每天运行数千个智能体循环的团队将看到显著的成本差异。
公告中没有包含的内容:第三方基准测试、实时延迟数据或开放的评估集。早期采用者需要自己复现结果。
它的定位
宽松的商业许可是关键信号。英伟达并不像OpenAI或Anthropic那样将Nemotron-4锁定在专有端点之后。它押注于开放权重模型的采用将推动其其余硬件和软件生态系统的发展, , 芯片、Nemo框架、CUDA优化。
对于已经在运行Llama或Mistral的团队来说,迁移路径很简单:相同的服务基础设施,不同的权重。问题在于Nemotron-4是否能在实践中真正赢得每token的准确性,还是仅仅在基准排行榜上取胜。
如果声称的30%计算节省是准确的,那么英伟达就有了一个清晰的故事:在不损失能力的情况下降低推理成本。这比微不足道的MMLU提升更有说服力。优化成本的团队会在切换之前,用自己的工作负载对模型进行基准测试,英伟达似乎明白这一点。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。