AI 模型 | NVIDIA Nemotron 3.5 Lightning
为什么 Nemotron 3.5 Lightning 认为大多数智能体步骤不需要大模型
Nvidia 的新开源模型在本地运行,具有 3B 激活参数和 100 万 token 上下文,专为持续运行的智能体打造。Nvidia 声称吞吐量最高可达同类开源模型的 4 倍,任务完成速度快 30%。

Nvidia 对 Nemotron 3.5 Lightning 的推销可以概括为一句话:智能体执行的大部分工作并不需要大模型。读取文件、调用工具、整理结果、重试失败的步骤。这些步骤填满了智能体的日常,Nvidia 认为一个紧凑型模型可以在你已有的硬件上承载这些工作,而不是按 token 在数据中心里向你收费。
该模型于 8 月 11 日上线 Ollama。它拥有 300 亿总参数,每个 token 仅激活 30 亿参数,这是一种混合专家(MoE)设计,公司称其专为持续运行的智能体打造:收集上下文、调用工具、处理多步骤任务。在本地运行时,你的数据会留在设备上。
30 亿激活参数,100 万 token 的上下文
值得特别关注的数字不是 300 亿总参数,而是每个 token 激活 30 亿参数,再加上可达 100 万 token 的上下文窗口。这个模型运行成本低,而这正是处理高量级步骤所需要的;长上下文也为多轮会话中不断累积的工具历史留下了空间。
Nvidia 列出了目标硬件:RTX PC、RTX PRO 工作站、DGX Spark 和 DGX Station,以及数据中心和云端。Apple silicon 用户可获得专用的 MLX 版本 nemotron-3.5-lightning:30b-mlx。安装只需一条命令:ollama run nemotron-3.5-lightning。该模型由 Nemotron Coalition 开发,并针对开发者已在使用的工具进行了训练,覆盖编码、工具调用、指令跟随和多轮工作。
本地层级的价值所在
建议的工作负载读起来就像一份 AI 运营中最重复工作的清单。处理电子邮件、日历和预订的长期运行个人助理。运行测试、搜索代码库并在团队已使用的框架内应用重构的编码子智能体。安全运营:丰富告警、对事件分类、查询日志、关联指标,并为分析师准备结构化结论。
更有趣的建议是混合部署。Nemotron 3.5 Lightning 在本地处理高量级步骤,而一个更大的托管模型只接手少数确实需要它的步骤。Claude Code、OpenClaw、Hermes Agent 和 OpenCode 的集成随模型一起提供,同样的模式也适用于在 Ollama 云中运行的模型,因此智能体可以在不更改其他任何内容的情况下,将单个步骤转发给更大的模型。开放权重和开放数据集完善了这套主张:团队可以针对某个细分任务对模型进行后训练,并让结果在从边缘到数据中心的任何位置运行。
吞吐量才是 Nvidia 主打的指标
在基准测试中,公司声称吞吐量比同类开源模型高 4 倍,任务完成速度快 30%,并在智能体、编码和推理任务上保持领先准确率。这些是 Nvidia 自家测试配置下的数据;完整结果位于发布博客中,独立验证需要时间。
这些数字背后的逻辑更容易辩护。对于一个持续运行的智能体,吞吐量才是最重要的指标:每分钟更多步骤意味着长任务能够完成。Nvidia 通过使用多 token 预测的投机解码,以及 DFlash 和 DSpark 技术来实现这一点。
一个熟悉的主张,推向边缘侧
这并不是 Nvidia 第一次处理智能体成本问题。智能体每项任务消耗的 token 比普通问答更多,这会推高云账单,而 Nvidia 在最近几代产品中的答案是让大部分 token 在更便宜的硬件上提供。Nemotron 3 Ultra 从云端一侧推进了这一逻辑:一个 100 万 token 的上下文窗口,一个为编排构建的微调配方,强化学习反馈循环和长上下文检索,以及将准确率与吞吐量放在右上象限的基准图表,在智能体生产力、代码生成和指令跟随方面领先于现有开源替代方案。Nvidia 还发布了材料,论证合成数据比模型权重更重要,以及微调而非预训练才是护城河。
Nemotron 3.5 Lightning 将这一模式带到了本地层级。30B/3B 的分割是对智能体经济性的一个论断:智能体消耗的大部分步骤都便宜,而且其中大部分可以在你已有的硬件上运行。
这些都不能证明这个赌注是否押对了。厂商基准测试只是起点,不是证据。这次发布清楚表明的是方向:Nvidia 正在把本地层级当作智能体技术栈中头等的一部分,而一个拥有百万 token 记忆的 3B 激活模型,是对该层级应该如何运作的一个具体、可验证的主张。
- 来源 : Why Nemotron 3.5 Lightning bets most agent steps don't need a big model — 2026-08-11
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。