开放权重 AI
小红书 dots3-note:280B 开源 MoE,仅激活 16B
小红书的 dots studio 发布了其首个开放权重模型 dots3-note preview:一个多模态 MoE,拥有 280B 参数、16B 激活参数和 512K 上下文窗口。这种稀疏设计旨在降低单台 8-GPU 节点上的服务成本,但模型卡尚未公布基准测试数字。

中国消费互联网公司小红书发布了其首个开放权重模型。dots3-note preview 由其 dots studio 打造,是一款混合专家(MoE)设计,总参数量 280B,每个 token 激活 16B。它支持文本、图像、视频和音频输入,输出文本,拥有 512K token 的上下文窗口,并以 Apache 2.0 协议发布。
此次发布是一个模型家族的开端,而非一次性动作。dots3 系列围绕能力、延迟和推理成本之间的权衡进行设计,模型卡将 dots3-note preview 描述为其最轻量的成员。这使它处于该工作室预留扩展空间的设计空间中成本最低的一端。
小红书的首个开放权重
小红书并非前沿级权重的显而易见来源。它运营的是一个消费平台,而非 AI 基础设施业务。此次亮相正值开放权重发布已成为中国 AI 行业常态之时,模型卡将该模型定位在广泛的任务列表上:指令遵循、数学与逻辑推理、工具使用和多步骤智能体工作流、代码生成、长上下文处理,以及理解图像、文档、图表、音频和视频。
模型卡未发布的内容与其承诺的内容同样重要。通用推理与智能体、多模态理解的评测部分均已列出,但下面没有任何数字。完整报告标注为“即将推出”。
对稀疏参数的 17:1 押注
阅读规格表,一个数字格外突出。在 280B 总参数中激活 16B,总参数与激活参数之比约为 17:1,稀疏度高于当前一些开源 MoE 设计。Qwen3-VL 作为最重要的开放权重视频-语言模型家族之一,最高提供 235B-A22B 变体,更接近 10:1。在这样的规模下,每个 token 的成本由 16B 这个数字决定,而非 280B。
架构简述:
| 属性 | dots3-note preview |
|---|---|
| 总参数 / 激活参数 | 280B / 16B |
| 层数 | 1 稠密 + 45 MoE |
| 专家 | 256 路由 + 1 共享,top-8 |
| 注意力 | 13 DSA + 33 SWA(约 1:3) |
| 上下文长度 | 512K tokens |
| 视觉编码器 | MoE ViT,7B 总 / 1.2B 激活 |
| 音频编码器 | 稠密,800M |
| 精度 | BF16, FP8 |
| 许可证 | Apache 2.0 |
这些行中隐藏着几个与服务相关的细节。该混合模型运行 256 个路由专家外加一个共享专家,采用 top-8 路由。视觉编码器本身也是一个 MoE,总参数量 7B,激活 1.2B,而音频编码器是稠密的 800M 模型。注意力分布在 13 个 DSA 层和 33 个 SWA 层之间,约为 1:3。一个多 token 预测头(一个共享的 1.13B 层)为可选的推测解码路径提供输入。
基准测试附录为空
这正是此次发布应该让人冷静下来的地方。模型卡宣传了广泛的能力范围,但就目前发布的内容而言,它没有提供任何评测数字来支撑。智能体相关的主张尤其需要谨慎:工具使用、多步骤工作流,以及需要探索和记忆的任务,恰恰是整个领域不断发现基准测试高估模型的领域。已发表的评测显示,智能体在一项人类专家通过率为 95% 的测试中得分 49%。512K 上下文窗口也同样值得怀疑,因为宣传的上下文和实际可用的上下文很少是同一个数字。
这些都不意味着该模型表现不佳。这意味着厂商的数字尚未公布,与竞品开源模型的比较应等到这些数字公布后再进行。
运行它:FP8、单节点、两个待合并的拉取请求
部署方面的信息比基准测试更具体,但有一个注意事项:支持只合并了一半。vLLM 在其主分支上提供了原生支持,因此在下一个稳定版本发布之前,用户需要最近的 nightly 构建。SGLang 和 Transformers 的集成目前仅以拉取请求的形式存在,即 #33829 和 #47844,两者仍在审查中。在它们合并之前,文档会引导用户使用这些 PR 分支。
推荐路径是在单个 8-GPU 节点上使用 FP8 检查点。vLLM 示例使用八块 H100,张量并行度为 8,专家并行度为 8,deep_gemm 作为 MoE 后端,上下文长度为 262,144 token。这是宣传最大值的一半,模型卡表示要根据可用内存、并发度和输入模态来调整上下文。BF16 受支持,但需要更多内存。
SGLang 路线以 Docker 镜像形式提供,即 lmsysorg/sglang:dev-dots3-note,首次运行时会从 Hugging Face 的 FP8 检查点 拉取。相关标志涵盖 fa3 注意力后端和可选的推测解码配置,其中多 token 预测头以 NEXTN 方式运行;文档称这可以将每个输出 token 的时间减少 50% 以上。尚不支持 Prefill CUDA graphs。
对于更轻量的测试,Transformers 路径在通常的技术栈之上增加了 torchcodec 和 FFmpeg,用于处理音频和视频。两个服务端都提供 OpenAI 兼容的 API,工具调用通过一个 dots 专用的解析器标志开启。聊天模板选项 enable_thinking 可在推理轨迹和直接响应之间切换。
消费平台想用开放权重做什么
此次发布背后的战略模式是效率。MiniMax 的 M3 已经在开放包中结合了原生多模态、1M token 上下文和智能体编程。Qwen 覆盖了从 30B-A3B 到 235B-A22B 的稠密和 MoE 变体。在极端一端,开放的 975B 参数 Inkling 以 1.9TB 发布,之后 Unsloth 以 1-bit 将其压缩到 270GB,准确率保留 74.2%。即使是小型安全模型也在玩同样的游戏:Mistral 声称其 3B Shieldstral 可匹配最高达其七倍体量的开放文本安全模型。
dots3-note preview 以一位不同寻常的母公司契合了这一模式。Apache 2.0 授权允许这些权重无限制地用于商业产品,而 FP8 单节点方案表明该工作室定价瞄准的是真实部署,而不仅仅是排行榜运行。由于该系列围绕多个能力和成本点进行规划,这很可能是多次发布中的第一次。
缺失的是报告。17:1 的稀疏比和 512K 窗口只有在背后的数字公开之后才会变得有趣。在那之前,dots3-note preview 只是来自一个意想不到领域的架构声明。仅凭这一点就值得关注。基准测试将决定它是否不止于此。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。