SevenTnewS

开源AI

Kimi K3 是有史以来最大的开放模型,但仍不是最好的。

Kimi K3是最大的开源模型,拥有2.8T参数,但在整体基准测试中未能击败最好的专有模型。尽管它在特定编码和智能体任务上表现出色,但与Claude Fable 5和GPT 5.6 Sol等前沿领先者的差距暴露了没有架构和数据突破的规模扩展的局限性。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-27 · 阅读需 3 分钟

Kimi K3 是有史以来最大的开放模型,但仍不是最好的。
来源 : Kimi K3 launch …·Seventnews inte…

Kimi K3 是迄今为止最大的开放模型,拥有 2.8 万亿参数,由 Moonshot AI 构建,采用新颖的注意力架构和 100 万 token 的上下文窗口。但其基准测试表中有一个数字更加突出:整体性能仍落后于 Claude Fable 5 和 GPT 5.6 Sol,而 Claude Opus 5 最近以一半的成本达到了 Fable 级别的性能,根据 Claude Opus 5 的基准测试结果。这一差距很重要,不是因为 K3 弱(它并不弱),而是因为它使开放模型正在赶超的说法变得复杂。

K3 的优势所在

K3 在几项独立基准测试中领先。在 SWE Marathon 上,它得分 59.7,领先于 Claude Fable 5 的 57.4 和 GPT 5.6 Sol 的 56.5。在 Terminal-Bench 2.1 上,K3 达到 45.8,击败了所有专有竞争对手。BrowseComp 的 100 万上下文变体使其获得 89.5,再次超越竞争对手,正如 逐基准测试的详细分析 所证实的。这些分数表明了在长周期编程、自主工具使用和深度网络研究方面的真正优势。在需要持续推理和环境交互的智能体任务中,K3 常常领先,这反映了模型在处理持续交互方面的进步,而像 SEED 蒸馏 这样的技术在这方面已显示出前景。

但在 DeepSWE、Program Bench 和 KCB 2.0 等综合基准测试中,K3 落后于最佳专有模型几个百分点,这一模式与以下观察结果一致:即使是一流的智能体在复杂分类任务上也只能得 49%,如 HSCodeComp 基准测试 所示。总体情况是有赢有输,并非明确的胜利。

架构告诉我们什么

K3 的技术故事比标题数字更有趣。Kimi Delta Attention 和 Attention Residuals 是真正的创新,旨在处理深度网络和长序列而不会出现常见的退化。Stable LatentMoE 激活 896 个专家中的 16 个,训练方法(分位数平衡、每头 Muon、使用 MXFP4 的量化感知训练)解决了早期大型模型遇到的真正扩展难题。这些是工程上的突破,即使 K3 本身没有在每个排行榜上登顶,也可能渗透到其他开源项目中。

定价策略

Moonshot AI 正在积极定价。Kimi API 对缓存命中的输入收取每百万 token 0.30 美元,缓存未命中的输入收取 3.00 美元,输出收取 15.00 美元。这低于 Anthropic 和 OpenAI 的可比层级。该公司声称,由于 Mooncake 的解耦推理架构,在编码工作负载上缓存命中率超过 90%。定价依赖于高效推理,这是近期工作(如 Together AI 的开放推理数学)的重点。结合计划于 2026 年 7 月 27 日发布的开放权重,这一价格使 K3 对那些希望自行检查和托管 2.8T 参数模型的组织具有吸引力。

这对开源前沿意味着什么

业界一直流传着一个说法:开放模型正在迎头赶上。K3 直接挑战了这一说法。它是目前规模最大的开放模型,但并不能始终击败那些参数更少但数据和后训练更好的模型。这表明差距不仅仅是计算能力的问题。数据整理、对齐技术和专有训练管道仍然赋予封闭模型原始规模无法抹去的优势。这一说法因以下事实而进一步复杂化:开放模型需求飙升,Ollama 因流量过大暂停了其高级计划,41 家公司组成的联盟认为开放权重 AI 是美国的最佳选择。与此同时,来自东方的开源模型正在侵蚀美国的优势,正如来自东方的趋势所示。

K3 是一项严肃的成就。它证明了开放模型可以达到 3T 级别的规模并仍然可靠运行,这是一项不容小觑的工程壮举。但基准测试结果也警告人们不要认为参数数量是智能的代表。前沿不仅仅是一个数字。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。