平台战略
Groq停止兜售速度,转而推出智能体操作系统
Groq于9月23日推出远程MCP支持,并迅速添加Kimi K2-0905和OpenAI的GPT-OSS系列等模型,将其API从快速推理管道转变为完整的智能体编排层。该平台不再仅仅依靠每秒token数来竞争。

变更日志比任何新闻稿都更能说明情况。在2025年9月4日至9月23日期间,Groq新增了三大能力:远程模型上下文协议(MCP)服务器集成测试版、Moonshot AI的Kimi K2-0905指令模型,以及将网络搜索、代码执行和浏览器自动化整合到单个API调用中的复合智能体系统。单从数量上看,这像是一场产品闪电战。但仔细审视,其模式是一贯的:Groq不再兜售推理能力,而是在销售一个为API时代打造的完整智能体操作系统。并行代理并非为了速度,而是为了协调
在这三者中,MCP的推出是最具深远意义的。远程MCP是Model Context Protocol的缩写,是Anthropic用于连接AI模型与外部工具的开源标准,它允许开发者将任何符合MCP规范的服务器连接到Groq托管的模型。该集成完全兼容OpenAI的Responses API及其自身的远程MCP规范。实际效果是,任何目前使用OpenAI工具调用基础设施的开发者,都可以迁移到Groq,无需修改一行连接代码。他们只需更改端点,保留工具定义,并为每个token支付更少的费用。在宣布该功能时,Groq重点介绍了七个发布合作伙伴:BrowserBase、Browser Use、Exa、Firecrawl、HuggingFace、Parallel、Stripe和Tavily。每个合作伙伴都为网络自动化、搜索、抓取或支付工作流提供了现成的MCP服务器。Anthropic Academy:免费学习Claude的平台
如果说MCP是通用适配器,那么Kimi K2-0905的发布则为开发者提供了一个专门利用它的模型。Moonshot AI的最新变体已在GroqCloud上提供,并附带首日支持:256K上下文窗口(这是该平台迄今为止最大的),以及提示缓存功能,可为缓存的前缀部分降低高达50%的成本。该模型的性能数据具有竞争力:混合价格为每百万token 1.50美元,每秒处理超过200个token。更重要的是,Groq将其定位为智能体编程模型,声称在复杂的多轮交互中可靠性更高。这正符合MCP的故事:一个能在长上下文窗口中处理多次工具调用的模型,正是使远程MCP发挥作用的关键引擎。Kimi K2.7 Code更快更便宜,但开源编程撞上了名为GPT-5.5的墙。
复合系统和复合迷你系统于9月4日从测试版升级为全面可用,完全抽象化了工具编排流程。它们基于OpenAI的GPT-OSS-120B和Meta的Llama模型构建,将网络搜索、代码执行、Wolfram Alpha和并行浏览器自动化(最多支持10个同时运行的浏览器)整合到单个API调用中。Groq声称,在内部基准测试中,其准确率比OpenAI的Web Search Preview和Perplexity Sonar高出约25%,错误率减少50%。复合系统不是一个模型,而是一个即开即用的智能体。那些不想使用MCP自行组装工具链的开发者,只需调用groq/compound,就能得到一个能够自动搜索、计算和浏览页面的研究助手。IBM 开源 CUGA 智能体框架:跳过基础设施搭建,直接写提示词
模型阵容还在不断壮大。OpenAI于8月初发布的开源权重模型GPT-OSS-20B和GPT-OSS-120B带来了推理能力、内置浏览器搜索和结构化输出。6月加入的Qwen 3 32B支持思维模式,可以关闭以获得低延迟响应。Meta的Llama 4 Scout和Maverick模型于4月推出,具备视觉理解能力。Groq刻意保持模型中立。其策略不是押注某个基础模型,而是托管所有模型,并提供使它们有用的粘合剂。
8月下旬推出的提示缓存功能实现了成本优化的自动化。该系统会重用来自最近请求的计算结果,这些请求共享共同的前缀、系统提示、工具定义和少量示例,并对缓存的token提供50%的折扣。缓存数据保存在易失性内存中,并在数小时内过期,这避免了困扰持久缓存的隐私问题。该功能目前适用于Kimi K2,其他模型预计很快也会支持。
随着变更日志中的每一次更新,战略图景变得更加清晰。推理即服务市场已成为一场商品化竞赛,供应商竞相在每token价格和模型阵容上竞争。Groq正试图通过成为编排层来退出这场竞赛。远程MCP为开发者提供了一种标准化的工具连接方式。复合系统为他们提供了一个预先组装好的智能体。Kimi K2和GPT-OSS为他们提供了具有足够上下文和工具支持能力的模型,以便大规模使用这些功能。定价依然具有竞争力:Kimi K2为每百万token 1.50美元,Qwen 3为0.29/0.59美元,但其差异化优势已不再是单次推理调用的单位经济学,而是从头到尾构建一个智能体应用程序的总成本。
风险依然存在。MCP仍是一个测试版标准,Anthropic自身的协议路线图可能会发生变化,使Groq的集成复杂化。复合系统的性能数据来自Groq自身的基准测试,而非独立审计,且现实世界中的智能体可靠性往往会因控制性评估无法捕捉的边缘情况而下降。快速添加模型的节奏也引发了维护问题。每个新模型都需要跨工具集成进行持续的兼容性测试,而这并非线性可扩展的。600个文件,一条命令:moonshot.ai 的代码重构揭示了AI Agent在实战中的价值
尽管如此,方向是明确的。Groq正在为一个应用程序不再是聊天界面,而是由推理模型编排的工具调用网络的世界而构建。过去五个月的变更日志记录了该世界的基础设施:远程MCP用于连接,复合系统用于打包,Kimi K2用于运行,提示缓存用于降低支付。每秒token数仍然重要,但它们已不再是头条新闻。头条新闻是:Groq希望成为一个组装智能体的平台,而不仅仅是执行推理的地方。Aleph Alpha 为 DeepSeek 构建理论推理模型:从硬件原语推导性能
- 来源 : Groq Changelog — 2025-04-29
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。