SevenTnewS

语音智能体

为什么 Grok 4.1 Fast 在电话通话中胜过更智能的模型

综合排行榜为语音通话选错了大语言模型。BenchLM 的 2026 年排名将延迟放在首位:Grok 4.1 Fast 在 0.54 秒内作答,而最高分得主 Claude Opus 4.6 需要 1.78 秒。快速模型承担对话;推理模型留在后台工具调用中。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-05 · 阅读需 5 分钟

为什么 Grok 4.1 Fast 在电话通话中胜过更智能的模型

基准测试表和电话通话惩罚的是不同的品质。登顶综合排行榜的模型,往往是你在来电者耳边最不想听到的那一个,因为决定一段对话能否存活的指标是首次回答时间,而这正是大多数排行榜埋没或忽略的数字。

BenchLM 的 2026 年语音智能体报告用实时运行时数据说明了这一点。其速度仪表盘显示,综合得分最高的 Claude Opus 4.6(86 分)需要 1.78 秒才能生成首次回答。而 68 分的 Grok 4.1 Fast 在 0.54 秒内作答。在实时通话中,这两个模型一个能正常工作,另一个听起来就像掉线。

为什么排行榜在通话中失灵

来电者感受到的延迟中约 70% 来自大语言模型推理,这使得模型选择成为开发者手中最大的延迟调节杠杆。响应在 800 毫秒内开始会感觉很自然;到约 1.5 秒时就会觉得卡顿;超过三秒,来电者就会以为线路已断,开始打断智能体说话。

这一限制悄悄淘汰了大多数推理模型。在 BenchLM 的仪表盘上,它们的思考阶段使首次回答延迟达到 10 到 150 秒,而任何基准测试分数都经不起电话通话中 30 秒的停顿。实际的分界线约为 1.5 秒:任何更慢的模型都只是后台工作者,而不是对话者。

跨过门槛的最快模型

以下是根据 BenchLM 实时运行时数据得出的、仍能跨过可用质量门槛的最低延迟模型:

模型首次回答输出速度类型综合得分
Grok 4.1 Fast0.54s138 t/s非推理68
Claude Opus 4.51.01s46 t/s非推理75
GPT-4.11.02s108 t/s非推理56
GLM-4.71.10s82 t/s推理68
Gemini 3 Flash1.19s159 t/s非推理55
Claude Sonnet 4.61.48s44 t/s非推理80
GLM-51.64s74 t/s非推理66
Claude Opus 4.61.78s40 t/s非推理86
MiMo-V2-Flash2.14s129 t/s推理59
Kimi K2.52.38s45 t/s非推理63

首次回答时间采用端到端测量,包括推理模型的完整思考阶段。输出速度以每秒 token 的中位数计算。小于 10 亿参数的微型模型可以做到更低延迟,但在任何超出简单 IVR 的场景中都会低于质量门槛。

数据实际选中了什么

Grok 4.1 Fast 是其中最突出的:首次回答只需半秒,同时仍能跨过 65 分左右的综合得分门槛, , 这是语音场景真正需要的罕见组合。Gemini Flash 系列在原始吞吐量上胜出,而一旦模型开始说话,输出速度就变得重要,因为它决定了音频的流式传输速度。Gemini 3 Flash 以每秒 159 个 token 创下表中最高速率。

GPT-4.1 在约一秒延迟与 100 万 token 上下文和可靠函数调用之间取得平衡。当你愿意用几百毫秒换取复杂人设下明显更好的指令遵循时,Claude Sonnet 4.6 是首选;它 80 分的综合得分是表中 1.5 秒上限以内模型中最高的。而表中得分最高(86 分)的 Claude Opus 4.6 正好站在那条线的错误一侧。

能力仍然重要,但不是排行榜那种排序方式。语音智能体活在系统提示词中,提示词设定了人设、护栏和输出长度限制;偏离指令的模型会逐渐听起来不像你的产品,而是开始大声念出列表和网址。长度纪律是这个问题最尖锐的体现:在屏幕上,过长的回答只是一次滚动;在通话中,则意味着来电者要等十秒才能插上话。

注意表中缺失了什么:那些登顶综合排名的旗舰推理模型。这正是这一比较的全部意义所在。旗舰模型属于后台,而不是来电者的耳边。

分脑模式

2026 年的生产级语音智能体很少只使用一个模型。它们使用两个:一个快速模型承担对话,一个推理模型专门处理真正困难的问题,通常是在工具调用之后。团队往往在付出代价后才明白这一点, , 上线单一旗舰模型后,每次触发长时间思考的轮次都会让通话放弃率飙升。

模型决策所处的位置

大语言模型只是三个组件之一,而你接入的平台决定了你能保留多少这一选择权。OpenAI 的 Realtime API 是原生的语音到语音流水线,是做出可用演示的最快路径,但它将你锁定在 OpenAI 的模型上:没有 Grok 4.1 Fast,也没有可自托管的开源权重模型。Retell 和 Vapi 这类编排层为你提供管道,让你自己挑选大脑。ElevenLabs 被报告称为 2026 年的生产标准,它自己提供语音层,首次音频时间短,可叠加在你的大语言模型延迟之上,在长时间会话中保持声音稳定,并提供免费层级用于原型开发。

按用例选择

  • 面向客户的电话智能体:选择能跨过你指令遵循门槛的最快模型,也就是 Grok 4.1 Fast 或某个 Gemini Flash 层级。两分的基准测试优势对来电者而言不可见;一秒的停顿则不然。
  • 内部语音助手:对延迟容忍度较高,因此选择 Claude Sonnet 4.6 或轻量推理层级,可以换来更好的工具使用和指令遵循。当用户知道自己在和机器说话时,约两秒以内的首次回答是可以接受的。
  • 带复杂后端工作的语音:采用分脑模式,用填充音频覆盖思考时间。
  • 多语言:先查看语言排行榜选择大脑,再确认 TTS 层覆盖同样的语言。一个精通某种语言、而你的语音层却说不了那种语言的模型,是最常见的生产事故之一。

BenchLM 的规则很短:选择能跨过你指令遵循和工具使用门槛的最快模型,忽略综合排行榜。根据当前数据,这意味着对话中用一个快速模型,后台工具调用中用一个推理模型,token 直接流入 TTS 层,并为整条语音链路设定延迟预算。这四件事做对了,一个中端模型听起来就像真人;做错了,世界上最好的模型也让人觉得是坏的。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。