一款158毫秒模型刚刚改写了速度与质量的游戏规则
打破速度-质量规则的158毫秒模型
Celeris-1在MMLU-Pro上以158毫秒延迟获得75.9%的分数,比GPT-5 mini快八倍,仅损失2.6个准确率百分点。本文分析了基准测试方法以及这种速度-质量权衡对实时AI应用的意义。

速度与质量的前沿
传统观点认为,速度和准确性不可兼得。推理排行榜上的顶级模型需要数秒。快速模型则牺牲了太多智能。Celeris-1由一支独立团队发布,旨在打破这一权衡。其MMLU-Pro数据为:中位响应时间158毫秒,准确率75.9%。不是最高分,但延迟仅为领先者的几分之一。专注于延迟的设计已在其他地方取得成果:Mistral Nano在内存不足1GB的设备上实现了其更大版本85%的推理能力。
背景:GPT-5在相同测试中得分为81.9%,但耗时2.0秒。Gemini 3.5 Flash Lite以83.0%领先,但需要1.2秒。Celeris-1用约5到7个准确率点换取了8到16倍的速度优势。对于每一毫秒都至关重要的应用而言,这一权衡是恰当的。该模型专为热路径设计:每一个对话轮次、每一个智能体循环步骤、每一次按键。
基准测试结果
Celeris团队在五次提示的思维链配置下运行了完整的MMLU-Pro测试集,采用严格评分,并为允许设置推理预算的每个模型将其归零。Mercury 2以即时模式运行。下表显示了六个模型的准确率和响应时间。
| 模型 | 准确率 | 响应时间(p50) | 计时依据 |
|---|---|---|---|
| Celeris-1 | 75.9% | 158 ms | 服务器报告 |
| Gemini 3.5 Flash Lite | 83.0% | 1,232 ms | 端到端,共址 |
| GPT-5 | 81.9% | 2,046 ms | 服务器报告 |
| GPT-5 mini | 78.5% | 2,495 ms | 服务器报告 |
| Gemini 2.5 Flash | 73.0% | 2,600 ms | 端到端,共址 |
| Inception / Mercury 2 | 63.7% | 257 ms | 服务器报告 |
Celeris-1达到75.9%,比GPT-5 mini低2.6个百分点,但快16倍。它击败了Mercury 2, , 同一延迟级别中唯一的其他模型, , 高出12个以上百分点,同时响应速度还快了100毫秒。Gemini 3.5 Flash Lite仍然是最
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。