SevenTnewS

一款158毫秒模型刚刚改写了速度与质量的游戏规则

打破速度-质量规则的158毫秒模型

Celeris-1在MMLU-Pro上以158毫秒延迟获得75.9%的分数,比GPT-5 mini快八倍,仅损失2.6个准确率百分点。本文分析了基准测试方法以及这种速度-质量权衡对实时AI应用的意义。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-25 · 阅读需 1 分钟

打破速度-质量规则的158毫秒模型
来源 : How we test Cel…

速度与质量的前沿

传统观点认为,速度和准确性不可兼得。推理排行榜上的顶级模型需要数秒。快速模型则牺牲了太多智能。Celeris-1由一支独立团队发布,旨在打破这一权衡。其MMLU-Pro数据为:中位响应时间158毫秒,准确率75.9%。不是最高分,但延迟仅为领先者的几分之一。专注于延迟的设计已在其他地方取得成果:Mistral Nano在内存不足1GB的设备上实现了其更大版本85%的推理能力

背景:GPT-5在相同测试中得分为81.9%,但耗时2.0秒。Gemini 3.5 Flash Lite以83.0%领先,但需要1.2秒。Celeris-1用约5到7个准确率点换取了8到16倍的速度优势。对于每一毫秒都至关重要的应用而言,这一权衡是恰当的。该模型专为热路径设计:每一个对话轮次、每一个智能体循环步骤、每一次按键。

基准测试结果

Celeris团队在五次提示的思维链配置下运行了完整的MMLU-Pro测试集,采用严格评分,并为允许设置推理预算的每个模型将其归零。Mercury 2以即时模式运行。下表显示了六个模型的准确率和响应时间。

模型准确率响应时间(p50)计时依据
Celeris-175.9%158 ms服务器报告
Gemini 3.5 Flash Lite83.0%1,232 ms端到端,共址
GPT-581.9%2,046 ms服务器报告
GPT-5 mini78.5%2,495 ms服务器报告
Gemini 2.5 Flash73.0%2,600 ms端到端,共址
Inception / Mercury 263.7%257 ms服务器报告

Celeris-1达到75.9%,比GPT-5 mini低2.6个百分点,但快16倍。它击败了Mercury 2, , 同一延迟级别中唯一的其他模型, , 高出12个以上百分点,同时响应速度还快了100毫秒。Gemini 3.5 Flash Lite仍然是最

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。