SevenTnewS

AI效率

四个小模型刚刚击败了它们的大哥。这不再是巧合。

OvisOCR2(0.8B)、Mage-Flow(4B)、Celeris-1,以及Claude Opus 5以成本效益击败Fable 5,本月都击败了更大或更昂贵的系统,不是通过规模,而是通过修复实际限制性能的具体瓶颈:分词、流水线冗余、延迟。

Emmanuel Fabrice Omgbwa Yasse

2026-07-30 · 阅读需 2 分钟

四个小模型刚刚击败了它们的大哥。这不再是巧合。
来源 : Analysis synthe…

来自腾讯的OvisOCR2,一个拥有8亿参数的模型,在OmniDocBench上获得了96.58分,成为首个登顶该排行榜的端到端模型。多年来,多阶段流水线系统(将检测、布局和识别模型串联)一直主导文档解析领域,其假设是将问题分解为多个阶段是达到最高精度的唯一方法。一个单一的小模型凭借强化学习和蒸馏而非更多参数,彻底击败了这一架构。这样的结果应该让每个维护流水线系统的团队反思:这种复杂性是否仍然值得?

这并非本月孤立的案例。微软的Mage-Flow,一个拥有40亿参数的图像生成与编辑模型,在单块A100 GPU上即可运行,其性能媲美Qwen-Image和FLUX.2等更大的300亿参数系统。其关键创新并非更大的网络,而是一个轻量级分词器,将编码成本降低了12倍。Celeris-1在MMLU-Pro上获得75.9%的分数,延迟仅为158毫秒,比GPT-5 mini快8倍,而准确率仅下降2.6个百分点, , 这种取舍,大多数生产部署都会毫不犹豫地接受。在一个更具体但也更尖锐的对比中,Claude Opus 5在一个交互物理基准测试中通过了所有三项任务,且成本在顶级模型中最低,而Claude Fable 5以两倍的价格却未能通过任何一项

这四个模型的共同点

这些成果并非来自某个碰巧能泛化的单一架构技巧。OvisOCR2依赖蒸馏和强化学习;Mage-Flow依赖分词器效率;Celeris-1将推理速度作为首要设计目标而非事后考虑;Opus 5的结果实际上关乎特定任务类型上的训练和对齐质量,与规模完全无关。它们的共同点是,每个团队都不再把参数数量当作默认杠杆,而是找到了各自具体问题中的实际瓶颈, , 分词开销、流水线冗余、推理延迟、任务特定推理, , 并直接加以解决。

为什么这比四个产品发布更重要

实际后果是,“可用最大模型”不再是“我们应该用哪个模型”的安全默认答案,即使对于没有预算限制的团队也是如此。一个300亿参数的图像模型被一个40亿参数的模型在单个消费者可访问的GPU上匹敌,这不仅更便宜,更表明更大模型的额外容量从一开始就没有被高效利用。这四个成果各自是一个小而具体的工程胜利。它们共同表明,该领域剩余的最容易的收益越来越多地来自问模型浪费了什么,而不是问它能有多大。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。