SevenTnewS

分析

挑战文档解析所有常规的0.8B模型

腾讯的OvisOCR2,一个0.8B参数的文档解析器,在OmniDocBench上获得96.58分,是首个登顶排行榜的端到端模型。该模型使用强化学习和蒸馏技术超越了更大的基于流水线的系统,挑战了多阶段架构必要性的假设。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-26 · 阅读需 3 分钟

挑战文档解析所有常规的0.8B模型
来源 : OvisOCR2 Techni…

长期以来,文档解析一直由流水线系统主导。这些由专用模块组成的链条, , 文本检测器、识别器、布局分析器、公式解析器, , 每个都增加了复杂性,并存在错误向下游传播的风险。传统观点认为,没有任何单一的端到端模型能够达到它们的精度,尤其是在杂乱的真实世界页面上。

腾讯的OvisOCR2对那种观点提出了质疑。该模型仅用0.8亿参数,就在OmniDocBench v1.6排行榜上获得了96.58分,是所有方法(流水线或端到端)中的最佳总体分数。7月15日在arXiv上发布的技术报告详细介绍了该团队如何实现这一目标。

示意图:OvisOCR2训练流水线
腾讯技术报告中描述的OvisOCR2训练流水线,结合了数据引擎、监督微调、带多组件奖励的强化学习训练、蒸馏和检查点融合,以产生一个0.8B参数的端到端模型。

训练方法是真正的关键。团队构建了一个数据引擎,将过滤后的真实文档注释与合成页面混合在一起,其中图像和Markdown目标都来自同一个HTML源,保证了完美的对齐。在监督微调之后,他们使用强化学习训练了一个40亿参数的分支,该分支使用多组件奖励来评分准确性、结构和格式。然后他们通过策略内蒸馏将该知识提炼到0.8B模型中,并融合了多个检查点的权重。结果:一个端到端模型击败了经常使用五倍以上参数和独立模块的方法。

这一成果的意义超越了一个单独的基准。在PureDocBench上,OvisOCR2获得了75.06分,是所比较方法中最高的Avg3。一个涵盖更多样化和更具挑战性布局的内部基准也显示该模型保持领先,表明该方法能泛化到精心策划的测试集之外。

该领域一直在向端到端设计发展。DeepSeek-OCR 2Mistral OCR 4都提供开源文档解析,但两者都没有以这个规模的端到端模型在OmniDocBench上占据榜首。DeepSeek-OCR 2使用动态分辨率和视觉令牌,而Mistral OCR 4添加了边界框和每个词的置信度分数,两者都倾向于流水线式结构。OvisOCR2是纯粹的端到端:输入页面图像,输出Markdown,没有中间框或阶段。

实际意义是明确的。对于构建文档工作流的开发者来说,一个单一的0.8B模型一次处理文本、表格、公式和布局,简化了基础设施并减少了延迟。它还降低了在边缘设备或资源有限环境中运行的障碍。

还存在一些未解决的问题。论文没有说明训练计算成本、推理速度或合成数据的具体组成。该模型在GitHub上可用,但预印本中未完全展开仓库链接。独立的复现和延迟基准将告诉我们96.58分是否能转化为实际吞吐量。

无论如何,OvisOCR2的结果是一个里程碑。它证明了只要有足够的数据质量和智能的训练流水线,小型端到端模型可以竞争并战胜那些拥有多年优化起点的模块化系统。现在,责任转移到了流水线阵营,他们需要证明其复杂性的合理性。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。