文档AI
为什么最好的文档解析器现在只需8亿参数
阿里巴巴的OvisOCR2,一个紧凑的0.8B端到端模型,在OmniDocBench(96.58)和PureDocBench(75.06)上取得了最先进的分数,超越了更大的基于流程的解析器。它的成功来自于一个数据引擎,混合了经过过滤的真实文档和合成页面,在4B教师模型上进行强化学习,并通过同策略蒸馏将知识注入小模型。

文档解析长期以来一直是两阶段的任务。首先,布局分析模型将页面分割成区域、文本块、表格、公式、图形,然后识别模型读取每个裁剪区域。这种方法虽然稳健但繁琐:第一阶段的错误会级联到第二阶段,而且部署两个具有不同运行时的模型会增加操作复杂性。
端到端模型直接从页面图像生成Markdown表示,在理论上一直看起来更简洁。但在实践中,它们落后了,无法与主导公共基准测试(如OmniDocBench)的模块化系统匹敌。这个差距刚刚被缩小,而且是由一个只有8亿参数的模型实现的,这更令人印象深刻。
OvisOCR2由阿里巴巴的ATH-MaaS团队开发,将Qwen3.5-0.8B(Qwen3.5家族中最小的成员)后训练成一个专用的页面级解析器。在OmniDocBench v1.6上,它总体得分96.58,领先于所有流程方法,包括PaddleOCR-VL-1.6(96.33)、GLM-OCR(95.22)和MinerU2.5-Pro(95.75)。在PureDocBench上,其Avg3得分为75.06,也位居榜首。
小型模型如何击败大型模型
主要创新在于训练方案,而非架构。该团队构建了一个数据引擎,包含两个互补的流程。
真实世界流程:获取实际文档图像,通过PaddleOCR-VL-1.5或MinerU2.5-Pro处理,解析结构化的JSON输出,将其归一化为统一的Markdown模式,并通过基于规则的检查和人工抽检对结果进行过滤。这确保了当模型看到扫描发票或学术论文时,监督信号尽可能干净。
合成流程:从模型最初出错的困难样本开始。一个多模态模型将这些样本转换为HTML模板,然后由一个代理通过变化内容和结构来多样化模板。关键洞察:由于HTML源同时渲染图像和Markdown真实标注,因此没有标注噪声。模型从完美的标签中学习,这对于表格、公式和长篇布局尤其有价值。
用于结构化输出的强化学习
训练分阶段进行。首先,在Qwen3.5-0.8B之上进行监督微调,建立基础的解析策略。然后,一个4B分支进行强化学习(GRPO),使用多组件奖励:文本的归一化编辑距离、公式的字符检测匹配(CDM)、表格的树编辑距离(TEDS)。奖励仅对页面真实标注中存在的组件取平均,避免了无关指标的噪声。
直接将RL应用于0.8B模型会导致表格质量不稳定。因此,团队使用RL增强的4B模型作为教师进行同策略蒸馏(OPD)。学生生成输出,教师对其进行评分,学生通过反向KL散度学习,偏向教师最自信的token。一个top-k技巧将每个位置的张量从词汇表大小减少到k,使长响应的内存管理变得可行。
最后,通过加权参数平均融合多个候选变体。
基准测试结果的背景
| 基准测试 | OvisOCR2 | 最佳流程(先前SOTA) | 最佳端到端(先前) |
|---|---|---|---|
| OmniDocBench v1.6(总体) | 96.58 | 96.33(PaddleOCR-VL-1.6) | 94.74(HunyuanOCR-1.5) |
| PureDocBench(Avg3) | 75.06 | 70.39(DotsMOCR,流程) | 73.92(FD-RL,端到端) |
| 文本编辑距离(OmniDocBench) | 0.025 | 0.033(PaddleOCR-VL-1.6) | 0.039(HunyuanOCR-1.5) |
| 公式CDM(OmniDocBench) | 97.53 | 97.49(PaddleOCR-VL-1.6) | 95.79(Unlimited-OCR) |
改进在所有四个评估维度(文本、公式、表格和阅读顺序)上都是一致的,而不仅仅是总体平均值。在OmniDocBench上,OvisOCR2在所有专门模型中报告了最低的文本编辑距离、最高的公式CDM、最高的表格TEDS-S和最低的阅读顺序编辑距离。
这对该领域意味着什么
文档解析领域一直在向统一模型发展。Mistral OCR 4在单个容器中添加了边界框和类型块分类。DeepSeek-OCR 2引入了视觉因果流并开源了权重。两者在精神上都是端到端的,但仍然依赖一些模块化组件。
OvisOCR2更进一步:一个单一的0.8B模型直接输出Markdown,没有附加布局解析器。其权衡是实际世界中的鲁棒性:在PureDocBench的Real轨道(手机拍摄页面、复印、屏幕摄影)上,OvisOCR2得分为66.56,低于Gemini-3.1-Pro和Qwen3.5-122B-A10B。团队承认图像质量下降仍然是一个弱点。
尽管如此,该模型在手写体和复杂表格(流程方法的两个痛点)上的表现尤其强劲。在内部手写体子集上,OvisOCR2总体得分为72.28,而GLM-OCR为69.58。在复杂表格上,其缺失率(输出中完全缺失表格)降至7.96%,而流程解析器为13-17%。一旦流程的布局分析遗漏了表格,任何下游识别器都无法找回。
该模型可在HuggingFace上获取。凭借0.8B参数,它可以运行在消费级GPU甚至CPU上(通过优化),使高质量的文档解析不再局限于资源丰富的企业。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。