OCR
4 published articles
人工智能Featured3 min read
分析
挑战文档解析所有常规的0.8B模型
腾讯的OvisOCR2,一个0.8B参数的文档解析器,在OmniDocBench上获得96.58分,是首个登顶排行榜的端到端模型。该模型使用强化学习和蒸馏技术超越了更大的基于流水线的系统,挑战了多阶段架构必要性的假设。
2026-07-26
大语言模型与模型Featured3 min read
文档AI
Mistral OCR 4 高分胜出,但自身审计揭示基准测试分数并不能反映真实情况
Mistral OCR 4 在文本提取之外引入了边界框、块分类和置信度分数,支持 170 种语言。它实现了 72% 的人类偏好胜率和顶级基准测试分数,但 Mistral 自身的分析表明,标准基准测试会因格式伪影而非准确性错误而惩罚正确的输出。
2026-07-16
人工智能4 min read
领域专业化
为什么一个六个月的OCR模型在巴西葡萄牙语上仍胜过新对手
DharmaOCR在葡萄牙语基准测试中得分为0.925,而Mistral OCR4得分为0.798,Unlimited-OCR得分为0.7587。差距源于集中的训练分配和基于DPO的方法,该方法在复杂文档中抑制文本退化。
2026-07-16
DeepSeek2 min read
人工智能
DeepSeek-OCR 2 引入视觉因果流,开源文档理解再升级
DeepSeek-OCR 2 引入视觉因果流,实现类人视觉编码。该模型现已在 GitHub 上开源,支持 vLLM 和 Transformers,具备动态分辨率(最多 1,216 个视觉标记)及文档到 Markdown 的转换功能。
2026-07-09