الذكاء الاصطناعي للمستندات
لماذا يتناسب أفضل محلل للمستندات الآن مع 800 مليون معلمة
نموذج OvisOCR2 من علي بابا، وهو نموذج شامل صغير بحجم 0.8 مليار معلمة، يحقق نتائج متطورة على OmniDocBench (96.58) و PureDocBench (75.06)، متجاوزًا المحللات الأكبر القائمة على خطوط الأنابيب. يعود نجاحه إلى محرك بيانات يمزج بين المستندات الحقيقية المصفاة والصفحات الاصطناعية، والتعلم المعزز على نموذج معلم بحجم 4 مليارات معلمة، والتقطير على السياسة في النموذج الصغير.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-24 · قراءة 4 دقائق

كان تحليل المستندات لفترة طويلة عملية من مرحلتين. أولاً، يقوم نموذج تحليل التخطيط بتقسيم الصفحة إلى مناطق، كتل نصية، جداول، صيغ، أشكال، ثم يقوم نموذج التعرف بقراءة كل مقطع. هذا النهج قوي ولكنه مرهق: الأخطاء في المرحلة الأولى تتتالى إلى الثانية، ونشر نموذجين بملفات تشغيل مختلفة يضيف تعقيدًا تشغيليًا.
النماذج الشاملة، التي تُنتج تمثيل Markdown مباشرة من صورة الصفحة، بدت دائمًا أكثر نظافة على الورق. لكن في الواقع كانت متأخرة، غير قادرة على مجاراة الأنظمة المعيارية التي تهيمن على المعايير العامة مثل OmniDocBench. هذه الفجوة أغلقت للتو، مع نموذج بحجم 0.8 مليار معلمة فقط.
OvisOCR2، الذي طوره فريق ATH-MaaS في علي بابا، يقوم بتدريب Qwen3.5-0.8B، أصغر أفراد عائلة Qwen3.5، ليصبح محللًا مخصصًا للصفحات. على OmniDocBench v1.6، يسجل 96.58 إجمالاً، متقدمًا على كل طرق خطوط الأنابيب بما في ذلك PaddleOCR-VL-1.6 (96.33)، و GLM-OCR (95.22)، و MinerU2.5-Pro (95.75). على PureDocBench، درجة Avg3 البالغة 75.06 تتصدر أيضًا لوحة الصدارة.
كيف يتفوق نموذج صغير على النماذج الكبيرة
يكمن الابتكار الرئيسي في وصفة التدريب، وليس في الهندسة المعمارية. بنى الفريق محرك بيانات بخطي أنابيب متكاملتين.
خط الأنابيب الواقعي يأخذ صور مستندات حقيقية، ويشغلها عبر PaddleOCR-VL-1.5 أو MinerU2.5-Pro، ويحلل مخرجات JSON المنظمة، ويطبعها في مخطط Markdown موحد، ويصفي النتائج من خلال فحوصات قائمة على القواعد وفحوصات يدوية موضعية. وهذا يضمن أنه عندما يرى النموذج فواتير ممسوحة ضوئيًا أو أوراقًا أكاديمية، فإن الإشراف يكون نظيفًا قدر الإمكان.
خط الأنابيب الاصطناعي يبدأ من عينات صعبة، صفحات أخطأ فيها النموذج في البداية. يقوم نموذج متعدد الوسائط بتحويلها إلى قوالب HTML، ثم يتم تنويعها بواسطة وكيل يغير المحتوى والتخطيط. الرؤية الرئيسية: نظرًا لأن مصدر HTML يعرض كلاً من الصورة والحقيقة الأساسية Markdown، فلا يوجد ضوضاء في التعليقات التوضيحية. يتعلم النموذج من تسميات مثالية، وهو أمر قيم بشكل خاص للجداول والصيغ والتخطيطات الطويلة.
التعلم المعزز للمخرجات المنظمة
يتقدم التدريب على مراحل. أولاً، الضبط الدقيق الخاضع للإشراف على Qwen3.5-0.8B يؤسس سياسة التحليل الأساسية. ثم يخضع فرع بحجم 4 مليارات معلمة للتعلم المعزز (GRPO) مع مكافأة متعددة المكونات: مسافة التحرير المعيارية للنص، ومطابقة اكتشاف الأحرف (CDM) للصيغ، ومسافة تحرير الشجرة (TEDS) للجداول. تعمل المكافأة على متوسط المكونات الموجودة في الحقيقة الأساسية لكل صفحة فقط، متجنبة الضوضاء من المقاييس غير ذات الصلة.
تطبيق RL مباشرة على نموذج 0.8 مليار معلمة تسبب في عدم استقرار جودة الجدول. لذلك استخدم الفريق نموذج 4 مليارات معلمة المعزز بـ RL كمعلم للتقطير على السياسة (OPD). يقوم الطالب بتوليد المخرجات، ويقيمها المعلم، ويتعلم الطالب عبر تباعد KL العكسي، منحازًا نحو الرموز الأكثر ثقة لدى المعلم. تقوم خدعة top-k بتقليل التوتر لكل موضع من حجم المفردات إلى k، مما يحافظ على الذاكرة قابلة للإدارة للاستجابات الطويلة.
أخيرًا، يتم دمج العديد من المتغيرات المرشحة من خلال متوسط المعلمات الموزونة.
نتائج المعايير في السياق
| المعيار | OvisOCR2 | أفضل خط أنابيب (SOTA سابق) | أفضل نموذج شامل (سابق) |
|---|---|---|---|
| OmniDocBench v1.6 (إجمالي) | 96.58 | 96.33 (PaddleOCR-VL-1.6) | 94.74 (HunyuanOCR-1.5) |
| PureDocBench (Avg3) | 75.06 | 70.39 (DotsMOCR، خط أنابيب) | 73.92 (FD-RL، شامل) |
| مسافة تحرير النص (OmniDocBench) | 0.025 | 0.033 (PaddleOCR-VL-1.6) | 0.039 (HunyuanOCR-1.5) |
| CDM للصيغ (OmniDocBench) | 97.53 | 97.49 (PaddleOCR-VL-1.6) | 95.79 (Unlimited-OCR) |
التحسينات متسقة عبر جميع أبعاد التقييم الأربعة، النصوص، الصيغ، الجداول، وترتيب القراءة، وليس فقط في المتوسط الإجمالي. على OmniDocBench، يسجل OvisOCR2 أقل مسافة تحرير للنص، وأعلى CDM للصيغ، وأعلى TEDS-S للجداول، وأقل مسافة تحرير لترتيب القراءة بين جميع النماذج المتخصصة.
ما يعنيه هذا للمجال
يتجه مجال تحليل المستندات نحو النماذج الموحدة منذ فترة. Mistral's OCR 4 أضاف مربعات إحاطة وتصنيف كتل مكتوبة ضمن حاوية واحدة. DeepSeek-OCR 2 قدم التدفق السببي البصري وأتاح أوزانه مفتوحة المصدر. كلاهما شامل في الروح لكنهما لا يزالان يعتمدان على بعض المكونات المعيارية.
يذهب OvisOCR2 أبعد من ذلك: نموذج واحد بحجم 0.8 مليار معلمة يُخرج Markdown مباشرة، دون محلل تخطيط ملحق. المفاضلة هي المتانة في العالم الحقيقي: على مسار Real في PureDocBench (صفحات ملتقطة بالهاتف، نسخ ضوئي، تصوير شاشة)، يسجل OvisOCR2 66.56، أقل من Gemini-3.1-Pro و Qwen3.5-122B-A10B. يعترف الفريق بأن جودة الصورة المتدهورة لا تزال نقطة ضعف.
مع ذلك، أداء النموذج على الكتابة اليدوية و الجداول المعقدة، وهما نقطتا ألم لطرق خطوط الأنابيب، قوي بشكل ملحوظ. على مجموعة فرعية من الكتابة اليدوية داخل الشركة، يحقق OvisOCR2 درجة إجمالية 72.28 مقابل 69.58 لـ GLM-OCR. على الجداول المعقدة، ينخفض معدل الفقدان (الجداول الغائبة تمامًا عن المخرجات) إلى 7.96٪، مقارنة بـ 13-17٪ لمحللات خطوط الأنابيب. بمجرد أن يفوت تحليل التخطيط لخط الأنابيب جدولًا، لا يمكن لأي متعرف نهائي إعادته.
النموذج متاح على HuggingFace. مع 0.8 مليار معلمة، يمكن تشغيله على وحدات معالجة رسومية استهلاكية أو حتى على وحدة المعالجة المركزية مع التحسينات، مما يجعل تحليل المستندات عالي الجودة في متناول ما هو أبعد من المؤسسات ذات الموارد الجيدة.
- المصدر : OvisOCR2 Technical Report (arXiv)
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.