تحليل
نموذج 0.8 مليار معلمة الذي تحدى كل شيء في تحليل المستندات
OvisOCR2، محلل مستندات من Tencent بـ 0.8 مليار معلمة، حقق 96.58 على OmniDocBench، وهو أول نموذج من طرف إلى طرف يتصدر لوحة المتصدرين. يستخدم النموذج التعلم المعزز والتقطير ليتفوق على الأنظمة الأكبر القائمة على البنى الخطية، متحدياً الافتراضات حول ضرورة البنى متعددة المراحل.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-26 · قراءة 3 دقائق

لطالما هيمنت الأنظمة الخطية (pipeline) على تحليل المستندات. هذه السلاسل من الوحدات المتخصصة، كاشف النص، المعرّف، محلل التخطيط، محلل الصيغ، كل منها يضيف تعقيدًا وخطر انتشار الأخطاء إلى المراحل التالية. كانت الحكمة التقليدية تقول إنه لا يمكن لنموذج واحد من طرف إلى طرف أن يضاهي دقتها، خاصة على الصفحات الواقعية الفوضوية.
OvisOCR2 من Tencent يدعو هذه الحكمة إلى التساؤل. مع 0.8 مليار معلمة فقط، سجل النموذج 96.58 على لوحة متصدرين OmniDocBench الإصدار 1.6، وهو أفضل علامة إجمالية لأي طريقة، خطية أو من طرف إلى طرف. التقرير الفني المنشور في 15 يوليو على arXiv يشرح بالتفصيل كيف وصل الفريق إلى ذلك.

وصفة التدريب هي القصة الحقيقية. بنى الفريق محرك بيانات يخلط بين شروحات المستندات الحقيقية المفلترة وصفحات اصطناعية حيث تأتي الصورة وهدف Markdown من نفس مصدر HTML، مما يضمن محاذاة مثالية. بعد الضبط الدقيق الخاضع للإشراف، درّبوا فرعًا بـ 4 مليارات معلمة باستخدام التعلم المعزز مع مكافأة متعددة المكونات تسجل الدقة والهيكل والتنسيق. ثم قاموا بتقطير هذه المعرفة إلى النموذج بـ 0.8 مليار معلمة من خلال التقطير على السياسة (on-policy distillation) ودمج الأوزان من نقاط تفتيش متعددة. النتيجة: نموذج من طرف إلى طرف يتفوق على طرق تستخدم غالبًا خمسة أضعاف عدد المعلمات ووحدات منفصلة.
هذا الأمر مهم يتجاوز معيارًا واحدًا. على PureDocBench، سجل OvisOCR2 75.06، وهو أعلى متوسط Avg3 بين الطرق المقارنة. أظهر معيار داخلي يغطي تخطيطات أكثر تنوعًا وتحديًا أن النموذج يحافظ على تقدمه، مما يشير إلى أن النهج يعمم إلى ما بعد مجموعات الاختبار المنسقة.
يتجه المجال نحو التصاميم من طرف إلى طرف. DeepSeek-OCR 2 وMistral OCR 4 يقدمان تحليل مستندات مفتوح المصدر، لكن لم يطالب أي منهما بالمركز الأول على OmniDocBench بنموذج من طرف إلى طرف بهذا الحجم. يستخدم DeepSeek-OCR 2 الدقة الديناميكية والرموز المرئية، بينما يضيف Mistral OCR 4 مربعات إحاطة ودرجات ثقة لكل كلمة، كلاهما يحيد نحو بنية مشابهة للخط الأنابيب. OvisOCR2 هو نقي من طرف إلى طرف: صورة صفحة داخلة، Markdown خارجة، لا مربعات وسيطة أو مراحل.
الآثار العملية واضحة. بالنسبة للمطورين الذين يبنون سير عمل المستندات، نموذج واحد بـ 0.8 مليار معلمة يتعامل مع النص والجداول والصيغ والتخطيط في تمريرة واحدة يبسط البنية التحتية ويقلل زمن الاستجابة. كما يخفض الحاجز أمام التشغيل على الأجهزة الطرفية أو في البيئات منخفضة الموارد.
هناك أسئلة مفتوحة. لا تحدد الورقة تكلفة الحوسبة للتدريب، أو سرعة الاستدلال، أو التركيب الدقيق للبيانات الاصطناعية. النموذج متاح على GitHub، لكن رابط المستودع غير موسع بالكامل في النسخة الأولية. الاستنساخ المستقل ومعايير زمن الاستجابة سيخبران ما إذا كانت درجة 96.58 تترجم إلى إنتاجية في العالم الحقيقي.
بغض النظر، نتيجة OvisOCR2 هي علامة فارقة. إنها تثبت أنه مع جودة بيانات كافية وخط أنابيب تدريب ذكي، يمكن للنماذج الصغيرة من طرف إلى طرف أن تنافس وتفوز ضد الأنظمة المعيارية التي حصلت على بداية تحسين لسنوات. ينتقل العبء الآن إلى معسكر الخط الأنابيب لتبرير تعقيدهم.
- المصدر : OvisOCR2 Technical Report
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.