التعرف البصري على الحروف
4 published articles
تحليل
نموذج 0.8 مليار معلمة الذي تحدى كل شيء في تحليل المستندات
OvisOCR2، محلل مستندات من Tencent بـ 0.8 مليار معلمة، حقق 96.58 على OmniDocBench، وهو أول نموذج من طرف إلى طرف يتصدر لوحة المتصدرين. يستخدم النموذج التعلم المعزز والتقطير ليتفوق على الأنظمة الأكبر القائمة على البنى الخطية، متحدياً الافتراضات حول ضرورة البنى متعددة المراحل.
2026-07-26
الذكاء الاصطناعي للمستندات
نظام Mistral OCR 4 يحقق نتائج كبيرة، لكن مراجعته الخاصة تظهر لماذا لا تعكس أرقام المعايير القصة الحقيقية
يقدم Mistral OCR 4 مربعات محيطة وتصنيف كتل ودرجات ثقة إلى جانب استخراج النصوص، ويدعم 170 لغة. يحقق معدلات فوز بنسبة 72% في تفضيلات البشر وأعلى درجات المعايير، لكن تحليل Mistral الخاص يظهر أن المعايير القياسية تعاقب الناتج الصحيح بسبب القطع الأثرية في التنسيق وليس أخطاء الدقة.
2026-07-16
التخصص في المجال
لماذا لا يزال نموذج OCR يبلغ من العمر ستة أشهر يتفوق على المنافسين الأحدث في اللغة البرتغالية البرازيلية
يسجل DharmaOCR درجة 0.925 على معيار برتغالي مقارنة بـ 0.798 لـ Mistral OCR4 و 0.7587 لـ Unlimited-OCR. تعود الفجوة إلى تخصيص التدريب المركز ونهج قائم على DPO يمنع تدهور النص في المستندات المعقدة.
2026-07-16
الذكاء الاصطناعي
DeepSeek-OCR 2 يجلب التدفق البصري السببي إلى فهم المستندات مفتوح المصدر
يقدم DeepSeek-OCR 2 التدفق البصري السببي للتشفير البصري الشبيه بالإنسان. متاح الآن كمصدر مفتوح على GitHub، ويدعم النموذج vLLM و Transformers، والدقة الديناميكية (حتى 1,216 رمزًا بصريًا)، وتحويل المستندات إلى Markdown.
2026-07-09