عنق الزجاجة
معيار علي بابا الجديد يثبت ما لا تزال عوامل الذكاء الاصطناعي عاجزة عنه: اتباع القواعد
يكشف معيار HSCodeComp من علي بابا عن الفجوة: أفضل العوامل تحقق دقة 49.4% مقابل 95% للخبراء البشريين في تصنيف التعريفات الجمركية. عنق الزجاجة هيكلي، والمزيد من القدرة الحاسوبية لا يساعد.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-19 · قراءة 4 دقائق

في التجارة عبر الحدود، قد يعني رقم خاطئ واحد في رمز النظام المنسق المكون من 10 أرقام آلاف الدولارات من الرسوم الجمركية المدفوعة بشكل غير صحيح، أو تأخيرات جمركية، أو عقوبات قانونية. بالنسبة لعوامل الذكاء الاصطناعي المصممة للتعامل مع المستندات المعقدة، يكشف هذا الاختبار الواقعي جدًا لاتباع القواعد عن ضعف أعمق: لا يمكنها تطبيق القواعد الهرمية متعددة المستويات بشكل موثوق. عامل الذكاء الاصطناعي الخاص بك اجتاز الاختبار بالصدفة.…
يكشف معيار HSCodeComp من علي بابا، الذي تم الكشف عنه هذا الأسبوع، عن رقم صارم على الفجوة. أفضل عامل ذكاء اصطناعي، وهو إطار عمل قائم على Qwen صممته علي بابا نفسه، يسجل دقة 65.0% على 632 منتجًا واقعيًا عبر 32 فئة. أفضل عامل مغلق المصدر تم اختباره يحقق 49.4%. الخبراء البشريون: 95.0%. how-alibaba-cloud-pushed-its-way-into-20-gartner-quadrants-and-what-it-means-for-the-ai-cloud-race
الهوة البالغة 45 نقطة
الفجوة لا تتعلق بزيادة القدرة الحاسوبية على المشكلة. تُظهر تجارب الورقة البحثية أن توسيع نطاق وقت الاستدلال، وهو مسار يُروج له على نطاق واسع لتحسين الاستدلال، لا يحسن الأداء على HSCodeComp. يكتب الباحثون: "يتطلب الاستدلال على القواعد الهرمية نهجًا معماريًا جديدًا بدلاً من مجرد زيادة القدرة الحاسوبية." يشير ذلك إلى عنق زجاجة هيكلي يمتد إلى أبعد من التخليص الجمركي. أفق التحقق: لماذا أصبح التحقق من وكلاء البرمجة أصعب من…
يجبر المعيار العوامل على تفسير قواعد التعريفة الجمركية من مصادر مثل eWTP وقواعد بيانات القرارات الجمركية الرسمية. القواعد متعددة المستويات: تعريفة أساسية لفئة، استثناءات لفئات فرعية، تعديلات إضافية للمواد أو حالات الاستخدام، وتجاوزات شرطية للاتفاقيات التجارية. غالبًا ما تكون اللغة غامضة. المنطق ضمني. بالنسبة لعامل ذكاء اصطناعي، فإن تحليل هذا التسلسل الهرمي دون هلوسة شرط أو انهيار قاعدة فرعية هو الاختبار الأساسي. ويفشل. IFBench: المعيار الجديد لاختبار اتباع الذكاء الاصطناعي…
أين تخطئ العوامل
تحدد الورقة البحثية ثلاثة أنماط رئيسية للفشل. أولاً، الإفراط في الاستدلال: تقوم العوامل بتوليد سلاسل تصحيح ذاتي غير ضرورية تؤدي إلى طرق مسدودة. ثانيًا، هلوسات الاستدلال: يخترع النموذج شروطًا للقواعد غير موجودة في النص المصدر. ثالثًا، فجوات المعرفة المجالية: يفتقر العامل إلى الفهم الخلفي لاتفاقيات تصنيف التجارة التي يكتسبها الخبير البشري على مر السنين. the-1115-problem-when-ai-writing-challenges-become-a-test-of-editorial-integrity
وصف رئيس لجنة ACL، في مراجعة الأقران، المعيار بأنه "بيئة اختبار غنية في مجال متخصص للاستدلال الهيكلي، واتباع القواعد، والترسيخ المجالي، والتحليل التشخيصي لفشل العوامل." فازت الورقة البحثية بجائزة أفضل ورقة بحثية للموارد في الاجتماع السنوي الرابع والستين للجمعية الدولية للغويات الحاسوبية في سان دييغو، وهو شرف مخصص لمجموعات البيانات والمعايير التي تفتح آفاق بحثية جديدة.
ما وراء الجمارك
الآثار تمتد إلى أبعد من التجارة. يُعد تطبيق القواعد الهرمية أمرًا محوريًا للامتثال القانوني، والتشخيص الطبي، وتدقيق الضرائب، وهي مجالات يكون فيها تطبيق قاعدة واحدة بشكل خاطئ له عواقب حقيقية. معالجة مطالبات التأمين، والإيداعات التنظيمية، وأهلية استحقاقات الحكومة، كلها تتبع أشجار قرارات منظمة بشكل مشابه. العامل الذي لا يستطيع التعامل مع رمز جمركي مكون من 10 أرقام من غير المرجح أن يجتاز اختبار منطق تدقيق الضرائب. وكلاء الذكاء الاصطناعي لا يستطيعون إكمال ترحيل Java دون…
إطار عمل عامل Qwen الخاص بعلي بابا، المبني للتخليص الجمركي الرقمي، يتصدر المعيار بنسبة 65.0%. هذه قفزة كبيرة مقارنة بالعوامل مفتوحة المصدر القياسية، التي تتراوح حوالي 30-40%، لكنها لا تزال أقل بـ 30 نقطة عن الخبراء البشريين. الإطار مفتوح المصدر، متاح على Hugging Face و GitHub إلى جانب مجموعة بيانات HSCodeComp. how-local-llms-like-gemma-and-qwen-are-taming-open-source-repository-triage-at-scale
أرضية اختبار جديدة لهندسة العوامل
تشير جائزة ACL إلى أن المجتمع البحثي يعتبر HSCodeComp أداة تشخيصية صارمة. مع انتقال عوامل الذكاء الاصطناعي من واجهات الدردشة إلى سير العمل المؤسسي، ومعالجة الفواتير، وتوجيه تذاكر خدمة العملاء، وتدقيق مستندات الامتثال، تصبح القدرة على تطبيق القواعد الهرمية قدرة حاسمة.
نتيجة الورقة البحثية بأن المزيد من القدرة الحاسوبية لا يساعد هي قاسية بشكل خاص لطرق الاستدلال الحالية. سلسلة الأفكار، والاتساق الذاتي، والتقنيات المماثلة التي تعتمد على توسيع نطاق الجهد في وقت الاستدلال تفترض أن التفكير لفترة أطول يحقق نتائج أفضل. يُظهر HSCodeComp أنه لتطبيق القواعد الهرمية، غالبًا ما ينتج عن التفكير الأطول المزيد من الاستثناءات المهلوسة وسلاسل حجج أطول وأكثر هشاشة. أولمو-إيفال من Ai2 يمنح مطوري LLM ميكروسكوبًا لكل نقطة تفتيش
في الوقت الحالي، يحتفظ الخبراء البشريون بتاج دقتهم البالغ 95%. لكن المعيار يرسم هدفًا واضحًا: أي إطار عامل يمكنه سد تلك الفجوة البالغة 30 نقطة في اختبار الاستدلال الهيكلي سيكون قد أظهر قدرة جديدة حقيقية، ذات قيمة تجارية مباشرة في كل مجال تحكمه لوائح متعددة المستويات.
- المصدر : The 95% gap: a new benchmark shows deep search agents can't apply hierarchical rules — 2026-02-09
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.