معيار الاستدلال المالي
نماذج اللغة الكبيرة تعرف الصيغ المحاسبية. FinIndices يُظهر أنها لا تستطيع تطبيقها
يمكن لنماذج اللغة الكبيرة أن تردد الصيغ المحاسبية، لكن FinIndices، وهو معيار مبني على بيانات مالية صينية حقيقية، يُظهر أنها تكافح لتطبيقها. انخفضت دقة Gemini-3.1-Pro من 70.70% إلى 38.22% عند إزالة تلميحات الصيغ، وكان توليد الجداول يضعف استدلال النماذج بشكل مباشر.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-20 · قراءة 4 دقائق

أزل ورقة الصيغ وسيتعثر النموذج. هذه هي القراءة الأكثر مباشرة لـ FinIndices، وهو معيار جديد مبني على البيانات المالية الفعلية للشركات الصينية المدرجة، مع تقارير غير مقتطعة يصل طولها إلى 32,000 رمز. مع وجود صيغ صريحة، تتعامل نماذج اللغة الكبيرة القوية مع مهام المؤشر الواحد بشكل معقول. أزل التلميحات وستنهار الدرجات. انخفضت دقة Gemini-3.1-Pro من 70.70% إلى 38.22% في مهام الجداول، وهو تحول يعزوه مؤلفو الورقة إلى «مطابقة الأنماط بشكل هش» وليس إلى فهم حقيقي للبنية المحاسبية.
صُمم FinIndices، المتاح على Hugging Face، لاختبار ما تتجنبه المعايير المالية القائمة: هل يمكن للنماذج معالجة البيانات المالية الحقيقية من البداية إلى النهاية بدلاً من الإجابة عن أسئلة الاختيار من متعدد على جداول مقتطعة؟ يأتي بنوعين من المهام. يطلب Single-Index مؤشرًا ماليًا واحدًا محسوبًا من بيانات مالية طويلة مليئة بالمشتتات. ويطلب Table-Index مؤشرات متعددة عبر فترات متعددة، تُقدَّم بصيغة HTML منظمة أو JSON أو جدول. المهمة الثانية موجودة لأن سير العمل المالي الحقيقي ينتهي بجداول مقارنة، وليس بأرقام مفردة.
اختناق المعرفة: حفظ بلا فهم
النتيجة الأولى في الورقة، وهي اختناق المعرفة، تتمثل في أن نماذج اللغة الكبيرة اختزنت الصيغ المحاسبية أثناء التدريب المسبق دون أن تستوعب متى تستخدمها. المؤشر الدال هو مواضع ظهور الفشل: التمييز بين الخصوم التي تحمل فوائد وتلك التي لا تحمل فوائد عند حساب رأس المال المستثمر، وفصل حقوق الملكية العائدة للشركة الأم عن إجمالي حقوق المساهمين عندما تكون حقوق الأقلية ذات أهمية، ومطابقة متغيرات التدفق في قائمة الدخل مع متغيرات الأرصدة في الميزانية العمومية. وتضيف المعايير المحاسبية الصينية (CAS) فخاخها الخاصة، مع بنود مثل خسائر انخفاض القيمة الائتمانية والمكاسب أو الخسائر غير التشغيلية التي يجب على النماذج ربطها بالمؤشرات الصحيحة.
صيغ FinIndices منتقاة من مصادر موثوقة، بما في ذلك المعايير المحاسبية الصينية (CAS)، وكتب تحليل البيانات المالية، ومراجع تمويل الشركات. وقد راجع خبراء المجال مجموعة الاختبار يدويًا للتحقق من صحتها المحاسبية ودقتها الرقمية. عند إزالة التلميحات، يحدث خطأ في فك التراكم الزمني وتظهر تباينات بين متغيرات الأرصدة والتدفقات. الانخفاض بمقدار 32 نقطة في مهام الجداول هو العلامة الظاهرة؛ وتقرأه الورقة كدليل على أن الكفاءة المالية المقاسة بالمعايير غالبًا ما تكون مجرد مطابقة أنماط سطحية.
الاختناق البنيوي: الجداول تستنزف الاستدلال
النتيجة الثانية أكثر إثارة للدهشة. النماذج التي تنفذ الاشتقاقات المعزولة بدقة تامة تتراجع إلى استدلالات سطحية عندما يُطلب منها ملء جداول متعددة المؤشرات والفترات. وتسمي الورقة هذا الاختناق البنيوي: بنية المخرجات عبء حقيقي على القدرة الاستدلالية، وليست مسألة تنسيق ثانوية.
تحت هذا الضغط، تجلب النماذج أعمدة مجاورة غير صحيحة، وتستبدل العمليات الحسابية الحرفية الكسولة بتعديلات محاسبية أعمق، وتخلط بين فترات التقارير، وتسيء استخدام الأرصدة الافتتاحية. كلما كان المخرج أكثر كثافة، كان التفكير أسوأ. بالنسبة للفرق التي تبني أدوات تحوّل البيانات المالية إلى جداول جاهزة للتدقيق، هذه هي النتيجة الأكثر أهمية.
الهلوسة هي نمط الفشل الافتراضي
يتضمن FinIndices أيضًا حالات خصومية تكون فيها التقارير المطلوبة مفقودة تمامًا. الإجابة الصحيحة هي «معلومات غير كافية»، وليس رقمًا. نمط الفشل الذي صُمم المعيار لرصده هو الرقم الواثق الذي تُهلوسه النماذج على أي حال. بالنسبة للوكيل المالي، فإن معرفة متى يقول «لا أستطيع الجزم» هي المهمة كلها.
النمط نفسه يظهر خارج المجال المالي
المجال المالي بيئة اختبار قاسية، لكنه ليس المجال الوحيد الذي يظهر فيه هذا الانقسام. وجد SDABench، وهو معيار موجّه نحو القدرات يغطي ست مهارات في الاستدلال العلمي، أن النماذج قوية في التحليل الوصفي لكنها تنهار في المهام الاستدلالية والسببية. حتى سلامة اختبارات الاستدلال الأقدم أصبحت موضع تدقيق: فقد كشفت عمليات تدقيق GSM8K، مجموعة مسائل الرياضيات للمرحلة الابتدائية، أن معدلات الخطأ في أسئلتها تصل إلى 42%.
النتائج المرتفعة في الأسئلة الخاضعة للتحكم تبالغ في تقدير ما يمكن للنماذج فعله في العالم الحقيقي. وصُمم FinIndices ليكون قاسيًا مع هذه المبالغة.
يمكن للضبط الدقيق استعادة بعض البنية
تقدّم الورقة بعض الأخبار الجيدة لبناة النماذج. أنتج الضبط الدقيق الخاضع للإشراف مكاسب كبيرة في سيناريو غياب التلميحات: +8.54% في Single-Index و+3.82% في Table-Index، وفقًا للورقة. ويمكن استعادة المنطق البنيوي جزئيًا من خلال المواءمة القائمة على البيانات، حتى لو ظل السؤال الذي تفتتح به الورقة مفتوحًا: هل تمتلك نماذج اللغة الكبيرة استدلالًا بنيويًا حقيقيًا أم مجرد مطابقة أنماط سطحية؟
| النتيجة | القيمة |
|---|---|
| Gemini-3.1-Pro، مهام الجداول مع تلميحات الصيغ | 70.70% |
| Gemini-3.1-Pro، مهام الجداول دون تلميحات | 38.22% |
| مكسب الضبط الدقيق الخاضع للإشراف دون تلميحات، Single-Index | +8.54% |
| مكسب الضبط الدقيق الخاضع للإشراف دون تلميحات، Table-Index | +3.82% |
النموذج الذي لا يعمل إلا مع ورقة الصيغ أمامه لم يتعلم المحاسبة؛ لقد تعلم التعرف عليها. بالنسبة للفرق التي تُطلق وكلاء ماليين، هذا التمييز ليس أكاديميًا.
- المصدر : LLMs know accounting formulas. FinIndices shows they can't apply them — 2026-08-05
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.