معيار LLM

4 published articles

معايير واختبارات4 min read

معيار الاستدلال المالي

نماذج اللغة الكبيرة تعرف الصيغ المحاسبية. FinIndices يُظهر أنها لا تستطيع تطبيقها

يمكن لنماذج اللغة الكبيرة أن تردد الصيغ المحاسبية، لكن FinIndices، وهو معيار مبني على بيانات مالية صينية حقيقية، يُظهر أنها تكافح لتطبيقها. انخفضت دقة Gemini-3.1-Pro من 70.70% إلى 38.22% عند إزالة تلميحات الصيغ، وكان توليد الجداول يضعف استدلال النماذج بشكل مباشر.

2026-08-20

نماذج اللغات الكبيرة2 min read

أبحاث الذكاء الاصطناعي

لماذا لا يرى معلم الذكاء الاصطناعي الخاص بك كيفية بناء الرياضيات على نفسها؟

يكشف K12-Bench من جامعة بكين أن أفضل نماذج اللغة بالكاد تفهم كيفية ارتباط المفاهيم المدرسية. نتائج 57٪ و46٪ تظهر بقعة عمياء في قدرة الذكاء الاصطناعي على التعامل مع سلاسل المتطلبات الأساسية، تصنيفات المفاهيم، والتأصيل البصري، وهي مهارات يستخدمها المدرسون الحقيقيون يوميًا.

2026-08-02

معايير واختبارات4 min read

معيار

الفجوة بين نماذج اللغات الكبيرة والمنهج العلمي: معيار جديد يكتشف أن النماذج يمكنها وصف البيانات ولكنها لا تستطيع التفكير من خلالها

SDABench، وهو معيار جديد يركز على القدرات ويغطي ست مهارات أساسية في التفكير العلمي وخمسة مجالات، يختبر 15 نموذج لغوي كبير ويجد أن النماذج قوية في التحليل الوصفي ولكنها تنهار في المهام الاستدلالية والسببية. توفر الورقة إطارًا لتحليل الأخطاء من خمس مراحل لتحديد أماكن الفشل.

2026-07-25

نماذج اللغات الكبيرة4 min read

أداء نماذج اللغات الكبيرة

شركة ناشئة صينية لتوليد الفيديو تفاجئ بهدوء بتفوقها على Claude Opus في البرمجة

يسجل نموذج M2.7 من MiniMax 56.22% على SWE-Pro، مقاربًا لأداء Claude Opus، بينما يتفاخر بالالتزام بالمهارات بنسبة 97% في المهام المعقدة وتحرير إنتاجية مكتبية متفوقة. يشير النموذج إلى تحول من مطاردة المعايير إلى نشر وكيل في العالم الحقيقي.

2026-07-14