معايير تقييم LLM

5 published articles

معايير واختبارات5 min read

الذكاء الاصطناعي في التعليم

المعلّمون بالذكاء الاصطناعي يفرطون في المساعدة بحكم تصميمهم. معيار جديد يقيس ذلك

معيار مبني على 462 جلسة تدريس حقيقية يجد أن المعلّمين بالذكاء الاصطناعي يقومون افتراضيًا بالعمل نيابة عن الطلاب. التنبيه الصريح يساعد، لكن النماذج ما تزال تواجه صعوبة في الحكم الأساسي: متى تدفع، ومتى توفّر سقالة، ومتى تتراجع.

2026-08-10

معايير واختبارات5 min read

وكلاء الصوت

لماذا يتفوق Grok 4.1 Fast على النماذج الأذكى في المكالمات الهاتفية

الترتيبات العامة تختار نماذج LLM الخاطئة للمكالمات الصوتية. ترتيب BenchLM لعام 2026 يضع زمن الاستجابة أولاً: Grok 4.1 Fast يجيب في 0.54 ثانية بينما يحتاج Claude Opus 4.6، الأعلى تسجيلاً، إلى 1.78 ثانية. النماذج السريعة تتولى المحادثة؛ بينما تبقى نماذج التفكير لاستدعاءات الأدوات الخلفية.

2026-08-05

معايير واختباراتFeatured5 min read

تقييم الذكاء الاصطناعي

المعايير القديمة للذكاء الاصطناعي تعطلت. إليك ما حل محلها.

المعايير الثابتة مثل MMLU وGSM8K مشبعة وملوثة. انتقلت الصناعة إلى إعادة التوليد الديناميكي والامتحانات الخبيرة وبيئات المهام الوكيلية للحصول على قياس حقيقي لقدرة الذكاء الاصطناعي.

2026-08-04

الذكاء الاصطناعيFeatured4 min read

سباق النماذج

لوحة متصدر LiveBench هي دراسة في تناقص العوائد

يحتل نموذج GPT-5.6 Sol صدارة LiveBench الإجمالية بمتوسط 82.4، لكن Claude Fable 5 يتخلف بنحو 1.6 نقطة فقط بتكلفة تبلغ ثلاثة أضعافه تقريبًا. القصة الحقيقية هي كيف تراجع المستوى الأدنى.

2026-07-22

الأدوات والأطر4 min read

أطر العمل والأدوات

لغة التصور الجديدة من مايكروسوفت تخفي النمط التكراري حتى تتوقف وكلاء الذكاء الاصطناعي عن إفساد الرسوم البيانية

قدمت أبحاث مايكروسوفت فلينت (Flint)، وهي لغة وسيطة للتصور البياني تساعد نماذج اللغات الكبيرة ووكلاء الذكاء الاصطناعي في إنشاء رسوم بيانية مصقولة دون الحاجة إلى ترميز المعاملات منخفضة المستوى مثل المقاييس وتنسيق المحاور. في دراسة أجريت على ثلاثة نماذج، تفوقت فلينت على التوليد المباشر لـ Vega-Lite، وهي تستخدم بالفعل داخليًا في Data Formulator.

2026-07-08