معايير تقييم LLM
5 published articles
الذكاء الاصطناعي في التعليم
المعلّمون بالذكاء الاصطناعي يفرطون في المساعدة بحكم تصميمهم. معيار جديد يقيس ذلك
معيار مبني على 462 جلسة تدريس حقيقية يجد أن المعلّمين بالذكاء الاصطناعي يقومون افتراضيًا بالعمل نيابة عن الطلاب. التنبيه الصريح يساعد، لكن النماذج ما تزال تواجه صعوبة في الحكم الأساسي: متى تدفع، ومتى توفّر سقالة، ومتى تتراجع.
2026-08-10
وكلاء الصوت
لماذا يتفوق Grok 4.1 Fast على النماذج الأذكى في المكالمات الهاتفية
الترتيبات العامة تختار نماذج LLM الخاطئة للمكالمات الصوتية. ترتيب BenchLM لعام 2026 يضع زمن الاستجابة أولاً: Grok 4.1 Fast يجيب في 0.54 ثانية بينما يحتاج Claude Opus 4.6، الأعلى تسجيلاً، إلى 1.78 ثانية. النماذج السريعة تتولى المحادثة؛ بينما تبقى نماذج التفكير لاستدعاءات الأدوات الخلفية.
2026-08-05
تقييم الذكاء الاصطناعي
المعايير القديمة للذكاء الاصطناعي تعطلت. إليك ما حل محلها.
المعايير الثابتة مثل MMLU وGSM8K مشبعة وملوثة. انتقلت الصناعة إلى إعادة التوليد الديناميكي والامتحانات الخبيرة وبيئات المهام الوكيلية للحصول على قياس حقيقي لقدرة الذكاء الاصطناعي.
2026-08-04
سباق النماذج
لوحة متصدر LiveBench هي دراسة في تناقص العوائد
يحتل نموذج GPT-5.6 Sol صدارة LiveBench الإجمالية بمتوسط 82.4، لكن Claude Fable 5 يتخلف بنحو 1.6 نقطة فقط بتكلفة تبلغ ثلاثة أضعافه تقريبًا. القصة الحقيقية هي كيف تراجع المستوى الأدنى.
2026-07-22
أطر العمل والأدوات
لغة التصور الجديدة من مايكروسوفت تخفي النمط التكراري حتى تتوقف وكلاء الذكاء الاصطناعي عن إفساد الرسوم البيانية
قدمت أبحاث مايكروسوفت فلينت (Flint)، وهي لغة وسيطة للتصور البياني تساعد نماذج اللغات الكبيرة ووكلاء الذكاء الاصطناعي في إنشاء رسوم بيانية مصقولة دون الحاجة إلى ترميز المعاملات منخفضة المستوى مثل المقاييس وتنسيق المحاور. في دراسة أجريت على ثلاثة نماذج، تفوقت فلينت على التوليد المباشر لـ Vega-Lite، وهي تستخدم بالفعل داخليًا في Data Formulator.
2026-07-08