أبحاث الذكاء الاصطناعي
لماذا لا يرى معلم الذكاء الاصطناعي الخاص بك كيفية بناء الرياضيات على نفسها؟
يكشف K12-Bench من جامعة بكين أن أفضل نماذج اللغة بالكاد تفهم كيفية ارتباط المفاهيم المدرسية. نتائج 57٪ و46٪ تظهر بقعة عمياء في قدرة الذكاء الاصطناعي على التعامل مع سلاسل المتطلبات الأساسية، تصنيفات المفاهيم، والتأصيل البصري، وهي مهارات يستخدمها المدرسون الحقيقيون يوميًا.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-02 · قراءة 2 دقائق

نموذج Gemini-3-Flash، أحد أكثر النماذج قدرة المتاحة حالياً، يسجل 57 بالمئة فقط في معيار جديد مصمم لاختبار ما إذا كانت أنظمة الذكاء الاصطناعي تفهم كيفية تنظيم معرفة المنهج الدراسي. نموذج Gemma-4-31B-IT يسجل 46 بالمئة. كلا الرقمين يأتيان من اختبار مكون من 23,640 سؤالاً يُسمى K12-Bench، بناه باحثون في جامعة بكين.
يجادل الباحثون بأن المعايير التعليمية الحالية تركز على الإجابة على أسئلة الامتحانات، وليس على ما إذا كان النموذج يفهم العلاقات بين المفاهيم على طول مسار تعلم الطالب: يسمون هذه القدرة "الإدراك المنهجي". النموذج الذي يمكنه حل معادلة تربيعية قد لا يكون لديه أي فكرة أن تحليل ثلاثيات الحدود هو شرط مسبق لتلك المهارة، أو أن المفهوم يظهر في كل من الجبر والفيزياء.
لإنشاء المعيار، بنى الفريق أولاً K12-KGraph، وهو رسم بياني معرفي مستخرج من كتب دراسية رسمية من مطبعة التعليم الشعبي (People's Education Press) تغطي الرياضيات والفيزياء والكيمياء والأحياء من المرحلة الابتدائية إلى الثانوية. يستخدم الرسم البياني تسعة أنواع من العقد وأربعة عشر نوعاً من العلاقات لالتقاط هيكل المنهج والتأصيل البصري: على سبيل المثال، أي المفاهيم تتطلب أي مفاهيم أخرى كمتطلبات أساسية، وكيف ترتبط التجارب بالنظرية، وأين تظهر الرسوم البيانية أو المعادلات في المواد الرسمية.
من ذلك الرسم البياني اشتقوا K12-Bench، الذي يحتوي على خمس عائلات مهام: Ground (التأصيل البصري للمفاهيم في صور الكتب المدرسية)، Prereq (تحديد المتطلبات الأساسية)، Neighbor (مطابقة محيط المفهوم)، Evidence (ربط الأدلة التجريبية بالادعاءات)، وLocate (تحديد موقع المفاهيم في الجدول الزمني للمنهج). أصعب المهام هي Prereq وNeighbor، وكلاهما يتطلب التفكير في كيفية ارتباط المفاهيم ببعضها البعض بدلاً من مجرد استرجاع الحقائق. هذا هو السبب على الأرجح في أن حتى النماذج القوية تواجه صعوبة معها.
التدريب على هيكل المنهج يسد جزءاً من الفجوة
الورقة ليست مجرد تشخيص. بنى الباحثون K12-Train، وهي مجموعة بيانات ضبط دقيق خاضعة للإشراف مكونة من 7,335 عينة تخلط بين أزواج أسئلة وأجوبة نصية فقط وأزواج أسئلة وأجوبة بصرية متعددة الوسائط. عندما دربوا النماذج على ميزانية متطابقة من 2,300 عينة، تفوقت مجموعة K12-Train-Text النصية باستمرار على مجموعات فرعية متساوية الحجم من ثماني مجموعات ضبط تعليمات رئيسية أخرى في معيارين نهائيين، GaokaoBench وEduEval.
بالنسبة لنماذج الرؤية واللغة، حققت مجموعة K12-Train متعددة الوسائط الكاملة أفضل النتائج الإجمالية في ثلاثة معايير تقييم: Gaokao-MM وMDK12-medium وK12Vista. وقد فعلت ذلك باستخدام عينات تدريب أقل من خطوط الأساس الكاملة مثل DataFlow وWizardLM. كما تفوقت النسخة متعددة الوسائط على كل من المتغيرات النصية فقط والبصرية فقط، مما يؤكد أن هيكل المفهوم النصي والرسوم البيانية البصرية يوفران إشارات متكاملة لفهم المنهج.
ماذا تعني الفجوة للفصول الدراسية
الفرق بين أداء الامتحان والإدراك المنهجي له عواقب مباشرة. نظام تدريس بالذكاء الاصطناعي لا يستطيع إخبار الطالب أنه بحاجة إلى فهم الكسور قبل معالجة المعادلات الخطية ليس تدريساً حقيقياً: إنه إجابة على الأسئلة. إطار K12-KGraph يمنح المطورين طريقة لقياس وتدريب تلك القدرة المفقودة.
الخط بأكمله مفتوح: الرسم البياني، المعيار، بيانات التدريب، وكود البناء كلها منشورة. هذا مهم لأن المعيار بني من منهج وطني محدد (مطبعة التعليم الشعبي الصينية)، لكن المنهجية تنتقل إلى أي منهج. ما إذا كانت فجوات مماثلة موجودة في كتب دراسية لدول أخرى يعتمد على شخص ما يبني نفس النوع من الرسم البياني لهم.
أرقام الورقة تشير إلى أن الفجوة حقيقية وقابلة للقياس. السؤال الأكبر هو ما إذا كان سدها سينتج نتائج تعليمية أفضل أم مجرد نماذج تبدو أكثر تربوية دون فهم أعمق مما تفعله بالفعل.
- المصدر : Why your AI tutor can't see how math builds on itself — 2026-07-23
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.