معيار

الفجوة بين نماذج اللغات الكبيرة والمنهج العلمي: معيار جديد يكتشف أن النماذج يمكنها وصف البيانات ولكنها لا تستطيع التفكير من خلالها

SDABench، وهو معيار جديد يركز على القدرات ويغطي ست مهارات أساسية في التفكير العلمي وخمسة مجالات، يختبر 15 نموذج لغوي كبير ويجد أن النماذج قوية في التحليل الوصفي ولكنها تنهار في المهام الاستدلالية والسببية. توفر الورقة إطارًا لتحليل الأخطاء من خمس مراحل لتحديد أماكن الفشل.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-25 · قراءة 4 دقائق

الفجوة بين نماذج اللغات الكبيرة والمنهج العلمي: معيار جديد يكتشف أن النماذج يمكنها وصف البيانات ولكنها لا تستطيع التفكير من خلالها
المصادر : arXiv:2607.1107…

تم الاحتفاء بنماذج اللغات الكبيرة لقدرتها على كتابة الكود وتلخيص الأدبيات وحتى إنشاء سير عمل علمي يبدو معقولاً. لكن ورقة جديدة، نُشرت على arXiv في 13 يوليو 2026، تجادل بأن معيار الاكتشاف العلمي أعلى بكثير، وأن المعايير الحالية كانت تقيس الشيء الخطأ.

SDABench، الذي قدمه باحثون بقيادة تشوهان شي وشياوكوان رين، يعيد تنظيم التقييم حول ست قدرات متميزة: الوصفية، والاستكشافية، والاستدلالية، والتنبؤية، والسببية، والآلية. بدلاً من مكافأة النماذج على تجميع سير عمل ينتهي برقم صحيح، يختبر المعيار ما إذا كانت النماذج تفهم أي طريقة تحليلية تناسب السؤال، وما إذا كان بإمكانها نمذجة المتغيرات غير الملحوظة، وما إذا كان بإمكانها التفكير في السببية وليس فقط الارتباط.

يحتوي المعيار على 527 مثالًا لبيانات حقيقية (SDA-Real) و6000 مثال اصطناعي (SDA-Synth)، كل منها بصيغتي الاختيار من متعدد والأسئلة المفتوحة، تم بناؤها من خلال خط أنابيب آلي. تمتد المجالات عبر الأحياء والكيمياء والبيئة والجغرافيا والفيزياء.

إتقان وصفي، انهيار استدلالي

عندما قام الباحثون بتقييم 15 نموذج لغوي كبير ممثلين، كان النمط واضحًا. تعاملت النماذج مع التحليل الوصفي، مهام مثل تلخيص المتوسطات والتباينات والتوزيعات، بأداء صلب. ولكن بمجرد أن تتطلب المهمة اختيار الافتراضات، أو نمذجة العمليات الكامنة، أو التفكير الآلي، تدهور الأداء بشكل حاد.

"تتعامل النماذج مع التحليل الوصفي بشكل جيد ولكنها تتدهور بشكل حاد في المهام التي تتطلب اختيار الافتراضات، أو نمذجة العمليات الكامنة، أو التفكير الآلي،" يكتب المؤلفون. يشير هذا إلى أن نماذج اللغات الكبيرة حاليًا أكثر ملاءمة لكونها مساعدين للبيانات بدلاً من كونها علماء مستقلين.

إطار تحليل الأخطاء من خمس مراحل

قد تكون إحدى أكثر المساهمات فائدة في SDABench هي إطار تحليل الأخطاء من خمس مراحل، الذي يحدد بالضبط أين تفشل نماذج اللغات الكبيرة. المراحل هي: تحديد النطاق، تحديد المتغيرات، اختيار الإجراء، نمذجة العلاقات، واستخلاص الاستنتاجات.

النتائج دقيقة. النماذج الأكثر تقدمًا، مثل أحدث المتغيرات من OpenAI وGoogle DeepMind وAnthropic، تحدد بشكل موثوق النطاق والمتغيرات ذات الصلة بسؤال علمي. لكنها لا تزال تواجه صعوبة في اختيار الإجراءات التحليلية المناسبة، ونمذجة العلاقات بين المتغيرات، واستخلاص استنتاجات صحيحة تتوافق مع افتراضات الطريقة المختارة.

هذه ليست قصة توسع بسيطة: إضافة المزيد من المعلمات إلى المشكلة لا يعالج الفجوة الأساسية بين مطابقة الأنماط والتفكير العلمي.

ما يكشفه المعيار عن الذكاء الاصطناعي في العلوم

للبحث آثار فورية على المجال المتنامي لـ"علماء الذكاء الاصطناعي"، الأنظمة الآلية التي تدعي إجراء مراجعة الأدبيات من البداية إلى النهاية، وتوليد الفرضيات، والتجريب، وكتابة الأوراق. يشير عمل شي ورين إلى أن هذه الأنظمة قد تنتج مخرجات تبدو مقنعة بينما ترتكب أخطاء منطقية أساسية يمكن للمراجع البشري اكتشافها.

يكشف SDABench أيضًا عن مشكلة أعمق: الخلط بين "القدرة على توليد مخرج" و"فهم الطريقة المناسبة." النموذج الذي يمكنه كتابة كود بايثون لتشغيل اختبار t لا يفهم بالضرورة أن اختبار t يفترض طبيعية البيانات واستقلاليتها، ولا يمكنه الاختيار بين اختبار t واختبار مان-ويتني U بناءً على خصائص البيانات.

ما وراء الارتباط إلى السببية

تركيز الورقة على التفكير السببي والآلي هو في الوقت المناسب بشكل خاص. شهد العام الماضي زيادة في الاهتمام بالاستدلال السببي داخل مجتمع الذكاء الاصطناعي، لكن معظم المعايير لا تختبر بشكل صريح قدرة النموذج على التمييز بين الارتباط والسببية. SDABench يفعل ذلك، وتشير النتائج إلى أن هذا لا يزال قدرة حدودية لم تتمكن حتى النماذج الحدودية من التغلب عليها.

التفكير الآلي، فهم العمليات الأساسية التي تولد البيانات، هو أكثر صعوبة. لم يؤد أي من النماذج التي تم تقييمها أداءً جيدًا على هذا المحور.

آثار على مستقبل الذكاء الاصطناعي في العلوم

لا يجادل SDABench بأن نماذج اللغات الكبيرة عديمة الفائدة للعلم. على العكس من ذلك، فهو يوفر أداة تشخيصية دقيقة يمكن أن توجه التطوير. يمكن للباحث الذي يصمم نموذج لغوي كبير علمي أفضل الآن استهداف أنواع أخطاء محددة، مثل اختيار الإجراء أو نمذجة العلاقات، وتتبع التحسينات.

تثير الورقة أيضًا سؤالًا حاسمًا لمجتمع سلامة الذكاء الاصطناعي والتوافق: إذا كان العامل لا يمكنه بشكل موثوق اختيار الاختبار الإحصائي الصحيح أو التفكير في السبب والنتيجة، فهل يجب السماح له بتصميم التجارب بشكل مستقل أو استخلاص استنتاجات من البيانات؟ يوفر المعيار بيئة اختبار ملموسة للإجابة على هذا السؤال.

مع نضوج مجال الاكتشاف العلمي بقيادة الذكاء الاصطناعي، يقدم SDABench مقياسًا صارمًا ومتعدد الأبعاد للتقدم، وتذكيرًا واقعيًا بأن وصف مجموعة بيانات ليس هو نفسه فهمها.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.