نماذج اللغات الكبيرة

نماذج لغوية كبيرة: GPT، Claude، Gemini، Mistral والنماذج مفتوحة المصادر

93 published articles

3 min read

أبحاث الذكاء الاصطناعي

بينيلوب تخفي استدلالها في طبقة مفكك ترميز واحدة لخفض تكاليف الاستدلال

بينيلوب، إطار عمل للاستدلال الكامن لمحولات مفكك الترميز فقط، يحدد الحساب المتكرر في فاصل زمني ضيق لمفكك الترميز، مما يقلل زمن استجابة الاستدلال دون تأثير كبير على الدقة. تصف الورقة منهجًا دراسيًا ينقل الاستدلال من الرموز المرئية إلى حلقة GRU داخلية.

2026-08-04

3 min read

بحث في الذكاء الاصطناعي

لماذا يُعد الاحتمال اللوغاريتمي للرموز إشارة خاطئة لمراقبة نماذج التفكير في الذكاء الاصطناعي

تظهر Novelis Research أن الاحتمال اللوغاريتمي للرموز يفشل كمراقب لفك الترميز لنماذج التفكير المكممة، كونه أعمى عن الحلقات الواثقة. يقدمون وحدة تحكم e-CUSUM معايرة تجمع بين إشارات عدم اليقين والتكرار، محققة انتقائية على GSM8K مع DeepSeek-R1-Distill-Qwen-1.5B.

2026-08-03

3 min read

أبحاث الذكاء الاصطناعي

نموذج LLM يتفوق على كل الصيغ الثابتة لتخصيص المستودعات في JD.com

نموذج لغة كبير تم تدريبه عبر التعلم المعزز الموجه بالمحلل يختار أفضل صيغة MIP لكل حالة تخصيص مخزون في JD.com. قفزت نسبة Hit Ratio@1 من 21% إلى 50%، وتجاوزت دقة التخصيص المحققة كل صيغة ثابتة بمقدار 12.57 نقطة مئوية.

2026-08-03

2 min read

أبحاث الذكاء الاصطناعي

لماذا لا يرى معلم الذكاء الاصطناعي الخاص بك كيفية بناء الرياضيات على نفسها؟

يكشف K12-Bench من جامعة بكين أن أفضل نماذج اللغة بالكاد تفهم كيفية ارتباط المفاهيم المدرسية. نتائج 57٪ و46٪ تظهر بقعة عمياء في قدرة الذكاء الاصطناعي على التعامل مع سلاسل المتطلبات الأساسية، تصنيفات المفاهيم، والتأصيل البصري، وهي مهارات يستخدمها المدرسون الحقيقيون يوميًا.

2026-08-02

3 min read

الذكاء الاصطناعي

توليد أفكار البحث يصبح أفضل بـ 3.89 مرة باستخدام IDEAgent

يستخدم IDEAgent الأنساب والتغذية الراجعة متعددة الأهداف والذاكرة المتسلسلة لموازنة الجودة والتنوع في أفكار البحث المولدة بواسطة نماذج اللغة الكبيرة. تم اختباره عبر 32 موضوعًا في 8 مجالات من علوم الكمبيوتر، ويحقق 3.89 أضعاف العائد (أفكار متنوعة فوق عتبة الجودة) مقارنة بالطرق السابقة.

2026-08-02

3 min read

الاستدلال ثلاثي الأبعاد

SceneActBench: لماذا تفشل حتى أفضل نماذج VLM في الحركة ثلاثية الأبعاد

يختبر SceneActBench أحد عشر تكوينًا لـ VLM على خمس مهام ثلاثية الأبعاد في حلقة وكيل موحدة. تتراوح النتائج الإجمالية من 38.6 إلى 50.2، دون أداء ثابت لأي نموذج. يكشف المعيار عن بقعة عمياء في وكلاء الرؤية واللغة: التصرف في المشاهد الكاملة، وليس مجرد وصفها.

2026-07-31

4 min read

تقطير نماذج اللغات الكبيرة

تقطير نماذج اللغات الكبيرة يتعثر عندما يبقى السياق ثابتًا. هذه الورقة تجعله يتطور

يمكن للسياقات حمل تفضيلات المهمة إلى تدريب نماذج اللغات الكبيرة، لكنها بعد تقطيرها في الطالب لا تضيف إشرافًا يذكر. تُبقي Flux-OPD من جامعة بكين السياق متحركًا مع الطالب وتستخدم حد تعارض لترجيح تصحيحات المعلّم. يذكر الملخص تحقيق مكاسب على نماذج التقطير ضمن السياسة الحالية دون ذكر أرقام.

2026-07-31

4 min read

بحوث الذكاء الاصطناعي

رغوة في سلسلة الأفكار: معيار جديد يكشف كيف تهدر LLMs الرموز في استدلال صحيح لكنه عديم الفائدة

غالبًا ما تولد LLMs سلاسل استدلال صحيحة ولكنها محشوة بخطوات غير ضرورية. يظهر معيار تشخيصي جديد وطريقة ضغط أن المقيمين الحاليين يغفلون تمامًا عن هذا عدم الكفاءة وأن نصف خطوات الاستدلال التي كتبها البشر قد تكون قابلة للضغط.

2026-07-31

4 min read

ملخص بحثي

عنق الزجاجة الهيكلي في الاستدلال يتفوق على سحر المطالبات في مهام الاستقراء لنماذج اللغة الكبيرة

منهجية جديدة تُسمى الاستدلال الساعي تُطبق عزلًا صارمًا للسياق بين مراحل الاستقراء والاستنباط والتنفيذ، مع تمرير قاعدة رمزية مضغوطة فقط بينها. على ARC-AGI-2، ترفع دقة أفضل 5 محاولات بما يصل إلى 14 نقطة عن التحسين التكراري؛ على توليف Verilog لـ ChipBench، تضاعف الدقة تقريبًا مع GPT-5.5. تؤكد عمليات الإزالة أن الهيكلية نفسها هي التي تدفع التحسين.

2026-07-31

3 min read

أبحاث الذكاء الاصطناعي

جهاز تحكم صغير للمراقبة رفع درجات نماذج اللغة الكمية المضغوطة بمقدار 4.5 نقاط على اختبار MATH-500

يقترح بحث جديد جهاز تحكم خارجي للمراقبة للنماذج اللغوية الصغيرة المضغوطة، يكتشف مسارات الاستدلال المتكررة أو المتدهورة ويطلق عملية إعادة إلى الوراء وإعادة فك تشفير مقيدة. تحسنت الدقة بمقدار 4.5 نقطة مئوية على مجموعة تقييم واسعة، لكن المؤلفين يؤكدون أن النتائج ليست تأكيدية.

2026-07-30

5 min read

الذكاء الاصطناعي في الألعاب

المشكلات الثلاث التي لم يحلها أي محرك ألعاب ذكاء اصطناعي حتى الآن: الاتساق، قابلية التنقل، والتقييم

MAGIC هو خط أنابيب من أربع مراحل يحول موجهًا واحدًا إلى مشروع Unity قابل للعب مع مشاهد متعددة متصلة. يفرض قابلية الوصول للبوابات باستخدام مدقق ملء الفيضان، ويقدم وكيل تقييم يمشي فعليًا عبر كل انتقال، مكملاً عقودًا من المقاييس التي نظرت فقط إلى الديكورات الداخلية الفردية.

2026-07-30

4 min read

أبحاث الذكاء الاصطناعي

وكلاء الذكاء الاصطناعي أبقوا الذاكرة خارج النموذج. ميتيس يضعها في الداخل

ميتيس من MemTensor هو أول نموذج أولي لنماذج الذاكرة الأساسية: تاريخ مضغوط في العمود الفقري، يُقرأ عبر انتباه الذاكرة، ويُحدَّث في تمرير أمامي واحد. إنه يتحدى عصر مخازن المتجهات في ذاكرة الوكلاء. القيود معترف بها لكنها لم تُحدَّد كميًا بعد.

2026-07-30

← PreviousPage 2 / 8 · 93 articlesNext →