نماذج اللغات الكبيرة
نماذج لغوية كبيرة: GPT، Claude، Gemini، Mistral والنماذج مفتوحة المصادر
93 published articles
أبحاث الذكاء الاصطناعي
بينيلوب تخفي استدلالها في طبقة مفكك ترميز واحدة لخفض تكاليف الاستدلال
بينيلوب، إطار عمل للاستدلال الكامن لمحولات مفكك الترميز فقط، يحدد الحساب المتكرر في فاصل زمني ضيق لمفكك الترميز، مما يقلل زمن استجابة الاستدلال دون تأثير كبير على الدقة. تصف الورقة منهجًا دراسيًا ينقل الاستدلال من الرموز المرئية إلى حلقة GRU داخلية.
2026-08-04
بحث في الذكاء الاصطناعي
لماذا يُعد الاحتمال اللوغاريتمي للرموز إشارة خاطئة لمراقبة نماذج التفكير في الذكاء الاصطناعي
تظهر Novelis Research أن الاحتمال اللوغاريتمي للرموز يفشل كمراقب لفك الترميز لنماذج التفكير المكممة، كونه أعمى عن الحلقات الواثقة. يقدمون وحدة تحكم e-CUSUM معايرة تجمع بين إشارات عدم اليقين والتكرار، محققة انتقائية على GSM8K مع DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
أبحاث الذكاء الاصطناعي
نموذج LLM يتفوق على كل الصيغ الثابتة لتخصيص المستودعات في JD.com
نموذج لغة كبير تم تدريبه عبر التعلم المعزز الموجه بالمحلل يختار أفضل صيغة MIP لكل حالة تخصيص مخزون في JD.com. قفزت نسبة Hit Ratio@1 من 21% إلى 50%، وتجاوزت دقة التخصيص المحققة كل صيغة ثابتة بمقدار 12.57 نقطة مئوية.
2026-08-03
أبحاث الذكاء الاصطناعي
لماذا لا يرى معلم الذكاء الاصطناعي الخاص بك كيفية بناء الرياضيات على نفسها؟
يكشف K12-Bench من جامعة بكين أن أفضل نماذج اللغة بالكاد تفهم كيفية ارتباط المفاهيم المدرسية. نتائج 57٪ و46٪ تظهر بقعة عمياء في قدرة الذكاء الاصطناعي على التعامل مع سلاسل المتطلبات الأساسية، تصنيفات المفاهيم، والتأصيل البصري، وهي مهارات يستخدمها المدرسون الحقيقيون يوميًا.
2026-08-02
الذكاء الاصطناعي
توليد أفكار البحث يصبح أفضل بـ 3.89 مرة باستخدام IDEAgent
يستخدم IDEAgent الأنساب والتغذية الراجعة متعددة الأهداف والذاكرة المتسلسلة لموازنة الجودة والتنوع في أفكار البحث المولدة بواسطة نماذج اللغة الكبيرة. تم اختباره عبر 32 موضوعًا في 8 مجالات من علوم الكمبيوتر، ويحقق 3.89 أضعاف العائد (أفكار متنوعة فوق عتبة الجودة) مقارنة بالطرق السابقة.
2026-08-02
الاستدلال ثلاثي الأبعاد
SceneActBench: لماذا تفشل حتى أفضل نماذج VLM في الحركة ثلاثية الأبعاد
يختبر SceneActBench أحد عشر تكوينًا لـ VLM على خمس مهام ثلاثية الأبعاد في حلقة وكيل موحدة. تتراوح النتائج الإجمالية من 38.6 إلى 50.2، دون أداء ثابت لأي نموذج. يكشف المعيار عن بقعة عمياء في وكلاء الرؤية واللغة: التصرف في المشاهد الكاملة، وليس مجرد وصفها.
2026-07-31
تقطير نماذج اللغات الكبيرة
تقطير نماذج اللغات الكبيرة يتعثر عندما يبقى السياق ثابتًا. هذه الورقة تجعله يتطور
يمكن للسياقات حمل تفضيلات المهمة إلى تدريب نماذج اللغات الكبيرة، لكنها بعد تقطيرها في الطالب لا تضيف إشرافًا يذكر. تُبقي Flux-OPD من جامعة بكين السياق متحركًا مع الطالب وتستخدم حد تعارض لترجيح تصحيحات المعلّم. يذكر الملخص تحقيق مكاسب على نماذج التقطير ضمن السياسة الحالية دون ذكر أرقام.
2026-07-31
بحوث الذكاء الاصطناعي
رغوة في سلسلة الأفكار: معيار جديد يكشف كيف تهدر LLMs الرموز في استدلال صحيح لكنه عديم الفائدة
غالبًا ما تولد LLMs سلاسل استدلال صحيحة ولكنها محشوة بخطوات غير ضرورية. يظهر معيار تشخيصي جديد وطريقة ضغط أن المقيمين الحاليين يغفلون تمامًا عن هذا عدم الكفاءة وأن نصف خطوات الاستدلال التي كتبها البشر قد تكون قابلة للضغط.
2026-07-31
ملخص بحثي
عنق الزجاجة الهيكلي في الاستدلال يتفوق على سحر المطالبات في مهام الاستقراء لنماذج اللغة الكبيرة
منهجية جديدة تُسمى الاستدلال الساعي تُطبق عزلًا صارمًا للسياق بين مراحل الاستقراء والاستنباط والتنفيذ، مع تمرير قاعدة رمزية مضغوطة فقط بينها. على ARC-AGI-2، ترفع دقة أفضل 5 محاولات بما يصل إلى 14 نقطة عن التحسين التكراري؛ على توليف Verilog لـ ChipBench، تضاعف الدقة تقريبًا مع GPT-5.5. تؤكد عمليات الإزالة أن الهيكلية نفسها هي التي تدفع التحسين.
2026-07-31
أبحاث الذكاء الاصطناعي
جهاز تحكم صغير للمراقبة رفع درجات نماذج اللغة الكمية المضغوطة بمقدار 4.5 نقاط على اختبار MATH-500
يقترح بحث جديد جهاز تحكم خارجي للمراقبة للنماذج اللغوية الصغيرة المضغوطة، يكتشف مسارات الاستدلال المتكررة أو المتدهورة ويطلق عملية إعادة إلى الوراء وإعادة فك تشفير مقيدة. تحسنت الدقة بمقدار 4.5 نقطة مئوية على مجموعة تقييم واسعة، لكن المؤلفين يؤكدون أن النتائج ليست تأكيدية.
2026-07-30
الذكاء الاصطناعي في الألعاب
المشكلات الثلاث التي لم يحلها أي محرك ألعاب ذكاء اصطناعي حتى الآن: الاتساق، قابلية التنقل، والتقييم
MAGIC هو خط أنابيب من أربع مراحل يحول موجهًا واحدًا إلى مشروع Unity قابل للعب مع مشاهد متعددة متصلة. يفرض قابلية الوصول للبوابات باستخدام مدقق ملء الفيضان، ويقدم وكيل تقييم يمشي فعليًا عبر كل انتقال، مكملاً عقودًا من المقاييس التي نظرت فقط إلى الديكورات الداخلية الفردية.
2026-07-30
أبحاث الذكاء الاصطناعي
وكلاء الذكاء الاصطناعي أبقوا الذاكرة خارج النموذج. ميتيس يضعها في الداخل
ميتيس من MemTensor هو أول نموذج أولي لنماذج الذاكرة الأساسية: تاريخ مضغوط في العمود الفقري، يُقرأ عبر انتباه الذاكرة، ويُحدَّث في تمرير أمامي واحد. إنه يتحدى عصر مخازن المتجهات في ذاكرة الوكلاء. القيود معترف بها لكنها لم تُحدَّد كميًا بعد.
2026-07-30