نماذج الذكاء الاصطناعي
إصدار Laguna XS 2.1 من Poolside يحقق تحسنًا بمقدار 5 نقاط في معايير البرمجة بنفس العتاد
يعمل Laguna XS 2.1 من Poolside على تحسين SWE-bench متعدد اللغات بمقدار 5.4 نقاط ليصل إلى 63.1% مع الحفاظ على نفس بنية MoE (33B-3B). يتضمن الإصدار نقاط تفتيش كمية، ونماذج مسودة لفك الترميز التخميني، وترخيص OpenMDW-1.1، مما يجعل برمجة الذكاء الاصطناعي المحلية أكثر عملية.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-21 · قراءة 4 دقائق

أصدرت Poolside اليوم إصدار Laguna XS 2.1، وهو تحديث تدريجي لنموذج Mixture-of-Experts المخصص للبرمجة. الرقم الرئيسي هو قفزة بمقدار 5.4 نقاط في SWE-bench متعدد اللغات، مما يرفع معدل المهام المحلولة إلى 63.1%. يبدو هذا تحسنًا طفيفًا حتى تنظر إلى جدول المعايير الخاص بالشركة: يتفوق XS 2.1 الآن على نماذج تمتلك معلمات نشطة أكثر بعشر إلى 40 مرة في العديد من اختبارات البرمجة الوكيلة.
يحتفظ النموذج بنفس بنية XS.2، بإجمالي 33 مليار معلمة، و3 مليارات معلمة مفعلة لكل رمز، لكن الشركة تقول إنها دربته لفترة أطول أو على بيانات أفضل، أو كليهما. لا يحدد منشور الإصدار ما الذي تغير في التدريب، فقط أن النتيجة هي "تحسن ملحوظ في SWE-bench متعدد اللغات وأداء أقوى في مهام نمط الطرفية". هذا الغموض شائع في ملاحظات إصدار النماذج، لكنه مهم هنا لأن تحسينات المعايير تأتي دون أي زيادة في تكلفة العتاد. تكلفة XS 2.1 هي نفس تكلفة XS.2 على واجهة برمجة التطبيقات الخاصة بـ Poolside: 0.10 دولار لكل مليون رمز إدخال، و0.20 دولار لكل مليون رمز إخراج، و0.05 دولار لكل مليون رمز قراءة من ذاكرة التخزين المؤقت. بالنسبة للفرق التي تشغل XS.2 محليًا بالفعل على وحدة معالجة رسومية واحدة، فإن الترقية مجانية بشكل أساسي من حيث الحوسبة.
ما تظهره المعايير بالفعل
نشرت Poolside نتائج عبر أربعة معايير برمجة وكيلة: SWE-bench المُتحقق منه، وSWE-bench متعدد اللغات، وSWE-Bench Pro، وTerminal-Bench 2.0. قارنت الشركة XS 2.1 مع Qwen3.6 (35B-A3B)، وNorth Mini Code من Cohere (30B-A3B)، وMAI-Code-1-Flash (137B-A5B)، وGPT-OSS-120B، وClaude Haiku 4.5. في SWE-bench متعدد اللغات، يتصدر XS 2.1 مجموعة المقارنة بنسبة 63.1%. في SWE-bench المُتحقق منه، يتخلف عن العديد من النماذج الأكبر. في Terminal-Bench 2.0، يتعادل تقريبًا مع Qwen3.6.
الخلاصة ليست أن XS 2.1 يهيمن على كل معيار، فهو لا يفعل ذلك. عبر أربعة اختبارات، يتصدر واحدًا، ويتعادل تقريبًا في واحد، ويتخلف في اثنين. لكنه يفعل كل هذا بـ 3 مليارات معلمة نشطة فقط. نموذج يتسع على وحدة معالجة رسومية واحدة للمستهلك يتنافس مع عروض تحتاج إلى عتاد مراكز البيانات، وهذا يغير اقتصاديات برمجة الذكاء الاصطناعي المحلية للمطورين الأفراد والفرق الصغيرة.

فك الترميز التخميني والاستدلال المحلي
تصدر Poolside أيضًا نماذج مُخمّنة DFlash لكل نقطة تفتيش من XS 2.1. هذه نماذج مسودة صغيرة تم تدريبها للتنبؤ بالرموز التالية للنموذج الرئيسي بتكلفة زهيدة، وهي تقنية تسمى فك الترميز التخميني. في اختبارات الشركة الداخلية، يؤدي إقران XS 2.1 مع المُخمّن إلى مضاعفة عدد الرموز المحققة في الثانية. لأي شخص يشغل النموذج محليًا، حيث يكون زمن الوصول هو عنق الزجاجة، يحدث هذا فرقًا ذا معنى في مدى استجابة الوكيل البرمجي.
يدعم النموذج vLLM وSGLang وNVIDIA TensorRT-LLM و Hugging Face transformers وOllama. تتوفر نقاط التفتيش الكمية بتنسيقات FP8 وINT4 وNVFP4، مما يسمح للمستخدمين بالمقايضة بين الدقة وذاكرة VRAM. تقول الشركة إن نقاط تفتيش GGUF الكمية ودعم llama.cpp قادمة قريبًا.
تغيير الترخيص ولعبة النظام البيئي
تُرخص Poolside نموذج XS 2.1 بموجب OpenMDW-1.1، متخلية عن الترخيص الذي استخدمته XS.2. OpenMDW هو إطار توزيع النماذج المفتوحة المدعوم من NVIDIA ومؤسسة Linux. تسميه الشركة "متساهل تمامًا" وتقول إن التغيير "يقلل من الاحتكاك المتعلق بالترخيص لإصدارات النماذج المفتوحة". بالنسبة للفرق التي تقيم النماذج، يزيل هذا صداعًا آخر، فلا حاجة لإجراء مراجعة ترخيص لنموذج قد ينتهي به المطاف في منتج تجاري.
يتزامن التوقيت مع دفعة أوسع من NVIDIA لتوحيد طريقة توزيع النماذج المفتوحة. قصة Poolside لا تتعلق فقط بأرقام المعايير؛ بل تتعلق بجعل تلك الأرقام متاحة على العتاد المحلي بموجب ترخيص سيوافق عليه المحامون.
ما سيتم إلغاء أولويته
ستوقف Poolside دعم XS.2 على واجهة برمجة التطبيقات الخاصة بها بعد أسبوع واحد. لا يزال بإمكان الفرق التي أنشأت نشرًا مخصصًا حول النموذج الأقدم الوصول إليه من خلال مكتبة النماذج Baseten، لكن الشركة تدفع الجميع بوضوح نحو 2.1. فترة الإيقاف البالغة أسبوع واحد على واجهة برمجة التطبيقات قصيرة، ويحتاج الفرق التي تدير تقييمات أو اختبارات انحدار إلى التحرك بسرعة.
قامت الشركة أيضًا برهان متعمد على البرمجة الوكيلة بدلاً من التفكير العام. تم تصميم XS 2.1 "لعمل طويل الأجل على جهاز محلي"، مما يعني نوع مهام البرمجة متعددة الخطوات التي يعالجها الحلقة الوكيلة. إنه ليس روبوت محادثة عامًا. قد تجده الفرق التي تستخدمه لأي شيء غير البرمجة أضيق مما يوحي به جدول المعايير.
الصورة الأكبر
يتناسب إصدار Poolside مع نمط تطور على مدى عامين: النماذج الصغيرة الفعالة التي تعمل على العتاد المحلي تأكل من الأراضي التي كانت مملوكة حصريًا لنشر مراكز البيانات الضخمة. XS 2.1 ليس اختراقًا؛ إنه تحسن تدريجي يجعل حجة جيدة أفضل قليلاً. الزيادة البالغة 5.4 نقاط في معيار واحد متواضعة. ما يهم هو أن Poolside حققت ذلك دون زيادة بصمة النموذج، أو تسعير واجهة برمجة التطبيقات، أو متطلبات العتاد. هذا هو نوع التحسن الذي يتراكم بمرور الوقت، وهو كيف تصبح برمجة الذكاء الاصطناعي المحلية سير عمل افتراضيًا بدلاً من كونها فضولًا.
- المصدر : Laguna XS 2.1 release blog post
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.