وكلاء الذكاء الاصطناعي على الأجهزة
LFM2.5-2.6B: الوكيل الصغير الذي يتفوق على نماذج أكبر منه بأربعة أضعاف
يضع LFM2.5-2.6B من Liquid AI نموذجًا وكيلًا في 2.6 مليار معامل وأقل من 2.5 غيغابايت من الذاكرة، متصدرًا كل معايير اتباع التعليمات التي اختُبر عليها. يعمل بسرعة 220 رمزًا في الثانية على حاسوب محمول؛ والبرمجة هي الفجوة الواضحة الوحيدة.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-12 · قراءة 4 دقائق

كان السباق لبناء وكلاء ذكاء اصطناعي مفيدين في معظمه لعبة حجم: نماذج أكبر، وسياقات أطول، وأدوات أكثر داخل الحلقة. تراهن Liquid AI على الاتجاه المعاكس. يضغط نموذجها الجديد LFM2.5-2.6B الحزمة الوكيلة في 2.6 مليار معامل تعمل في أقل من 2.5 غيغابايت من الذاكرة. وفي تقييمات الشركة الخاصة، ينافس النموذج منافسين يصل حجمهم إلى أربعة أضعاف حجمه في استخدام الأدوات والمهام الوكيلة متعددة الخطوات، ويتفوق عليهم جميعًا في اتباع التعليمات.
هذا هو الطرح التسويقي، وللمرة الأولى هناك أرقام تدعمه. نشرت Liquid AI نتائج تشغيل كامل للمعايير ضد أربعة نماذج أكبر: gemma-4-E2B-it (5.1B)، وgemma-4-E4B-it (8B)، وQwen3.5-4B (4.7B)، وQwen3.5-9B (9.7B). LFM2.5-2.6B هو أصغر نموذج في هذه المجموعة.
أصغر نموذج في المجموعة، متقدّم في اتباع التعليمات
تشير Liquid إلى أن نموذجها بحجم 2.6 مليار معامل يحل في المركز الأول في كل معايير اتباع التعليمات ضمن المجموعة، وفي المركز الأول في كل معايير استخدام الأدوات باستثناء BFCLv4، حيث يتقدم Qwen بحجم 9.7 مليار معامل بفارق ضئيل فقط.
| المعيار | LFM2.5-2.6B (2.6B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|---|
| AA Omniscience | -29.50 | -74.47 | -49.03 | -54.30 | -50.43 |
| AIME25 | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
| IFBench | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
| Multi-IF | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
| BFCLv4 | 56.88 | 36.98 | 46.39 | 50.56 | 60.13 |
| ToolSandbox | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
| BrowseComp+ (OpenClaw) | 26.89 | 8.31 | 15.90 | 24.46 | 27.23 |
في المهام الوكيلة تكون الصورة أكثر توازنًا: يتفوق LFM2.5-2.6B على نموذجي Gemma ويبقى بمستوى نماذج Qwen، ويسجّل أعلى نتيجة في AA Omniscience ضمن المجموعة. تلخّص Liquid النتائج بأنها تتصدر في المعرفة وتبقى قريبة في الرياضيات. هذه أرقام الشركة الخاصة، دون أي تحقق من طرف ثالث، لكن الفوارق، حيث توجد، ليست صغيرة.
أربع مراحل تدريب، وخدعة واحدة لبيئة تشغيل صندوق أسود
يبدأ LFM2.5-2.6B من نموذج أساسي مُدرَّب مسبقًا على نحو 34 تريليون رمز، مع مرحلة تدريب وسطي تمدّد نافذة السياق إلى 128 ألف رمز. يأتي السلوك الوكيل من التدريب اللاحق، الذي يعمل في أربع مراحل.
- جولتان من الضبط الدقيق الخاضع للإشراف، بوزن أكبر للبيانات الوكيلة: استخدام الأدوات، والبحث على الويب، ومسارات بيئة التشغيل.
- مدرّب متخصص واحد لكل مجال: الرياضيات، والبرمجة، واستخدام الأدوات، والمزيد.
- تقطير متعدد المجالات ضمن السياسة يعيد دمج المدرّبين في طالب واحد.
- تعلم معزز وكيل، حيث يعمل التعلم المعزز متعدد الجولات داخل بيئات تشغيل وكيلة حقيقية ليتعلم النموذج عبر الأدوات ومطالبات النظام وبيئات المهام متعددة الجولات.
الهندسة الجديرة بالملاحظة تكمن في تلك المرحلة الأخيرة. تفصل Liquid بين تحسين النموذج والاستدلال وتنفيذ البيئة، ثم تشغّل الوكيل داخل بيئة تشغيل صندوق أسود، ذاكرةً OpenClaw وHermes Agent كمثالين. يعترض Harness Proxy نداءات النموذج الصادرة عن بيئة التشغيل ويسجّل مسارات الرموز التي تحتاجها حلقة التدريب، دون تعديل بيئة التشغيل نفسها. وهذا هو التصميم نفسه الذي يقف خلف OpenForgeRL، الإطار مفتوح المصدر الذي تتابعه تغطيتنا: وكيل خفيف يحوّل نداءات بيئة التشغيل إلى بيانات تدريب لشفرة تعلم معزز قياسية، وكل عملية تشغيل تُنفَّذ في حاوية Kubernetes خاصة بها.
المقايضة هي أن بيئة التشغيل نفسها تصبح جزءًا من سطح التدريب. يوثّق عمل OpenForgeRL أن بعض بيئات التشغيل أصعب في التعلم منها من غيرها، وأن التعلم المعزز يحسّن الموثوقية في الغالب بينما تظل القدرات الحرجة مثل التعافي من الأخطاء ضعيفة.
سريع بما يكفي لهاتف، ورخيص بما يكفي لأسطول
ثم هناك السرعة الخام. تُعلن Liquid سرعة فك تشفير تبلغ 220 رمزًا في الثانية على Apple M5 Max و113 رمزًا في الثانية على AMD Ryzen AI Max+ 395، وكلاهما في أقل من 2.5 غيغابايت من الذاكرة. وعند 30 رمزًا في الثانية، تقول الشركة، يكون النموذج سريعًا بما يكفي لوكيل قادر على الهاتف. وعند التزامن العالي على شريحة H100 واحدة، يحقق النموذج نحو 15,000 رمز إخراج في الثانية، أي ما يقارب 1.3 مليار رمز يوميًا.
تغطي ميزات الدعم من اليوم الأول llama.cpp وMLX وvLLM وSGLang وONNX، ويُحمَّل النموذج عبر إصدار transformers 5.0.0 أو أحدث. يتوفر كل من LFM2.5-2.6B ونسخة LFM2.5-2.6B-Base على Hugging Face، وتشغّل نسخة WebGPU تجريبية وكيل أبحاث في المتصفح، ونشرت Liquid أدلة لتشغيل وكلاء محليين في بيئات مثل OpenClaw وHermes Agent وPi.
البرمجة هي حيث تبرّر النماذج الأكبر حجمها
المكان الوحيد الذي ينعكس فيه تفوق الحجم هو البرمجة. في LiveCodeBench v6، يسجّل كل منافس باستثناء Gemma بحجم 5.1B نتيجة أعلى من 59.41 التي يحققها LFM2.5-2.6B. تقول Liquid إن النماذج الأكبر تحافظ على تقدّم واضح هناك وتوصي باللجوء إلى نموذج أكبر. إنه تنازل يستحق القراءة بعناية، لأن مختبرات أخرى تجعل البرمجة محور التدريب الوكيل. MiniMax M3، الذي وجدت تغطيتنا أنه يتفوق على GPT-5.5 في البرمجة الحقيقية، دُرِّب على تسلسلات تفاعل متعددة الجولات عبر محاكي مستخدم تفاعلي. سارت Liquid في الاتجاه الآخر: صغير، وعام، وسريع، وغير مخصص للبرمجة صراحةً.
كلاهما رهان على الأطروحة نفسها: السلوك الوكيل يأتي من كيفية تدريب النموذج، وليس فقط من حجمه. تسمي Liquid هذا الإصدار خطوة نحو «ذكاء اصطناعي يعمل في أي مكان». بالنسبة لاستخدام الأدوات واتباع التعليمات والمهام متعددة الخطوات على الأجهزة المحلية، تجعل الأرقام هذا الطرح ذا مصداقية. ولكل شيء آخر، هناك دائمًا نموذج أكبر.
- المصدر : LFM2.5-2.6B: the tiny agent that outruns models 4x its size — 2026-08-04
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.