وكلاء البرمجة

9 published articles

جوجل ديب مايندFeatured3 min read

نموذج جوجل المعتمد، أكبر في تحديث 3.7

جيميناي 3.7 فلاش يخفض سعره إلى النصف، ثم يقدّم الحجج المؤيدة لذلك

يُطرح نموذج Gemini 3.7 Flash من Google بنصف السعر التمهيدي لنموذج 3.6 Flash، مع ادعاءات بتحقيق مكاسب في معايير البرمجة وتطوير الويب وأعمال المعرفة. ويصدر الإصدار بعد ثلاثة أسابيع من إصدار Flash السابق، ويقدّم لمطوّري الوكلاء حجة جديدة قائمة على السعر مقابل الأداء.

2026-08-16

الذكاء الاصطناعي4 min read

متعدد الوسائط / مفتوح المصدر

حزمة إضافات Qwen تمنح وكيل البرمجة لديك عينين ويدين وذاكرة فيديو

أصدر فريق Qwen التابع لشركة Alibaba حزمة Qwen-MM-Plugins، وهي مجموعة أدوات بترخيص Apache-2.0 تمنح وكلاء البرمجة مهارات متعددة الوسائط بشكل أصلي: قراءة الصور والفيديو بدقة ديناميكية، والتعرف الضوئي على الحروف (OCR)، والتأريض (grounding)، والتعرف التلقائي على الكلام (ASR)، وذاكرة الفيديو الطويل، وتوليد الفيديو، والتحكم عبر عميل خفيف في Blender وFreeCAD. سكربت واحد يثبّتها عبر Claude Code وCodex وQoder وOpenClaw وQwen Code وGemini CLI.

2026-08-15

وكلاء الذكاء الاصطناعي7 min read

أمان الطرفية

فخ '$HOME': وكلاء البرمجة بالذكاء الاصطناعي يحتاجون إلى صناديق رمل، لا إلى مطالبات 'allow?'

يحظر صندوق رمل الطرفية في Qoder ما يقارب مئة أمر وكيل مدمر يوميًا. الحالات التي تقف خلف هذا الحظر تشرح لماذا تفشل مطالبات 'allow?': مجلد مشروع باسم $HOME، وعملية تنظيف استهدفت /root، ونقرة كادت تكلف قرصًا كاملًا.

2026-08-13

بيئات تطوير الذكاء الاصطناعي4 min read

Alibaba / بيئات التطوير المتكاملة للذكاء الاصطناعي

لماذا تخلى Qoder 1.0 عن بيئة التطوير المتكاملة ذات مساحة العمل الواحدة

يفصل Qoder 1.0 حدود مساحة العمل والتنفيذ والمخرجات والتسليم عبر أشجار عمل معزولة بحيث تتوقف مهام الوكلاء المتوازية عن التصادم. وتقول بيانات A/B الخاصة بـ Alibaba إن محرك الذاكرة المحدود النطاق خفّض رموز الإدخال بنسبة 40%.

2026-08-04

الذكاء الاصطناعي5 min read

بحث في الذكاء الاصطناعي

عندما يفشل وكيل البرمجة، فإن إعادة المحاولة الرخيصة أفضل من التصعيد، بتكلفة 35%

CodeRescue، نظام توجيه الاسترداد لوكلاء البرمجة، يستخدم ملاحظات التنفيذ ليقرر متى يعيد المحاولة باستخدام نماذج رخيصة مقابل التصعيد إلى نماذج باهظة الثمن. توفر طبقة التحكم في المخاطر المطابقة للمشغلين إمكانية تحديد أهداف التكلفة دون إعادة تدريب، محققة معدلات حل شبه مثالية بتكلفة 35% من التصعيد الدائم.

2026-07-25

معايير واختباراتFeatured3 min read

البرمجة الوكيلة

كيف تقدّم Grok 4.5 في سباق SWE Marathon، وماذا يعني ذلك لوكلاء البرمجة

يقود Grok 4.5 الآن لوحة SWE Marathon متفوقاً على Claude 4 Opus وGPT-5. يختبر المعيار مهارات هندسة البرمجيات الحقيقية: إصلاح الأخطاء وإضافة الميزات وفهم الكود عبر المستودعات الحقيقية. تعيد النتيجة تشكيل المشهد التنافسي لوكلاء البرمجة بالذكاء الاصطناعي.

2026-07-20

Mistral AI3 min read

وكلاء الذكاء الاصطناعي

وكلاء Mistral البرمجيون يتركون حاسوبك المحمول خلفك: جلسات متوازية دون حاجة للإشراف

تنقل Mistral الوكلاء البرمجيين إلى السحابة، مما يتيح تنفيذ المهام بشكل متوازٍ وغير متزامن عبر نموذج Mistral Medium 3.5 الجديد. يتضمن التحديث وكلاء عن بُعد في Mistral Vibe وLe Chat، إلى جانب وضع العمل للمهام متعددة الخطوات، مع الإبقاء على الإشراف البشري للإجراءات الحساسة.

2026-07-12

الذكاء الاصطناعيFeatured5 min read

تحليل معايير الوكلاء

ProgramBench: كل نموذج ذكاء اصطناعي عام يسجل 0% في أصعب اختبار برمجة حتى الآن

ProgramBench يتحدى وكلاء الذكاء الاصطناعي لإعادة بناء البرامج من الملفات الثنائية فقط، دون كود مصدري أو أوصاف مشكلات. جميع النماذج العامة تفشل في حل أي مهمة بالكامل، مما يكشف نقاط ضعف في الاستقصاء، والهندسة المعمارية، والحكم على التوقف. المعيار هو اختبار ضغط لوكلاء البرمجة الذين يتجاوزون سير العمل القائم على التصحيحات.

2026-06-29

معايير واختباراتFeatured3 min read

أداء

Gemma 4 يعمل أسرع بنحو 90 بالمائة في Ollama 0.31 مع التنبؤ متعدد الرموز

يقدم Ollama 0.31 التنبؤ متعدد الرموز لـ Gemma 4 على Apple Silicon، مما يحقق توليدًا أسرع بنسبة تقارب 90% للرموز في معايير البرمجة. يأتي التسريع من نموذج أولي مضبوط تلقائيًا ونواة MLX مخصصة تلغي قراءات الأوزان الزائدة.

2026-06-29