وكلاء البرمجة
9 published articles
نموذج جوجل المعتمد، أكبر في تحديث 3.7
جيميناي 3.7 فلاش يخفض سعره إلى النصف، ثم يقدّم الحجج المؤيدة لذلك
يُطرح نموذج Gemini 3.7 Flash من Google بنصف السعر التمهيدي لنموذج 3.6 Flash، مع ادعاءات بتحقيق مكاسب في معايير البرمجة وتطوير الويب وأعمال المعرفة. ويصدر الإصدار بعد ثلاثة أسابيع من إصدار Flash السابق، ويقدّم لمطوّري الوكلاء حجة جديدة قائمة على السعر مقابل الأداء.
2026-08-16
متعدد الوسائط / مفتوح المصدر
حزمة إضافات Qwen تمنح وكيل البرمجة لديك عينين ويدين وذاكرة فيديو
أصدر فريق Qwen التابع لشركة Alibaba حزمة Qwen-MM-Plugins، وهي مجموعة أدوات بترخيص Apache-2.0 تمنح وكلاء البرمجة مهارات متعددة الوسائط بشكل أصلي: قراءة الصور والفيديو بدقة ديناميكية، والتعرف الضوئي على الحروف (OCR)، والتأريض (grounding)، والتعرف التلقائي على الكلام (ASR)، وذاكرة الفيديو الطويل، وتوليد الفيديو، والتحكم عبر عميل خفيف في Blender وFreeCAD. سكربت واحد يثبّتها عبر Claude Code وCodex وQoder وOpenClaw وQwen Code وGemini CLI.
2026-08-15
أمان الطرفية
فخ '$HOME': وكلاء البرمجة بالذكاء الاصطناعي يحتاجون إلى صناديق رمل، لا إلى مطالبات 'allow?'
يحظر صندوق رمل الطرفية في Qoder ما يقارب مئة أمر وكيل مدمر يوميًا. الحالات التي تقف خلف هذا الحظر تشرح لماذا تفشل مطالبات 'allow?': مجلد مشروع باسم $HOME، وعملية تنظيف استهدفت /root، ونقرة كادت تكلف قرصًا كاملًا.
2026-08-13
Alibaba / بيئات التطوير المتكاملة للذكاء الاصطناعي
لماذا تخلى Qoder 1.0 عن بيئة التطوير المتكاملة ذات مساحة العمل الواحدة
يفصل Qoder 1.0 حدود مساحة العمل والتنفيذ والمخرجات والتسليم عبر أشجار عمل معزولة بحيث تتوقف مهام الوكلاء المتوازية عن التصادم. وتقول بيانات A/B الخاصة بـ Alibaba إن محرك الذاكرة المحدود النطاق خفّض رموز الإدخال بنسبة 40%.
2026-08-04
بحث في الذكاء الاصطناعي
عندما يفشل وكيل البرمجة، فإن إعادة المحاولة الرخيصة أفضل من التصعيد، بتكلفة 35%
CodeRescue، نظام توجيه الاسترداد لوكلاء البرمجة، يستخدم ملاحظات التنفيذ ليقرر متى يعيد المحاولة باستخدام نماذج رخيصة مقابل التصعيد إلى نماذج باهظة الثمن. توفر طبقة التحكم في المخاطر المطابقة للمشغلين إمكانية تحديد أهداف التكلفة دون إعادة تدريب، محققة معدلات حل شبه مثالية بتكلفة 35% من التصعيد الدائم.
2026-07-25
البرمجة الوكيلة
كيف تقدّم Grok 4.5 في سباق SWE Marathon، وماذا يعني ذلك لوكلاء البرمجة
يقود Grok 4.5 الآن لوحة SWE Marathon متفوقاً على Claude 4 Opus وGPT-5. يختبر المعيار مهارات هندسة البرمجيات الحقيقية: إصلاح الأخطاء وإضافة الميزات وفهم الكود عبر المستودعات الحقيقية. تعيد النتيجة تشكيل المشهد التنافسي لوكلاء البرمجة بالذكاء الاصطناعي.
2026-07-20
وكلاء الذكاء الاصطناعي
وكلاء Mistral البرمجيون يتركون حاسوبك المحمول خلفك: جلسات متوازية دون حاجة للإشراف
تنقل Mistral الوكلاء البرمجيين إلى السحابة، مما يتيح تنفيذ المهام بشكل متوازٍ وغير متزامن عبر نموذج Mistral Medium 3.5 الجديد. يتضمن التحديث وكلاء عن بُعد في Mistral Vibe وLe Chat، إلى جانب وضع العمل للمهام متعددة الخطوات، مع الإبقاء على الإشراف البشري للإجراءات الحساسة.
2026-07-12
تحليل معايير الوكلاء
ProgramBench: كل نموذج ذكاء اصطناعي عام يسجل 0% في أصعب اختبار برمجة حتى الآن
ProgramBench يتحدى وكلاء الذكاء الاصطناعي لإعادة بناء البرامج من الملفات الثنائية فقط، دون كود مصدري أو أوصاف مشكلات. جميع النماذج العامة تفشل في حل أي مهمة بالكامل، مما يكشف نقاط ضعف في الاستقصاء، والهندسة المعمارية، والحكم على التوقف. المعيار هو اختبار ضغط لوكلاء البرمجة الذين يتجاوزون سير العمل القائم على التصحيحات.
2026-06-29
أداء
Gemma 4 يعمل أسرع بنحو 90 بالمائة في Ollama 0.31 مع التنبؤ متعدد الرموز
يقدم Ollama 0.31 التنبؤ متعدد الرموز لـ Gemma 4 على Apple Silicon، مما يحقق توليدًا أسرع بنسبة تقارب 90% للرموز في معايير البرمجة. يأتي التسريع من نموذج أولي مضبوط تلقائيًا ونواة MLX مخصصة تلغي قراءات الأوزان الزائدة.
2026-06-29