الترميز الوكيلي

9 published articles

المختبرات والأبحاث5 min read

ذكاء اصطناعي / أبحاث البرمجة الوكيلة

Blast Radius يدفن السياق الميت. صفر من أصل 450 جثة عاد

ورقة بحثية جديدة على arXiv باسم Blast Radius تتعامل مع سياق الوكيل المهدر كمادة ميتة وتدفنه بشكل قابل للعكس: توفير 17-26% من الرموز عبر سبعة نماذج من OpenAI، و450 سياقًا مؤرشَفًا، وصفر عملية استرجاع. الهدف الأجرأ للورقة هو جعل البرمجة الوكيلة مستدامة، رمزًا مستعادًا في كل مرة.

2026-08-19

وكلاء الذكاء الاصطناعي4 min read

البرمجة بالوكلاء وتضخّم التعليمات

التذكّر الكارثي: لماذا تنمو ملفات CLAUDE.md بنسبة 226% ولا تنكمش أبدًا

دراسة على arXiv لـ1,867 مستودعًا تجد أن ملفات تعليمات البرمجة بالوكلاء مثل CLAUDE.md تتضاعف ثلاث مرات في الحجم على مدى عمرها، لأن حذف سطر يخاطر بحدوث انتكاسات بمجرد فقدان مبرره. يسمّي المؤلفون ذلك التذكّر الكارثي ويُظهرون أن توثيق المنطق يقلّص التعليمات الزائدة بنسبة 99.3%.

2026-08-15

xAI / GrokFeatured4 min read

الذكاء الاصطناعي

Grok 4.6 يتعادل مع GPT-5.6 Sol عند 61، ثم تنقسم نتائج المكونات

يتعادل نموذج Grok 4.6 من xAI مع GPT-5.6 Sol عند 61 على مؤشر Artificial Analysis Intelligence، وهو مؤشر مركب من تسعة معايير. توزيع النتائج غير متوازن: انتصارات في أعمال المعرفة ومعظم اختبارات البرمجة، وخسائر في DeepSWE وTerminal-Bench. متاح الآن في Cursor وGrok Build، بدءًا من 2 دولار لكل مليون رمز إدخال.

2026-08-13

بيئات تطوير الذكاء الاصطناعي5 min read

بيئات تطوير الذكاء الاصطناعي

Cursor يهاجم تكاليف الوكلاء بخطة هندية بسعر 649 روبية وموجّه نماذج

تحديث يوليو من Cursor يضيف خطة هندية بقيمة 649 روبية شهريًا ووضع Auto يوجّه الطلبات إلى نماذج أرخص، إلى جانب مراجعة كاملة لطلبات السحب على iPhone وiPad ووكلاء يعملون داخل Slack. الإصدار يدور حقًا حول التحكم في تكاليف البرمجة الوكيلة.

2026-08-05

Qwen / AlibabaFeatured5 min read

الذكاء الاصطناعي مفتوح المصدر

Qwen3.8-Max يتفوق على 458 فريقًا بشريًا في 24 ساعة، وهو يعمل بمفرده

تفوق Qwen3.8-Max على 458 من أصل 526 فريقًا بشريًا في مسابقة استمرت 24 ساعة بينما كان يعمل بمفرده، وستفتح Alibaba مصدر أوزانه الأسبوع المقبل. كل رقم حتى الآن ورد من الشركة نفسها، وهذا تحديدًا هو السبب الذي يجعل ادعاءات الاستقلالية تستحق التدقيق.

2026-08-03

معايير واختباراتFeatured2 min read

تحليل المعايير

في SWE-bench Verified، النماذج العليا تحقق 96%. أما على الكود المؤسسي الخاص، فبالكاد تتجاوز 23%

يجعل SWE-bench Verified النماذج الحدودية تبدو قريبة من حل هندسة البرمجيات الواقعية، بأعلى الدرجات فوق 95%. أما SWE-bench Pro، الذي يُجرى على مستودعات مؤسسية خاصة، فيخفض نفس النماذج إلى 23% أو أقل، مما يكشف مدى اعتماد نتيجة Verified على التعرض للبيانات العامة.

2026-08-02

بيئات تطوير الذكاء الاصطناعي2 min read

إطلاق منتج

خطة كرسور الهندية بسعر 649 روبية شهريًا تتضمن موجه نموذج يختار أرخص نموذج لكل مهمة

يمنح Cursor Start المطورين الهنود تسعيرًا محليًا مع UPI، بينما يتيح Cursor Router للفرق التحكم في المفاضلة بين التكلفة والذكاء لكل طلب. ميزتان تخفضان الحاجز وتحسنان الإنفاق.

2026-08-01

الذكاء الاصطناعي5 min read

Qoder من علي بابا

كود الذكاء الاصطناعي أكثر عرضة للعيوب بمقدار الضعف. Qoder يعالج ذلك أثناء الجلسة

تقوم Qoder Security بتضمين مهندس أمان مخصص في كل جلسة ترميز بالذكاء الاصطناعي، لالتقاط الثغرات في لحظة كتابة الكود، وليس بعد أيام في مرحلة النشر.

2026-07-30

الأمن السيبرانيFeatured4 min read

أمن البرمجة بالذكاء الاصطناعي

النقطة العمياء في الكود المولّد بالذكاء الاصطناعي التي تعالجها Alibaba في منتصف الجملة

تطلق سحابة علي بابا Qoder Security، وهو نظام مراجعة كود داخل الجلسة مصمم لاكتشاف الثغرات أثناء التطوير بدلاً من مرحلة CI. تدعي المنصة تقليل النتائج الإيجابية الكاذبة بنسبة 80% ودورات إصلاح تستغرق ساعات.

2026-07-26