وكلاء الذكاء الاصطناعي
سرب كيرسر أعاد بناء SQLite من الصفر. نتائج متطابقة وفواتير متباينة بشكل هائل
أعاد سرب وكلاء كيرسر المُعاد تصميمه بناء SQLite في Rust من دليله وحده واجتاز مجموعة التحقق الكاملة، مخفضًا تعارضات الدمج من أكثر من 70,000 إلى أقل من 1,000. قدّمت كل خلطات النماذج جودة متشابهة بأسعار مختلفة جدًا، وتلك الفجوة هي القصة.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-05 · قراءة 6 دقائق

نفّذ سرب وكلاء كيرسر دليل SQLite المكوّن من 835 صفحة في Rust انطلاقًا من صفحة فارغة، دون كود مصدري، ودون مجموعات اختبار، ودون ملف تنفيذي، ودون إنترنت. تم تقييمه على sqllogictest، مجموعة المشروع التي تضم ملايين الاستعلامات بإجابات معروفة، ولم يُبلَّغ بوجود المجموعة أصلًا. جميع التهيئات الأربع للإطار المُعاد تصميمه اجتازت في النهاية 100% منه.
تقارن التجربة بين الإطارين القديم والجديد على المهمة نفسها، وبالنماذج نفسها وبالميزانية الزمنية نفسها. تفوّق الجديد على القديم في كل تهيئة. مع Grok 4.5 في الدورين بلغ 80% في أربع ساعات، بينما توقّف السرب القديم وأُوقِف قبل انتهاء ساعته الثانية. يحذّر كيرسر من أن الاتجاهات أهم من القراءات المفردة: بعض الوكلاء يسجّلون نتائج منخفضة لساعات قبل اندفاعة متأخرة، وآخرون يبلغون الذروة مبكرًا ثم يستقرّون.
ضريبة التنسيق: 70,000 تعارض
تبدو بيانات النشاط وكأنها إنتاجية حتى تضعها بجانب النتائج. أجرى تشغيل Grok 4.5 القديم 68,000 commit في أول ساعتين، أي نحو 70 ضعف وتيرة التشغيل الجديد، وراكم أكثر من 70,000 تعارض دمج، متسارعًا بدل أن يستقرّ. سجّل التشغيل الجديد أقل من ألف تعارض في أربع ساعات. الملف الأكثر تنازعًا في التشغيل القديم جمع 7,771 تعارضًا من 1,173 وكيلًا مختلفًا. أما الملف الأكثر سخونة في التشغيل الجديد فشهد 47 تعارضًا.
يُظهر الكود النهائي الفجوة نفسها. امتدّ التشغيل القديم عبر 54 crate من Rust، بما فيها ثلاث حزم SQL منفصلة، وهي بصمة مُخطِّطين يبنيان بهدوء الأمر نفسه في زوايا مختلفة من قاعدة الكود. يسمّي كيرسر هذا الانقسام الدماغي (split-brain). استقرّ التشغيل الجديد على تسعة crates ولم يضِف أي crate آخر. في خلطة Fable 5، احتاج الإطار القديم إلى 64,305 سطرًا من كود المحرّك لاجتياز المجموعة؛ أما الجديد فأنجزها في 9,908. وفي خلطة Opus: 19,013 سطرًا بنسبة 97%، مقابل 4,645 بنسبة 100%.
الوتيرة هي التي تفرض الهندسة. بلغ سرب Browser السابق ذروته عند نحو 1,000 commit في الساعة على Git؛ بينما يبلغ النظام الجديد ذروته عند نحو 1,000 في الثانية على نظام تحكم بالنسخ بناه كيرسر من الصفر.
معظم الإصلاحات حوله إجرائية، وليست ذكاءً نموذجيًا. وكيل ثالث محايد يحلّ تعارضات الدمج، تمامًا كما يفعل طابور دمج بشري. يمكن للعمال وضع علامة على الملفات الضخمة المفرطة، مما يحجب commits جديدة حتى يقسّم وكيل آخر الملف. تُوضع القرارات التصميمية في مستندات مشتركة يشير إليها الكود وقت الترجمة؛ وعندما يتناقض مُخطِّطان، تدمج عملية مصالحة المستندات وتنشر المراجع القرار إلى المصب. قد يقوم الوكلاء حتى بتغييرات كسرية متعمّدة خارج نطاق مهامهم إذا تركوا تعليقًا، وكل وكيل يصطدم بالتبعات يقرأ المنطق. أحد أنماط الفشل التي يسميها كيرسر هو التصلّب: تعلّم الوكلاء عدم لمس الكود الحرج حتى عندما كان يحتاج إلى التغيير.
حيث تتباين الفواتير
النتيجة الاقتصادية هي الجديرة بالاقتباس. كل تقسيم للنماذج أنتج جودة متشابهة، كما يقول كيرسر، بينما تفاوتت التكاليف بشكل هائل. فوتر التشغيل الذي استخدم GPT-5.5 في الدورين بمبلغ $9,373 للعمال وحدهم. أما تشغيل GPT-5.5 المنفرد فكلّف $1,339. عند الساعة الرابعة، تراوحت التشغيلات الجديدة بين 73% و85%، والقديمة بين 11% و77%، وانتهى كل تهيئة جديدة في النهاية عند 100%.
استهلك العمال 69% على الأقل من التوكنات في كل تشغيل، وأكثر من 90% في معظمها، لكن توكنات المخطّط تكلف أكثر. في خلطة Opus 4.8 وComposer 2.5، أنتج Opus جزءًا صغيرًا من التوكنات ومثّل نحو ثلثي التكلفة. اختيار النموذج وحده لا يحدد الفاتورة: فوتر مخطّط Fable 5 بمبلغ أقل قليلًا من مخطّط Opus 4.8 رغم أن سعر التوكن الواحد كان أعلى بنحو الضعف، لأنه استخدم عددًا أقل بكثير من توكنات التخطيط. ثم استهلك عماله أضعافًا مضاعفة من التوكنات، فارتفعت تكلفة التشغيل بشكل ملحوظ.
قلّة من الخطوات في مهمة كبيرة تحتاج إلى ذكاء حدّي: التفكيك الأولي، والقرارات التصميمية، وبعض التحكيمات. بمجرد أن يحوّل مخطّط من الطراز الأول الغموض إلى تعليمة صريحة، تحتاج النماذج الأرخص فقط إلى تنفيذها. الغريزة نفسها تظهر في مواضع أخرى من هندسة الوكلاء. نظام توجيه اسمه CodeRescue يستخدم التغذية الراجعة من التنفيذ ليقرر متى يجب على نموذج رخيص إعادة المحاولة، محققًا معدلات حل شبه مثالية بتكلفة تبلغ 35% من تكلفة التصعيد المنهجي.
كيف ترتّبت التهيئات الأربع، كما ورد عن كيرسر:
| المخطّط | العامل | النتيجة المذكورة |
|---|---|---|
| GPT-5.5 | GPT-5.5 | بلغت فاتورة العمال وحدها $9,373 |
| Grok 4.5 | Grok 4.5 | 80% في sqllogictest خلال أربع ساعات؛ الإطار القديم توقف قبل الساعة الثانية |
| Opus 4.8 | Composer 2.5 | مثّل المخطّط نحو ثلثي التكلفة؛ أنهى بنسبة 100% مع 4,645 سطرًا من كود المحرّك |
| Fable 5 | Composer 2.5 | نحو ثلثي المجموعة في الساعة الأولى؛ أنهى بنسبة 100% مع 9,908 أسطر من كود المحرّك |
المواصفة تصبح وحدة العمل
كل قفزة في قدرة النماذج رفعت المستوى الذي يعمل عنده المهندس، كما يرى كيرسر. نقل الإكمال التلقائي المهندسين من سطر إلى سطر، والنماذج المبكرة إلى كتل برمجية، والوكلاء إلى ملفات وميزات. مع الأسراب، تصبح وحدة العمل هي المواصفة: 835 صفحة نثرية تدخل، وقاعدة بيانات تخرج. الجزء النادر كان صياغة النية بدقة كافية. يبدأ السرب في الشبه بمترجم (compiler)، يفكّك الهدف إلى شجرة مهام ويحوّله خطوة بخطوة إلى عمل قابل للتنفيذ. يحافظ المترجم على المعنى في كل خطوة؛ بينما يظل السرب احتماليًا في كل خطوة، ومعظم الآليات التي يصفها كيرسر موجودة لسدّ هذه الفجوة. كان رونالد كوز ليميّز هذا الشكل: تكاليف التنسيق تنمو أسرع من العمل نفسه، لذا تشكّل المؤسسات طبقات محدودة بدلًا من أن يتواصل الجميع مع الجميع.
تبرز آليتان. دليل الميدان (Field Guide) هو مجلد يملكه الوكلاء، ويُحقن ملف index.md الخاص به في كل وكيل عند الإقلاع ضمن ميزانية أسطر. المنطق يقول إن أوزان النماذج مجمّدة، لذا فإن المواقف غير المتوقعة هي بالضبط ما يستحق التوثيق. اختبر كيرسر أيضًا زوايا مراجعة تتراوح من النص الكامل لسجل العامل إلى لا شيء سوى قاعدة الكود، مع مراجعين على نماذج وتدريبات وشخصيات مختلفة. لا تلتقط زاوية واحدة كل شيء، لكن الزوايا غير المترابطة تفوّت أقل، تمامًا كما تتفوق أنظمة القيادة الذاتية على البشر في المجموع دون أي مكوّن مثالي.
تُظهر حاشية سفلية أن البنية التقنية ما تزال هشّة. أراد كيرسر استخدام GPT-5.6 Sol في تهيئته الرئيسية، لكن النموذج الجديد خرج عن السيطرة مع الصياغات الحرفية الملحّة، فعاد إلى GPT-5.5 بدل ضبط نموذج واحد وتحريف المقارنة. مكاسب الإطار مبنية على سلوك نموذجي لا يزال متفاوتًا.
مخرجات تشغيل Opus 4.8 المنفرد متاحة للعموم على github.com/cursor/minisqlite لمن يريد تفكيكها؛ يقول كيرسر إنها تبدو ممتازة للوهلة الأولى ولم يُجرِ مراجعة يدوية أعمق. الخلاصة: انتقل الإطار من العمل بالكاد إلى العمل الموثوق، وهذه الموثوقية حوّلت خلطة النماذج إلى قرار تكلفة بدلًا من رهان على الجودة.
- المصدر : Cursor's swarm rebuilt SQLite from scratch. Same scores, wildly different bills — 2026-07-20
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.