نماذج الذكاء الاصطناعي
كلود أوبوس 5 يحقق أداءً قريبًا من الحدود الأمامية بنصف التكلفة، مع نقطة عمياء متعمدة في الأمن السيبراني
يطلق كلود أوبوس 5 بنتائج قريبة من فابل في معايير البرمجة والمعرفة بنصف السعر. لكن قدراته الضعيفة عمدًا في الأمن السيبراني تخلق مقايضة واضحة للمطورين.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-24 · قراءة 3 دقائق

كلود أوبوس 5 متاح اليوم، والأرقام مذهلة. في معيار Frontier-Bench v0.1، يتجاوز النموذج كل نموذج آخر تم اختباره، ليضاعف أكثر من ضعف نتيجة سلفه أوبوس 4.8 بتكلفة أقل لكل مهمة. في CursorBench 3.2، يصل إلى أقل من 0.5% من أعلى درجة لفابل 5 بتكلفة نصف التكلفة لكل مهمة. في ARC-AGI 3، وهو تقييم يقيس القدرة على حل المشكلات الجديدة، يسجل أوبوس 5 درجة أعلى بثلاث مرات من أفضل نموذج تالٍ له.
تظل الأسعار كما هي في أوبوس 4.8: 5 دولارات لكل مليون رمز إدخال و25 دولارًا لكل مليون رمز إخراج. وهذا يضع ذكاءً قريبًا من الحدود الأمامية بجزء صغير من سعر فابل 5، مما يجعله النموذج الافتراضي على كلود ماكس وأقوى نموذج على كلود برو.
لكن الأرقام البارزة تأتي مع تحذير. دربت أنثروبيك أوبوس 5 عمدًا على تجنب تطوير القدرات في الهجوم السيبراني. يكتشف النموذج الثغرات بمعدل قريب من ميثوس 5 (شقيقه المتخصص في الأمن السيبراني)، لكنه يكافح لتحويل تلك الثغرات إلى استغلالات عاملة. في معيار OSS-Fuzz، يحدد أوبوس 5 وميثوس 5 الأخطاء بمعدلات متشابهة، لكن درجة تطوير الاستغلال لأوبوس 5 تتأخر كثيرًا.
هذا عن قصد. مصنفات السلامة في أنثروبيك على أوبوس 5 تمنع فحص الثغرات الثنائية، واختبار الاختراق، وتوليد الاستغلال. يتم إعادة توجيه الطلبات المرفوضة إلى أوبوس 4.8 افتراضيًا، ويمكن للمؤسسات الوصول إلى إصدار أقل تقييدًا من خلال برنامج التحقق السيبراني.
| المعيار | أوبوس 5 | فابل 5 | أوبوس 4.8 |
|---|---|---|---|
| Frontier-Bench v0.1 | الأفضل (يتفوق على الجميع) | أقل من أوبوس 5 | أقل من نصف أوبوس 5 |
| CursorBench 3.2 | في حدود 0.5% من فابل 5 | الأعلى | أقل |
| ARC-AGI 3 | 3 أضعاف التالي الأفضل | غير متاح | أقل |
| معدل نجاح Zapier AutomationBench | 1.5 ضعف التالي الأفضل بنفس التكلفة | غير متاح | أقل |
| تطوير استغلال OSS-Fuzz | متأخر كثيرًا عن ميثوس 5 | غير متاح | غير متاح |
في الاستخدام الواقعي، يصف المختبرون الأوائل نموذجًا يفكر قبل أن يتصرف. استخدم أحد المهندسين في شركة تداول أوبوس 5 لبناء خلاصة بيانات سوقية لبورصة جديدة في جلسة واحدة، وهو أمر لم تكمله النماذج السابقة حتى مع إرشادات واسعة. وأعطى مختبر آخر أوبوس 5 دور رئيس الأركان لبيئات تطويره، وقام النموذج ببناء شاشة خاصة به وقاد كل جهاز بشكل مستقل.
يظهر النموذج أيضًا تحققًا ذاتيًا أقوى. عند إعطائه مهمة لا توجد طريقة مباشرة لعرض رسم فيها، كتب خط أنابيب رؤية حاسوبية خاصًا به لاستخراج الهندسة من البكسلات الأولية. وعند طلب إصلاح خطأ في مدير حزم شائع، وجد السبب الجذري وأصلح حالة حافة فاتها إصلاح المجتمع نفسه.
في علم الأحياء والبحث العلمي، يعد أوبوس 5 ترقية واضحة عن أوبوس 4.8، مع تحسينات عبر تقييمات علوم الحياة، خاصة في الكيمياء العضوية والمهام المتعلقة بالبروتينات. ومع ذلك، لا يزال يقصر عن ميثوس 5 في مهام البحث المستقلة الطويلة، والتي تشير إليها أنثروبيك على أنها المنطقة الأكثر خطورة لتطبيقات علم الأحياء.
تقدم أنثروبيك أيضًا ميزتين إلى جانب الإطلاق: تغييرات الأدوات في منتصف المحادثة على منصة كلود (مما يسمح للمطورين بتغيير الأدوات دون إبطال ذاكرة التخزين المؤقت للطلب)، والتراجع التلقائي على واجهة API (يتم توجيه الطلبات المرفوضة إلى نموذج آخر بدلاً من حظرها).
بالنسبة للفرق التي تقرر بين أوبوس 5 وفابل 5، فإن الحساب بسيط: أوبوس 5 يمنحك معظم تفكير فابل بنصف التكلفة، لكنك تفقد الميزة في المهام السيبرانية وبعض أصعب الأبحاث المستقلة. بالنسبة لمعظم أعمال البرمجة والمعرفة، فهو الخيار اليومي الأفضل.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.