نقاط نهاية الاستدلال
Hugging Face تسحب ذراع البنية التحتية، وليس ذراع النموذج
تجدد Hugging Face خدمة Inference Endpoints الخاصة بها، مع التركيز على سهولة النشر بدلاً من أداء النموذج الخام. تدعم المنصة الآن vLLM وSGLang وllama.cpp والحاويات المخصصة، مع التوسع التلقائي والتسعير حسب الاستخدام. الفكرة: تخطى أعمال العمليات وركز على النموذج.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-24 · قراءة 5 دقائق

قضت Hugging Face سنوات في بناء المستودع الافتراضي للنماذج المفتوحة. يمكنك تصفح أي بنية محولات تقريبًا، وقراءة ورقتها البحثية، والتحقق من درجة لوحة المتصدرين، وتنزيل الأوزان في ثوانٍ. الجزء الذي بقي صعبًا هو ما يحدث بعد تنزيلها.
الحصول على نموذج إلى مرحلة الإنتاج بشكل موثوق، مع التوسع التلقائي والمراقبة وواجهة برمجة تطبيقات مناسبة، يعني امتلاك فاتورة سحابية ومعرفة كافية عن Kubernetes لتكون خطيرًا. خدمة Inference Endpoints من Hugging Face موجودة منذ عام 2022، لكن فريق المنصة عمل بهدوء على سد الثغرات التي منعتها من أن تكون خيارًا افتراضيًا بدلاً من خيار احتياطي.
العرض الأساسي الآن هو طبقة استدلال مُدارة حيث تختار النموذج والإطار (vLLM أو SGLang أو llama.cpp أو TGI أو TEI أو حاوية مخصصة) ونوع نقطة النهاية، وتتعامل المنصة مع الباقي. التوسع التلقائي مدمج، والمراقبة تأتي مع السجلات والمقاييس، والتسعير قائم على الاستهلاك دون التزام مسبق. تصفه الشركة بأنه "ركز على نموذجك، وليس على العمليات."
ما الذي تغير
التغيير الأكثر جوهرية هو اتساع دعم الأطر. الإصدارات المبكرة من Inference Endpoints كانت مرتبطة بإحكام بحاويات Text Generation Inference (TGI) وText Embeddings Inference (TEI) الخاصة بـ Hugging Face. لا تزال هذه مواطنة من الدرجة الأولى، لكن المنصة تشغل الآن vLLM وSGLang وllama.cpp مباشرة، مما يعني أن الفريق الذي قام بتحسين أحد هذه الأطر يمكنه النشر دون إعادة تنفيذ خط أنابيبه.
الحاويات المخصصة تفتح الباب على مصراعيه. إذا كان نموذجك يحتاج إلى حلقة استدلال متخصصة، أو لديك منطق معالجة مسبقة مخصص لا يتناسب مع إطار قياسي، يمكنك إحضار صورة Docker الخاصة بك. تم تجريد طبقة البنية التحتية إلى الحد الذي يمكن أن يكون فيه تعريف نقطة النهاية أمرًا واحدًا hf CLI، أو موجهًا لعامل ترميز يستدعي CLI.
"لا تقلق بشأن Kubernetes أو إصدارات CUDA أو تكوين شبكات VPN،" يقرأ نص المنصة. بالنسبة للفرق التي تركز على النموذج وخفيفة العمليات، هذا التبسيط هو عرض القيمة.

من يستخدمها بالفعل
تسرد Hugging Face العديد من مستخدمي الإنتاج. استخدمت Musixmatch، منصة كلمات الأغاني، Inference Endpoints لنشر واجهة مخصصة، حيث قال عالم البيانات Andrea Boscarino إن التكيف استغرق "بضع ساعات." ادعت Phamily، وهي شركة ناشئة في مجال الرعاية الصحية، أن الخدمة وفرت أسبوعًا من وقت المطور، مشيرًا المهندس الأول Bryce Harlan إلى أن الفريق يقضي الآن كل وقته في البحث والتطوير بدلاً من تكوين AWS.
قامت Pinecone، شركة قواعد البيانات المتجهة، بنشر نموذج يعالج أكثر من 100 طلب في الثانية. قال Gareth Jones، مدير المنتج الأول هناك، إن النشر استغرق "بضع نقرات بالزر." قال مؤسس Waymark Nathan Labenz إن المنصة تضغط الوقت من الاختبار إلى الإنتاج إلى أقل من يوم واحد.
لا تعد أي من هذه حالات حافة، فهي تغطي استخراج المحتوى والرعاية الصحية والبحث المتجه وتكنولوجيا الإعلانات. يشير هذا النطاق إلى أن التجريد يثبت عبر أشكال عبء العمل المختلفة، وهو ما تحتاج الخدمة المُدارة إلى إثباته.
المشهد التنافسي
تقع Inference Endpoints بين فئتين مختلفتين من المنتجات. في جانب، موفرو السحابة الخام، AWS SageMaker وGCP Vertex AI وAzure ML، التي تمنحك التحكم ولكن تتطلب الخبرة. في الجانب الآخر، واجهات برمجة تطبيقات النموذج كخدمة مثل OpenAI وAnthropic وGoogle، التي تجرد كل شيء ولكن تحبسك في عائلة نموذج محددة خلف واجهة برمجة تطبيقات خاصة.
رهان Hugging Face هو أن هناك وسطًا متزايدًا: فرق تريد اختيار نموذجها الخاص، بما في ذلك النماذج المفتوحة، دون بناء مجموعة النشر الخاصة بها. إذا كان هذا الوسط حقيقيًا، فإن الخندق هو Hugging Face Hub، كتالوج أكثر من 900,000 نموذج موجود بالفعل ولديه بالفعل إصدار وبيانات وصفية وواجهة برمجة تطبيقات للتنزيل. تتصل Inference Endpoints مباشرة بهذا الكتالوج.
"تنزيل أوزان النموذج بسرعة وأمان مع تكامل سلس مع Hugging Face Hub" ليست ميزة، بل هي الميزة المعمارية الأساسية. لا يمكن لأي منصة استدلال أخرى ادعاء هذا التكامل لأنه لا توجد منصة أخرى هي مركز النماذج.
ما لم يُقال
لا تذكر صفحة الخدمة مستويات التسعير أو أنواع GPU محددة. تقول "تسعير الدفع حسب الاستخدام" وتشجع المؤسسات على طلب عروض أسعار مخصصة. هذا الغموض شائع في خدمات GPU المدارة، حيث تعتمد التكاليف الحقيقية على خصائص عبء العمل، لكنه يجعل المقارنة المباشرة للتكلفة مع المزودين القائمين على واجهة برمجة التطبيقات أو مثيلات السحابة الخام صعبة دون التسجيل.
لا تعالج الصفحة أيضًا زمن الانتقال للبدء البارد، وهي نقطة ألم معروفة لخدمات الاستدلال ذات التوسع التلقائي. يمكن أن تستغرق النماذج عشرات الثواني للتحميل عند الطلب الأول، اعتمادًا على الحجم، ولدى الخدمة المُدارة بالكامل حوافز لتقليل عدد النسخ المتماثلة الخاملة لتوفير التكلفة. كيفية موازنة المنصة لهذه المقايضات غير موصوفة.
ما يعنيه هذا
لا تتنافس Hugging Face على جودة النموذج. إنها تتنافس على الاحتكاك بين تنزيل النموذج وواجهة برمجة تطبيقات الإنتاج. حدد فريق المنصة أن خطوة النشر هي حيث تتعثر معظم مشاريع النماذج المفتوحة، وInference Endpoints هي الذراع التي يسحبونها لإزالة هذا العائق.
ما إذا كانت هذه الذراع قوية بما يكفي يعتمد على عدد الفرق المستعدة فعليًا لدفع علاوة لمزود مُدار على الحوسبة السحابية الخام، مقابل تشغيل مجموعة vLLM الخاصة بها على مثيل GPU واحد. ولكن بالنسبة للفرق التي وازنت المفاضلة واختارت المسار المُدار، لدى Hugging Face الآن إجابة موثوقة.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.