TTS مفتوح الأوزان

Magpie TTS يستهلك 32 مللي ثانية من ميزانية زمن استجابة وكيل الصوت الخاص بك

يُفيد Magpie TTS بتحقيق زمن وصول إلى أول صوت يبلغ 32 مللي ثانية على معالج NVIDIA B200، ويضيف العربية والكورية والبرتغالية البرازيلية، ليرفع قائمته إلى 12 لغة. طرح الأوزان المفتوحة: توليف الكلام المستضاف ذاتيًا لم يعد يخسر حجة زمن الاستجابة.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-08-16 · قراءة 4 دقائق

Magpie TTS يستهلك 32 مللي ثانية من ميزانية زمن استجابة وكيل الصوت الخاص بك

التأخير المهم في هذا الإصدار هو 32 مللي ثانية. هذا هو زمن الوصول إلى أول صوت أعلنته NVIDIA لنموذج Magpie TTS على معالج B200، مع قياسات تمت عبر حزمة تقديم NIM، داخل الموقع، بمتوسط ثلاث محاولات. بالنسبة لخط أنابيب صوتي يحتاج إلى نافذة زمنية شاملة أقل من 200 مللي ثانية ليشعر المستخدم بالطبيعية، فإن 32 مللي ثانية شريحة صغيرة من الميزانية في المرحلة الأخيرة من السلسلة.

تدمج نماذج الكلام المتكاملة التعرف والتركيب ونموذج اللغة الكبير خلف استدعاء API واحد. هذه البساطة تأتي على حساب التحكم: لا ضبط دقيق لكل مكوّن، ولا استبدال بنماذج أفضل عند صدورها، ولا خيارات لتوطين البيانات، ورؤية محدودة لمصادر زمن الاستجابة. Magpie هو رد NVIDIA على ذلك؛ نموذج مفتوح الأوزان بعدد 364 مليون معامل يعمل في بيئتك الخاصة، والإطار العام للإصدار هو أنك لم تعد تضحي بالسرعة مقابل الحصول على ذلك.

شريحة بمقدار 32 مللي ثانية من ميزانية أقل من 200 مللي ثانية

زمن الوصول إلى أول صوت، أي الفجوة بين بدء توليد الكلام ووصول الصوت إلى المستخدم، هو المقياس النهائي في خط أنابيب المحادثة. تُظهر جداول قياس NVIDIA، المأخوذة من وثائق أداء TTS NIM للإصدار 26.07، أول صوت يتراوح بين 32 و79 مللي ثانية على تدفق واحد عبر وحدات معالجة الرسوميات الحالية.

GPUTTFA (تدفق واحد)RTFX (تدفق واحد)TTFA (64 تدفقًا)RTFX (64 تدفقًا)
B20032 ms12.1x239 ms319.81x
H10047 ms14.7x275 ms290.79x
DGX Spark53 ms9.8x962 ms75.88x
A10079 ms12.2x395 ms197x

المصدر: وثائق أداء NVIDIA TTS NIM (الإصدار 26.07)، متوسط ثلاث محاولات، داخل الموقع. TTFA هو زمن الوصول إلى أول صوت؛ RTFX هو الإنتاجية كمضاعف للوقت الفعلي.

تحفظان ينبغي وضعهما بجانب هذه الأرقام. الأول أنها قياسات من البائع نفسه، والثاني أنها صادرة عن حاوية NIM المحسّنة وليس عن نقطة التفتيش الخام على Hugging Face. وفقًا لـ NVIDIA، فإن نقطة التفتيش المفتوحة هي النموذج نفسه، وهي المسار المناسب للبحث والضبط الدقيق؛ أما NIM فهي حزمة التقديم المضبوطة التي تنتج أزمنة الاستجابة في بيئات الإنتاج. ويتغير المشهد أيضًا مع العتاد: DGX Spark، النظام من فئة أجهزة المكتب، ينخفض إلى 9.8 أضعاف الوقت الفعلي على تدفق واحد وإلى 962 مللي ثانية تحت حمولة 64 تدفقًا، بينما يظل B200 أعلى من 300 ضعف الوقت الفعلي حتى مع 64 تدفقًا متزامنًا.

تكديس الإطارات، والمقايضة الكامنة خلفه

للسرعة آلية. تتنبأ وحدة فك التشفير بإطارين صوتيين لكل خطوة فك تشفير بدلاً من إطار واحد، ما يخفض عدد تكرارات فك التشفير إلى النصف. وهذا وحده قد يضر بالجودة لأن رموز كتاب الأكواد المتزامنة تُدخل تبعيات، لذا يقوم محول محلي بنمذجة هذه التبعيات واستعادة الصوت. تصف NVIDIA هذا التصميم في ورقة بحثية مقدمة إلى ICASSP 2026 بعنوان Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation.

نتائج الجودة التي ينشرها هذا الإصدار فعليًا متباينة، وهذا الجزء من القصة يتجاوزه سرد NVIDIA نفسه. ينخفض معدل خطأ الأحرف في الفرنسية من 2.70% إلى 1.54%، مع ارتفاع تشابه المتحدث. وتتحسن الإسبانية من 1.14% إلى 0.60% في معدل خطأ الأحرف. أما الألمانية فهي الاستثناء: ارتفع معدل خطأ الأحرف من 0.66% إلى 0.80% حتى مع صعود التشابه من 0.626 إلى 0.742.

اللغةCER (السابق)CER (هذا الإصدار)SSIM (السابق)SSIM (هذا الإصدار)
الفرنسية2.70%1.54%0.7030.747
الإسبانية1.14%0.60%0.7150.793
الألمانية0.66%0.80%0.6260.742

المصدر: بطاقة نموذج Magpie TTS متعدد اللغات. انخفاض CER أفضل؛ وارتفاع SSIM أفضل. تصل اللغات الجديدة بمعدلات خطأ أحرف أساسية تبلغ 1.62% (العربية)، و2.69% (الكورية)، و2.91% (البرتغالية البرازيلية).

اثنتا عشرة لغة، ثلاث منها جديدة

تصل العربية الفصحى الحديثة والكورية والبرتغالية البرازيلية بهذه المعدلات الأساسية الأولى. تحصل كل لغة على أصوات ذكورية وأنثوية عبر تمثيل مشترك للمتحدث متعدد اللغات. كما يمتد تبديل اللغات (Code-switching) إلى الهندية واليابانية، بفضل معالجة تحويل الغرافيم إلى أصوات وفقًا للأبجدية الصوتية الدولية وقواميس نطق مخصصة، تستهدف الأسماء والمصطلحات التقنية داخل الجمل المختلطة اللغات.

حجة الأوزان المفتوحة، دون العلامة النجمية

الادعاء الأوسع يتعلق بمكان تشغيل الذكاء الاصطناعي الصوتي. دعم العملاء العالمي، ومساعدو المؤسسات، والتوثيق الطبي، وأتمتة التجزئة يحتاجون بشكل متزايد إلى عدة لغات بزمن استجابة منخفض، والأوزان المفتوحة تتيح للمطورين النشر حيث توجد البيانات، بما في ذلك البيئات المعزولة عن الشبكة، ثم ضبط النطق والأصوات بدقة عبر NVIDIA NeMo وقياس زمن الاستجابة على أجهزتهم الخاصة.

ولطالما كانت الحجة المضادة هي الوقت: أسرع طريق إلى عرض تجريبي يعمل هو حزمة مدارة. تشير مقارنتنا لحزم الصوت لعام 2026 إلى أن مسار OpenAI Realtime يوصلك إلى عرض تجريبي بأسرع وقت، مقابل الارتباط بنموذج واحد، وأن ElevenLabs تظل المعيار الإنتاجي في طبقة الصوت، بزمن وصول منخفض إلى أول صوت يُضاف فوق زمن استجابة نموذج اللغة الكبير نفسه. يهاجم Magpie هذا الاعتراض في زمن التشغيل: عند 32 مللي ثانية على أجهزة تملكها، لم يعد زمن الاستجابة سببًا لتسليم توليد الكلام إلى خدمة مدارة.

من TTS إلى وكيل صوتي كامل

تضع NVIDIA أيضًا Magpie كطبقة واحدة ضمن منظومة. يجمع مثال مطوّر وكيل الصوت Nemotron بينه وبين Nemotron Speech للتعرف المتدفق، ونماذج Nemotron اللغوية ومتعددة الوسائط للاستدلال، وNIM وNeMo للتقديم والتخصيص، مع أنماط مرجعية لمحادثات الاقتحام (barge-in)، ووكلاء مدعومين بالرؤية، وزمن استجابة شامل أقل من ثانية. تتوفر الأوزان المفتوحة على Hugging Face بموجب رخصة نماذج NVIDIA المفتوحة، مع عروض توضيحية على NVIDIA Build وبطاقة النموذج.

لا شيء من هذا يحسم مسألة الثقة. الأرقام هي أرقام NVIDIA نفسها، وقِيست على حزمتها، والخطوة الصادقة لأي فريق يهتم بزمن الاستجابة هي إعادة إنتاجها على وحدات معالجة الرسوميات الخاصة به. هذه هي النقطة، لا الإصدار نفسه: فمع الأوزان المفتوحة، يصبح المعيار شيئًا يمكنك تشغيله فعليًا.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.