الذكاء الاصطناعي الطرفي

وقت تشغيل Audio8 على المعالج فقط يختصر استنساخ الصوت إلى حوالي 1 جيبيبايت من الذاكرة

يشغّل إصدار ONNX Runtime من Audio8 النسخة التجريبية من TTS بحجم 0.6B بالكامل على المعالج: أوزان انحدار ذاتي بصيغة INT4، وترميز صوتي مدمج بتردد 44.1 كيلوهرتز، وبث PCM، ونقطة نهاية متوافقة مع OpenAI. تستهلك الخدمة حوالي 1 جيبيبايت من الذاكرة على حاسوب محمول، ولا حاجة إلى PyTorch أو Transformers أثناء التشغيل.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-08-05 · قراءة 4 دقائق

وقت تشغيل Audio8 على المعالج فقط يختصر استنساخ الصوت إلى حوالي 1 جيبيبايت من الذاكرة
المصادر : Audio8 TTS ONNX…·Audio8-TTS Prev…

إليكم الرقم الأهم في إصدار ONNX Runtime من Audio8 لـ TTS: على جهاز MacBook Air بشريحة Apple M2 وذاكرة 16 جيجابايت، مع خمس خيوط معالجة في ONNX Runtime، تستقر خدمة الاستدلال عند حوالي 1004 ميبيبايت من الذاكرة بعد التحميل، وتصل ذروتها بين 1.1 و1.2 جيبيبايت أثناء التوليف. هذا يعني استنساخ الصوت وتوليد الكلام على معالج حاسوب محمول، دون أي وحدة معالجة رسومات في الصورة. يبلغ حجم ملفات النموذج حوالي 572 ميبيبايت عند التحميل عبر الإنترنت، أو نحو 968 ميبيبايت إذا أضفت مشفر تسجيل الصوت الاختياري.

هذا الإصدار هو الرفيق الذي يعمل على المعالج فقط لنموذج Audio8-TTS-Preview-0.6B-ONNX-INT4، النموذج مفتوح الأوزان الذي أصدرته Audio8 بموجب رخصة Apache 2.0. كان وعد النموذج هو 11 لغة، واستنساخ الصوت بدون تدريب مسبق (zero-shot) من عينة مرجعية قصيرة، وترميز صوتي مدمج بتردد 44.1 كيلوهرتز، مستهدفًا تطبيقات الكلام الطرفية التي تحتاج إلى السرعة والخصوصية. هذا المنفذ من ONNX هو ما يجعل هذا الوعد عمليًا خارج بيئة وحدات معالجة الرسومات: بعد تنزيل الأوزان، لا يحتاج الاستدلال إلى PyTorch ولا Transformers ولا Hugging Face Hub.

ما التكلفة الفعلية لوقت التشغيل

تنقسم الدقة حسب الدور. أوزان الانحدار الذاتي البطيء والسريع، وهي الجزء من النموذج الذي يولّد رموز الترميز الصوتي، هي INT4 للأوزان فقط. تبقى التنشيطات والحالات المخفية وذاكرة KV في FP16، وكذلك مشفر الترميز الصوتي ووحدة فك الترميز. فقط إخراج الشكل الموجي النهائي يكون FP32.

المكوّنالدقة أو استخدام الموارد
أوزان الانحدار الذاتي البطيء/السريعINT4 للأوزان فقط
التنشيطات، الحالات المخفية، ذاكرة KVFP16
مشفر الترميز الصوتي ووحدة فك الترميزFP16
إخراج الشكل الموجيFP32
ملفات النموذج عبر الإنترنتحوالي 572 ميبيبايت
التنزيل الكامل مع مشفر التسجيلحوالي 968 ميبيبايت
الذاكرة بعد التحميل، M2 MacBook Air، 5 خيوطحوالي 1004 ميبيبايت
الذروة أثناء التوليفحوالي 1.1 إلى 1.2 جيبيبايت
الذروة أثناء تسجيل الصوتحوالي 1.55 جيبيبايت

التوليف العادي يحمّل ثلاث جلسات فقط: الانحدار الذاتي البطيء (Slow AR)، والانحدار الذاتي السريع (Fast AR)، ووحدة فك ترميز الترميز الصوتي. الترميز الصوتي المدمج هو جزء من سبب بقاء خط الأنابيب خفيفًا بهذا الشكل: لا يوجد مُولّد صوتي (vocoder) منفصل يجب إضافته. يعمل التوليف على مرحلتين: تصدر نماذج الانحدار الذاتي رموز الترميز الصوتي، وتحوّلها وحدة فك الترميز إلى صوت. يكتب واجهة سطر الأوامر هذه الرموز في ملف .npy بجانب ملف .wav المُخرَج.

تسجيل الصوت يتبع المنطق نفسه. الملف الصوتي هو مجموعة من رموز الترميز الصوتي المستخرجة من تسجيل مرجعي: بطول يتراوح بين 0.5 و30 ثانية، ولا يتجاوز 50 ميبيبايت، وقابل للقراءة بواسطة libsndfile، وتحوّله الخدمة إلى صوت أحادي بتردد 44.1 كيلوهرتز. يجب أن يقترن التسجيل بنصه الحرفي الدقيق. يُحمَّل المشفر فقط لهذه الخطوة، ما يرفع الذاكرة إلى حوالي 1.55 جيبيبايت، ثم يُفرَّغ لتعود جلسات التوليف. ملف README صريح بشأن نقطة الضعف: المراجع الصاخبة أو الطويلة أو سيئة النسخ تقلل الاستقرار وتشابه المتحدث.

مصمم للنشر، لا للعروض التوضيحية

الخبر الهادئ هنا هو ميزانية الاعتماديات. المتطلبات هي Python 3.11 أو أحدث، وواجهة سطر أوامر Hugging Face Hub للتنزيل لمرة واحدة، وهيكل مجلدات ثابت. اختبرت Audio8 الإصدار الحالي على macOS arm64 مع موفر تنفيذ CPUExecutionProvider. ومن هناك، تتحول إلى خدمة HTTP على 127.0.0.1:8024 بثلاث طرق للوصول: صفحة ويب، وواجهة JSON API على /api/tts، ونقطة نهاية متوافقة مع OpenAI على /v1/audio/speech تستجيب بصيغة WAV. يمكن للكود المكتوب بالفعل لتلك الواجهة أن يتوجه إلى نموذج محلي بدلًا من ذلك. يعمل البث عبر /api/tts/stream، الذي يعيد JSON مفصولًا بأسطر جديدة مع صوت PCM بترميز base64 بدقة 16 بت وتردد 44.1 كيلوهرتز، ويوقف /api/tts/cancel أي بث نشط. يغطي سكربت واجهة سطر أوامر الاستخدام النصي، وتُكتب السجلات في service.log.

تسلسل الخدمة طلبات التوليف والتسجيل، وهو مقايضة مقصودة تحدّ من استخدام الذاكرة على حساب التوافقية. يضعها ملف README للاستخدام المحلي ونشر CPU منخفض التوافقية. عدد الخيوط، ومجلد النموذج، ومجلد الأصوات، والمضيف، والمنفذ كلها متغيرات بيئة بقيم افتراضية معقولة، ويوقف سكربت الإيقاف خدمة الخلفية المُدارة.

لحظة النماذج الصغيرة

تصدر Audio8 في فترة تواصل فيها نماذج الكلام الصغيرة تقليص الفجوة مع النماذج الكبيرة. يدّعي Voxtral Realtime، نموذج التعرف على الكلام البثي مفتوح المصدر من إنتاج باحثين، نسخًا بجودة مماثلة لنموذج Whisper من OpenAI بتأخير 480 ميلي ثانية فقط. تقع النسخة التجريبية من TTS بحجم 0.6B تحت عتبة 1B حيث تتجمع معظم نماذج TTS مفتوحة المصدر، وهي تستنسخ صوتًا من عينة قصيرة دون ضبط دقيق. تضغط حركة الأوزان المفتوحة على الحجة نفسها علنًا: دافع 41 موقّعًا مؤخرًا عن النماذج المفتوحة في رسالة. مساهمة Audio8 مختلفة في نوعها: فهي توليدية، تصنع الكلام بدلًا من نسخه، ووقت التشغيل المحلي يُشحن كمكوّن أساسي، لا كفكرة لاحقة.

التحفظات موجودة في البيانات. حوالي 1 جيبيبايت بعد التحميل هو مجموعة عمل تناسب حاسوبًا محمولًا بذاكرة 16 جيجابايت، لا هاتفًا. طابور الطلبات المتسلسل يحد من الإنتاجية عن قصد، وتختلف القياسات بحسب نظام التشغيل وسلوك مُخصِّص الذاكرة في ONNX Runtime، كما يلاحظ ملف README. لكن من الصعب المجادلة في الاتجاه: خط أنابيب يجمع بين الانحدار الذاتي والترميز الصوتي كان يتطلب بيئة وحدات معالجة رسومات قبل وقت ليس ببعيد، وأصبح الآن يعمل على خيوط المعالج مع مساحة فارغة إضافية. استنساخ الصوت محليًا أصبح الآن خيارًا هندسيًا، لا قرارًا ببنية تحتية.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.