TTS مفتوح المصدر
نموذج TTS الجديد من Audio8 ينسخ الأصوات في 11 لغة مجانًا
تصدر Audio8 الإصدار التجريبي Audio8-TTS بموجب ترخيص Apache 2.0، وهو نموذج بحجم 0.6 مليار معلمة يدعم 11 لغة واستنساخ الأصوات بدون تدريب مسبق، مع برنامج ترميز صوتي مضمن بتردد 44.1 كيلوهرتز. يستهدف الإصدار تطبيقات الكلام الطرفية التي تحتاج إلى سرعة وخصوصية.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-30 · قراءة 1 دقائق

نموذج Audio8 الجديد يزيل الحدود بين التوليف الصوتي السحابي والمحلي. أُعلن اليوم، يحزم Audio8-TTS Preview 0.6 مليار معامل، واستنساخ الصوت بصفر عينة عبر 11 لغة، وترميز صوتي مدمج بتردد 44.1 كيلوهرتز، كل ذلك بموجب Apache 2.0، متوافقًا مع حركة الأوزان المفتوحة التي دافع عنها 41 موقعًا في رسالة عامة.
بـ 0.6 مليار معامل، يعمل النموذج على أجهزة المستهلك ويستنسخ الصوت من عينة قصيرة دون ضبط دقيق. تصفها Audio8 بأنها حزمة واحدة لتطبيقات الكلام التي تحتاج إلى سرعة ووصول وخصوصية. التشغيل المحلي يعني عدم مغادرة الصوت للجهاز، وهي ميزة خصوصية تزداد الحاجة إليها في النشر المؤسسي، كما نُوقش في مقارنة استراتيجيات البنية التحتية للذكاء الاصطناعي.
نماذج الكلام الصغيرة تلحق بالركب بسرعة. Voxtral Realtime، نموذج ASR مفتوح المصدر للبث المباشر، طابق جودة Whisper بتأخير 480 مللي ثانية في وقت سابق هذا العام. Qwen2.5-Omni من علي بابا يعمل على هاتف. Cosmos 3 Edge من Nvidia يحزم نمذجة العالم في 4 مليارات معامل للمهام المحلية، محتلًا المرتبة الأولى في VANTAGE-Bench ضمن فئة حجمه. نموذج Audio8 توليدي: ينتج الكلام بدلاً من نسخه. بـ 0.6 مليار معامل، يبقى تحت علامة 1 مليار حيث تقع معظم نماذج TTS المفتوحة، ويعمل الاستنساخ بصفر عينة من الإنجليزية إلى الماندرين.
الترميز المدمج 44.1 كيلوهرتز يلغي الحاجة إلى جهاز ترميز صوتي منفصل ويقدم مخرجات نظيفة افتراضيًا. The
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.