الذكاء الاصطناعي

زمن استجابة 480 مللي ثانية، دقة بمستوى Whisper، وصفة مفتوحة، كاناري من نفيديا يعيد تعريف التعرف على الصوت في الوقت الفعلي

نماذج Nemo Canary من إنفيديا تحقق دقة على مستوى Whisper في معيارَي LibriSpeech وCommon Voice مع بث بزمن استجابة 480 مللي ثانية. يتضمن الإصدار مفتوح المصدر نصوص التدريب والأوزان، مما يجعله منافسًا نادرًا قابلًا لإعادة الإنتاج في مجال التعرف على الكلام اللحظي.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-26 · قراءة 2 دقائق

زمن استجابة 480 مللي ثانية، دقة بمستوى Whisper، وصفة مفتوحة، كاناري من نفيديا يعيد تعريف التعرف على الصوت في الوقت الفعلي
المصادر : NVIDIA Nemo Can…

كان Whisper المعيار للنسخ منذ عام 2022، لكن تصميمه غير المتصل يعني الانتظار حتى انتهاء الجملة الكاملة. نماذج نيمو كاناري من نفيديا، التي صدرت مفتوحة المصدر هذا الأسبوع، تدعي مطابقة دقة Whisper أثناء البث بزمن استجابة 480 مللي ثانية.

الهندسة المعمارية: لماذا لم يعد البث مؤلماً

يستخدم كاناري محول FastConformer مع مفكك رموز متعدد الرموز يتنبأ بستة رموز لكل خطوة. هذا التصميم، الشائع في توليد الصور ولكنه نادر في التعرف على الصوت، يتيح للنموذج إصدار وحدات فرعية للكلمات بشكل أسرع دون انتظار النافذة الصوتية الكاملة. يسمح مفكك رموز قابل للتحفيز للمستخدمين بالتحكم في نمط الإخراج، وعلامات الترقيم، والأحرف الكبيرة، والتنبؤ بالطوابع الزمنية، دون إعادة تدريب.

تتضمن العائلة ثلاثة أحجام: Canary-180M وCanary-1B وCanary-1B-Code. تدعم متغيرات 1B أربع لغات (الإنجليزية والألمانية والفرنسية والإسبانية) وتتضمن وضع تبديل الرموز للتدفقات ثنائية اللغة. يضحي نموذج 180M ببعض الدقة مقابل السرعة، مستهدفاً الأجهزة الطرفية، وهو نمط يُرى في نماذج أخرى موجهة للأجهزة الطرفية مثل Mistral Nano.

المعايير: مطابقة Whisper وجهاً لوجه

على LibriSpeech النظيف، يسجل Canary-1B معدل خطأ في الكلمات بنسبة 1.9%، مطابقاً لـ Whisper المتوسط وضمن 0.3% من Whisper الكبير. على Common Voice الإنجليزية، تضيق الفجوة أكثر: Canary-1B بنسبة 5.8% WER مقابل Whisper الكبير بنسبة 5.6%. زمن استجابة البث، المُقاس من طرف إلى طرف، هو 480 مللي ثانية، تقريباً الوقت اللازم لنطق كلمة "hello". يحتاج Whisper الكبير إلى 3.2 ثانية على نفس وحدة معالجة الرسوميات، فجوة تسلط الضوء على الاتجاهات حيث تتنافس النماذج الأصغر مع الأكبر من خلال التحسين التكراري.

النموذجLibriSpeech النظيف WER (%)Common Voice الإنجليزية WER (%)زمن الاستجابة (مللي ثانية)
Canary-1B1.95.8480
Whisper medium1.96.22600
Whisper large1.65.63200

قابلية التكرار كعامل تمييز

أرقام الدقة مثيرة للإعجاب. ما يهم أكثر للمجتمع هو أن نفيديا نشرت وصفة التدريب الكاملة داخل إطار NeMo، بما في ذلك خطوات معالجة مجموعة البيانات. أغفلت ورقة Whisper تلك التفاصيل، مما جعل من الصعب على المجتمع التحقق أو التحسين. تدريب كاناري قابل للتكرار من الصفر، وهي نقطة تتماشى مع الجهود لـ تبسيط البنية التحتية للنشر.

"أردنا إظهار أن التعرف على الصوت المتطور لا يتطلب سحراً أسود"، حسبما ورد في الـPDF. "كل ملف تكوين موجود في NeMo." هذا الادعاء، إذا تم التحقق منه، يقلل من العمل الأولي للفرق التي تحتاج إلى ضبط دقيق خاص بمجال معين، طبي، قانوني، أو كلام ذي لكنة، دون البدء من الصفر.

ما هو مفقود

يغطي كاناري أربع لغات فقط. يدعم Whisper 99 لغة. وضع تبديل الرموز يقتصر على الإنجليزية مقترنة بلغة أخرى واحدة، وليس مزيجاً متعدد اللغات حقيقياً. كما أن زمن الاستجابة 480 مللي ثانية يفترض وجود وحدة معالجة رسوميات واحدة بحجم دفعة 1؛ عمليات النشر الإنتاجية على الأجهزة المشتركة غالباً ما تمدد هذه الأرقام.

ومع ذلك، أصبح لدى مجتمع المصادر المفتوحة الآن بديل موثوق للبث لـ Whisper، يطابق الرائد في الدقة مع تقليل زمن الاستجابة بعامل ستة. الاختبار التالي سيكون ما إذا كان المجتمع سيتبناه ويوسعه، متبعاً مسار نماذج الوزن المفتوح الأخرى التي وصلت إلى اعتماد واسع.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.