التعرف على الكلام
4 published articles
أبحاث الذكاء الاصطناعي
«ذاكرة الصوت» (Voice Memory): ملف بحجم 776 بايت يخبر التعرف على الكلام متى لا يفعل شيئًا
طريقة جديدة تعتمد على الاستنتاج فقط في التعرف على الكلام تتعلم ضبط النفس: مُصحِّح مجمَّد يقرأ ملف ذاكرة خاصًا بكل مجال ويقرر متى يمتنع عن التصحيح. التصحيح غير المقيد يكسر الرموز الصحيحة في ما يصل إلى 64% من التعديلات؛ وتخفض «ذاكرة الصوت» (Voice Memory) هذه النسبة إلى 35%، مع خفض معدل خطأ الكلمات الموزون من 8.36% إلى 7.52%.
2026-08-06
الذكاء الاصطناعي
زمن استجابة 480 مللي ثانية، دقة بمستوى Whisper، وصفة مفتوحة، كاناري من نفيديا يعيد تعريف التعرف على الصوت في الوقت الفعلي
نماذج Nemo Canary من إنفيديا تحقق دقة على مستوى Whisper في معيارَي LibriSpeech وCommon Voice مع بث بزمن استجابة 480 مللي ثانية. يتضمن الإصدار مفتوح المصدر نصوص التدريب والأوزان، مما يجعله منافسًا نادرًا قابلًا لإعادة الإنتاج في مجال التعرف على الكلام اللحظي.
2026-07-26
الذكاء الاصطناعي مفتوح المصدر
480 مللي ثانية ومفتوح المصدر: Voxtral Realtime يتحدى Whisper على أرضها
Voxtral Realtime يطابق جودة النسخ غير المتصل بزمن استجابة أقل من ثانية وهو مفتوح المصدر. يستخدم النموذج الذي يدعم 13 لغة مشفرًا صوتيًا سببيًا جديدًا ويتم تدريبه بشكل شامل للتدفق بدلاً من تكييفه من أنظمة غير متصلة.
2026-07-17
الذكاء الاصطناعي
نموذج الصوتي الجديد من إنفيديا يقوم بخمس مهام في وقت واحد ويتفوق على المتخصصين في مجالهم
أودكس من إنفيديا يوحد فهم الصوت وتوليده والاستدلال النصي في نموذج واحد، متفوقًا أو معادلاً للأنظمة المتخصصة في المهام الصوتية ومعايير الكلام دون التضحية بأداء النص.
2026-07-09