أبحاث الذكاء الاصطناعي

«ذاكرة الصوت» (Voice Memory): ملف بحجم 776 بايت يخبر التعرف على الكلام متى لا يفعل شيئًا

طريقة جديدة تعتمد على الاستنتاج فقط في التعرف على الكلام تتعلم ضبط النفس: مُصحِّح مجمَّد يقرأ ملف ذاكرة خاصًا بكل مجال ويقرر متى يمتنع عن التصحيح. التصحيح غير المقيد يكسر الرموز الصحيحة في ما يصل إلى 64% من التعديلات؛ وتخفض «ذاكرة الصوت» (Voice Memory) هذه النسبة إلى 35%، مع خفض معدل خطأ الكلمات الموزون من 8.36% إلى 7.52%.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-08-06 · قراءة 4 دقائق

«ذاكرة الصوت» (Voice Memory): ملف بحجم 776 بايت يخبر التعرف على الكلام متى لا يفعل شيئًا

لسنوات، كانت الطريقة المعتادة لتنظيف مخرجات التعرف على الكلام هي تمرير النص المكتوب إلى نموذج توليدي ثانٍ والسماح له بإصلاح ما أخطأ فيه النموذج الأول. تطرح «ذاكرة الصوت» (Voice Memory)، الطريقة الجديدة القائمة على الاستنتاج فقط والموصوفة في ورقة بحثية منشورة على Hugging Face، حجة مختلفة: يحتاج المُصحِّح إلى معرفة متى يترك النص كما هو، والطريقة لتعليمه ذلك هي ملف نصي.

عند تركه دون قيود، يبالغ التصحيح التوليدي للأخطاء في التصحيح. ففي الأخبار المالية، يفسد ما يصل إلى 64% من تعديلاته رموزًا كانت صحيحة بالفعل. بعبارة أخرى، كانت حلقة التصحيح تنتج ضررًا أكبر من الأخطاء التي كان من المفترض أن تُصلحها.

كيف يعمل تقسيم المستمع-والمفكر

تبني «ذاكرة الصوت» على إطار عمل النمذجة اللغوية الكلاسيكي للتعرف التلقائي على الكلام بما تسميه الورقة بنية «المستمع-والمفكر» (listener-thinker architecture). المستمع هو وحدة فك ترميز مجمَّدة تنتج الفرضية. المفكر هو مُصحِّح مجمَّد يقرأ ملف ذاكرة واحدًا خاصًا بالمجال، memory.md، ويقرر لكل جملة صوتية ما إذا كان يعيد كتابة الفرضية أم يمتنع ويُبقي النتيجة الأفضل الأولى (1-best). الدوران مرتبطان فقط عبر الذاكرة؛ ولا تتغير أي أوزان في أي مكان في الحلقة.

تحديث الذاكرة مهمة منفصلة وغير متزامنة. يُراجع مُحسِّن مُوجَّه بالدرجات (score-gated optimizer) الملف عبر تعديلات محدودة النطاق، ولا يقبل تعديلًا إلا إذا حسّن بشكل صارم درجة على بيانات محجوزة (held-out score). على كل مراجعة أن تبرر نفسها مقابل تلك الدرجة قبل أن تبقى. ولأن المهارة المكتسبة تكمن في ملف نصي وليس في معاملات (parameters)، تظل قابلة للتدقيق والنقل. ذاكرة Wall Street Journal المنشورة حجمها 776 بايت.

ماذا تقول الأرقام

عبر عشرة مجالات من HyPoradise مع مُصحِّح مفتوح، تخفض «ذاكرة الصوت» معدل خطأ الكلمات الموزون من 8.36% إلى 7.52%، أو إلى 7.47% مع إضافة ثلاثة أمثلة في السياق، دون أن ينخفض أي من مجموعات البيانات إلى ما دون خطها الأساسي 1-best. هذا الحد الأدنى بنيوي: فعندما يمتنع المُصحِّح عن التصحيح، تمر الفرضية الأصلية 1-best دون أي تغيير.

الحالةالخط الأساسيمع «ذاكرة الصوت»
معدل خطأ الكلمات الموزون، عشرة مجالات من HyPoradise8.36%7.52%
أوامر السفر الجوي8.40%3.40%
كلام بعيد المدى صاخب CHiME-412.69%10.46%
التعديلات التي تفسد رموزًا صحيحة64%35%

تتركز المكاسب حيث تكون مساحة التحسين القابلة للاسترداد أكبر. تتحسن أوامر السفر الجوي من 8.40% إلى 3.40%. معيار CHiME-4، معيار الكلام الصاخب بعيد المدى، ينتقل من 12.69% إلى 10.46%. أما بقية القصة فهي ضبط النفس: التصحيح التوليدي غير المقيد يكسر الرموز الصحيحة في ما يصل إلى 64% من تعديلاته في الأخبار المالية، وتخفض «ذاكرة الصوت» هذه النسبة إلى 35%.

ضبط النفس هو المهارة الفعلية

ملخص المؤلفين أنفسهم صريح: «المهارة التي تتعلمها الحلقة في الغالب هي ضبط النفس». ملف الذاكرة لا يجعل المُصحِّح أكثر ذكاءً؛ بل يمنحه سببًا لعدم فعل أي شيء. هذا الامتناع هو الآلية الكامنة خلف المكاسب، ولا يكلف شيئًا في وقت الاستنتاج: «ذاكرة الصوت» تضيف صفر معاملات إلى مسار الاستنتاج. كما تنتقل الذاكرة عبر عائلات المُصحِّحات، لذا يمكن إعادة استخدام ملف مجال جرى تعلمه مع مُصحِّح واحد مع مُصحِّح آخر. هذه القابلية للنقل نتيجة مباشرة لإبقاء السياسة في نص بدلًا من أوزان.

جدير بالذكر وجود حدّين. المواد المنشورة لا تسمي نموذج المُصحِّح، فقط تشير إلى أنه نموذج مفتوح. وتستند الأدلة إلى عشرة مجالات من HyPoradise، وليس إلى حركة إنتاج فعلية.

إلى ماذا يشير ملف بحجم 776 بايت

تؤطر الورقة الطريقة على أنها «تعرف وكيلي على الكلام» (agentic speech recognition): يعمل المُصحِّح كعامل (agent) يقرأ ذاكرة ويقرر لكل جملة صوتية ما إذا كان سيتدخل أم لا. وضع السياسة المتعلمة في ملف memory.md نصي عادي بدلًا من الأوزان له نتيجة عملية لأي خط أنابيب يشغّل نموذجًا ثقيلًا ثانيًا على نصوصه المكتوبة: البوابة هي ملف، وهذا الملف أصغر من معظم كتل الإعدادات. نشر المؤلفون أيضًا عرضًا توضيحيًا تفصيليًا وكودًا نموذجيًا، مع النموذج وذاكرات المجالات على Hugging Face.

الجزء المحرج في هذه النتيجة هو مدى تشابهها مع الفطرة السليمة. رد الفعل التلقائي في هذا المجال هو التصحيح بقوة أكبر، بنماذج أكبر. «ذاكرة الصوت» تفعل العكس. يظل المُعرِّف (recognizer) والمُصحِّح مجمَّدين، مرتبطين فقط عبر ملف يتسع في كيلوبايت واحد، ولا يُعتمد أي تعديل إلا عندما تثبت درجة على بيانات محجوزة أنه مفيد. بناءً على هذه الأدلة، أكثر قدرة قيّمة يمكن أن يتعلمها ذكاء اصطناعي للكلام هي معرفة متى يقول «لا».

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.