التقطير وفق السياسة | دمج EOPD وToDi في عائلة واحدة
نتيجة 33 من 36، تُنشر مع علامة تحفّظ من المؤلفين أنفسهم
عائلة رباعية المعاملات لبوّابة الخسائر لكل رمز في التقطير وفق السياسة تتفوق على خطوط الأساس أحادية القناة في 33 من 36 خلية. ثم يصف المؤلفون إحصاءاتهم الخاصة بأنها دليل اتجاهي، ويصفون تكراراتهم بثلاث بذور بأنها غير معنوية.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-09-20 · قراءة 4 دقائق

ظهرت الورقة في قائمة cs.AI على arXiv في 10 سبتمبر 2026 بعنوان يقول ما تفعله: "A Unified Per-Token Gating Family for On-Policy Distillation: FKL/RKL Mixing with Multi-Channel and Bias Coefficients". وجوهرها معادلة واحدة، lambda_t = sigma(a * h_t + b * u(x) + c + d * gap_t)، وهي تحدد الوزن الذي تحمله خسارة KL الأمامية أو العكسية عند كل رمز أثناء التقطير.
تقارن التجارب معلماً من Qwen3-32B بطالب من Qwen3-4B على TweetEval (Barbieri et al., 2020)، في مهمتي المشاعر والكراهية. وحققت التكوينات المستمدة من العائلة الكاملة رباعية المعاملات دقة أعلى من القيود أحادية القناة المطابقة في المقدار، أي البوّابتين المعتمدتين على الإنتروبيا فقط والفجوة فقط، في 33 من 36 خلية قابلة للمقارنة. وفي تشغيل ثانٍ، تجربة عزل بمطابقة المتوسط على 26 خلية، تقدّمت البوّابة الديناميكية على خطوط الأساس الساكنة المطابقة من حيث KL الفعّال في 19 من 26 خلية.
نظام إحداثيات مشترك، لا بديل
لا يُعد أي من التصميمين الذي تستوعبه العائلة جديداً. يثبّت كل من EOPD (Jin et al., 2026) وToDi (Jung et al., 2025) إشارة بوّابة واحدة واتجاهاً واحداً للبوّابة، ويذكر الملخص صراحةً أن الاثنين لم يُقارَنا مباشرة قط. وفي ظل التوصيف الجديد يظهر كل منهما كقيد أحادي البعد في المعادلة نفسها، وهو ما يسمح لمسح واحد بتغطية الاثنين معاً.
يقدّمه المؤلفون كنظام إحداثيات لا كخلف. وبكلماتهم، يُطرح التوصيف "أساساً كنظام إحداثيات مشترك لمقارنة تصاميم البوّابة لكل رمز في التقطير وفق السياسة لتصنيف المخرجات القصيرة". وما تضيفه العائلة على التصميمين الأقدم هو التركيب متعدد القنوات وتحيز صريح، إلى جانب مزج KL الأمامي/العكسي المذكور في العنوان.
التحفظ الذي كتبه المؤلفون بأنفسهم
يأتي العدّان الرئيسيان من خلايا تشترك في بيانات التدريب والنماذج والبنية الفرعية للمعاملات. ويشير المؤلفون إلى ذلك قبل أن يفعل أي قارئ، فيسجّلون العدّين بوصفهما "دليلاً اتجاهياً تراكمياً استكشافياً لا اختبارات فرضيات مستقلة". وخلايا هذا النوع ليست عينات مستقلة، لذا تصف الأرقام الاتجاه الذي يميل إليه المسح لا مدى موثوقية تكرار النتيجة.
كما عادوا وكرّروا. أُعيد تشغيل المقارنات التسع الرئيسية التي أبرزها المسح الأول بثلاث بذور مقترنة، وأُضيفت مهمة ثالثة، هي الإساءة (offensive). وحافظت الفروق على اتجاهها لكنها تقلّصت: جاء كل أثر مكرّر أصغر من تقدير البذرة الواحدة، ولم يكن أي منها معنوياً عند n = 3.
| كتلة الأدلة | المقارنة | النتيجة | تصنيف المؤلفين أنفسهم |
|---|---|---|---|
| المسح الرئيسي | العائلة الكاملة مقابل القيود أحادية البعد أحادية القناة المطابقة في المقدار (الإنتروبيا فقط، الفجوة فقط) | دقة أعلى في 33 من 36 خلية قابلة للمقارنة | دليل اتجاهي تراكمي استكشافي |
| العزل بمطابقة المتوسط | البوّابة الديناميكية مقابل خطوط أساس ساكنة مطابقة من حيث KL الفعّال | متقدمة في 19 من 26 خلية | دليل اتجاهي تراكمي استكشافي |
| التكرار بثلاث بذور | تسع مقارنات رئيسية، إضافة إلى مهمة الإساءة | متسقة اتجاهياً، وأصغر من تقديرات البذرة الواحدة | غير معنوية عند n = 3 |
أين تقف مقابل EOPD وToDi
ظلّت بوّابة خسائر KL الأمامية والعكسية لكل رمز تقنية معيارية في التقطير وفق السياسة مدة طويلة كافية لتتبلور التصاميم حول إشارات واحدة. والفجوة التي تسدّها هذه الورقة ضيقة وحقيقية: تصميمان من تلك التصاميم لم يوضعا جنباً إلى جنب قط. وما إذا كان ذلك يُعد تقدماً يتوقف على ما أراده القارئ. لا يوجد في الملخص أي ادعاء بالتوصل إلى أحدث ما بلغه المجال، ولا يقول ما إذا أُعيد تشغيل EOPD أو ToDi في ظروف مطابقة أو ما إذا أُعيد إنتاج أرقامهما المنشورة. وكل مقارنة مُبلّغ عنها تندرج داخل هذه العائلة الواحدة، على هذا الثنائي الواحد من المعلّم والطالب.
لذا تُقرأ الورقة كتوحيد مصحوب بمسطرة قياس، لا كتقدّم مُبرهن على أي من السلفين على نطاق واسع. ومع ذلك يبقى للتأطير قيمة، لأن أي تصميم بوّابة يمكن كتابته كمعاملات داخل هذه العائلة يمكن وضعه على المحور نفسه مع البقية.
ما يحصل عليه الفريق فعلاً عند اختيار بوّابة
النطاق هو أول ما ينبغي للممارس التحقق منه. تغطي الأدلة التصنيف قصير المخرجات في ثلاث مهام: المشاعر والكراهية من TweetEval، إضافة إلى الإساءة. وتغطي معلماً واحداً هو Qwen3-32B يُقطَّر إلى طالب واحد هو Qwen3-4B. ولا يُفيد الملخص شيئاً عن التوليد الطويل أو الأعمال المعتمدة على الاستدلال أو عائلات نماذج أخرى، ولا يقول كيف ضُبطت المعاملات ولا كم كلّف المسح من قدرة حوسبة.
ما يحصل عليه الفريق هو طريقة لصياغة اختيار البوّابة بأربعة أرقام بدلاً من تفريع كود تدريب شخص آخر، ما يسهّل مسح الاختيار والإبلاغ مقابله. وما لا يحصل عليه هو حكم بأي إشارة بوّابة تفوز. يصف المؤلفون هامشهم بأنه اتجاهي ويقدّمون الإطار كأداة مقارنة. من يأمل في حكم قاطع بأي بوّابة يعتمدها لن يجد ذلك هنا، والورقة لا تتظاهر بغير ذلك.
- المصدر : A 33-of-36 result, published with the authors' own asterisk — 2026-09-10
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.