أبحاث الذكاء الاصطناعي · معايير المخرجات المهيكلة

LFM2.5-350M يربح 14 نقطة في JSON. وبالكاد تحرك YAML

رفعت جولة GRPO من 100 خطوة LFM2.5-350M من 22.6% إلى 29.7% على معيار مخطط IFStruct. ربح JSON 14 نقطة، وربح YAML 0.3، وبالكاد تحرك نمط الفشل المهيمن.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-09-17 · قراءة 5 دقائق

LFM2.5-350M يربح 14 نقطة في JSON. وبالكاد تحرك YAML

قفزة السبع نقاط، و70% التي لا تزال تفشل

شغّلت جولة الأساس LFM2.5-350M من LiquidAI عبر llama.cpp بصيغة BF16، واختبرته أمام جميع بنود اختبار IFStruct البالغ عددها 2,000. اجتاز 452 منها، أو 22.6%، بمتوسط زمن استجابة 1,453 مللي ثانية. تشير مدونة إصدار IFStruct إلى 21.1% للنموذج نفسه، وهو قريب بما يكفي ليعيد الدفتر استخدام الرقم المحلي كخط أساس ثابت: كل رقم بعد هذه النقطة يأتي من حزمة تقديم متطابقة، لذا تقيس المقارنة التدريب لا البنية التحتية.

ثم جاءت 100 خطوة GRPO على نحو 500 عينة تدريب. اجتازت نقطة التحقق المدمجة 594 من 2,000، أو 29.7%، عند 1,518 مللي ثانية. هذا مكسب 7.1 نقاط، ولا يزال النموذج المضبوط يعيد شيئًا يرفضه المُقيّم نحو سبع مرات من كل عشر.

يكشف إحصاء الأخطاء أين تكمن تلك الإخفاقات. تهيمن على كلتا الجولتين شكوى واحدة: "حقل مطلوب مفقود"، سُجلت 7,228 مرة على النموذج الأساسي و7,331 مرة بعد التدريب. ارتفعت أعداد العناصر الخاطئة من 738 إلى 890، وعدم تطابق الأنواع من 540 إلى 555. لكن نوعين من الأخطاء يختفيان. سجّلت جولة الأساس 317 كتلة كود غير مغلقة و170 كتلة كود مفقودة؛ ولا يظهر أي منهما في إحصاء الجولة المضبوطة، وهو النتيجة التي صُمم الموجّه لإنتاجها.

لماذا يحصل الامتثال للمخطط على لوحة نتائج خاصة به

المخرجات المهيكلة من أكثر الأشياء الشائعة التي يطلب الناس من نموذج لغوي القيام بها، ومن أقلها قياسًا بحد ذاتها. تدمج معظم المجموعات الصلاحية في درجة أوسع للاستدلال أو الاستخلاص، لذا فإن نموذجًا ينتج الإجابة الصحيحة في شكل غير قابل للتحليل قد يحصل على الدرجة نفسها التي يحصل عليها نموذج لم يجد الإجابة أصلًا. يقيس IFStruct الشكل. يختبر ما إذا كان الناتج صالحًا وقابلًا للتحليل ومطابقًا للمخطط المطلوب، وهو السؤال الذي يحدد ما إذا كان يمكن ربط نموذج بنظام لاحق على الإطلاق.

أداة الاختبار ومجموعة البيانات مفتوحتان: الكود موجود في مستودع Liquid4All/ifstruct، والإصدار 1.0 من مجموعة البيانات منشور باسم LiquidAI/ifstruct-v1.0. يوضح المصدر صراحة أن هذا الدفتر ليس خط الأنابيب الذي يقف خلف نموذج RL في مدونة IFStruct، وأنه لا يحاول إعادة إنتاج الدرجة المنشورة. إنه برهان على أن الضبط الدقيق الضيق والمحدد بالمهمة يمكن أن يدفع نموذجًا صغيرًا نحو أداء نموذج أكبر منه بكثير.

ستة ملايين معامل قابل للتدريب على وحدة GPU من الطبقة المجانية

كل ذلك يتسع على وحدة GPU من الطبقة المجانية بسعة 16 جيجابايت في Colab أو Kaggle. تأتي بيانات التدريب من nvidia/Nemotron-RL-instruction_following-structured_outputs، وهي مجموعة تقرن كل موجّه بمخطط JSON مستهدف وعدد حقول متوقع؛ استُخدمت نحو 500 عينة. المحوّل LoRA برتبة 16 مع alpha 32، ولأن LFM2.5 يشغّل بنية هجينة من الانتباه والالتفاف، فإنه يستهدف أسماء وحدات خاصة بذلك التصميم: q_proj وk_proj وv_proj وout_proj وin_proj وw1 وw2 وw3. يدرّب ذلك نحو 6 ملايين معامل، أي حوالي 1.66% من النموذج.

لا يتطابق توزيع Nemotron مع توزيع IFStruct، لذا عُدّلت الموجّهات أولًا. أُضيفت تعليمة كتلة كود محاطة بأسوار إلى أربعين بالمئة منها. وأُعيدت كتابة 20% منفصلة، لا تتداخل مع تلك المجموعة، كمهام مصفوفة على المستوى الأعلى مع عدد عناصر مطلوب. التغيير الثاني هو مصدر نتائج القائمة المجردة لاحقًا.

تقيّم ثلاث دوال مكافأة كل إكمال على مقياس من 0 إلى 1. يمنح json_format_reward ائتمانًا كاملًا للشكل المطلوب، و0.2 لإجابة قابلة للتحليل في شكل خاطئ، ولا شيء لمخرجات لا يمكن تحليلها. يمنح field_count_reward 1.0 لعدد حقول دقيق على المستوى الأعلى، ويتضاءل خطيًا مع انحراف العدد. يحصي schema_validation_reward انتهاكات القيود ويشترط ائتمانًا جزئيًا بناءً على عدد المفاتيح المطلوبة الموجودة. وهي تتحد في مجموع مرجح قدره 1.0 و0.5 و2.0، ما يضع وزنًا مضاعفًا لصلاحية المخطط مقارنة بالشكل وحده. يجري التدريب عند حرارة 1.1 مع عقوبة KL قدرها 0.01 مقابل النموذج المرجعي.

تشكّل ميزانية 16 جيجابايت خيارات أخرى أيضًا. الإكمالات محدودة بـ 1,024 رمزًا، وهو ليس سخيًا لـ JSON المتداخل، ويفيد المؤلف بأن نسبة الإكمالات المقتطعة بقيت قرب الصفر طوال الجولة.

الانحدارات المختبئة داخل المتوسط

مجموعة IFStructالأساسمضبوط بـ GRPOالتغيير
الإجمالي22.6%29.7%+7.1
JSON18.0%31.9%+13.9
YAML27.2%27.5%+0.3
مفتاح الغلاف28.5%29.7%+1.2
قائمة مجردة16.6%29.7%+13.1

عند التقسيم حسب التنسيق المطلوب، تضاعفت تقريبًا معدلات نجاح JSON بينما بقي YAML ثابتًا. وعند التقسيم حسب البنية على المستوى الأعلى، قفزت القوائم المجردة من 16.6% إلى 29.7%، وتسللت كائنات مفتاح الغلاف من 28.5% إلى 29.7%. يتتبع هذا النمط توسيع الموجّهات مباشرة، لأن مخرجات القائمة المجردة هي بالضبط ما أُعيدت كتابة 20% من موجّهات التدريب لتعليمه.

نوع الكيانالأساسمضبوط بـ GRPOالتغيير
مشهد سيناريو17.4%37.0%+19.6
أمثلة محلل السجلات29.2%45.8%+16.6
دفعة تذاكر الدعم37.0%49.3%+12.3
حجز تذاكر الفعالية45.8%57.9%+12.1
مقطع نص المقابلة26.2%16.2%-10.0
مراجعة كاميرا7.2%6.0%-1.2

تتأرجح النتائج على مستوى الكيان بقوة أكبر في الاتجاهين. تراجعت مراجعات الكاميرا من ست نجاحات إلى خمس من أصل 83 بندًا، وهبطت مقاطع نص المقابلة عشر نقاط. أضعف خمسة أنواع كيانات هي نفسها قبل التدريب وبعده، لكن بإعادة ترتيب فقط: recipe وgpu_review وcamera_review وcustomer_email_thread وconference_schedule تحتل قاع كلتا الجولتين. تضاعف recipe أكثر من الضعف، من 4.3% إلى 10.0%، ولا يزال ينتهي قرب القاع. ومهما علّمت إشارة المكافأة، فإنها لم تعلّم المهام التي كانت الأصعب أصلًا.

المقارنة المهمة هي التي يرسمها المصدر. يحل النموذج المضبوط 350M دون Qwen3.5-2B عند 33.15%، وهو نموذج أكبر منه عدة مرات. إغلاق معظم فجوة بهذا الاتساع باستخدام 6 ملايين معامل قابل للتدريب و100 خطوة هو الحجة. ويقع التحفظ بجانبها مباشرة. يكافئ IFStruct الشكل، والشكل هو ما يمكن لإشارة مكافأة ضيقة أن تشتريه. الحقول المطلوبة المفقودة البالغة 7,331 في الجولة المضبوطة لم تكن الهدف قط.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.