توليد الصور
أداة Qwen-Image-3.0 من علي بابا تحول عرض النص إلى حجة إنتاجية
أطلق فريق Qwen التابع لشركة علي بابا نموذج Qwen-Image-3.0، وهو الجيل الثالث من نماذج توليد الصور، الذي يضع أولوية للمحتوى الكثيف والاستخدام العملي على حساب الجمالية. يتعامل النموذج مع مطالبات تصل إلى 4500 رمز، ويعرض نصوصًا بحجم 10 بكسل بوضوح، ويولد صفحات جرائد كاملة أو رسومات معلوماتية متعددة الخلايا في خطوة واحدة.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-23 · قراءة 3 دقائق

معظم نماذج توليد الصور تسعى لأن تكون فنانة. فريق Qwen من علي بابا يريد لنموذجه الأخير أن يكون خط إنتاج.
تم الإعلان عن Qwen-Image-3.0 في 21 يوليو، وهو الجيل الثالث من سلسلة صور Qwen، وموقعه هو انحراف هادئ عن اتجاه المجال. بينما تسعى DALL-E و Midjourney إلى اللمعان البصري والتنوع الأسلوبي، يسعى Qwen-Image-3.0 إلى الكثافة والدقة والفائدة. يقبل النموذج مطالبات تصل إلى 4500 رمز، ويعرض نصوصًا صغيرة بحجم 10 بكسل، ويخرج تخطيطات معقدة مثل الصحف وأوراق الامتحانات والرسومات المعلوماتية متعددة اللوحات في جيل واحد، وليس مكونًا من مخرجات منفصلة.

منشور المدونة التجريبي، الذي كتبه فريق Qwen، يقدم أمثلة واسعة. من أبرزها شبكة 3x3 من الرسومات المعلوماتية تغطي موضوعات من سلامة الأنفاق إلى نظرية المجموعات إلى الرسوم البيانية الطبية، كلها مولدة في خطوة واحدة من مطالبة بحجم 3700 رمز. كل خلية عبارة عن رسم معلوماتي قائم بذاته مع نصوصه وصيغه وتخطيطه الخاص. يظهر النموذج أيضًا ما يسميه الفريق بعمق "صورة داخل صورة": مطالبة واحدة تولد نافذة VSCode تحتوي على واجهة Qwen Chat، والتي بدورها تحتوي على شاشة WeChat تظهر ملصق قهوة pour-over، مع كل طبقة تحافظ على أسلوبها ونصها الخاص.
التركيز على عرض النص متعمد. يدعي النموذج عرض نصوص صغيرة بحجم 10 بكسل بوضوح، وتشمل الأمثلة المقدمة صفحة كاملة من ورقة هندسة جبرية تحتوي على صيغ LaTeX كثيفة، ورموز فرعية وفوقية، وترقيم نظريات. مثال آخر يظهر صفحة جريدة مع أعمدة متعددة وعناوين رئيسية. عرض توضيحي للتحرير قبل وبعد يضيف ملاحظات بخط اليد واقعية إلى صفحة كتاب مدرسي، مع تسطير وأسهم وملاحظات هامشية بخط متصل طبيعي.
خط أنابيب التحرير نفسه تم توسيعه. يمكن لـ Qwen-Image-3.0 استعادة اللوحات التقليدية التالفة، واستبدال العناصر في التراكيب الموجودة، وتوليد رسومات معلوماتية معقدة عن طريق الطبقات فوق صورة حقيقية. يظهر الفريق لوحة حبرية لمقاتلة نسر تالفة تم استعادتها إلى شكلها الأصلي، مع إزالة بقع العفن ومطابقة ضربات الفرشاة بأسلوب الفنان الأصلي.
دعم اللغة هو عامل تمييز آخر مزعوم. يعرض النموذج النص أصلاً بـ 12 لغة، مع أمثلة توضيحية باليابانية والكورية والإسبانية. يمكنه أيضًا محاكاة واجهات المستخدم الرئيسية، بما في ذلك صفحات الويب وغرف البث المباشر وشاشات الألعاب، ويتضمن المنشور توقعات جوية مولدة لهانغتشو تم استرجاعها من الويب، وغرفة بث مباشر مع Qi Baishi و Van Gogh يقدمون المنتج، ورسم معلوماتي مالي متراكب على مخطط أسهم حقيقي.
Qwen-Image-3.0 متاح عبر Qwen Studio، منصة الشركة الموحدة للدردشة والصورة والفيديو ومعالجة المستندات، وعبر واجهة برمجة التطبيقات الخاصة به. يؤطر منشور المدونة الإصدار على أنه تطور طبيعي من الجيل الأول "الدقة" والجيل الثاني "الدقة والتنوع والاكتمال والجمال والأصالة" إلى الجيل الثالث بكلمة رئيسية واحدة: "حقيقي"، مكتوبة بالصينية كـ 实، وتعني عملي، صلب، ومتجذر.
النموذج لا يضع نفسه كمنافس لتوجيه Midjourney الفني أو تنوع DALL-E الأسلوبي. إنه يستهدف سير العمل الإنتاجي حيث تكون دقة النص، وتعقيد التخطيط، وكثافة المعلومات أكثر أهمية من البريق البصري. يتضمن ذلك تخطيط الصحف، وإنشاء الامتحانات، والرسوم البيانية الأكاديمية، وملصقات التجارة الإلكترونية، ونمذجة واجهات المستخدم. ما إذا كان النموذج يمكنه الوفاء بتلك الوعود على نطاق واسع، وما إذا كان السوق لتوليد الصور الغنية بالنص كبيرًا بما يكفي لتبرير الاستثمار، لا يزال غير مؤكد. لكن الاختيار متعمد، وهو يجعل Qwen-Image-3.0 واحدًا من أكثر إصدارات توليد الصور إثارة للاهتمام هذا العام على وجه التحديد لأنه لا يحاول الفوز على الجماليات.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.