← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

أطلقت Qwen أداة لإعادة صياغة المطالبات لمعالجة مشكلة المطالبات

نُشر في 7 أكتوبر 2026
أطلقت Qwen أداة لإعادة صياغة المطالبات لمعالجة مشكلة المطالبات

--- title: Qwen Shipped a Prompt Rewriter to Fix the Prompt Problem slug: qwen-shipped-a-prompt-rewriter-to-fix-the-prompt-problem meta_title: Qwen's Prompt Rewriter Targets a Real Barrier meta_description: Qwen open-sourced a fine-tuned Qwen3.5-VL 9B that turns a short request in any language into a detailed English prompt and a recommended aspect ratio. category: ai tags: Qwen,Qwen-Image-2.1,prompt rewriting,Qwen3.5-VL,open weights,diffusers,Aspect ratio,image generation,licensing ---

أطلقت علي بابا نموذجًا صغيرًا مفتوح المصدر يؤدي مهمة واحدة: أن يأخذ طلب صورة موجزًا بأي لغة، ويوسّعه إلى مطالبة إنجليزية مفصّلة، ويوصي بنسبة أبعاد مناسبة. النموذج Qwen-Image-2.1-PE-T2I هو نسخة مضبوطة بدقة (fine-tuned) من Qwen3.5-VL 9B، وهو يستهدف عقبة نادرًا ما تعالجها الشركات المطوّرة لنماذج الصور بشكل مباشر.

ما الذي يفعله النموذج

المدخل وصف قصير بأي لغة. والمخرج كائن JSON يحتوي على مطالبة معاد صياغتها ونسبة أبعاد موصى بها، يُنتَج بعد كتلة استدلال. والنموذج المستهدف هو Qwen-Image-2.1، الذي يستخدم مكوّنًا بصريًا للتوليد بـ 7 مليارات معامل مع 32 طبقة DiT أحادية المسار.

ورقة بيضاء فارغة تخرج من آلة كاتبة باهتة على مكتب من خشب فاتح، والصفحة غير مطبوعة تمامًا

الآلية مباشرة. فبدلًا من مطالبة المستخدمين بتعلّم كيفية استجابة Qwen-Image للمطالبات، درّبت الشركة نموذجًا يترجم النوايا إلى الصيغة التي يتعامل معها المولّد على أفضل وجه.

كتلة الاستدلال أهم مما قد تبدو عليه. فأداة إعادة الصياغة لا تكتفي بحشو الطلب القصير بالصفات، بل تعمل على تحليل ما يضمره الطلب، ثم تُخرج كائنًا مُنظَّمًا يحتوي على مطالبة وشكل إطار موصى به. وهذا أقرب إلى خطوة تخطيط من كونه توسيعًا نصيًا.

ضبط نموذج لغوي بصري لهذه المهمة، بدلًا من تدريب نموذج نصي صغير من الصفر، خيار متعمّد. فـ Qwen3.5-VL يفهم الصور أصلًا، لذا تستطيع أداة إعادة الصياغة أن تستنتج المحتوى البصري الذي يضمره الوصف، لا كلماته فقط.

لماذا يُعد هذا أكثر فائدة مما يبدو

طالما كان هندسة المطالبات (prompt engineering) ضريبة غير رسمية على توليد الصور. فالمستخدمون الذين يكتبون بالإنجليزية وقضوا وقتًا في تعلّم قواعد الصياغة يحصلون على نتائج أفضل من غيرهم، والفارق لا علاقة له بالقدرة الإبداعية.

أما بالنسبة لغير الناطقين بالإنجليزية، فالعقبة تتراكم. فالطلب المكتوب بالصينية أو العربية أو البرتغالية عليه أن ينجو من الترجمة قبل أن يصل إلى النموذج، والترجمة تميل إلى إسقاط التفصيل البصري المحدد الذي جعل الطلب جيدًا في المقام الأول. وأداة إعادة صياغة تعمل انطلاقًا من اللغة الأصلية وتُخرج مطالبة إنجليزية مفصّلة تُلغي طبقة من الفقد.

توصية نسبة الأبعاد ميزة أصغر تعالج مشكلة مزعجة حقيقية. فالخطأ في أبعاد الإطار فشل صامت: تُولَّد الصورة بشكل سليم، ثم لا تناسب المكان الذي يجب أن تُستخدم فيه.

التحفظ المتعلق بالترخيص

النموذج متاح على Hugging Face بموجب اتفاقية ترخيص Qwen Research، التي تقيّد الاستخدام التجاري. وهذا متسق مع شروط Qwen-Image-2.1 نفسه، ويفصله عن إصدارات Qwen-Image الأقدم بترخيص Apache 2.0، والتي تظل الخيار التجاري الآمن لكنها تحتل مراتب أدنى بكثير في لوحات التصنيف العامة.

على الشركات التي تخطط للبناء على أداة إعادة الصياغة أن تقرأ الترخيص قبل دمجها، لأن ترخيصًا مخصصًا للبحث فقط يغيّر نطاق الاستخدامات المسموح بها لخط المعالجة.

أعمال التكامل المحيطة

جاءت أداة إعادة الصياغة إلى جانب دمج Qwen-Image 2.1 في Diffusers v0.41.0، حيث يتولى النموذج الآن توليد الصور من النص، وتحرير الصور، وإخراج الشفافية الأصلية بصيغة RGBA، وتدريب LoRA في خط معالجة واحد. كما أهدر الإصدار نفسه دعم ONNX لصالح Optimum وأزال الأسماء المستعارة الأقدم لخط Lumina.

ثلاثة أشياء صدرت معًا: مولّد، ومترجم للمطالبات، ودعم مكتبي يجعل المولّد قابلًا للتحميل بالأدوات التي يستخدمها معظم المطورين بالفعل. هذا المزيج هو ما يحوّل إصدار نموذج إلى شيء يستطيع المطورون تبنّيه دون إعادة بناء أدواتهم.

تُلمّح ميزات خط المعالجة إلى أين يتوقع الفريق استخدام النموذج. فتدريب LoRA يعني أن الفرق يمكنها ضبط نمط معيّن دون إعادة تدريب النموذج بالكامل. وإخراج RGBA الأصلي يعني أن الصور المولَّدة يمكن إدراجها في ملف تصميم دون خطوة إزالة الخلفية. وتحميل نقاط الحفظ بالتوازي التنسوري (tensor-parallel) يعني إمكانية تحميل النموذج على تكوينات عتادية لم تكن قادرة على استيعابه سابقًا.

لا شيء من هذه ميزات عناوين رئيسية. لكنها مجتمعة تصف نموذجًا موجّهًا لخطوط الإنتاج لا للعروض التوضيحية.

أضاف الإصدار نفسه دعمًا لخانات الإطارات المفتاحية في LTX-2.5، وإزالة الضوضاء بالدقة المختلطة في Cosmos 3، ومحمّلات ملف واحد لـ Krea 2 و MiniMax-H3. ويتحول Diffusers تدريجيًا إلى رفّ مشترك لنماذج الفيديو والصور، وهو ما يفيد أي مورّد يندمج مبكرًا.

كيف ستستخدمه الفرق فعليًا

التكامل البديهي يكون في مقدمة خط المعالجة: يكتب المستخدم طلبًا قصيرًا، فتوسّعه أداة إعادة الصياغة، ثم يولّد المولّد الصورة. وهذا يلغي خطوة الضبط اليدوي لمن يمتلك مفردات مطالبات محدودة، ويقلل كلفة إدخال غير المصممين إلى سير عمل الصور.

أما الاستخدام الأقل بداهة فهو كأداة تقييم. فتمرير طلب موجز عبر أداة إعادة الصياغة ينتج مطالبة مرجعية يمكن مقارنتها بما كتبه خبير بشري. والفارق مقياس لما يضيفه الإنسان، وهو مفيد لتقرير ما إذا كان كاتب مطالبات متخصص لا يزال يستحق ميزانيته في مشروع معين.

الحجة الأقوى لدى خطوط المعالجة الدفعية (batch). فعندما يولّد نظام مئات صور المنتجات من طلبات قائمة على قوالب، فإن أداة إعادة صياغة توحّد صيغة المطالبة تقلل التباين بين العناصر. والاتساق عبر الكتالوج أهم من الجودة القصوى في أي صورة منفردة.

هناك أيضًا استخدام دفاعي. فالفرق التي تحتفظ بطلباتها بلغتها الأصلية يمكنها تمريرها عبر أداة إعادة الصياغة بدلًا من مترجم بشري، ما يحافظ على التفاصيل البصرية التي تُسطّحها الترجمة عادةً. وبالنسبة للشركات التي تدير حملات في أسواق عديدة، فهذا تقليل قابل للقياس في إعادة العمل.

أنماط الفشل المتوقعة

تفشل أدوات إعادة الصياغة في اتجاه محدد: المبالغة في التخصيص. فطلب موجز لمنظر بحري هادئ قد يعود بمطالبة تحدد وقت اليوم، وعدسة، ولوحة ألوان، وتكوينًا لم يطلبها المستخدم قط. فتكون الصورة مفصّلة وخاطئة، وهذا أصعب في التشخيص من صورة تفشل بشكل واضح.

وترث توصيات نسبة الأبعاد المخاطرة نفسها. فنسبة 16:9 الموصى بها تخمين للنية، وخط معالجة يطبّقها بصمت قد ينتج قصًا لا يناسب الموضع الأصلي. وينبغي للفرق أن تتعامل مع التوصية كاقتراح يؤكده إنسان، على الأقل حتى تنشر النماذج أرقام دقتها.

التغطية اللغوية هي المجهول الثالث. فأداة إعادة صياغة دُرّبت أساسًا على بيانات مطالبات بالإنجليزية قد تتعامل جيدًا مع الطلبات الصينية وتتراجع مع لغات أقل تمثيلًا في مجموعة التدريب. ويجعل ترخيص البحث من الصعب اختبارها على نطاق إنتاجي دون التفاوض على الشروط.

السؤال من الدرجة الثانية

تغيّر أداة إعادة صياغة المطالبات قيمة \"المطالبة الجيدة\". فإذا أنتجت الأداة بموثوقية مطالبة إنجليزية مفصّلة من طلب موجز، تتوقف مهارة كتابة المطالبات عن كونها عامل تمييز للنموذج المستهدف. وهذا جيد للتبني وسيئ لمنظومة أدلة المطالبات المبنية حوله.

وهو ما يطرح أيضًا سؤالًا يتعلق بالبيانات. فأداة إعادة صياغة دُرّبت على سلوك نموذج Qwen نفسه تتعلّم ما يستجيب له Qwen-Image. وهذا يجعلها مفيدة لـ Qwen-Image وأقل فائدة في مكان آخر. فأداة إعادة الصياغة الخاصة بمورّد معيّن آلية احتكار بقدر ما هي ميزة للراحة.

ما يجب مراقبته

ما إذا كان ناتج أداة إعادة الصياغة يطابق ما ينتجه كتّاب المطالبات المهرة، وما إذا كانت Qwen توسّع النهج إلى وسائط أخرى. فأداة إعادة صياغة المطالبات نموذج صغير بمهمة واضحة، وقيمتها تعتمد كليًا على ما إذا كانت المطالبة المعاد صياغتها أفضل فعلًا من التي كان المستخدم سيكتبها. ولم تنشر الشركة مقارنة مستقلة، لذا يبقى الادعاء بحاجة إلى إثبات من جانبها.

الإشارة التالية هي ما إذا كانت Qwen ستطلق أدوات إعادة صياغة مماثلة للفيديو والصوت، أو تدمج القدرة مباشرة في خط معالجة Qwen-Image بحيث لا يرى المستخدمون المطالبة الوسيطة أبدًا. وكلاهما سيشير إلى أن الشركة تتعامل مع هندسة المطالبات كمشكلة ينبغي هندستها بعيدًا لا تعليمها.

مقالات ذات صلة