أطلق فريق Qwen التابع لشركة علي بابا إصدار Qwen-Image-2.1-Turbo، وهو نقطة تفتيش مسرَّعة من نموذجه مفتوح الأوزان Qwen-Image-2.1. وهو يولّد الصور ويحررها في 8 خطوات إزالة ضوضاء بدلاً من 40 خطوة الافتراضية في النموذج الأساسي. بالنسبة للمطورين، هذا يعني تقليل خطوات إزالة الضوضاء بمقدار 5 أضعاف على نفس البنية ذات 7B، بالإضافة إلى خيار واجهة برمجة تطبيقات مستضافة.
الخلاصة السريعة
- الحجم: 7B معاملات في المولّد البصري، مقترنة بمُرمِّز نصوص Qwen3-VL 8B.
- يعمل على: كرت CUDA الرسومية بدقة BF16 عبر Diffusers. لا تنشر Qwen حداً أدنى لذاكرة VRAM لإصدار Turbo. تقدّر Unsloth أن النموذج الأساسي يعمل على 11 جيجابايت VRAM مع GGUF و24 جيجابايت مع INT8/FP8.
- الأداء: نفس مخرجات 2K ومجموعة ميزات التحرير كما في Qwen-Image-2.1، لكن بـ 8 خطوات بدلاً من 40.
- الأفضل: يحقق النموذج الأساسي Qwen-Image-2.1 درجة 60.28 على Qwen-Image-Bench، وهي أعلى درجة مفتوحة الأوزان تعلنها Qwen.
- الخلاصة (الأفضل): توليد وتحرير بدقة 2K في 8 خطوات ضمن نقطة تفتيش مفتوحة واحدة.
- الخلاصة (الأسوأ): رخصة بحثية فقط، لذا يتطلب الاستضافة الذاتية التجارية إذناً منفصلاً.
ما هو Qwen-Image-2.1-Turbo؟
Qwen-Image-2.1-Turbo هو نقطة تفتيش لتوليد الصور وتحريرها في 8 خطوات من فريق Qwen التابع لشركة علي بابا. وهو مبني على Qwen-Image-2.1. يحافظ Turbo على نفس بنية التوليد البصري ذات 7B. ويمكن تحميله مباشرة باستخدام QwenImage21Pipeline في Diffusers.
تأتي نقطة التفتيش مع جدول أخذ العينات الموصى به ذي 8 خطوات محفوظاً داخلها. يستخدم التوليد CFG=1 افتراضياً. وتعيد ذاكرة التخزين المؤقتة KV للبادئة استخدام سياق النص والصورة المرجعية عبر خطوات إزالة الضوضاء.
كيف يعمل Qwen-Image-2.1-Turbo؟
الأساسي هندسة معمارية هو DiT أحادي المسار (single-stream) بـ 32 طبقة و7B معامل. يستخدم انتباهاً من نوع block-causal. تحصل رموز النص على قناع سببي على مستوى الرمز (token-level causal mask)، بينما تستخدم الصور قناعاً ثنائي الاتجاه على مستوى الكتلة (chunk-level bidirectional mask).
- مُرمِّز النص: يقوم Qwen3-VL 8B بترميز التعليمات وصور الشرط معاً.
- VAE: مُشفِّر-مفكِّك تلقائي RGBA بقناتين 64 مع ضغط مكاني بمقدار 16x، مما يتيح الشفافية الأصلية.
- المُجدوِل (Scheduler): Flow Matching مع جدولة Euler المنفصلة والإزاحة الديناميكية.
تصميم الانتباه هو ما يجعل التخزين المؤقت للبادئة (prefix caching) يعمل. تُحسب صور الإدخال والنص مرة واحدة في الخطوة الأولى. وكل خطوة لاحقة تعيد استخدام تلك الذاكرة المؤقتة. مع 8 خطوات فقط، تغطي البادئة المخزنة مؤقتاً معظم تكلفة التكييف (conditioning).
ما الذي يمكنه توليده وتحريره؟
يعرض بطاقة نموذج Turbo عرض بطاقة النموذج 8 فئات. تشمل هذه الفئات الصور الشخصية، ووضعيات الجسم البشري، والصور الشفافة، والطباعة والملصقات، وتخطيطات واجهات المستخدم. وتشمل أمثلة التحرير التحويل أحادي الصورة، والتركيب متعدد المراجع، والتركيب الداخلي من 4 صور. يدعم النموذج الأساسي حتى 10 صور مرجعية والتحرير المحلي عبر الدوائر أو التعليقات المرسومة أو الأقنعة.
كيف تُشغِّل Qwen-Image-2.1-Turbo؟
يتطلب الإعداد Diffusers من المصدرإلى جانب transformers>=5.17.0. يحتاج نقطة التفتيش (checkpoint) إلى Diffusers PR #14950الذي يضيف قيم سيغما لأخذ العينات مُهيّأة عبر إعداد الأنبوب (pipeline-configured sampling sigmas).
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]
للتحرير، مرِّر image=input_image مع تعليمات نصية. تمتد الإعدادات المسبقة المدعومة من 2048×2048 مربعة إلى 2752×1536 بنسبة 16:9.
أمر واحد يجب ملاحظته هنا. ضبط num_inference_steps وحده لا يتجاوز الجدولة المحفوظة. فقط الوسيط الصريح sigmas هو ما يفعل ذلك، وتشير ملاحظات Qwen إلى أن الجداول الأخرى غير مُختبرة.
كم تبلغ تكلفة الـ API؟
يستضيف Alibaba Cloud Model Studio الآن كلاً من نسختي Turbo وPro. qwen-image-2.1-turbo تكلفتها 0.1 يوان صيني لكل صورة في معظم المناطق، مع حد 120 RPM. qwen-image-2.1-pro تكلفتها 0.25 يوان صيني لكل صورة، مع سرعة 20 RPM. النسخة Turbo أرخص بـ 2.5 مرة لكل صورة وتسمح بمعدل طلبات أعلى بـ 6 أضعاف.
مقارنة Qwen-Image-2.1-Turbo بنماذج الصور السريعة المنافسة
| الميزة | Qwen-Image-2.1-Turbo | Qwen-Image-2.1 | Z-Image-Turbo | FLUX.2 klein 9B |
|---|---|---|---|---|
| المنظمة | Alibaba Qwen | Alibaba Qwen | Alibaba Tongyi-MAI | Black Forest Labs |
| حجم المولّد | 7B | 7B | 6B | 9B |
| مُرمِّز النص | Qwen3-VL 8B | Qwen3-VL 8B | غير معلن | Qwen3 8B |
| الخطوات الافتراضية | 8 | 40 | 8 NFEs | 4 |
| التحرير | نعم، متعدد المراجع | نعم، حتى 10 مراجع | لا (نموذج Edit منفصل) | نعم، متعدد المراجع |
| إخراج RGBA شفاف | نعم | نعم | غير معلن | غير معلن |
| الدقة الأصلية | 2K (2048×2048) | 2K (2048×2048) | 1024×1024 في الأمثلة | 1024×1024 في الأمثلة |
| إرشادات الأجهزة | غير مُعلَن | 11 جيجابايت GGUF / 24 جيجابايت FP8 (Unsloth) | يتسع في ذاكرة VRAM سعة 16 جيجابايت | حوالي 29 جيجابايت VRAM، RTX 4090 أو أحدث |
| الترخيص | Qwen Research License | Qwen Research License | Apache 2.0 | FLUX Non-Commercial |
| Qwen-Image-Bench | غير مُعلَن | 60.28 (المزوّد) | غير مُعلَن | غير مُعلَن |
| واجهة برمجية مستضافة | 0.1 يوان صيني/صورة | Pro: 0.25 يوان صيني/صورة | غير مُعلَن | BFL API |
الخلاصات الرئيسية
- يقلّل Qwen-Image-2.1-Turbo عدد خطوات إزالة الضوضاء من 40 خطوة إلى 8 خطوات على البنية نفسها ذات 7B.
- نقطة تفتيش واحدة تتعامل مع توليد الصور من النص بدقة 2K، والتحرير بمراجع متعددة، وإخراج RGBA شفاف.
- تكلفة الواجهة البرمجية 0.1 يوان صيني لكل صورة، أي أرخص بـ2.5 مرة من Pro.
- الأوزان مرخّصة لأغراض البحث، لذا يتطلب الاستضافة الذاتية التجارية إذنًا منفصلاً.
- لا توجد حتى الآن معايير قياس مخصصة لنسخة Turbo؛ بينما تحقق Qwen-Image-2.1 الأساسية درجة 60.28 على Qwen-Image-Bench.
اطّلع على صفحة ModelScope, صفحة Hugging Face, Pro API و Turbo API. كل الفضل يعود إلى الباحث في هذا المشروع. كما يمكنك بحرية متابعتنا على تويتر ولا تنسَ الانضمام إلى 150k+ على ML SubReddit والاشتراك في نشرتنا البريدية. مهلاً! هل أنت على تيليجرام؟ يمكنك الآن الانضمام إلينا على تيليجرام أيضًا.
المنشور علي بابا كيوين تطلق Qwen-Image-2.1-Turbo، نموذج صور بحجم 7B بخطوات 8 ظهر لأول مرة على MarkTechPost.