PARADOXآکادمی سینما پارادوکس
هوش مصنوعی

Qwen-Image-2.1 لوکال؛ ابزار تازه ۲۰۲۶ برای تولید و ادیت تصویر

تیم آکادمی پارادوکس۴ دقیقه مطالعه
خلاصه در یک نگاه

Qwen-Image-2.1 در ۲۰ سپتامبر ۲۰۲۶ منتشر شد و generation، editing، خروجی RGBA و استفاده از چند reference را در یک مدل 7B visual component جمع می‌کند. پشتیبانی روز اول ComfyUI باعث شده این مدل فوراً برای workflowهای لوکال جدی شود.

مدل Qwen Image برای تولید و ویرایش تصویر

Qwen-Image-2.1 لوکال یکی از تازه‌ترین اتفاق‌های تولید تصویر در ۲۰۲۶ است. تیم Qwen این نسخه را در ۲۰ سپتامبر ۲۰۲۶ منتشر کرد؛ یعنی این مدل فقط «جدید» نیست، عملاً در زمان نوشتن این مطلب تازه وارد اکوسیستم شده است.

نکته مهم‌تر: Qwen-Image-2.1 فقط text-to-image نیست. generation، editing، transparency و reference-based workflow را یک‌جا هدف گرفته است.

Qwen-Image-2.1 لوکال چه چیز تازه‌ای دارد؟

طبق README رسمی، visual generation component مدل 7B پارامتر دارد و چهار محور اصلی برجسته شده است:

  • معماری فشرده‌تر و کارآمد؛
  • generation و editing یکپارچه؛
  • native RGBA؛
  • استفاده از چند reference.

منبع رسمی: Qwen-Image-2.1 در GitHub

خروجی RGBA چرا واقعاً مهم است؟

در تولید گرافیک، background removal یک مرحله دائمی است. اگر مدل بتواند مستقیماً alpha channel بسازد، workflow کوتاه‌تر می‌شود.

کاربرد:

  • sticker؛
  • packshot؛
  • asset برای motion graphics؛
  • cutout محصول؛
  • element برای Photoshop؛
  • compositing.

البته خروجی alpha هم باید بررسی شود. لبه مو، شیشه، motion blur و نیمه‌شفاف‌ها همیشه چالش‌اند.

تا ۱۰ Reference؛ عددی که workflow را عوض می‌کند

Qwen در معرفی رسمی پشتیبانی از حداکثر ۱۰ تصویر reference را برای editing ذکر کرده است.

این یعنی می‌توان چند نوع اطلاعات را جدا کرد:

  • هویت چهره؛
  • لباس؛
  • محصول؛
  • محیط؛
  • style؛
  • composition.

ولی reference زیاد الزاماً بهتر نیست. تصاویر متناقض می‌توانند مدل را گیج کنند. reference set باید curated باشد.

Local Editing با Annotation

از قابلیت‌های جالب معرفی‌شده، مشخص‌کردن ناحیه edit با circle، painted annotation یا mask جداست.

برای production این یعنی کاربر لازم نیست همیشه mask دقیق پیکسلی بسازد. در iteration سریع می‌تواند محدوده تغییر را مشخص کند و بعد در pass نهایی mask را دقیق‌تر کند.

Typography؛ جذاب ولی نیازمند QC

Qwen-Image از ابتدا روی text rendering توجه داشت و 2.1 typography را بهبود داده است.

اما برای کار چاپی یا برند:

  • spelling را دستی چک کنید؛
  • لوگو را از generation نهایی نگیرید؛
  • فونت سازمانی را در نرم‌افزار طراحی اعمال کنید؛
  • متن حقوقی و قیمت را بعداً اضافه کنید.

AI typography برای concept عالی است، نه جایگزین قطعی layout نهایی.

ComfyUI از روز اول

طبق خبر رسمی تیم Qwen، ComfyUI از همان روز انتشار Qwen-Image-2.1 پشتیبانی native داشته و workflowهای text-to-image و editing ارائه شده‌اند.

این برای کاربر Local AI مهم است، چون لازم نیست ماه‌ها منتظر custom integration بماند.

برای ساخت graph تمیز، ComfyUI حرفه‌ای را ببینید.

حافظه و Offload

model card رسمی برای Diffusers نمونه CPU offload هم ارائه می‌کند. این نشانه خوبی است که سازندگان اجرای consumer hardware را در نظر گرفته‌اند.

با این حال، نیاز واقعی به:

  • resolution؛
  • reference count؛
  • precision؛
  • backend؛
  • batch

بستگی دارد.

راهنمای VRAM را قبل از نتیجه‌گیری از عدد 7B بخوانید.

یک Workflow برای محصول

فرض کنید ساعت یا کفش دارید.

Pass 1: Identity

reference تمیز محصول، بدون تغییر فرم.

Pass 2: Scene

محیط و نور اضافه شود.

Pass 3: Local Edit

بازتاب، سطح زیر محصول یا عنصر اضافی اصلاح شود.

Pass 4: Transparency

نسخه RGBA جدا برای طراحی.

Pass 5: Retouch

لبه، لوگو و جزئیات در Photoshop بررسی شود.

این workflow از تولید «یک عکس نهایی با یک prompt» قابل‌کنترل‌تر است.

یک Workflow برای کاراکتر

برای consistency:

  • یک portrait frontal؛
  • یک 3/4؛
  • یک full body؛
  • reference لباس؛
  • reference محیط.

بعد فقط متغیرهای صحنه را تغییر دهید.

اگر identity هنوز پایدار نیست، LoRA برای consistency گزینه مرحله بعد است.

مجوز را بخوانید

Qwen-Image-2.1 با Qwen Research License منتشر شده است. این یعنی قبل از استفاده تجاری، deployment یا بازتوزیع باید شرایط همان مجوز را بررسی کنید.

مرجع: Model Card رسمی Qwen-Image-2.1

Open-source یا open-weight بودن همیشه معادل Apache/MIT نیست.

آیا باید فوراً workflow قبلی را عوض کنیم؟

نه.

مدل تازه را با baseline مقایسه کنید:

  • prompt ثابت؛
  • reference ثابت؛
  • زمان ثابت؛
  • تعداد retry؛
  • fidelity محصول؛
  • text rendering؛
  • editing accuracy.

اگر 2.1 واقعاً تعداد retry را کم کند، ارزش مهاجرت دارد.

جذاب‌ترین کاربردها

  • product compositing؛
  • transparent asset؛
  • concept board؛
  • multi-reference character؛
  • localized editing؛
  • پوستر اولیه با text concept؛
  • assetسازی برای motion.

جمع‌بندی

Qwen-Image-2.1 لوکال به‌خاطر تازگی تنها جذاب نیست؛ ترکیب generation، editing، RGBA و چند reference باعث می‌شود برای pipeline واقعی ارزش بررسی داشته باشد.

مدل جدید را به‌عنوان «ابزار جایگزین همه‌چیز» نبینید. آن را در چند مرحله workflow جا دهید و براساس کاهش retry و افزایش کنترل قضاوت کنید.

پرسش‌های متداول

Qwen-Image-2.1 چه زمانی منتشر شد؟

طبق مخزن رسمی Qwen، نسخه 2.1 در ۲۰ سپتامبر ۲۰۲۶ منتشر شد.

آیا Qwen-Image-2.1 خروجی شفاف می‌سازد؟

بله. model card رسمی از تولید و ویرایش native RGBA و استخراج سوژه با شفافیت پشتیبانی می‌کند.

چند تصویر reference می‌پذیرد؟

در معرفی رسمی، پشتیبانی از حداکثر ۱۰ reference image برای editing ذکر شده است.

آیا Qwen-Image-2.1 در ComfyUI پشتیبانی می‌شود؟

بله. تیم Qwen اعلام کرده ComfyUI از روز انتشار پشتیبانی native و workflowهای نمونه ارائه کرده است.

#Qwen-Image-2.1#Qwen Image#ComfyUI#تولید تصویر#Local AI