بهینهسازی Wan2.2 لوکال؛ از Preview سریع تا رندر نهایی
Wan2.2 لوکال فقط یک مدل ویدئو نیست؛ خانوادهای از مسیرهای T2V، I2V، TI2V، Animate و S2V است. برای production باید مدل را براساس نوع شات انتخاب کنید، preview را ارزان نگه دارید و فقط شات تأییدشده را با تنظیمات سنگین رندر کنید.

Wan2.2 لوکال را اگر فقط با یک workflow آماده اجرا کنید، بخش مهمی از قدرتش را از دست میدهید. خانواده Wan2.2 چند مسیر متفاوت دارد و production واقعی از انتخاب درست مسیر شروع میشود، نه از بالا بردن steps.
در مخزن رسمی امروز شاخههای T2V-A14B، I2V-A14B، TI2V-5B، S2V-14B و Animate-14B دیده میشوند. همین تنوع نشان میدهد سؤال درست این نیست که «Wan2.2 خوب است؟»؛ سؤال این است که کدام Wan برای کدام شات؟
Wan2.2 لوکال را براساس مسئله انتخاب کنید
T2V-A14B
وقتی reference تصویری ندارید و ایده، محیط و حرکت از متن شروع میشود.
I2V-A14B
وقتی فریم شروع، محصول یا کاراکتر مشخص دارید و ثبات بصری مهم است.
TI2V-5B
مسیر سبکتر text-image-to-video که برای بعضی workflowهای مصرفی و iteration سریعتر جذاب است.
S2V-14B
برای سناریوهایی که ورودی صوتی بخشی از generation است.
Animate-14B
برای انتقال حرکت و animation سناریوهای خاص.
فهرست رسمی configها را میتوان در مخزن Wan2.2 دید.
چرا Preview باید یک Pipeline جدا باشد؟
بیشترین وقت در تولید ویدئو معمولاً روی رندر خراب تلف نمیشود؛ روی تصمیم دیرهنگام تلف میشود.
اگر بعد از ۲۰ دقیقه بفهمید حرکت دوربین اشتباه بوده، GPU فقط یک تصمیم ساده را گران کرده است.
Preview باید:
- رزولوشن کمتر داشته باشد؛
- شات کوتاهتر باشد؛
- upscale خاموش باشد؛
- interpolation خاموش باشد؛
- encode سبک باشد؛
- فقط motion و composition را نشان دهد.
بعد از تأیید، Final Pipeline فعال شود.
طول شات را قبل از کیفیت کم کنید
وقتی VRAM یا زمان محدود است، خیلیها ابتدا quality را قربانی میکنند. گاهی تصمیم بهتر این است که شات را کوتاهتر کنید.
یک شات ۳ ثانیهای تمیز در تدوین، از یک پلان ۱۰ ثانیهای پر از drift ارزش بیشتری دارد.
برای منطق کامل این موضوع راهنمای ثبات شات در ویدئوی هوش مصنوعی را بخوانید.
رزولوشن رسمی را بشناسید
configهای رسمی Wan2.2 برای مسیرهای 14B رزولوشنهایی مثل 720×1280، 1280×720 و 480×832 را تعریف میکنند و TI2V-5B مسیرهای متفاوتی دارد.
این یعنی ابعاد را صرفاً با عدد دلخواه تغییر ندهید. ابتدا اندازههای پشتیبانیشده workflow رسمی را تست کنید، بعد سراغ custom resolution بروید.
مرجع فنی: Config رسمی Wan2.2
Prompt را کوتاهتر اما ساختاریافته کنید
برای ویدئو، prompt خیلی طولانی گاهی چند دستور حرکتی متناقض میسازد.
ساختار مناسب:
- Subject: چه کسی/چه چیزی؟
- Action: دقیقاً چه حرکت؟
- Environment: کجا؟
- Camera: ثابت، dolly، pan، orbit؟
- Light: منبع و جهت؟
- Mood/Style: فقط اگر لازم است.
یک حرکت اصلی برای هر شات تعریف کنید.
I2V؛ جایی که کیفیت فریم شروع تعیینکننده است
Image-to-Video خطاهای فریم اول را به زمان میبرد.
قبل از generation:
- دستها را اصلاح کنید؛
- لوگو و نوشته را تمیز کنید؛
- artifact صورت را حذف کنید؛
- perspective را درست کنید؛
- crop را نهایی کنید.
اگر فریم مرجع هنوز draft است، ویدئو را نهایی نکنید.
VRAM را با Offload حل کنید، نه با آشفتگی Workflow
مدلهای 14B سنگیناند. اگر حافظه محدود است، ممکن است از offload، quantization یا implementationهای بهینه استفاده کنید.
اما هر optimization را جدا تست کنید. وقتی همزمان quantization، low-VRAM mode و sampler متفاوت را عوض کنید، نمیفهمید افت کیفیت از کدام بخش آمده است.
برای مبانی، راهنمای GPU و VRAM را ببینید.
Steps کمتر همیشه «بهینهسازی» نیست
هدف کاهش عدد steps نیست؛ هدف کاهش زمان رسیدن به شات قابلقبول است.
اگر steps کم باعث شود چهار بار retry کنید، در مجموع کندتر شدهاید.
معیار حرفهای:
Total Time to Approved Shot
نه فقط seconds per generation.
Retry Rate را ثبت کنید
برای هر preset بنویسید:
| Preset | زمان هر رندر | درصد شات قابلاستفاده | زمان تقریبی تا انتخاب |
|---|---|---|---|
| Preview Fast | کم | متوسط | کم |
| Balanced | متوسط | خوب | متوسط |
| Final | زیاد | فقط پس از approval | کنترلشده |
این جدول را با داده واقعی سیستم خودتان پر کنید.
ComfyUI را دوشاخه کنید
در راهنمای پایه Wan2.2 در ComfyUI نصب و اولین generation را داریم. برای production، graph بهتر است دو branch داشته باشد:
PREVIEW
decode سریع، save سبک، بدون upscale.
FINAL
کیفیت کامل، post-process، interpolation در صورت نیاز و export.
با یک switch یا bypass میتوانید بین دو حالت جابهجا شوید.
Seed و Version را ثبت کنید
هر شات تأییدشده باید این اطلاعات را داشته باشد:
- model/variant؛
- seed؛
- prompt؛
- reference؛
- frame count؛
- resolution؛
- sampler/steps؛
- workflow version.
بدون این metadata، اصلاح شات دو هفته بعد تبدیل به حدس میشود.
Animate و S2V را با T2V قاطی نکنید
اگر مسئله شما انتقال حرکت یا هماهنگی با ورودی صوتی است، استفاده از T2V عمومی و prompt طولانی لزوماً راه درست نیست.
خانواده Wan2.2 برای taskهای متفاوت شاخه تخصصی دارد. اول task را تشخیص دهید، بعد checkpoint را انتخاب کنید.
نصب رسمی یا ComfyUI؟
اجرای رسمی برای benchmark و فهم مدل ارزش دارد. INSTALL رسمی نمونه اجرای T2V را با generate.py نشان میدهد: راهنمای نصب Wan2.2
ComfyUI برای pipeline چندمرحلهای، reference، finishing و iteration تیم خلاق راحتتر است.
بهتر است حداقل یک بار مدل را با مسیر رسمی بشناسید تا وقتی workflow شخص ثالث خراب شد، ریشه مشکل را بفهمید.
یک Benchmark واقعی بسازید
پنج شات ثابت:
- چهره با حرکت کم؛
- راهرفتن full body؛
- محصول با camera move؛
- محیط wide؛
- شات با motion سریع.
برای هر preset ثبت کنید:
- VRAM؛
- زمان؛
- identity؛
- motion؛
- artifact؛
- retry.
بعد از ۲۰ generation، preset شما براساس داده ساخته شده، نه توصیه یک ویدئو.
خروجی نهایی را بیرون از مدل تمام کنید
ویدئوی AI خام است. finishing شامل:
- حذف فریم خراب؛
- تدوین؛
- speed؛
- interpolation در صورت نیاز؛
- upscale؛
- color؛
- sound design؛
- encode.
اگر این مراحل را از generation جدا کنید، Wan2.2 لوکال از یک «مدل جذاب» به ابزار production تبدیل میشود.
پرسشهای متداول
Wan2.2 فقط Text-to-Video است؟
نه. مخزن رسمی مسیرهای T2V، I2V، TI2V، Speech-to-Video و Animate را در نسخههای مختلف ارائه میکند.
مدل 5B چه زمانی منطقیتر است؟
وقتی iteration سریعتر، مصرف حافظه کمتر و workflow ترکیبی متن/تصویر مهمتر از استفاده از مدلهای 14B باشد، TI2V-5B گزینه قابل بررسی است.
برای کاهش زمان Wan2.2 اول steps را کم کنیم؟
نه همیشه. ابتدا رزولوشن، طول شات، مدل مناسب و preview workflow را بهینه کنید؛ کاهش افراطی steps میتواند motion و جزئیات را خراب کند.
آیا Wan2.2 در ComfyUI قابل استفاده است؟
بله. Wan2.2 از ۲۰۲۵ وارد اکوسیستم ComfyUI شده و workflowهای متنوعی برای شاخههای آن وجود دارد.


