ثبات شات در ویدئوی هوش مصنوعی لوکال؛ کاراکتر، دوربین و زمان
بزرگترین مشکل ویدئوی مولد فقط کیفیت یک فریم نیست؛ ثبات در زمان است. هویت، لباس، نور، geometry و حرکت دوربین باید از فریم اول تا آخر منطق داشته باشند و این کار با طراحی shot و reference بهتر از prompt طولانی حل میشود.

ثبات ویدئوی هوش مصنوعی با کیفیت یک فریم فرق دارد. ممکن است فریم اول فوقالعاده باشد اما در ثانیه سوم چهره عوض شود، دکمههای لباس جابهجا شوند یا نور بدون دلیل تغییر کند.
در ویدئو، مدل باید نه فقط «چه چیزی» بلکه «همان چیز در طول زمان» را حفظ کند.
ثبات ویدئوی هوش مصنوعی را به پنج لایه تقسیم کنید
- Identity: چهره یا محصول.
- Appearance: لباس، رنگ، جزئیات.
- Geometry: شکل بدن و محیط.
- Lighting: جهت و کیفیت نور.
- Motion: حرکت سوژه و دوربین.
وقتی failure میبینید، مشخص کنید کدام لایه شکسته است.
Text-to-Video یا Image-to-Video؟
Text-to-Video آزادی بیشتری دارد ولی control کمتر.
Image-to-Video یک فریم شروع مشخص میدهد و برای:
- هویت؛
- composition؛
- لباس؛
- محصول؛
- art direction
معمولاً نقطه شروع بهتری است.
برای شروع مدلها راهنمای تولید ویدئوی لوکال را ببینید.
شات کوتاه فکر کنید
یکی از اشتباههای رایج تلاش برای ساخت یک پلان ۲۰ ثانیهای پیچیده در یک generation است.
در سینما هم روایت با شات ساخته میشود.
بهتر:
- ۲ تا ۵ ثانیه؛
- یک حرکت اصلی؛
- یک هدف composition؛
- cut در نقطه طبیعی.
بعد شاتها را در تدوین بسازید.
فریم مرجع را جدیتر از Prompt بگیرید
اگر کاراکتر اهمیت دارد، reference تمیز بسازید:
- نور خنثی؛
- جزئیات واضح؛
- بدون artifact؛
- رزولوشن کافی؛
- pose نزدیک به شات.
فریم مرجع خراب در طول زمان تکثیر میشود.
Character Sheet قبل از Video
برای پروژه داستانی، character sheet بسازید:
- front؛
- profile؛
- 3/4؛
- full body؛
- costume؛
- expression.
این assets به شما کمک میکند فریمهای شروع چند شات را هماهنگ بسازید.
اگر مدل reference کافی ندارد، LoRA لوکال میتواند مرحله بعد باشد.
Prompt حرکت را از ظاهر جدا کند
Prompt ویدئو را میتوان به دو بخش نوشت:
Scene: زن با کت قرمز در راهروی صنعتی.
Motion: دوربین آرام dolly-in، سوژه دو قدم جلو میرود، سر ثابت.
وقتی ده حرکت در یک prompt میگذارید، مدل ممکن است فقط بخشی را انجام دهد.
دوربین واقعی فکر کنید
بهجای «cinematic movement» بنویسید:
- slow dolly-in؛
- locked camera؛
- handheld subtle؛
- pan left؛
- tilt up؛
- orbit 30 degrees.
حرکت مشخصتر قابل ارزیابی است.
Motion Budget
هر شات ظرفیت پیچیدگی محدودی دارد.
اگر همزمان:
- کاراکتر میدود؛
- دوربین orbit میکند؛
- لباس در باد است؛
- جمعیت حرکت میکند؛
- نور تغییر میکند؛
ریسک drift بالا میرود.
پیچیدگی را بین چند شات تقسیم کنید.
Keyframe Strategy
اگر مدل یا workflow اجازه میدهد، keyframeهای مهم را قبل از generation بسازید.
مثلاً شروع و پایان شات را طراحی کنید. سپس motion بین آنها کنترل شود.
این روش برای product shot و حرکت دوربین بسیار مفید است.
نور؛ عامل پنهان Drift
تغییر نور میتواند چهره را متفاوت نشان دهد و مدل هویت را از دست بدهد.
برای consistency:
- direction ثابت؛
- color temperature ثابت؛
- source مشخص؛
- exposure منطقی.
در شاتهای پیوسته، «sunset → neon → daylight» نگذارید مگر قصد transition دارید.
Temporal Artifact را در سرعت واقعی ببینید
Frame-by-frame ممکن است همهچیز خوب باشد، ولی playback flicker داشته باشد.
QC باید دو حالت داشته باشد:
- فریم کلیدی در zoom؛
- ویدئو در سرعت واقعی.
به اینها نگاه کنید:
- texture crawl؛
- face morph؛
- edge shimmer؛
- background breathing؛
- object pop.
Interpolation همه مشکل را حل نمیکند
Frame interpolation حرکت را نرمتر میکند، اما identity drift را درست نمیکند. اگر دو فریم اصلی متفاوتاند، interpolation فقط بین دو خطا پل میزند.
اول generation را پایدار کنید، بعد interpolation.
Upscale را آخر انجام دهید
رندر high-res از اولین تست iteration را کند میکند.
Pipeline:
- low/medium preview؛
- motion approval؛
- identity approval؛
- final generation؛
- interpolation اگر لازم؛
- upscale؛
- color؛
- encode.
ثبت تنظیمات
برای هر شات:
- model؛
- seed؛
- reference؛
- resolution؛
- frames؛
- FPS؛
- motion setting؛
- prompt version.
اگر یک شات خراب شد، باید بتوانید دقیقاً نسخه قبلی را بازسازی کنید.
ComfyUI برای Video Pipeline
در ComfyUI generation و finishing را جدا کنید. راهنمای ComfyUI حرفهای برای group و versioning مفید است.
مستندات رسمی نیز workflowهای مدلهای جدید را بهروز میکند: ComfyUI Docs
تدوین هنوز بخش اصلی است
AI video را مثل raw footage ببینید. بهترین شاتها را انتخاب کنید، cut بزنید، speed را تنظیم کنید، sound design و color اضافه کنید.
تلاش برای ساخت «فیلم کامل در یک generation» معمولاً کنترل را از شما میگیرد.
جمعبندی
ثبات ویدئوی هوش مصنوعی با prompt جادویی حل نمیشود. شات کوتاه، فریم مرجع قوی، حرکت محدود، نور ثابت، ثبت تنظیمات و تدوین هوشمند مجموعهای هستند که consistency میسازند.
پرسشهای متداول
چرا کاراکتر در ویدئوی AI تغییر میکند؟
مدل باید هویت را در بعد زمان حفظ کند؛ حرکت، زاویه، occlusion و نور میتوانند باعث drift شوند. reference و شات کوتاهتر کمک میکند.
شات کوتاه بهتر است یا یک کلیپ طولانی؟
برای production معمولاً شاتهای کوتاهتر قابلکنترلترند و میتوان آنها را در تدوین به هم وصل کرد.
Seed ثابت در ویدئو کافی است؟
نه. Seed فقط بخشی از تکرارپذیری است؛ reference، prompt، model، frame count و motion setting هم باید کنترل شوند.
Image-to-Video برای consistency بهتر است؟
اغلب نقطه شروع کنترلشدهتری از text-to-video میدهد، چون فریم مرجع هویت و composition اولیه را مشخص میکند.


