HunyuanVideo 1.5 لوکال؛ مدل 8.3B برای ویدئوی سبکتر و حرفهای
HunyuanVideo 1.5 با 8.3 میلیارد پارامتر برای پایین آوردن هزینه inference ویدئو طراحی شده و از T2V و I2V پشتیبانی میکند. نسخههای distilled، SR و پشتیبانی ComfyUI آن را برای کاربران Local AI جدی کردهاند، اما مجوز منطقهای مدل باید حتماً بررسی شود.

HunyuanVideo 1.5 لوکال با یک هدف روشن عرضه شده: پایین آوردن سد سختافزاری ویدئوی مولد، بدون اینکه مدل به یک نسخه بسیار کوچک آزمایشی تبدیل شود. مخزن رسمی Tencent این مدل را با 8.3 میلیارد پارامتر معرفی میکند و از Text-to-Video و Image-to-Video پشتیبانی دارد.
برای کاربر ComfyUI، نکته جذاب این است که پشتیبانی رسمی و مسیرهای بهینهسازی مثل LightX2V و Diffusers نیز در پروژه دیده میشوند.
HunyuanVideo 1.5 لوکال چه تفاوتی دارد؟
نسخه 1.5 با معماری سبکتر نسبت به نسلهای بسیار بزرگ ویدئو معرفی شده و روی motion coherence و inference روی consumer GPU تأکید دارد.
مرجع رسمی: HunyuanVideo-1.5 در GitHub
طبق معرفی تیم سازنده، مدل 8.3B است و از چند duration و resolution پشتیبانی میکند.
T2V یا I2V؟
Text-to-Video
برای concept آزاد، environment و shotهایی که reference مشخص ندارند.
Image-to-Video
برای پروژهای که composition، محصول یا character باید کنترل شود.
در کار حرفهای، I2V معمولاً repeatability بهتری میدهد چون فریم شروع را خودتان art-direct میکنید.
مدل Step-Distilled چرا مهم است؟
Tencent در دسامبر ۲۰۲۵ نسخه 480p I2V step-distilled را منتشر کرد که با 8 یا 12 step کار میکند.
در benchmark رسمی، تیم اعلام کرده روی RTX 4090 زمان end-to-end نسبت به مدل اصلی 75 درصد کم شده و generation در حدود 75 ثانیه ممکن است.
این عدد را benchmark سازنده ببینید، نه تضمین سیستم شما. driver، resolution، settings و workflow تفاوت ایجاد میکنند.
SR Model؛ تولید و Upscale را جدا کنید
پروژه HunyuanVideo 1.5 مدل super-resolution هم در برنامه/وزنهای منتشرشده دارد.
این معماری منطقی است:
- motion را در رزولوشن پایینتر حل کنید.
- شات خوب را انتخاب کنید.
- فقط final را upscale کنید.
همان اصل ثبات ویدئوی هوش مصنوعی اینجا هم صدق میکند.
Prompt ساختاریافته
Tencent یک Prompt Handbook رسمی هم دارد و روی توصیف ساختاریافته scene، camera، light و motion تأکید میکند.
مرجع: HunyuanVideo 1.5 Prompt Handbook
برای prompt عملی:
- subject؛
- action؛
- environment؛
- camera؛
- lighting؛
- mood؛
- style.
حرکت دوربین را مبهم نگذارید.
Text Encoderها و Dependency
مخزن رسمی نشان میدهد pipeline فقط یک checkpoint نیست. text encoder و vision/MLLM componentها هم وجود دارند.
در راهنمای دانلود رسمی، Qwen2.5-VL-7B-Instruct بهعنوان جایگزین open-source برای MLLM و ByT5 بهعنوان encoder دیگر ذکر شده است.
یعنی هنگام محاسبه disk و memory فقط فایل اصلی DiT را نبینید.
ComfyUI
پشتیبانی ComfyUI در roadmap رسمی پروژه آمده و برای کاربر node-based مزیت مهمی است.
Workflow را بخشبندی کنید:
- model/encoder load؛
- reference image؛
- prompt؛
- sampling؛
- decode؛
- SR؛
- export.
ComfyUI حرفهای برای مدیریت این graph مفید است.
VRAM و Consumer GPU
عبارت «consumer-grade» به معنی «روی هر GPU راحت» نیست.
8.3B همچنان مدل بزرگی است. مصرف واقعی به precision، offload، frame count و resolution بستگی دارد.
قبل از نصب، راهنمای VRAM را بخوانید و مستندات release موردنظر را چک کنید.
License؛ بخش مهم و کمتر گفتهشده
HunyuanVideo 1.5 با Tencent Hunyuan Community License منتشر شده است.
متن رسمی صراحتاً میگوید این agreement در اتحادیه اروپا، بریتانیا و کره جنوبی اعمال نمیشود.
مرجع: License رسمی HunyuanVideo 1.5
بنابراین قبل از استفاده تجاری یا deployment، منطقه، نوع استفاده و شرایط مجوز را بررسی کنید.
Workflow تست پیشنهادی
پنج شات استاندارد بسازید:
- portrait با حرکت کم؛
- full body walk؛
- product orbit؛
- wide environment؛
- camera dolly.
برای هرکدام ثبت کنید:
- زمان؛
- VRAM؛
- motion؛
- identity؛
- artifact؛
- retry count.
بعد مدل را با Wan یا LTX در همان پروژه مقایسه کنید.
برای Wan، راهنمای Wan2.2 موجود است.
چه زمانی HunyuanVideo 1.5 جذاب است؟
- I2V با کنترل reference؛
- نیاز به مدل open-weight لوکال؛
- workflow ComfyUI؛
- سختافزار مصرفی قوی؛
- اهمیت speedup distilled.
چه زمانی نه؟
اگر GPU محدود دارید، سرویس ابری ارزانتر تمام میشود، یا license منطقه شما مبهم است، ممکن است انتخاب دیگری منطقیتر باشد.
خروجی نهایی
ویدئوی generated را مستقیم تحویل ندهید:
- frame artifact؛
- flicker؛
- identity؛
- color؛
- encode؛
- sound
را بررسی کنید.
جمعبندی
HunyuanVideo 1.5 لوکال بهخاطر 8.3B بودن، نسخه distilled و پشتیبانی workflowهای رایج یکی از گزینههای جدی ویدئو است. ولی مزیت واقعی زمانی مشخص میشود که روی شاتهای واقعی خودتان benchmark کنید و license را همانقدر جدی بگیرید که کیفیت تصویر.
پرسشهای متداول
HunyuanVideo 1.5 چند پارامتر دارد؟
مخزن رسمی نسخه 1.5 را با 8.3 میلیارد پارامتر معرفی میکند.
آیا HunyuanVideo 1.5 Image-to-Video دارد؟
بله، چارچوب رسمی از text-to-video و image-to-video پشتیبانی میکند.
نسخه distilled چه مزیتی دارد؟
تیم Tencent برای 480p I2V مدل step-distilled با 8 یا 12 step معرفی کرده تا inference سریعتر شود.
مجوز HunyuanVideo 1.5 محدودیت منطقهای دارد؟
بله. متن مجوز رسمی میگوید قرارداد Hunyuan Community License برای اتحادیه اروپا، بریتانیا و کره جنوبی اعمال نمیشود؛ استفادهکننده باید شرایط کامل را بررسی کند.


