راهنمای GPU و VRAM برای هوش مصنوعی لوکال؛ از متن تا ویدئو
برای Local AI یک عدد جادویی به نام حداقل VRAM وجود ندارد. حافظه موردنیاز به نوع مدل، کوانتایز، رزولوشن، طول ویدئو و offload بستگی دارد؛ این راهنما کمک میکند سختافزار را براساس کار واقعی انتخاب کنید، نه تبلیغ کارت گرافیک.

برای انتخاب سیستم مناسب هوش مصنوعی لوکال، سریعترین پاسخ بازار معمولاً این است: «هرچه VRAM بیشتر، بهتر». جمله غلط نیست، اما برای خرید حرفهای کافی نیست. VRAM را باید در کنار نوع مدل، precision، رزولوشن، تعداد فریم و runtime ببینید.
یک مدل متنی کوانتایزشده، یک مدل تصویر، یک workflow چند ControlNet و یک مدل ویدئویی نیازهای کاملاً متفاوتی دارند. بنابراین قبل از خرید کارت گرافیک باید workload را تعریف کنید.
VRAM دقیقاً چه کاری انجام میدهد؟
VRAM حافظه نزدیک GPU است. وزن مدل، activationها، tensorهای موقت و بخش بزرگی از دادههای پردازش آنجا قرار میگیرند. RAM حافظه اصلی سیستم است و در بارگذاری مدل، CPU offload، cache و برنامههای دیگر نقش دارد.
اگر VRAM کم بیاورید، یکی از این اتفاقها میافتد:
- مدل اصلاً بار نمیشود؛
- بخشی از مدل به RAM/CPU منتقل میشود و سرعت پایین میآید؛
- مجبور میشوید precision، رزولوشن، batch یا تعداد فریم را کاهش دهید.
چرا برای VRAM عدد قطعی وجود ندارد؟
حافظه مصرفی از اسم مدل بهتنهایی مشخص نمیشود. این متغیرها اثر دارند:
- FP32، FP16، BF16، FP8 یا quantizationهای سبکتر؛
- backend و runtime؛
- رزولوشن تصویر؛
- batch size؛
- context length در LLM؛
- تعداد فریم در ویدئو؛
- VAE و text encoder؛
- LoRA و ControlNetهای همزمان؛
- attention optimization؛
- offload به CPU.
به همین دلیل جدول زیر راهنمای برنامهریزی است، نه تضمین اجرای هر مدل.
| VRAM | تجربه معمول | کاربرد محتمل |
|---|---|---|
| 6 تا 8GB | شروع با محدودیت | LLM کوچک/کوانتایز، تصویر سبک |
| 10 تا 12GB | نقطه شروع جدی | تصویر، LLM متوسط، بعضی ویدئوهای بهینه |
| 16GB | انعطاف خوب | تصویر حرفهای، LoRA سبک، ویدئوی بهینه |
| 20 تا 24GB | فضای حرفهای | مدلهای بزرگتر، رزولوشن و فریم بیشتر |
| بالاتر از 24GB | ورکفلو سنگین | چندمدلی، آموزش، batch و ویدئوی جدی |
اگر تمرکز شما LLM است
در مدلهای متنی، quantization بازی را عوض میکند. یک فایل GGUF کوانتایزشده میتواند بسیار سبکتر از نسخه full precision باشد. context طولانی نیز حافظه اضافه مصرف میکند.
قبل از دانلود یا خرید بپرسید:
- مدل چند پارامتر دارد؟
- با چه quantization اجرا میشود؟
- context واقعی من چقدر است؟
- چند کاربر همزمان دارم؟
- CPU offload برای من قابلقبول است؟
برای مقایسه runtimeها، LM Studio، Ollama و llama.cpp را ببینید.
اگر تمرکز شما تولید تصویر است
رزولوشن و اجزای workflow روی مصرف VRAM اثر مستقیم دارند. یک text-to-image ساده با workflow شامل ControlNet، adapter، LoRA و upscale یکسان نیست.
در ComfyUI میتوان با unload، tiled VAE و مدلهای بهینه فشار حافظه را کم کرد، اما هر تکنیک هزینه خودش را دارد: زمان بیشتر، پیچیدگی بیشتر یا محدودیت در کیفیت.
اگر هنوز محیط را نصب نکردهاید، راهنمای نصب ComfyUI نقطه شروع خوبی است.
اگر تمرکز شما ویدئو است
ویدئو سختتر است چون علاوه بر ارتفاع و عرض، بعد زمان دارید. تعداد فریم، طول کلیپ، FPS، motion و مرحله upscale روی حافظه و زمان اثر میگذارند.
روش حرفهای این نیست که از ابتدا طولانیترین کلیپ را بسازید:
- شات کوتاه تستی بسازید.
- composition و motion را تثبیت کنید.
- seed و تنظیمات را ثبت کنید.
- نسخه نهایی را با رزولوشن یا فریم بیشتر تولید کنید.
راهنمای تولید ویدئوی لوکال معماری کلی این بخش را توضیح میدهد.
CPU چقدر مهم است؟
اگر GPU دارید، CPU معمولاً ستاره اصلی نیست؛ ولی CPU ضعیف میتواند در preprocessing، decode، data loading و offload گلوگاه شود.
به تعداد هسته کافی، پلتفرم مناسب RAM، PCIe، منبع تغذیه و خنککاری واقعی توجه کنید. کارت قوی در کیس با airflow بد میتواند در رندر طولانی افت عملکرد داشته باشد.
RAM؛ عددی که دیر متوجه اهمیتش میشویم
وقتی مرورگر، Photoshop، ComfyUI و مدل بزرگ همزمان بازند، 16GB RAM زود محدود میشود. برای workstation چندمنظوره، 32GB معمولاً فضای راحتتری میدهد و پروژههای سنگین میتوانند از 64GB یا بیشتر سود ببرند.
این اعداد نسخه پزشکی نیستند؛ مصرف واقعی سیستم خودتان را با ابزار مانیتورینگ اندازه بگیرید.
SSD و معماری ذخیرهسازی
مدلها سریع فضا میگیرند: checkpoint، VAE، encoder، LoRA، ControlNet، cache و خروجیهای میانی.
از روز اول پوشهها را منظم کنید:
- Models / LLM
- Models / Image
- Models / Video
- Models / Audio
- Models / LoRA
- Projects / Client / Source
- Projects / Client / Generations
- Projects / Client / Final
کپیکردن یک مدل در چند برنامه، SSD را بیدلیل پر میکند.
NVIDIA، AMD یا Apple Silicon؟
NVIDIA: اکوسیستم CUDA در بسیاری از ابزارهای مولد مسیر کماصطکاکی دارد.
Apple Silicon: unified memory و backendهایی مثل MLX برای مدلهای متنی جذاباند. LM Studio و Ollama روی این پلتفرم بهینهسازی فعال دارند.
AMD: در پروژههای متعددی قابل استفاده است، اما سطح پشتیبانی ابزارها یکسان نیست. قبل از خرید compatibility مدل و runtime واقعی خودتان را چک کنید.
برای جزئیات runtimeهای متن، مستندات رسمی LM Studio نمونه خوبی از تفاوت backendها و فرمتهاست.
خرید برای بنچمارک، نه برای کار؛ اشتباه گران
دو GPU ممکن است در یک بنچمارک فاصله کمی داشته باشند، اما برای workload شما تفاوت جدی ایجاد کنند. در ویدئو، VRAM اضافه ممکن است از چند درصد قدرت خام مهمتر باشد. در LLM کوچک، شاید RAM، SSD و صدای کمتر سیستم ارزش بالاتری داشته باشند.
چهار سناریوی تصمیمگیری
یادگیری و آزمایش
اول سختافزار موجود را فشار دهید. وقتی محدودیت واقعی را دیدید، ارتقا کنید.
تولید تصویر روزانه
VRAM کافی، SSD سریع، RAM راحت و اکوسیستم پایدار مهماند.
ویدئوی مولد
VRAM، خنککاری، فضای ذخیره و تحمل زمان رندر در اولویتاند.
سرویس داخلی تیم
پایداری، شبکه، API، UPS، مانیتورینگ و کنترل دسترسی گاهی از قدرت خام مهمترند.
چکلیست قبل از خرید
- سه مدل اصلیتان را نام ببرید.
- precision یا quantization را مشخص کنید.
- رزولوشن هدف را بنویسید.
- بیشترین context یا طول ویدئو را مشخص کنید.
- اجرای روزانه را تخمین بزنید.
- نرمافزارهای همزمان را حساب کنید.
- فضای model/cache را اندازه بگیرید.
- مسیر ارتقای ۱۲ ماه آینده را در نظر بگیرید.
پرسشهای متداول
آیا ۸ گیگابایت VRAM برای هوش مصنوعی لوکال کافی است؟
برای مدلهای سبک، بعضی مدلهای کوانتایزشده و بسیاری از کارهای متنی یا تصویری سبک میتواند کافی باشد؛ ویدئوی مولد و مدلهای بزرگ محدودیت بیشتری خواهند داشت.
RAM مهمتر است یا VRAM؟
در اجرای GPU محور، VRAM معمولاً گلوگاه اصلی است؛ RAM برای بارگذاری مدل، offload، چندوظیفگی و اجرای همزمان ابزارها اهمیت زیادی دارد.
GPU قویتر همیشه خروجی باکیفیتتری میدهد؟
نه. GPU قویتر بیشتر سرعت، رزولوشن قابلاجرا یا امکان استفاده از مدل بزرگتر را افزایش میدهد؛ کیفیت پایه بیشتر به مدل و تنظیمات مربوط است.
برای Local AI حتماً NVIDIA لازم است؟
نه. NVIDIA در بسیاری از پروژههای CUDA مسیر سادهای دارد، اما Apple Silicon، AMD و backendهای دیگر هم بسته به مدل و نرمافزار قابل استفادهاند.


