PARADOXآکادمی سینما پارادوکس
هوش مصنوعی

آموزش LoRA لوکال؛ ساخت ثبات کاراکتر، محصول و استایل

تیم آکادمی پارادوکس۴ دقیقه مطالعه
خلاصه در یک نگاه

LoRA لوکال وقتی ارزش دارد که reference ساده دیگر برای حفظ هویت کاراکتر، محصول یا سبک کافی نباشد. کیفیت dataset، caption و تست نسخه‌ها از تعداد step مهم‌تر است و یک آموزش بد می‌تواند مدل را به حفظ‌کردن چند تصویر محدود کند.

Stable Diffusion و آموزش LoRA برای ساخت مدل و استایل اختصاصی

LoRA لوکال زمانی جذاب می‌شود که تولید یک تصویر خوب دیگر کافی نیست. شما می‌خواهید همان کاراکتر، همان محصول یا همان زبان بصری در ده‌ها خروجی تکرار شود، بدون اینکه هر بار از صفر برای هویت بجنگید.

اما LoRA دکمه «ثبات» نیست. یک dataset بد می‌تواند مدل را overfit کند، لباس را به چهره بچسباند یا فقط همان زاویه‌های آموزشی را تکرار کند.

LoRA لوکال چه چیزی را یاد می‌دهد؟

LoRA روشی برای adaptation مدل است که به‌جای آموزش تمام وزن‌های مدل، بخش کوچکتری از پارامترها را یاد می‌گیرد. نتیجه معمولاً فایل بسیار کوچک‌تر از checkpoint کامل است و می‌توان آن را روی مدل پایه اعمال کرد.

کاربردهای رایج:

  • هویت کاراکتر؛
  • محصول خاص؛
  • style؛
  • لباس یا costume؛
  • material؛
  • visual language برند.

منبع فنی مناسب برای workflowهای Diffusers: راهنمای LoRA در Hugging Face

قبل از LoRA بپرسید آیا واقعاً لازم است؟

مدل‌های جدید image editing و multi-reference قوی‌تر شده‌اند. مثلاً Qwen-Image-2.1 و FLUX.2 می‌توانند در بعضی سناریوها با reference نتیجه کافی بدهند.

قاعده عملی:

Reference اول، LoRA وقتی reference کافی نیست.

چون آموزش هزینه زمان، dataset و نگهداری نسخه ایجاد می‌کند.

Dataset مهم‌تر از تعداد Step است

فرض کنید برای چهره یک نفر ۳۰ عکس دارید، اما ۲۵ عکس با لباس مشکی و پس‌زمینه سفید است. مدل ممکن است لباس مشکی را بخشی از هویت بداند.

Dataset خوب باید تغییر کنترل‌شده داشته باشد:

  • زاویه؛
  • فاصله دوربین؛
  • نور؛
  • پس‌زمینه؛
  • expression؛
  • لباس، اگر لباس نباید جزو مفهوم باشد.

برای محصول، لوگو و geometry باید دقیق بماند، اما محیط و نور متنوع باشد.

تصویر بد را فقط چون «داده بیشتر» است نگه ندارید

مواردی که بهتر است حذف شوند:

  • blur ناخواسته؛
  • watermark؛
  • distortion؛
  • crop عجیب؛
  • duplicate نزدیک؛
  • رنگ شدیداً خراب؛
  • تصویرهایی که مفهوم اشتباه دارند.

۲۰ تصویر تمیز می‌تواند از ۸۰ تصویر پر از نویز بهتر باشد.

Caption باید چه چیزی را بگوید؟

Caption قرار نیست همه pixelها را توصیف کند. هدف این است که به مدل کمک کند بفهمد کدام ویژگی متعلق به token/concept شماست و کدام ویژگی متغیر است.

اگر لباس باید قابل تغییر باشد، لباس را caption کنید. اگر همیشه آن را نادیده بگیرید، مدل ممکن است لباس را با هویت یکی کند.

برای سبک نیز عناصر محتوایی را توصیف کنید تا مدل style را از subject جدا کند.

Trigger Word؛ نامی که باید خاص باشد

برای مفهوم اختصاصی token یا phrase متمایز انتخاب کنید.

بد:

  • man
  • shoe
  • style

بهتر:

  • نام ساختگی کوتاه که در vocabulary روزمره کمتر تداخل دارد.

بعد در تست ببینید آیا بدون trigger هم اثر بیش از حد روی مدل مانده است یا نه.

Validation را از روز اول بسازید

چند prompt ثابت داشته باشید که در طول آموزش تغییر نکنند.

برای character:

  1. portrait frontal؛
  2. profile؛
  3. outdoor full body؛
  4. نور سخت؛
  5. لباس متفاوت.

برای product:

  1. studio packshot؛
  2. زاویه 3/4؛
  3. محیط واقعی؛
  4. close-up material؛
  5. دست انسان کنار محصول.

این test suite مشخص می‌کند checkpoint کجا بهتر و کجا بدتر می‌شود.

Overfitting چه شکلی است؟

نشانه‌ها:

  • همه خروجی‌ها شبیه تصاویر dataset؛
  • pose تکراری؛
  • پس‌زمینه ثابت؛
  • تغییر لباس سخت؛
  • prompt adherence پایین؛
  • artifactهای dataset در خروجی.

اگر training loss پایین‌تر می‌رود ولی انعطاف خراب می‌شود، «آموزش بیشتر» الزاماً بهتر نیست.

وزن LoRA در Generation

حتی LoRA خوب هم در یک weight ثابت برای همه promptها بهترین نیست.

در تست‌ها weightهای مختلف را امتحان کنید. اگر وزن بالا identity را حفظ می‌کند ولی تصویر مصنوعی می‌شود، شاید sweet spot پایین‌تر باشد.

مهم است که model base، sampler و resolution تست ثابت باشند.

نسخه‌گذاری LoRA

فایل نهایی را final.safetensors ننامید.

مثلاً:

  • character-v01-1500steps
  • character-v02-clean-dataset
  • character-v03-caption-fix

همراه هر نسخه یک notes کوتاه بگذارید:

  • base model؛
  • dataset count؛
  • resolution؛
  • learning rate؛
  • steps/epochs؛
  • تاریخ؛
  • مشکل نسخه.

Dataset و حریم خصوصی

اگر LoRA برای چهره واقعی یا محصول منتشرنشده است، Local Training مزیت مهمی دارد؛ فایل‌ها لازم نیست برای سرویس ناشناس آپلود شوند.

اما dataset خودش دارایی حساس است. backup، access control و حذف نسخه‌های اضافی را جدی بگیرید.

ComfyUI برای تست LoRA

برای تست، یک workflow ثابت بسازید:

  • base model ثابت؛
  • prompt ثابت؛
  • seed ثابت؛
  • فقط LoRA/weight تغییر کند.

در ComfyUI حرفه‌ای درباره طراحی workflow قابل‌مقایسه توضیح داده‌ایم.

خطای رایج: ترکیب چند مشکل

اگر identity، pose و composition هم‌زمان خراب‌اند، LoRA را مقصر ندانید.

ممکن است به:

  • LoRA برای identity؛
  • ControlNet برای pose؛
  • reference برای style؛
  • inpaint برای دست/جزئیات

نیاز داشته باشید.

راهنمای ControlNet دقیقاً همین جداسازی کنترل را توضیح می‌دهد.

معیار LoRA خوب

LoRA خوب باید:

  • concept را سریع فعال کند؛
  • با prompt جدید انعطاف داشته باشد؛
  • جزئیات ناخواسته dataset را تحمیل نکند؛
  • در زاویه‌های خارج از داده فرو نریزد؛
  • با weight منطقی کار کند.

یک خروجی عالی از prompt آموزشی نشانه کافی نیست.

جمع‌بندی

در LoRA لوکال، کیفیت dataset و روش ارزیابی مهم‌تر از مسابقه روی تعداد step است. هدف این نیست که مدل عکس‌های شما را حفظ کند؛ باید مفهوم را یاد بگیرد و در شرایط تازه بازسازی کند.

پرسش‌های متداول

LoRA چیست؟

روش سبک‌تری برای سازگارکردن مدل با مفهوم، هویت یا سبک است که به‌جای تغییر کل وزن‌های مدل، پارامترهای محدودی را آموزش می‌دهد.

برای LoRA چند تصویر لازم است؟

عدد ثابت وجود ندارد. کیفیت، تنوع و هدف dataset مهم‌تر از تعداد خام است؛ مجموعه کوچک تمیز می‌تواند از مجموعه بزرگ و تکراری بهتر باشد.

چرا LoRA چهره را حفظ می‌کند ولی لباس را هم قفل می‌کند؟

dataset احتمالاً تنوع کافی نداشته و مدل هویت و لباس را به هم گره زده است. باید متغیرهای ناخواسته در داده متنوع شوند.

آیا LoRA همیشه بهتر از reference image است؟

نه. اگر چند reference بتوانند هویت را حفظ کنند، آموزش اضافه شاید لازم نباشد. LoRA زمانی ارزش دارد که consistency پایدارتر یا مفهوم اختصاصی بخواهید.

#LoRA#آموزش مدل#Consistency#ComfyUI#Local AI