آموزش LoRA لوکال؛ ساخت ثبات کاراکتر، محصول و استایل
LoRA لوکال وقتی ارزش دارد که reference ساده دیگر برای حفظ هویت کاراکتر، محصول یا سبک کافی نباشد. کیفیت dataset، caption و تست نسخهها از تعداد step مهمتر است و یک آموزش بد میتواند مدل را به حفظکردن چند تصویر محدود کند.

LoRA لوکال زمانی جذاب میشود که تولید یک تصویر خوب دیگر کافی نیست. شما میخواهید همان کاراکتر، همان محصول یا همان زبان بصری در دهها خروجی تکرار شود، بدون اینکه هر بار از صفر برای هویت بجنگید.
اما LoRA دکمه «ثبات» نیست. یک dataset بد میتواند مدل را overfit کند، لباس را به چهره بچسباند یا فقط همان زاویههای آموزشی را تکرار کند.
LoRA لوکال چه چیزی را یاد میدهد؟
LoRA روشی برای adaptation مدل است که بهجای آموزش تمام وزنهای مدل، بخش کوچکتری از پارامترها را یاد میگیرد. نتیجه معمولاً فایل بسیار کوچکتر از checkpoint کامل است و میتوان آن را روی مدل پایه اعمال کرد.
کاربردهای رایج:
- هویت کاراکتر؛
- محصول خاص؛
- style؛
- لباس یا costume؛
- material؛
- visual language برند.
منبع فنی مناسب برای workflowهای Diffusers: راهنمای LoRA در Hugging Face
قبل از LoRA بپرسید آیا واقعاً لازم است؟
مدلهای جدید image editing و multi-reference قویتر شدهاند. مثلاً Qwen-Image-2.1 و FLUX.2 میتوانند در بعضی سناریوها با reference نتیجه کافی بدهند.
قاعده عملی:
Reference اول، LoRA وقتی reference کافی نیست.
چون آموزش هزینه زمان، dataset و نگهداری نسخه ایجاد میکند.
Dataset مهمتر از تعداد Step است
فرض کنید برای چهره یک نفر ۳۰ عکس دارید، اما ۲۵ عکس با لباس مشکی و پسزمینه سفید است. مدل ممکن است لباس مشکی را بخشی از هویت بداند.
Dataset خوب باید تغییر کنترلشده داشته باشد:
- زاویه؛
- فاصله دوربین؛
- نور؛
- پسزمینه؛
- expression؛
- لباس، اگر لباس نباید جزو مفهوم باشد.
برای محصول، لوگو و geometry باید دقیق بماند، اما محیط و نور متنوع باشد.
تصویر بد را فقط چون «داده بیشتر» است نگه ندارید
مواردی که بهتر است حذف شوند:
- blur ناخواسته؛
- watermark؛
- distortion؛
- crop عجیب؛
- duplicate نزدیک؛
- رنگ شدیداً خراب؛
- تصویرهایی که مفهوم اشتباه دارند.
۲۰ تصویر تمیز میتواند از ۸۰ تصویر پر از نویز بهتر باشد.
Caption باید چه چیزی را بگوید؟
Caption قرار نیست همه pixelها را توصیف کند. هدف این است که به مدل کمک کند بفهمد کدام ویژگی متعلق به token/concept شماست و کدام ویژگی متغیر است.
اگر لباس باید قابل تغییر باشد، لباس را caption کنید. اگر همیشه آن را نادیده بگیرید، مدل ممکن است لباس را با هویت یکی کند.
برای سبک نیز عناصر محتوایی را توصیف کنید تا مدل style را از subject جدا کند.
Trigger Word؛ نامی که باید خاص باشد
برای مفهوم اختصاصی token یا phrase متمایز انتخاب کنید.
بد:
- man
- shoe
- style
بهتر:
- نام ساختگی کوتاه که در vocabulary روزمره کمتر تداخل دارد.
بعد در تست ببینید آیا بدون trigger هم اثر بیش از حد روی مدل مانده است یا نه.
Validation را از روز اول بسازید
چند prompt ثابت داشته باشید که در طول آموزش تغییر نکنند.
برای character:
- portrait frontal؛
- profile؛
- outdoor full body؛
- نور سخت؛
- لباس متفاوت.
برای product:
- studio packshot؛
- زاویه 3/4؛
- محیط واقعی؛
- close-up material؛
- دست انسان کنار محصول.
این test suite مشخص میکند checkpoint کجا بهتر و کجا بدتر میشود.
Overfitting چه شکلی است؟
نشانهها:
- همه خروجیها شبیه تصاویر dataset؛
- pose تکراری؛
- پسزمینه ثابت؛
- تغییر لباس سخت؛
- prompt adherence پایین؛
- artifactهای dataset در خروجی.
اگر training loss پایینتر میرود ولی انعطاف خراب میشود، «آموزش بیشتر» الزاماً بهتر نیست.
وزن LoRA در Generation
حتی LoRA خوب هم در یک weight ثابت برای همه promptها بهترین نیست.
در تستها weightهای مختلف را امتحان کنید. اگر وزن بالا identity را حفظ میکند ولی تصویر مصنوعی میشود، شاید sweet spot پایینتر باشد.
مهم است که model base، sampler و resolution تست ثابت باشند.
نسخهگذاری LoRA
فایل نهایی را final.safetensors ننامید.
مثلاً:
- character-v01-1500steps
- character-v02-clean-dataset
- character-v03-caption-fix
همراه هر نسخه یک notes کوتاه بگذارید:
- base model؛
- dataset count؛
- resolution؛
- learning rate؛
- steps/epochs؛
- تاریخ؛
- مشکل نسخه.
Dataset و حریم خصوصی
اگر LoRA برای چهره واقعی یا محصول منتشرنشده است، Local Training مزیت مهمی دارد؛ فایلها لازم نیست برای سرویس ناشناس آپلود شوند.
اما dataset خودش دارایی حساس است. backup، access control و حذف نسخههای اضافی را جدی بگیرید.
ComfyUI برای تست LoRA
برای تست، یک workflow ثابت بسازید:
- base model ثابت؛
- prompt ثابت؛
- seed ثابت؛
- فقط LoRA/weight تغییر کند.
در ComfyUI حرفهای درباره طراحی workflow قابلمقایسه توضیح دادهایم.
خطای رایج: ترکیب چند مشکل
اگر identity، pose و composition همزمان خراباند، LoRA را مقصر ندانید.
ممکن است به:
- LoRA برای identity؛
- ControlNet برای pose؛
- reference برای style؛
- inpaint برای دست/جزئیات
نیاز داشته باشید.
راهنمای ControlNet دقیقاً همین جداسازی کنترل را توضیح میدهد.
معیار LoRA خوب
LoRA خوب باید:
- concept را سریع فعال کند؛
- با prompt جدید انعطاف داشته باشد؛
- جزئیات ناخواسته dataset را تحمیل نکند؛
- در زاویههای خارج از داده فرو نریزد؛
- با weight منطقی کار کند.
یک خروجی عالی از prompt آموزشی نشانه کافی نیست.
جمعبندی
در LoRA لوکال، کیفیت dataset و روش ارزیابی مهمتر از مسابقه روی تعداد step است. هدف این نیست که مدل عکسهای شما را حفظ کند؛ باید مفهوم را یاد بگیرد و در شرایط تازه بازسازی کند.
پرسشهای متداول
LoRA چیست؟
روش سبکتری برای سازگارکردن مدل با مفهوم، هویت یا سبک است که بهجای تغییر کل وزنهای مدل، پارامترهای محدودی را آموزش میدهد.
برای LoRA چند تصویر لازم است؟
عدد ثابت وجود ندارد. کیفیت، تنوع و هدف dataset مهمتر از تعداد خام است؛ مجموعه کوچک تمیز میتواند از مجموعه بزرگ و تکراری بهتر باشد.
چرا LoRA چهره را حفظ میکند ولی لباس را هم قفل میکند؟
dataset احتمالاً تنوع کافی نداشته و مدل هویت و لباس را به هم گره زده است. باید متغیرهای ناخواسته در داده متنوع شوند.
آیا LoRA همیشه بهتر از reference image است؟
نه. اگر چند reference بتوانند هویت را حفظ کنند، آموزش اضافه شاید لازم نباشد. LoRA زمانی ارزش دارد که consistency پایدارتر یا مفهوم اختصاصی بخواهید.


