انسجام شخصیت با تعریف ویژگیهای تغییرناپذیر در متن و تثبیت آنها با مراجع بصری حفظ میشود، سپس متغیرهایی مانند نورپردازی و زاویه بهدقت کنترل میگردند. این کار با جداسازی هویت شخصیت از زمینه صحنه در جریان کاری شما انجام میشود.
مسئله لغزش شخصیت در هوش مصنوعی مولد
مدلهای مولد پرامپتها را بهصورت احتمالاتی تفسیر میکنند. هنگامی که برای یک شخصیت خاص درخواست میدهید، مدل از توزیعی از تفسیرهای ممکن نمونهبرداری میکند. بدون قیدها، هر تولید یک تاساندازی جدید است. تغییرات جزئی در ساختار صورت، بافت مو یا جزئیات لباس در طول تصاویر انباشته میشوند. این لغزش رخ میدهد زیرا مدل ترکیببندی کلی و نورپردازی را بر نشانگرهای هویتی خاص اولویت میدهد. اگر خروجی را بهطور فعال محدود نکنید، شخصیت به یک آرکیتایپ عمومی تبدیل میشود نه یک فرد مشخص.
تعریف ویژگیهای تغییرناپذیر شخصیت در پرامپتها
باید ویژگیهایی که شخصیت را تعریف میکنند شناسایی کرده و آنها را غیرقابلمذاکره در نظر بگیرید. اینها ویژگیهای تغییرناپذیر هستند. شامل هندسه خاص صورت، رنگ چشم، شکل مو و آیتمهای لباس منحصربهفرد میشوند. شخصیت را با عبارات مبهمی مانند «باحال» یا «رمزآلود» توصیف نکنید. واقعیت فیزیکی را توصیف کنید. به جای «ظاهری خشن»، بنویسید «موی کوتاه قیچیشده، جای زخم بالای ابروی چپ، کت چرمی فرسوده».
- ویژگیهای تغییرناپذیر را در یک بلوک متنی ثابت لیست کنید.
- این بلوک را برای هر پرامپت یکسان نگه دارید.
- این بلوک را در ابتدای پرامپت قرار دهید تا وزن بالایی داشته باشد.
- از صفتهایی که تفسیرهای متعدد را القا میکنند پرهیز کنید. از اسمهای عینی و توصیفکنندههای فیزیکی استفاده کنید.
اگر توصیف مو را تغییر دهید، مدل ممکن است توصیف جدید را بهعنوان شخصیتی متفاوت تفسیر کند. متن پرامپت لنگر اصلی است. اگر متن مبهم باشد، تصویر ناهماهنگ خواهد بود.
استفاده از تصاویر مرجع و لنگرهای سبک
متن بهتنهایی اغلب برای شخصیتهای پیچیده کافی نیست. مراجع بصری یک لنگر مکانی و سبک ارائه میدهند. شما تصویری از شخصیت را برای هدایت تفسیر مدل از هویت آپلود میکنید. اینجاست که ابزارهای خاص در فرآیند جای میگیرند.
- Midjourney را زمانی انتخاب کنید که به تصویری مرجع از شخصیت نیاز دارید تا ویژگیهای چهره و سبک در نسلهای جدید یکسان باقی بمانند.
- Adobe Firefly زمانی کاربرد دارد که لازم است تصویری مرجع از شخصیت بارگذاری کنید تا سبک و هویت تصاویر تولیدشده در اکوسیستم Creative Cloud هدایت شود.
- Leonardo.Ai را زمانی برگزینید که میخواهید ویژگیها و زیباییشناسی خاصی را در چندین نسل تصویر قفل کنید.
- Stable Diffusion برای دستیابی به یکپارچگی پیشرفته از طریق آموزش LoRA روی مجموعه دادههای شخصیت یا استفاده از ControlNet جهت قفل کردن پوز و ساختار به کار میرود.
- Krea زمانی اعمال میشود که نیاز دارید تصویری را بارگذاری کنید تا هویت و سبک شخصیت در تولید بلادرنگ حفظ شود.
- Runway زمانی به کار گرفته میشود که باید یکپارچگی شخصیت را هنگام تولید توالیهای ویدیویی یا انیمیت کردن طرحهای ایستای شخصیت حفظ کنید.
- DALL-E 3 زمانی مورد اتکا قرار میگیرد که باید یکپارچگی شخصیت را از طریق پرامپتهای متنی دقیق و جزئی و اصلاحات تکراری حفظ کنید، زیرا این ابزار فاقد قابلیت بومی ارجاع تصویری است.
هنگام استفاده از این ابزارها، خروجی را بر اساس تطابق ساختار چهره با تصویر مرجع ارزیابی کنید. آن را بر اساس خوب به نظر رسیدن صحنه داوری نکنید. اگر چهره نادرست باشد، صحنه بیاهمیت است.
مدیریت تغییرات نور و زاویه
نور و زاویه شایعترین علل درک ناهمگونی هستند. شخصیتی در نور روشن روز با همان شخصیت در سایه متفاوت به نظر میرسد. این لغزش نیست؛ بلکه فیزیک است. با این حال، مدلها اغلب تغییرات نور را به عنوان تغییرات هویت تفسیر میکنند.
- اگر میخواهید شخصیت یکسان به نظر برسد، توضیحات نور را یکسان نگه دارید.
- اگر زاویه را تغییر دهید، انتظار داشته باشید که ویژگیهای چهره جابهجا شوند.
- برای ایجاد هویت پایه در برگههای شخصیت، از نور خنثی استفاده کنید.
- نورپردازی دراماتیک را تنها پس از قفل شدن هویت اعمال کنید.
اگر شخصیتی را در یک کوچه تاریک و سپس در یک استودیوی روشن تولید کنید، مدل ممکن است سایهها را به عنوان ساختارهای چهره متفاوت تفسیر کند. هویت را از محیط جدا کنید. ابتدا شخصیت را در یک زمینه خنثی تولید کنید. سپس برای محیط خاص، ترکیببندی یا پرامپتنویسی انجام دهید.
اصلاح تکراری و پرامپتنویسی منفی
در اولین تلاش نتیجه مطلوب را نخواهید گرفت. بهبود تکراری، هسته اصلی گردش کار است. چندین نسخه تولید کنید. گزینهای را انتخاب کنید که به هویت هدف نزدیکتر است. آن انتخاب را بهعنوان مرجع جدید استفاده کنید. این کار حلقه بازخوردی ایجاد میکند که ثبات را افزایش میدهد.
پرامپتهای منفی ضروری هستند. باید به مدل بگویید چه کاری انجام ندهد.
- انحرافات رایج را در پرامپت منفی خود فهرست کنید.
- از عباراتی مانند "چهره متفاوت"، "موهای اشتباه" یا "ویژگیهای عمومی" استفاده کنید.
- با مشاهده انواع جدید خطاها، پرامپت منفی را بهروزرسانی کنید.
اگر مدل همچنان شکل بینی متفاوتی به شخصیت میدهد، عبارت "شکل بینی اشتباه" را به پرامپت منفی اضافه کنید. این کار بهطور فعال انحراف را سرکوب میکند.
اشتباهات رایج که ثبات را مختل میکنند
بیشتر شکستهای ثبات ناشی از خطاهای گردش کار است، نه محدودیتهای ابزار.
- تغییر توصیف شخصیت بین پرامپتها.
- استفاده از صفتهای مبهم به جای توصیفکنندههای فیزیکی.
- نادیده گرفتن زمینه نورپردازی هنگام ارزیابی هویت.
- عدم استفاده از پرامپتهای منفی برای سرکوب انحرافات.
- انتظار ثبات کامل بدون بهبود تکراری.
- استفاده از یک تصویر مرجع تک که کیفیت پایین یا مبهم دارد.
اگر این اشتباهات را مرتکب شوید، هیچ ابزاری شما را نجات نخواهد داد. گردش کار باید منظم باشد. متن باید دقیق باشد. مراجع باید شفاف باشند. تکرار باید مداوم باشد.
