AI Creative Guide

Przewodnik

Jak formułować prompty dla AI w celu uzyskania spójnego projektu postaci

Jak zachować spójność postaci w wielu obrazach wygenerowanych przez AI?

Spójność postaci zapewnia się poprzez definiowanie niezmiennych cech w tekście i zakotwiczanie ich za pomocą referencji wizualnych, a następnie ścisłe kontrolowanie zmiennych, takich jak oświetlenie i kąt. Osiąga się to poprzez oddzielenie tożsamości postaci od kontekstu sceny w procesie pracy.

Problem dryfu postaci w generatywnym AI

Modele generatywne interpretują prompty probabilistycznie. Gdy prosisz o konkretną postać, model pobiera próbki z rozkładu możliwych interpretacji. Bez ograniczeń każda generacja jest nowym rzutem kostką. Drobne różnice w strukturze twarzy, teksturze włosów czy szczegółach ubioru kumulują się między obrazami. Ten dryf wynika z faktu, że model priorytetyzuje ogólną kompozycję i oświetlenie ponad konkretne znaczniki tożsamości. Jeśli aktywnie nie ograniczysz wyjścia, postać stanie się generycznym archetypem zamiast konkretną jednostką.

Definiowanie niezmiennych cech postaci w promptach

Musisz zidentyfikować cechy definiujące postać i traktować je jako nienegocjowalne. Są to cechy niezminne. Obejmują one konkretną geometrię twarzy, kolor oczu, kształt włosów oraz unikalne elementy ubioru. Nie opisuj postaci w niejasnych terminach takich jak „cool” czy „mysterious”. Opisuj rzeczywistość fizyczną. Zamiast „surowy wygląd”, określ „krótko ścięte włosy, blizna nad lewą brwią, znoszona skórzana kurtka”.

  • Wypisz niezminne cechy w stałym bloku tekstu.
  • Zachowaj ten blok identyczny dla każdego promptu.
  • Umieść ten blok na początku promptu, aby nadać mu wysoką wagę.
  • Unikaj przymiotników sugerujących wiele interpretacji. Stosuj konkretne rzeczowniki i deskryptory fizyczne.

Jeśli zmienisz opis włosów, model może zinterpretować nowy opis jako inną postać. Tekstowy prompt jest głównym kotwiczeniem. Jeśli tekst jest niejednoznaczny, obraz będzie niespójny.

Wykorzystanie obrazów referencyjnych i kotwic stylu

Sam tekst często jest niewystarczający dla złożonych postaci. Referencje wizualne zapewniają kotwiczenie przestrzenne i stylistyczne. Przesyłasz obraz postaci, aby kierować interpretacją tożsamości przez model. Tutaj konkretne narzędzia wpisują się w proces.

  • Midjourney sprawdza się, gdy potrzebujesz odnieść się do konkretnego obrazu postaci, aby zapewnić spójne cechy twarzy i stylizację w kolejnych generacjach.
  • Adobe Firefly wykorzystujesz, gdy musisz przesłać obraz referencyjny postaci, aby kierować stylem i tożsamością generowanych obrazów w ekosystemie Creative Cloud.
  • Leonardo.Ai wybierasz, gdy chcesz zablokować określone cechy postaci i estetykę w wielu generacjach obrazów.
  • Stable Diffusion stosuje się do zaawansowanej spójności poprzez trenowanie LoRA na zbiorach danych postaci lub używanie ControlNet do blokowania pozy i struktury.
  • Krea aplikujesz, gdy musisz przesłać obraz, aby zachować tożsamość i styl postaci w generowaniu w czasie rzeczywistym.
  • Runway wykorzystujesz, gdy musisz zachować spójność postaci podczas generowania sekwencji wideo lub animowania statycznych projektów postaci.
  • DALL-E 3 polega na szczegółowych, konkretnych promptach tekstowych i iteracyjnym dopracowywaniu, aby zachować spójność postaci, ponieważ nie posiada natywnej funkcji referencji obrazu.

Gdy korzystasz z tych narzędzi, oceniaj wynik pod kątem tego, czy struktura twarzy odpowiada referencji. Nie oceniaj go pod kątem tego, czy scena wygląda dobrze. Jeśli twarz jest błędna, scena jest nieistotna.

Zarządzanie wariacjami oświetlenia i kąta

Oświetlenie i kąt to najczęstsze przyczyny postrzeganej niespójności. Postać w jasnym świetle dziennym wygląda inaczej niż ta sama postać w cieniu. To nie jest dryf; to fizyka. Jednak modele często interpretują zmiany oświetlenia jako zmiany tożsamości.

  • Zachowaj opis oświetlenia zgodny, jeśli chcesz, aby postać wyglądała tak samo.
  • Jeśli zmienisz kąt, spodziewaj się przesunięcia cech twarzy.
  • Używaj neutralnego oświetlenia dla arkuszy postaci, aby ustalić bazową tożsamość.
  • Stosuj dramatyczne oświetlenie dopiero po zablokowaniu tożsamości.

Jeśli wygenerujesz postać w ciemnej alejce, a następnie w jasnym studio, model może zinterpretować cienie jako różne struktury twarzy. Oddziel tożsamość od otoczenia. Najpierw wygeneruj postać w neutralnym kontekście. Następnie skomponuj lub użyj promptu dla konkretnego środowiska.

Iteracyjne dopracowywanie i negatywne promptowanie

Za pierwszym razem nie uzyskasz idealnego efektu. Iteracyjne dopracowywanie jest kluczowym elementem procesu. Generuj wiele wariantów. Wybierz ten najbliższy docelowemu wizerunkowi. Użyj tego wyboru jako nowego punktu odniesienia. Tworzy to pętlę sprzężenia zwrotnego, która zwiększa spójność.

Negatywne podpowiedzi są niezbędne. Musisz powiedzieć modelowi, czego nie robić.

  • Wymień typowe odchylenia w negatywnej podpowiedzi.
  • Uwzględnij terminy takie jak "different face", "wrong hair" lub "generic features".
  • Aktualizuj negatywną podpowiedź w miarę pojawiania się nowych typów błędów.

Jeśli model nadal nadaje postaci inny kształt nosa, dodaj "wrong nose shape" do negatywnej podpowiedzi. Aktywnie tłumi to dryfowanie.

Typowe błędy naruszające spójność

Większość problemów ze spójnością wynika z błędów w procesie pracy, a nie z ograniczeń narzędzi.

  • Zmiana opisu postaci między kolejnymi podpowiedziami.
  • Stosowanie ogólnikowych przymiotników zamiast konkretnych opisów fizycznych.
  • Ignorowanie kontekstu oświetlenia przy ocenie identyczności.
  • Niezastosowanie negatywnych podpowiedzi do tłumienia odchyleń.
  • Oczekiwanie idealnej spójności bez iteracyjnego dopracowywania.
  • Korzystanie z pojedynczego obrazu referencyjnego niskiej jakości lub niejednoznacznego.

Jeśli popełnisz te błędy, żadne narzędzie Cię nie uratuje. Proces pracy musi być zdyscyplinowany. Tekst musi być precyzyjny. Materiały referencyjne muszą być czytelne. Iteracja musi być ciągła.

Reklama
Reklama