Dryfowanie oświetlenia występuje, gdy kolejne obrazy generowane przez model sztucznej inteligencji wykazują subtelne, ale zauważalne różnice w położeniu źródła światła, poziomie jasności lub odcieniu. Wynika to z faktu, że większość modeli generatywnych traktuje każdą generację obrazu jako niezależne zdarzenie, optymalizując lokalny kontrast i czytelność zamiast ciągłości globalnej. Podczas generowania drugiego obrazu model może nieco inaczej interpretować „jasne poranne światło” niż w przypadku pierwszego obrazu, zmieniając kąt padania słońca lub podnosząc temperaturę balansu bieli. Ta niespójność łudzi złudzenie ciągłej sceny, sprawiając, że sekwencja wydaje się niepołączona, a nie spójna. Aby temu zaradzić, należy traktować oświetlenie nie jako automatyczny produkt uboczny polecenia, lecz jako sztywny warunek określony w tekście i wzmacniany za pomocą odniesień wizualnych.
Definiowanie „kotwicy oświetlenia” w początkowym poleceniu
Najskuteczniejszą metodą zapewnienia spójności jest ustalenie ścisłej tekstowej definicji warunków oświetlenia w pierwszym prompcie. Definicja ta pełni rolę „kotwicy” dla wszystkich kolejnych obrazów. Nie należy polegać na ogólnikowych opisach, takich jak „natural light” czy „bright and airy”, ponieważ są zbyt szerokie i dopuszczają zbyt dużą zmienność interpretacyjną. Zamiast tego należy precyzyjnie określić cechy fizyczne źródła światła pod względem geometrycznym i chromatycznym.
Należy zdefiniować trzy konkretne parametry: kierunek, jakość i temperaturę. Dla kierunku określ dokładnie, skąd pada światło względem obiektu, np. „światło padające z górnego lewego rogu pod kątem 45 stopni”. Dla jakości rozróżnij światło twarde i miękkie, opisując ostrość krawędzi cieni, np. „ostre, wysokie kontrasty z minimalną dyfuzją” versus „miękkie, rozproszone światło z łagodnymi przejściami gradientowymi”. Dla temperatury unikaj subiektywnych określeń takich jak „ciepłe”. Zamiast tego opisz przesunięcie barwy względem neutralnej bieli, np. „lekko złoty odcień typowy dla popołudniowego słońca” lub „chłodne, niebieskawe światło otoczenia charakterystyczne dla wczesnego poranka”. Utrwalając te trzy zmienne w zwięzłym zdaniu, które kopiujesz i wklejasz dosłownie do każdego kolejnego promptu, zapewniasz modelowi stałą strukturę logiczną do naśladowania, co zmniejsza losowość jego interpretacji.
Wykorzystanie obrazów referencyjnych do ustalenia kierunku i intensywności cieni
Sam tekst często nie oddaje precyzyjnie intensywności światła, ponieważ interpretacja modelu pojęcia „jasne” może się zmieniać w zależności od innych elementów promptu. Aby temu zaradzić, użyj obrazu referencyjnego jako wizualnej kotwicy. Technika ta polega na przesłaniu lub dołączeniu konkretnego obrazu, który odwzorowuje dokładnie pożądane warunki oświetleniowe, a następnie poinstruowaniu modelu, aby odwzorował ustawienie oświetlenia z tego obrazu referencyjnego na nowym obiekcie.
Przy wyborze obrazu referencyjnego wybierz taki z wyraźnymi, wyraźnie zarysowanymi cieniami. Płaski, równomiernie oświetlony obraz dostarcza mało informacji o kierunku lub intensywności światła, podczas gdy obraz z silnym światłem kierunkowym daje modelowi wyraźne wskazówki geometryczne. Wprowadzając obraz referencyjny, połącz go ze zwięzłą instrukcją oddzielającą treść od oświetlenia. Na przykład poleć modelowi „zastosuj układ oświetlenia z obrazu referencyjnego do nowego obiektu”. To wymusza na modelu priorytetowanie relacji przestrzennych między źródłami światła a obiektami nad konkretnymi szczegółami samego obrazu referencyjnego. Upewnij się, że obraz referencyjny pozostaje spójny w całej sekwencji. Zmiana obrazów referencyjnych między generacjami wprowadza nowe zmienne, co prowadzi do natychmiastowego dryfu. Zakotwiczając każdą generację na tym samym przykładzie wizualnym, tworzysz gramatykę wizualną powtarzaną przez model dla różnych obiektów, co zapewnia zachowanie proporcjonalności długości i ciemności cieni między kolejnymi ujęciami.
Techniki dostosowywania spójności temperatury barwowej między ujęciami
Nawet przy zachowaniu stałego kierunku i intensywności światła, temperatura barwowa – czyli ciepło lub chłód oświetlenia – może się zmieniać przez wewnętrzne algorytmy balansowania kolorów modelu. Algorytmy te często próbują korygować postrzegane rzuty kolorystyczne w treści obrazu, co może nieumyślnie zmieniać odcień oświetlenia tła. Aby zachować spójność temperatury, należy oddzielić kolor oświetlenia od inherentnych kolorów obiektu.
Skuteczną techniką jest określanie koloru oświetlenia osobno od opisu sceny. Zamiast wtapiać opis oświetlenia w główną narrację, dodaj dedykowaną klauzulę dotyczącą oświetlenia na końcu promptu. Używaj względnych terminów kolorystycznych opisujących relację między źródłami światła, a nie wartości bezwzględne. Na przykład, jeśli chcesz uzyskać neutralny wygląd, określ „neutralny balans kolorów bez dominującego odcienia”. Jeśli chcesz ciepła, określ „ciepło złotej godziny bez przesycenia czerwieni”. Pomaga to zapobiec nadmiernej kompensacji kolorów w scenie przez model. Dodatkowo, jeśli generujesz serię, w której zmienia się pora dnia, opisz zmianę temperatury jako gradient, a nie skok. Na przykład, przejdź od „chłodnego porannego błękitu” przez „neutralną południową biel” do „ciepłego wieczornego złota”, używając pośrednich opisów dla każdego kroku. Tworzy to logiczną progresję, którą model może śledzić, zapewniając, że zmiana koloru wydaje się celowa i płynna, a nie chaotyczna.
Rozwiązywanie problemów z niedopasowanymi światłami i cieniami w finalnych kompozycjach
Mimo starannego tworzenia promptów mogą nadal pojawiać się sporadyczne niedopasowania w intensywności świateł lub głębokości cieni. Podczas przeglądania sekwencji szukaj niespójności w tym, jak jasne są najjaśniejsze części obrazu (światła) i jak ciemne są najgłębsze cienie. Jeśli jeden obraz wygląda na wyblakły, podczas gdy inny wygląda na głęboki i kontrastowy, oznacza to, że intensywność oświetlenia uległa dryfowi.
Aby rozwiązać ten problem, najpierw sprawdź długość promptu. Dłuższe i bardziej złożone prompty mogą osłabiać wpływ konkretnych instrukcji dotyczących oświetlenia. Uprość prompt, usuwając zbędne przymiotniki opisujące obiekt i skupiając się na części dotyczącej oświetlenia. Jeśli rozbieżność utrzymuje się, dostosuj ustawienia „siły” lub „wpływu”, jeśli Twoje narzędzie na to pozwala, nadając większą wagę obrazowi referencyjnemu niż tekstowemu promptowi. Innym częstym problemem jest złożoność tła; zatłoczone tła mogą powodować, że model dostosowuje oświetlenie, aby wyróżnić obiekt, co zmienia ogólną ekspozycję. Aby to naprawić, uprość opis tła w kolejnych promptach, używając określeń takich jak „minimalistyczne tło” lub „jednolite tło”, aby umożliwić przewidywalne zachowanie oświetlenia. Na koniec, jeśli konkretny obraz znacznie odbiega od oczekiwań, wygeneruj go ponownie, używając poprzedniego udanego obrazu jako jedynego punktu odniesienia dla oświetlenia, zamiast polegać wyłącznie na oryginalnym tekście promptu. To iteracyjne dopracowywanie pomaga przywrócić sekwencję do ustalonego punktu odniesienia, zapewniając spójną narrację wizualną.
