AI Creative Guide

Průvodce

Jak zadávat prompty pro konzistentní design postav v AI

Jak udržet konzistenci postavy napříč více obrázky vygenerovanými pomocí AI?

Konzistence postavy se dosahuje definováním neměnných rysů v textu a jejich ukotvením vizuálními referencemi, následně přísným řízením proměnných, jako je osvětlení a úhel pohledu. Toho dosáhnete oddělením identity postavy od kontextu scény ve svém pracovním postupu.

Problém driftu postavy v generativní AI

Generativní modely interpretují prompty pravděpodobnostně. Když požadujete konkrétní postavu, model vzorkuje z distribuce možných interpretací. Bez omezení je každá generace novým hodem kostkou. Malé variace ve struktuře obličeje, textuře vlasů nebo detailech oblečení se napříč obrázky kumulují. Tento drift nastává proto, že model upřednostňuje celkovou kompozici a osvětlení před konkrétními identifikátory identity. Pokud výstup aktivně neomezíte, postava se stane generickým archetypem místo konkrétního jedince.

Definování neměnných rysů postavy v promptech

Musíte identifikovat rysy, které definují postavu, a považovat je za nezpochybnitelné. To jsou neměnné rysy. Patří mezi ně specifická geometrie obličeje, barva očí, tvar vlasů a unikátní kusy oblečení. Nepopisujte postavu vágními pojmy jako „cool“ nebo „mysterious“. Popište fyzickou realitu. Místo „hrubý vzhled“ specifikujte „krátké střižené vlasy, jizva nad levým obočím, ošoupaná kožená bunda.“

  • Seznamte neměnné rysy v pevném bloku textu.
  • Tento blok ponechte pro každý prompt identický.
  • Umístěte tento blok na začátek promptu, aby získal vysokou váhu.
  • Vyhněte se přídavným jménům, která implikují více interpretací. Používejte konkrétní podstatná jména a fyzické popisovače.

Pokud změníte popis vlasů, model může nový popis interpretovat jako jinou postavu. Textový prompt je primární kotva. Pokud je text nejednoznačný, bude obrázek nekonzistentní.

Používání referenčních obrázků a stylových kotev

Samotný text často nestačí pro složité postavy. Vizuální reference poskytují prostorovou a stylovou kotvu. Nahrajete obrázek postavy, který řídí interpretaci identity modelem. Zde se do procesu zapojují konkrétní nástroje.

  • Midjourney se používá, když potřebujete odkazovat na konkrétní obrázek postavy, aby byla zajištěna konzistence rysů obličeje a stylu napříč novými generacemi.
  • Adobe Firefly se používá, když potřebujete nahrát referenční obrázek postavy pro řízení stylu a identity generovaných obrázků v rámci ekosystému Creative Cloud.
  • Leonardo.Ai se volí, když potřebujete uzamknout specifické vlastnosti postavy a estetiku napříč více generacemi obrázků.
  • Stable Diffusion se využívá pro pokročilou konzistenci prostřednictvím trénování LoRA na datech postav nebo pomocí ControlNet pro uzamčení pózy a struktury.
  • Krea se aplikuje, když potřebujete nahrát obrázek pro udržení identity a stylu postavy při generování v reálném čase.
  • Runway se používá, když potřebujete udržet konzistenci postavy při generování video sekvencí nebo animaci statických designů postav.
  • DALL-E 3 se spoléhá na detailní a specifické textové prompty a iterativní zdokonalování pro udržení konzistence postavy, protože postrádá nativní funkci odkazování na obrázek.

Při používání těchto nástrojů hodnotte výstup podle toho, zda struktura obličeje odpovídá referenci. Nehodnoťte jej podle toho, zda scéna vypadá dobře. Pokud je obličej špatný, scéna je irelevantní.

Správa variací osvětlení a úhlu

Osvětlení a úhel jsou nejčastější příčiny vnímané nekonzistence. Postava ve světlém denním světle vypadá jinak než stejná postava ve stínu. To není drift; je to fyzika. Modely však často interpretují změny osvětlení jako změny identity.

  • Pokud chcete, aby postava vypadala stejně, udržujte popis osvětlení konzistentní.
  • Pokud změníte úhel, očekávejte posun rysů obličeje.
  • Pro listy postav používejte neutrální osvětlení k vytvoření základní identity.
  • Dramatické osvětlení aplikujte až poté, co je identita uzamčena.

Pokud vygenerujete postavu v tmavé uličce a poté ve světlém studiu, model může interpretovat stíny jako různé struktury obličeje. Oddělte identitu od prostředí. Nejprve vygenerujte postavu v neutrálním kontextu. Poté kompozitujte nebo promptujte pro specifické prostředí.

Iterativní zdokonalování a negativní prompting

Na první pokus to nebude dokonalé. Iterativní zdokonalování je jádrem pracovního postupu. Vygenerujte více variant. Vyberte tu, která je nejblíže cílové identitě. Použijte tento výběr jako nový referenční bod. Vznikne tak zpětnovazební smyčka, která zvyšuje konzistenci.

Negativní promptování je nezbytné. Modelu musíte říct, co nemá dělat.

  • Uveďte běžné odchylky v negativním promptu.
  • Použijte pojmy jako „different face“, „wrong hair“ nebo „generic features“.
  • Aktualizujte negativní prompt, jakmile zaznamenáte nové typy chyb.

Pokud model stále přiřazuje postavě jiný tvar nosu, přidejte do negativního promptu „wrong nose shape“. Tím aktivně potlačíte posun.

Běžné chyby, které narušují konzistenci

Většina problémů s konzistencí pramení z chyb v pracovním postupu, nikoli z omezení nástrojů.

  • Měnit popis postavy mezi jednotlivými promptami.
  • Používat neurčité přídavná jména místo fyzických popisů.
  • Při hodnocení identity ignorovat kontext osvětlení.
  • Nepoužívat negativní promptování k potlačení odchylek.
  • Očekávat dokonalou konzistenci bez iterativního ladění.
  • Používat jednu referenční fotografii, která je nízké kvality nebo nejasná.

Pokud budete dělat tyto chyby, žádný nástroj vás nezachrání. Pracovní postup musí být disciplinovaný. Text musí být přesný. Odkazy musí být jasné. Iterace musí být nepřetržitá.

Reklama
Reklama