維持角色一致性的方法,是在文字中定義不可變的特徵,並透過視覺參考來錨定這些特徵,接著嚴格控制光照與角度等變數。這需要在工作流程中將角色的身分與場景背景分開處理。
生成式 AI 中的角色漂移問題
生成式模型以機率方式解讀提示詞。當你要求特定角色時,模型會從可能的解釋分佈中進行取樣。若無約束條件,每次生成都是一次新的隨機結果。面部結構、頭髮質感或服裝細節上的微小差異會在各張圖片間累積。這種漂移之所以發生,是因為模型優先考慮整體構圖與光照,而非特定的身分標記。若不主動約束輸出結果,角色將變成一個泛化的原型,而非具體的個人。
在提示詞中定義不可變的角色特徵
你必須識別出定義該角色的特徵,並將其視為不可協商。這些就是不可變的特徵。它們包括特定的面部幾何結構、眼睛顏色、頭髮形狀以及獨特的服裝項目。不要使用如「酷」或「神秘」等模糊的詞彙來描述角色。應描述具體的物理現實。與其說「粗獷的外表」,不如明確寫出「短髮、左眉上方有疤痕、舊皮夾克」。
- 將不可變的特徵列在固定的文字區塊中。
- 確保每個提示詞中的這個區塊完全相同。
- 將這個區塊放在提示詞的開頭,以賦予其較高的權重。
- 避免使用暗示多種解釋的形容詞。使用具體的名詞與物理描述詞。
如果你改變頭髮的描述,模型可能會將新的描述解讀為不同的角色。文字提示詞是主要的錨點。如果文字含糊不清,圖片就會不一致。
使用參考圖片與風格錨點
對於複雜的角色,僅靠文字往往不夠充分。視覺參考提供了空間與風格上的錨點。你上傳角色的圖片來引導模型對身分的解讀。這就是特定工具在流程中發揮作用的地方。
- Midjourney:當您需要參考特定角色圖像,以確保新世代生成中面部特徵與風格的一致性時使用。
- Adobe Firefly:當您需要在 Creative Cloud 生態系統中上傳角色參考圖像,以引導生成圖像的風格與識別特徵時使用。
- Leonardo.Ai:當您需要在多次圖像生成中鎖定特定角色特徵與美學風格時選用。
- Stable Diffusion:透過在角色資料集上進行 LoRA 訓練,或使用 ControlNet 鎖定姿態與結構,以實現進階一致性。
- Krea:當您需要上傳圖像以在即時生成中維持角色識別特徵與風格時應用。
- Runway:當您在生成視頻序列或動畫靜態角色設計時需要維持角色一致性時採用。
- DALL-E 3:由於缺乏原生圖像參考功能,需依賴詳細且具體的文字提示與反覆優化來維持角色一致性時使用。
使用這些工具時,請依據面部結構是否與參考圖像相符來評估輸出結果,而非場景是否美觀。若面部錯誤,場景便無關緊要。
管理光照與角度變化
光照與角度是造成感知不一致最常見的原因。同一角色在明亮日光下與陰影中的外觀會有所不同。這並非漂移,而是物理現象。然而,模型常將光照變化解讀為識別特徵的變化。
- 若希望角色外觀保持一致,請維持光照描述的一致性。
- 若改變角度,預期面部特徵會發生位移。
- 使用中性光照製作角色設定圖,以確立基礎識別特徵。
- 僅在識別特徵鎖定後,才應用戲劇性光照。
若先在暗巷生成角色,接著在明亮攝影棚生成,模型可能將陰影解讀為不同的面部結構。請將識別特徵與環境分離。先在無特定環境背景下生成角色,再透過合成或特定提示加入目標環境。
反覆優化與負向提示
第一次嘗試通常無法達到理想效果。反覆精修是工作流程的核心。生成多個變體。選出最接近目標特徵的那一個。將該選擇作為新的參考基準。這會建立一個回饋迴圈,從而提升一致性。
負面提示詞至關重要。你必須告訴模型什麼是不該做的。
- 在負面提示詞中列出常見的偏差。
- 納入「不同的臉」、「錯誤的髮型」或「通用特徵」等詞彙。
- 隨著發現新的錯誤類型,持續更新負面提示詞。
如果模型持續為角色生成不同的鼻型,請在負面提示詞中加入「錯誤的鼻型」。這能主動抑制特徵漂移。
破壞一致性的常見錯誤
大多數的一致性失敗源於工作流程錯誤,而非工具限制。
- 在不同提示詞之間更改角色描述。
- 使用模糊的形容詞而非具體的物理特徵描述。
- 在判斷特徵時忽略光照環境。
- 未能使用負面提示詞來抑制偏差。
- 期望在不進行反覆精修的情況下獲得完美一致性。
- 使用單一且品質低或含義模糊的參考圖片。
若犯下這些錯誤,沒有任何工具能挽救局面。工作流程必須嚴謹。文字必須精準。參考資料必須清晰。迭代必須持續進行。
