維持敘事連貫性的方法,是為角色與環境建立嚴格的視覺錨點,並在每個獨立片段中嚴格控制鏡頭位置與燈光參數。生成式影片的時序一致性並非依賴模型理解你的故事來達成,而是透過將每個影片片段視為靜態、預先定義之視覺狀態的獨立渲染來實現。
生成式影片中的時序不連續問題
生成式影片模型依據 Prompt 與有限的上下文視窗預測畫面。它們並不具備對前一個片段中角色樣貌的持久記憶。若你生成一段五秒的影片,顯示一名女子走在街上,接著生成第二段五秒影片顯示她轉身,模型會將第二個 Prompt 視為全新的獨立指令。若無明確約束,模型很可能改變她的臉部特徵、髮色、服裝質感,甚至身高。這種現象稱為時序不連續。模型優化的是當前 Prompt 內的合理性,而非對整體敘事身份的忠實度。為解決此問題,你必須從允許詮釋的自然語言描述,轉向不留變異空間的嚴格、宣告式規範。
定義視覺錨點:鎖定角色與環境描述符
在生成任何動作之前,你必須以絕對精準度定義主體與場景的視覺身份。為每個角色建立主要描述符。該描述符應包含不可變屬性:年齡、種族、特定臉部特徵(例如:「堅毅的下顎線,左眉上有輕微疤痕」)、髮型與髮色,以及精確到圖案與剪裁的服裝細節。不要使用模糊用語如「酷帥穿搭」或「神秘女子」。相反地,應指定「身穿炭灰色羊毛大衣,鈕扣扣至頸部,搭配紅色絲質圍巾」。將此描述符撰寫一次,並複製貼上到涉及該角色的每個 Prompt 中。
For 環境場景,做法相同。以空間與紋理常數定義場景位置。若場景為圖書館,請說明書架木材種類、地毯顏色及主光源位置。這些描述詞構成你的視覺錨點,是所有動態建構的靜態基礎。若在片段間更改描述詞,將破壞連貫性。若省略描述詞,模型將以其統計平均值填補空缺,這可能與前一個片段不同。
提示鏡頭運動與空間關係
鏡頭語言是敘事斷裂最常發生的環節。模型常對「鏡頭跟隨」或「向右搖鏡」等指令產生歧義解讀,導致視角或方位突然跳躍。你必須明確定義鏡頭位置、朝向與運動向量。與其說「鏡頭跟隨角色移動」,不如指定「靜態中景、平視角度、鏡頭固定於位置 A,角色從左至右橫跨畫面移動」。若需要移動鏡頭,請定義路徑:「緩慢向前推軌,維持平視角度,跟蹤角色背影。」
空間關係必須相對於鏡頭鎖定,而非僅彼此相對。若角色 A 面對角色 B,請說明其相對位置與朝向。「角色 A 位於畫面左側三分之一處,面向右方。角色 B 位於右側三分之一處,面向左方。兩者相距兩公尺。」這種幾何鎖定可防止模型在鏡頭間交換位置或改變互動角度。使用「側面視角」、「四分之三視角」及「正面直視」等術語來固定臉部與身體朝向。
管理燈光與調色一致性
光線是連貫性中最微妙卻至關重要的環節。若光源位置或強度在不同片段間發生變化,陰影將隨之位移,使整體序列看起來像是兩部不同的電影。請在主要描述符中定義您的燈光佈局。明確指定主光源(例如:「單一頂部螢光燈管,冷白光,4000K」)、陰影方向以及環境補光。請在每個提示詞中包含調色指令。若敘事風格為黑色電影(Noir),請指定「高對比、低飽和度調色盤、青橙色陰影調」;若風格明亮愉悅,則指定「柔和漫射日光、暖色高光、低對比」。這些調色參數必須在場景的所有片段中保持恆定。若您希望因敘事效果而改變燈光,請將其設定為刻意設計的提示轉換,而非無意的漂移。
鏈接片段:使用尾幀作為起始幀
維持跨片段連貫性最有效的方法是鏈接技術。生成序列時,提取片段 1 的最後一幀,並將其用作片段 2 的起始幀或參考圖像。這迫使模型從上一片段結束時的確切視覺狀態開始生成。即使新動作的提示文字略有差異,起始幀的視覺錨點仍能鎖定角色的外觀、燈光和相機位置。這種方法優於僅依賴文字提示來維持連貫性,因為它繞過了模型對身份描述符的概率性解讀。若您的工具支援圖生視頻或關鍵幀插值,請加以利用。若不支援,請將尾幀用作風格參考或修復約束,以確保下一個片段的開頭與上一片段的結尾相匹配。
常見錯誤:過度指定動作與不足指定上下文
創作者常陷入兩個極端陷阱。第一個是過度指定動作。若您描述身體的每一個微觀細節——「她眨眼,她轉移重心,頭髮隨風擺動」——模型可能會不堪重負,從而忽略核心動作或生成物理上不合理的結果。請保持動作描述的高層次與動態感:「向前走」、「轉頭」、「舉手」。讓模型處理微觀機制即可。
第二個問題是上下文資訊不足。若你依賴模型從模糊提示中推斷角色身份或場景光照,便會失去控制權。若未重新陳述視覺錨點,你不能假設模型會記得前一段影片中的角色。若未明確限制光照條件,你不能假設光照會保持一致。原則很簡單:以極度詳細的方式指定不變元素(身份、光照、相機位置),並以高度簡潔的方式指定可變元素(動作、行為)。
