透過為角色同環境設定一個嚴格嘅視覺錨點,然後喺每個獨立片段入面嚴格控制鏡頭位置同燈光參數,你就可以維持敘事連貫性。生成式視頻嘅時間一致性,唔係靠期望模型明白你嘅故事而達成;而係將每個視頻片段視為一個靜態、預先定義視覺狀態嘅獨立渲染來達成。
生成式影片中的時間不連續問題
生成式影片模型透過根據提示詞及有限上下文窗口預測畫面來運作。它們不會保留角色在上一段片段中的持久記憶。如果你生成一段五秒的片段,顯示一名女子在街上行走,然後再生成第二段五秒的片段,顯示她轉身,模型會將第二個提示詞視為一個全新的獨立指令。若無明確限制,模型很可能會改變她的面部特徵、髮色、衣物紋理,甚至身高。這種現象稱為時間不連續性。模型旨在優化當前提示詞內的合理性,而非對全局敘事身份的忠實度。為解決此問題,你必須擺脫容許詮釋的自然語言描述,轉而採用不留變異空間的嚴格聲明式規範。
定義視覺錨點:鎖定角色與環境描述符
喺生成任何動態之前,你必須極度精準咁定義你嘅主角同場景嘅視覺特徵。為每個角色建立一個主要描述符。呢個描述符應該包含不可變嘅屬性:年齡、種族、具體面部特徵(例如:「下顎線條堅實,左眉微有疤痕」)、髮型同髮色,以及詳細到圖案同剪裁嘅服裝細節。唔好用「cool outfit」或者「mysterious woman」呢類含糊嘅詞彙。相反,要具體寫明「身穿深灰色羊毛大衣,鈕扣扣到頸部,配一條紅色絲質圍巾」。將呢個描述符寫一次,然後複製貼上到所有涉及該角色嘅提示詞入面。
處理環境時,做法一樣。用空間和質感常數來定義場景。如果場景是圖書館,請指明書架的木材種類、地毯顏色,以及主光源的位置。這些描述構成你的視覺錨點。它們是所有動作建構其上的靜態基礎。如果你在片段之間更改描述,就會破壞連貫性。如果你省略描述,模型會用自身的統計平均值填補空缺,這會與你之前的片段不同。
提示鏡頭運動和空間關係
鏡頭語言是大多數敘事崩潰發生的地方。模型經常將「鏡頭跟隨」或「向右搖鏡」解讀得含糊不清,導致視角或方向突然跳躍。你必須明確定義鏡頭的位置、方向和運動向量。與其說「鏡頭跟隨角色移動」,不如指定「靜態中景、視平線高度、鏡頭固定在位置 A,角色從左至右橫跨畫面移動」。如果你需要移動鏡頭,請定義路徑:「緩慢向前推軌,保持視平線高度,跟蹤角色背影。」
空間關係必須鎖定在相對於鏡頭的位置,而不只是彼此之間。如果角色 A 面對角色 B,請指明他們的相對位置和朝向。「角色 A 站在畫面左側三分之一處,面向右。角色 B 站在右側三分之一處,面向左。他們相距兩米。」這種幾何鎖定可防止模型在鏡頭之間交換位置或改變互動角度。使用「側面視圖」、「四分之三視圖」和「正面直視」等術語來固定臉部和身體的方向。
管理燈光和調色一致性
燈光係連貫性中最微妙但最關鍵嘅環節。如果光源喺不同片段之間改變位置或者強度,陰影就會移位,令到成個序列睇落好似兩套唔同嘅電影咁。喺主描述符(master descriptor)入面定義好你嘅燈光佈局。指明主要光源(例如「單一頂部熒光燈管,冷白光,4000K」)、陰影方向以及環境補光。喺每個提示詞(prompt)入面都要包含調色指令。如果敘事風格係黑色電影(noir),請指明「高對比度、低飽和度調色板、青橙色陰影調」。如果係明亮愉快嘅風格,請指明「柔和漫射日光、暖色高光、低對比度」。呢啲調色參數必須喺同一場景嘅所有片段中保持不變。如果你想為敘事效果而改變燈光,請將其設定為一個刻意嘅、有明確提示嘅過渡,而唔係意外嘅漂移。
串連片段:將結束幀用作開始幀
維持跨片段連貫性最有效嘅技術係串連(chaining)。當生成一個序列時,提取片段 1 嘅最後一幀,並將其用作片段 2 嘅開始幀或參考圖像。這會迫使模型從上一個片段結束時嘅確切視覺狀態開始生成。即使新動作嘅提示詞文字略有變化,開始幀嘅視覺錨點都會鎖定角色嘅外觀、燈光以及相機位置。這種方法優於僅依賴文字提示來維持連貫性,因為它繞過咗模型對身份描述符嘅概率性解讀。如果你嘅工具支援圖生視頻(image-to-video)或關鍵幀插值,請使用它。如果不支援,請將結束幀用作風格參考或修復(inpainting)約束條件,以確保下一個片段嘅開頭與上一個片段嘅結尾相匹配。
常見錯誤:過度指定動作對比欠指定上下文
創作者經常陷入兩個極端陷阱。第一個係過度指定動作。如果你描述身體嘅每一個微觀細節動作——「她眨眼,她轉移重心,頭髮隨風擺動」,模型就會應付不來,可能會忽略核心動作或者生成物理上不可能嘅結果。請將動作描述保持喺高層次同動態層面:「向前走」、「轉頭」、「舉起手」。讓模型去處理微觀機制。
第二個問題係 context 寫得太粗疏。如果你依賴模型從模糊嘅 prompt 去推斷角色身份或者場景光線,你就會失去控制。如果你唔重新講清楚視覺錨點,就唔可以假設模型會記得上一個片段嘅角色。如果你唔明確限制光線,就唔可以假設光線會保持一致。規則好簡單:極盡詳細咁寫清楚不變嘅元素(身份、光線、相機位置),同時用簡潔嘅高層次描述去寫可變嘅元素(動作、行為)。
The AI Creative Workflow Guide
The reader will be able to select, integrate, and apply AI tools effectively across creative media and design workflows.
Get it — $29