आप कैरेक्टर और एनवायरनमेंट के लिए एक सख्त विज़ुअल एंकर स्थापित करके, और हर अलग क्लिप में कैमरा पोज़िशन और लाइटिंग पैरामीटर्स को सख्ती से नियंत्रित करके नैरेटिव कोहेरेंस बनाए रखते हैं। जेनरेटिव वीडियो में टेंपोरल कंसिस्टेंसी इस बात पर निर्भर नहीं होती कि मॉडल आपकी कहानी को समझ ले; यह तब हासिल होती है जब आप हर वीडियो क्लिप को एक स्थिर, पूर्व-परिभाषित विज़ुअल स्टेट के अलग-अलग रेंडरिंग के रूप में मानते हैं।
जेनरेटिव वीडियो में टेंपोरल डिसकंटिन्यूइटी की समस्या
जेनरेटिव वीडियो मॉडल्स एक प्रॉम्प्ट और एक सीमित कॉन्टेक्स्ट विंडो के आधार पर फ्रेम्स की भविष्यवाणी करके काम करते हैं। उनके पास पिछली क्लिप में आपका कैरेक्टर कैसा था, इसकी कोई स्थायी मेमोरी नहीं होती। यदि आप एक सड़क पर चलती हुई महिला का पांच-सेकंड का क्लिप जनरेट करते हैं, और फिर उसे मुड़ते हुए का दूसरा पांच-सेकंड का क्लिप जनरेट करते हैं, तो मॉडल दूसरे प्रॉम्प्ट को एक नई, अलग-थलग निर्देश के रूप में मानता है। स्पष्ट बाधाओं के बिना, यह संभवतः उसके चेहरे की विशेषताओं, बालों का रंग, कपड़ों की टेक्सचर, या यहां तक कि उसकी ऊंचाई को भी बदल देगा। इस घटना को टेंपोरल डिसकंटिन्यूइटी कहते हैं। मॉडल वर्तमान प्रॉम्प्ट के भीतर संभाव्यता के लिए अनुकूलित करता है, वैश्विक नैरेटिव पहचान के प्रति निष्ठा के लिए नहीं। इसे हल करने के लिए, आपको व्याख्या की अनुमति देने वाले प्राकृतिक भाषा विवरणों से हटकर, सख्त, घोषणात्मक स्पेसिफिकेशन की ओर जाना होगा जो भिन्नता के लिए कोई जगह नहीं छोड़ते।
विज़ुअल एंकर को परिभाषित करना: कैरेक्टर और एनवायरनमेंट डिस्क्रिप्टर्स को लॉक करना
कोई भी मोशन जनरेट करने से पहले, आपको अपने सब्जेक्ट्स और सेटिंग की विज़ुअल पहचान को पूर्ण सटीकता के साथ परिभाषित करना होगा। हर कैरेक्टर के लिए एक मास्टर डिस्क्रिप्टर बनाएं। इस डिस्क्रिप्टर में अपरिवर्तनीय विशेषताएं शामिल होनी चाहिए: आयु, जातीयता, विशिष्ट चेहरे की विशेषताएं (जैसे, "मजबूत जबड़ा, बाएं भौंह पर हल्का निशान"), हेयर स्टाइल और रंग, और पैटर्न और कट तक के कपड़ों के विवरण। "कूल आउटफिट" या "रहस्यमय महिला" जैसे अस्पष्ट शब्दों का उपयोग न करें। इसके बजाय, "गहरे ग्रे ऊनी कोट, गले तक बटन बंद, और लाल सिल्क स्कार्फ के साथ" निर्दिष्ट करें। इस डिस्क्रिप्टर को एक बार लिखें, और उस कैरेक्टर से जुड़े हर प्रॉम्प्ट में इसे कॉपी-पेस्ट करें।
एनवायरनमेंट के लिए भी यही करें। स्थान को स्पेशल और टेक्सचरल कॉन्स्टेंट्स के साथ परिभाषित करें। यदि दृश्य एक लाइब्रेरी है, तो शेल्फ़ की लकड़ी का प्रकार, कारपेट का रंग और मुख्य प्रकाश स्रोत की स्थिति निर्दिष्ट करें। ये डिस्क्रिप्टर्स आपका विज़ुअल एंकर बनाते हैं। ये स्थिर आधार हैं जिन पर सभी मोशन बनाए जाते हैं। यदि आप क्लिप्स के बीच कोई डिस्क्रिप्टर बदलते हैं, तो कंटिन्यूइटी टूट जाती है। यदि आप कोई डिस्क्रिप्टर छोड़ देते हैं, तो मॉडल अपनी सांख्यिकीय औसत से उस अंतर को भर देगा, जो आपके पिछले क्लिप से अलग होगा।
कैमरा मूवमेंट और स्पेशल रिलेशनशिप को प्रॉम्प्ट करना
कैमरा लैंग्वेज वह जगह है जहाँ अधिकांश नैरेटिव ब्रेकडाउन होते हैं। मॉडल अक्सर "कैमरा फॉलो करता है" या "पैन राइट" को अस्पष्ट रूप से व्याख्या करते हैं, जिससे परस्पेक्टिव या ओरिएंटेशन में अचानक जंप आ जाते हैं। आपको कैमरे की स्थिति, ओरिएंटेशन और मूवमेंट वेक्टर को स्पष्ट रूप से परिभाषित करना होगा। "कैमरा कैरेक्टर के साथ चलता है" कहने के बजाय, निर्दिष्ट करें: "स्टैटिक मीडियम शॉट, आई-लेवल, कैमरा पोज़िशन A पर फिक्स्ड, कैरेक्टर फ्रेम में बाएं से दाएं चलता है।" यदि आपको एक मोविंग शॉट चाहिए, तो पथ को परिभाषित करें: "धीरे-धीरे डॉली फॉरवर्ड, आई-लेवल बनाए रखते हुए, कैरेक्टर की पीठ को ट्रैक करते हुए।"
स्पेशल रिलेशनशिप को कैमरे के सापेक्ष लॉक किया जाना चाहिए, न कि केवल एक-दूसरे के सापेक्ष। यदि कैरेक्टर A कैरेक्टर B की ओर मुखातिब है, तो उनकी सापेक्ष स्थितियां और ओरिएंटेशन निर्दिष्ट करें। "कैरेक्टर A फ्रेम के बाएं तिहाई में खड़ा है, दाईं ओर मुंह किए हुए। कैरेक्टर B दाएं तिहाई में खड़ा है, बाईं ओर मुंह किए हुए। वे दो मीटर की दूरी पर हैं।" यह ज्योमेट्रिक लॉकिंग मॉडल को शॉट्स के बीच स्थान बदलने या एंगेजमेंट के कोण को बदलने से रोकती है। चेहरों और शरीरों के ओरिएंटेशन को फिक्स करने के लिए "प्रोफाइल व्यू," "थ्री-क्वार्टर व्यू," और "डायरेक्ट फ्रंटल" जैसे शब्दों का उपयोग करें।
लाइटिंग और कलर ग्रेडिंग की निरंतरता को प्रबंधित करना
लाइटिंग कंटिन्यूइटी का सबसे सूक्ष्म लेकिन महत्वपूर्ण पहलू है। यदि क्लिप्स के बीच लाइट सोर्स की स्थिति या तीव्रता बदलती है, तो छायाएं स्थानांतरित हो जाएंगी, जिससे सीक्वेंस दो अलग-अलग फिल्मों जैसा लगेगा। मास्टर डिस्क्रिप्टर में अपनी लाइटिंग सेटअप को परिभाषित करें। प्राथमिक लाइट सोर्स (जैसे, "single overhead fluorescent tube, cool white, 4000K"), छायाओं की दिशा, और एम्बिएंट फिल लाइट को निर्दिष्ट करें। हर प्रॉम्प्ट में कलर ग्रेडिंग निर्देश शामिल करें। यदि आपकी कहानी नॉयर शैली में है, तो "high contrast, desaturated palette, teal and orange shadow tones" निर्दिष्ट करें। यदि यह चमकीली और हंसमुख है, तो "soft diffused daylight, warm highlights, low contrast" निर्दिष्ट करें। ये ग्रेडिंग पैरामीटर एक सीन की सभी क्लिप्स में स्थिर रहने चाहिए। यदि आप कहानी के प्रभाव के लिए लाइटिंग में बदलाव चाहते हैं, तो इसे एक जानबूझकर किया गया, प्रॉम्प्टेड ट्रांजिशन बनाएं, न कि एक अनजाना ड्रिफ्ट।
क्लिप्स को चेन करना: एंड-फ्रेम्स को स्टार्ट-फ्रेम्स के रूप में उपयोग करना
क्लिप्स के बीच कंटिन्यूइटी बनाए रखने के लिए सबसे प्रभावी तकनीक चेनिंग है। जब एक सीक्वेंस जनरेट करते हैं, तो क्लिप 1 का अंतिम फ्रेम निकालें और उसे क्लिप 2 के लिए स्टार्टिंग फ्रेम या रेफरेंस इमेज के रूप में उपयोग करें। यह मॉडल को पिछली क्लिप के समाप्त होने के ठीक उसी दृश्य स्थिति से अपनी जनरेशन शुरू करने के लिए मजबूर करता है। भले ही नए एक्शन के लिए प्रॉम्प्ट टेक्स्ट थोड़ा भिन्न हो, स्टार्टिंग फ्रेम का दृश्य एंकर कैरेक्टर की उपस्थिति, लाइटिंग और कैमरा पोजिशन को लॉक कर देता है। यह विधि कंटिन्यूइटी के लिए केवल टेक्स्ट प्रॉम्प्ट्स पर निर्भर रहने से बेहतर है क्योंकि यह मॉडल की आइडेंटिटी डिस्क्रिप्टर्स की संभाव्य व्याख्या को बायपास करती है। यदि आपका टूल इमेज-टू-वीडियो या कीफ्रेम इंटरपोलेशन का समर्थन करता है, तो इसका उपयोग करें। यदि नहीं, तो अगली क्लिप की शुरुआत पिछली क्लिप के अंत से मेल खाती है यह सुनिश्चित करने के लिए एंड-फ्रेम को एक स्टाइल रेफरेंस या इनपेंटिंग कंस्ट्रेन्ट के रूप में उपयोग करें।
आम गलतियां: मोशन को ओवर-स्पेसिफाई करना बनाम कॉन्टेक्स्ट को अंडर-स्पेसिफाई करना
क्रिएटर्स अक्सर दो चरम जाल में फंस जाते हैं। पहला है मोशन को ओवर-स्पेसिफाई करना। यदि आप शरीर के हर माइक्रो-मूवमेंट का वर्णन करते हैं—"she blinks, she shifts her weight, her hair swings in the wind," तो मॉडल अभिभूत हो सकता है और कोर एक्शन को नजरअंदाज कर सकता है या भौतिक रूप से असंभव परिणाम जनरेट कर सकता है। मोशन डिस्क्रिप्शन को हाई-लेवल और काइनेटिक रखें: "walks forward," "turns head," "raises arm." माइक्रो-मेकानिक्स को संभालने के लिए मॉडल को छोड़ दें।
दूसरा है संदर्भ का अपर्याप्त विनिर्देशन। यदि आप मॉडल पर चरित्र की पहचान या दृश्य की लाइटिंग को एक अस्पष्ट प्रॉम्प्ट से अनुमानित करने के लिए निर्भर करते हैं, तो आप नियंत्रण खो देते हैं। यदि आप पिछले क्लिप से चरित्र को दोबारा न बताएं तो आप यह नहीं मान सकते कि मॉडल उसे याद रखेगा। यदि आप लाइटिंग को स्पष्ट रूप से प्रतिबंधित नहीं करते हैं तो आप यह नहीं मान सकते कि वह सुसंगत रहेगी। नियम सरल है: अपरिवर्तनीय तत्वों (पहचान, लाइटिंग, कैमरा स्थिति) को अत्यधिक विस्तार से निर्दिष्ट करें, और परिवर्तनशील तत्वों (गति, क्रिया) को उच्च-स्तरीय संक्षिप्तता के साथ निर्दिष्ट करें।
