Mantens la coherència narrativa establint una àncora visual rígida per als personatges i els entorns, i controlant estrictament la posició de la càmera i els paràmetres d'il·luminació a cada clip individual. La coherència temporal en vídeo generatiu no s'aconsegueix esperant que el model entengui la teva història; s'aconsegueix tractant cada clip de vídeo com un renderitzat discret d'un estat visual estàtic i predefinit.
El problema de la discontinuïtat temporal en vídeo generatiu
Els models generatius de vídeo funcionen predient fotogrames basats en un prompt i una finestra de context limitada. No posseeixen una memòria persistent de qui era el teu personatge al clip anterior. Si generes un clip de cinc segons d'una dona caminant pel carrer, i després generes un segon clip de cinc segons d'ella girant-se, el model tracta el segon prompt com una instrucció nova i aïllada. Sense restriccions explícites, probablement alterarà els seus trets facials, el color del cabell, la textura de la roba o fins i tot la seva alçada. Aquest fenomen és la discontinuïtat temporal. El model optimitza la plausibilitat dins del prompt actual, no la fidelitat a una identitat narrativa global. Per resoldre això, has d'allunyar-te de les descripcions en llenguatge natural que permeten interpretació, i anar cap a especificacions rígides i declaratives que no deixen marge per a la variació.
Definir l'àncora visual: bloquejar els descriptors de personatge i entorn
Abans de generar qualsevol moviment, has de definir la identitat visual dels teus subjectes i l'escenari amb precisió absoluta. Crea un descriptor mestre per a cada personatge. Aquest descriptor ha d'incloure atributs immutables: edat, ètnia, trets facials específics (per exemple, "mandíbula marcada, cicatriu lleu a la cella esquerra"), estil i color del cabell, i detalls de la roba fins al patró i el tall. No utilitzis termes vagos com "vestit genial" o "dona misteriosa". En lloc d'això, especifica "porta un abric de llana gris carbó, botat fins al coll, amb una bufanda de seda vermella". Escriu aquest descriptor una sola vegada i copia-lo i enganxa-lo a cada prompt que impliqui aquest personatge.
Per als entorns, feu el mateix. Definiu la ubicació amb constants espacials i de textura. Si l'escena és una biblioteca, especifiqueu el tipus de fusta de les prestatgeries, el color de la catifa i la posició de la font de llum principal. Aquests descriptors formen la vostra àncora visual. Són la base estàtica sobre la qual es construeix tot el moviment. Si canvieu un descriptor entre clips, trencareu la continuïtat. Si ometeu un descriptor, el model omplirà el buit amb la seva pròpia mitjana estadística, que serà diferent del vostre clip anterior.
Indicar moviments de càmera i relacions espacials
El llenguatge de càmera és on es produeixen la majoria de trencaments narratius. Els models sovint interpreten «la càmera segueix» o «pla lateral a la dreta» de manera ambigua, cosa que provoca salts sobtats de perspectiva o orientació. Heu de definir explícitament la posició, l'orientació i el vector de moviment de la càmera. En lloc de dir «la càmera es mou amb el personatge», especifiqueu «pla mitjà estàtic, a l'altura dels ulls, càmera fixa a la posició A, el personatge es mou d'esquerra a dreta a través del quadre». Si necessiteu una presa en moviment, definiu el trajecte: «dolly cap endavant lentament, mantenint l'altura dels ulls, seguint l'esquena del personatge».
Les relacions espacials s'han de fixar respecte a la càmera, no només entre elles. Si el Personatge A mira el Personatge B, especifiqueu les seves posicions i orientacions relatives. "El Personatge A es troba al terç esquerre del marc, mirant a la dreta. El Personatge B es troba al terç dret, mirant a l'esquerra. Estan a dos metres de distància." Aquesta fixació geomètrica evita que el model intercanviï les posicions o alteri l'angle de trobada entre plans. Utilitzeu termes com "vista de perfil", "vista de tres quarts" i "frontal directa" per fixar l'orientació de les cares i els cossos.
Gestió de la coherència de la il·luminació i la correcció de color
La il·luminació és l'aspecte més subtil però crític de la continuïtat. Si la font de llum canvia de posició o intensitat entre clips, les ombres es desplaçaran, fent que la seqüència sembli dues pel·lícules diferents. Defineix la teva configuració d'il·luminació en el descriptor mestre. Especifica la font de llum principal (per exemple, "tub fluorescent superior únic, blanc fred, 4000K"), la direcció de les ombres i la llum d'emplenament ambiental. Inclou instruccions de graduació de color en cada prompt. Si la teva narrativa és noir, especifica "contrast nítid, paleta desaturada, tons d'ombra teal i orange". Si és brillant i alegre, especifica "llum de dia suau i difusa, altes llums càlides, contrast baix". Aquests paràmetres de graduació han de romandre constants en tots els clips d'una escena. Si vols un canvi d'il·luminació per efecte narratiu, fes-lo una transició deliberada i indicada al prompt, no una deriva accidental.
Encadenar clips: utilitzar els fotogrames finals com a fotogrames inicials
La tècnica més eficaç per mantenir la continuïtat entre clips és l'encadenament. En generar una seqüència, extreu el fotograma final del Clip 1 i utilitza'l com a fotograma inicial o imatge de referència per al Clip 2. Això obliga el model a començar la seva generació des de l'estat visual exacte on va acabar el clip anterior. Encara que el text del prompt variï lleugerament per a la nova acció, l'ancoratge visual del fotograma inicial fixa l'aparença del personatge, la il·luminació i la posició de la càmera. Aquest mètode és superior a confiar només en prompts de text per a la continuïtat perquè evita la interpretació probabilística del model dels descriptors d'identitat. Si la teva eina admet image-to-video o interpolació de fotogrames clau, utilitza-ho. Si no ho fa, utilitza el fotograma final com a referència d'estil o restricció d'inpainting per assegurar que el començament del següent clip coincideixi amb el final de l'anterior.
Errors comuns: sobre-especificar el moviment vs. infra-especificar el context
Els creadors sovint cauen en dos extrems. El primer és sobre-especificar el moviment. Si descrius cada micro-moviment del cos —"ella parpelleja, desplaça el pes, els cabells es mouen amb el vent"—, el model es pot veure desbordat i pot ignorar l'acció principal o generar resultats físicament impossibles. Mantén les descripcions de moviment a nivell general i cinètic: "camina endavant", "gira el cap", "aixeca el braç". Deixa que el model gestioni les micro-mecàniques.
La segona és especificar insuficientment el context. Si confieu que el model dedueixi la identitat del personatge o la il·luminació de l'escena a partir d'un prompt vague, perdeu el control. No podeu donar per fet que el model recordarà el personatge del clip anterior si no restateu l'ancoratge visual. No podeu donar per fet que la il·luminació es mantindrà consistent si no la restringiu explícitament. La regla és simple: especifiqueu amb detall extrem els elements immutables (identitat, il·luminació, posició de càmera), i especifiqueu amb brevetat d'alt nivell els elements variables (moviment, acció).
