Du opretholder narrativ sammenhæng ved at etablere et fast visuelt anker for personer og miljøer og derefter strengt styre kameraposition og belysningsparametre på tværs af hver enkelt clip. Tidsmæssig konsistens i generativ video opnås ikke ved at håbe, at modellen forstår din historie; den opnås ved at behandle hver videoclips som en diskret gengivelse af en statisk, foruddefineret visuel tilstand.
Problemet med tidsmæssig diskontinuitet i generativ video
Generative videomodeller fungerer ved at forudsige frames baseret på en prompt og et begrænset kontekstvindu. De har ikke en vedvarende hukommelse om, hvem din person var i den forrige clip. Hvis du genererer en femsekunders clip af en kvinde, der går ned ad en gade, og derefter genererer en anden femsekunders clip af hende, der vender sig om, behandler modellen den anden prompt som en ny, isoleret instruktion. Uden eksplicitte begrænsninger vil den sandsynligvis ændre hendes ansigtstræk, hårfarve, tøjtekstur eller endda hendes højde. Dette fænomen er tidsmæssig diskontinuitet. Modellen optimerer for plausibilitet inden for den aktuelle prompt, ikke for troskab over for en global narrativ identitet. For at løse dette skal du bevæge dig væk fra naturlige sprogbeskrivelser, der tillader fortolkning, og hen imod stive, deklarative specifikationer, der ikke efterlader plads til variation.
Definering af det visuelle anker: lås person- og miljøbeskrivelser
Før du genererer bevægelse, skal du definere den visuelle identitet for dine subjekter og dit miljø med absolut præcision. Opret en hovedbeskrivelse for hver person. Denne beskrivelse skal omfatte uforanderlige attributter: alder, etnicitet, specifikke ansigtstræk (f.eks. "kraftig kæbe, lille ar på venstre øjenbryn"), hårlængde og -farve samt tøjdetaljer ned til mønster og snit. Brug ikke vagter udtryk som "cool outfit" eller "mysteriøs kvinde". Specificér i stedet "iført en ulden frakke i kulgrå, knapet helt op til halsen, med et rødt silkeskarf". Skriv denne beskrivelse én gang, og kopier-indsæt den i hver prompt, der involverer den pågældende person.
For miljøer gør du det samme. Definer lokationen med rumlige og teksturelle konstanter. Hvis scenen er et bibliotek, skal du angive træsorten på hylderne, tæppets farve og hovedlyskildens placering. Disse beskrivelser udgør dit visuelle anker. De er det statiske fundament, som al bevægelse bygges på. Hvis du ændrer en beskrivelse mellem klip, bryder du kontinuiteten. Hvis du udelader en beskrivelse, vil modellen udfylde hullet med sin egen statistiske gennemsnitsværdi, som vil afvige fra dit forrige klip.
Prompting af kamerabevægelse og rumlige relationer
Kammersprog er der, hvor de fleste narrative sammenbrud opstår. Modeller fortolker ofte "kameraet følger" eller "panorér til højre" tvetydigt, hvilket fører til pludselige spring i perspektiv eller orientering. Du skal eksplicit definere kameraets position, orientering og bevægelsesvektor. I stedet for at sige "kameraet bevæger sig med karakteren", skal du specificere "statisk mellemplan, øjenhøjde, kamera fastlåst ved position A, karakteren bevæger sig fra venstre mod højre gennem billedet." Hvis du kræver et bevæget skud, skal du definere stien: "dolly fremad langsomt, hold øjenhøjde, følg karakterens ryg."
Rumlige relationer skal låses fast i forhold til kameraet, ikke kun i forhold til hinanden. Hvis Karakter A vender sig mod Karakter B, skal du angive deres relative positioner og orienteringer. "Karakter A står på den venstre tredjedel af billedet, vender mod højre. Karakter B står på den højre tredjedel, vender mod venstre. De står to meter fra hinanden." Denne geometriske lås forhindrer modellen i at bytte plads eller ændre vinklen på interaktionen mellem skud. Brug termer som "profilvisning", "tre-kvartsvisning" og "direkte frontal" til at fastlå orienteringen af ansigter og kroppe.
Håndtering af konsistens i belysning og farvekorrigerering
Belysning er det mest subtiele, men afgørende aspekt af kontinuitet. Hvis lyskilden skifter position eller intensitet mellem klip, vil skyggerne forskyde sig, hvilket får sekvensen til at føles som to forskellige film. Definer din belysningsopsætning i den overordnede beskrivelse. Angiv den primære lyskilde (f.eks. "enkelt loftsrør med fluorescerende lys, køligt hvidt, 4000K"), skyggernes retning og det omgivende fyldlys. Inkluder instruktioner til farvegradering i hver prompt. Hvis din fortælling er noir, skal du angive "høj kontrast, afsvækket palet, teal og orange skyggetoner". Hvis den er lys og munter, skal du angive "blødt diffust dagslys, varme højlys, lav kontrast". Disse graderingsparametre skal forblive konstante på tværs af alle klip i en scene. Hvis du ønsker en lysændring for at opnå en narrativ effekt, skal du gøre det til en bevidst, promptet overgang, ikke et utilsigtet drift.
Kædning af klip: brug af slutrammer som startrammer
Den mest effektive teknik til at opretholde kontinuitet på tværs af klip er kædning. Når du genererer en sekvens, skal du udtrække den sidste ramme fra Klip 1 og bruge den som startramme eller referencebillede for Klip 2. Dette tvinger modellen til at starte sin generering fra den præcise visuelle tilstand, hvor det forrige klip sluttede. Selv hvis promptteksten varierer lidt for den nye handling, låser den visuelle ankerpunkt i startrammen karakterens udseende, belysningen og kamerapositionen. Denne metode er bedre end at stole udelukkende på tekstprompts for kontinuitet, fordi den omgår modellens probabilistiske fortolkning af identitetsbeskrivelser. Hvis dit værktøj understøtter billede-til-video eller keyframe-interpolation, skal du bruge det. Hvis det ikke gør, skal du bruge slutrammen som stilreference eller inpainting-begrænsning for at sikre, at begyndelsen af det næste klip matcher slutningen af det forrige.
Almindelige fejl: over-specificering af bevægelse vs. under-specificering af kontekst
Skabere falder ofte i to ekstreme fælder. Den første er over-specificering af bevægelse. Hvis du beskriver hver mikrobevægelse i kroppen – "hun blinker, hun forskyder vægten, hendes hår svinger i vinden" – bliver modellen overvældet og kan ignorere kernehandlingen eller generere fysisk umulige resultater. Hold bevægelsesbeskrivelserne på højt niveau og kinetiske: "går fremad", "drejer hovedet", "løfter armen". Lad modellen håndtere mikro-mekanikken.
Det andet er under specificering af kontekst. Hvis du lader modellen gætte sig til karakterens identitet eller scenens belysning ud fra en vag prompt, afgiver du kontrollen. Du kan ikke forudsætte, at modellen husker karakteren fra det forrige klip, hvis du ikke gentager den visuelle ankerpunkt. Du kan ikke forudsætte, at belysningen forbliver konsistent, hvis du ikke eksplicit begrænser den. Reglen er simpel: specificér det uforanderlige (identitet, belysning, kameraposition) med ekstrem detaljegrad, og specificér det variable (bevægelse, handling) med kortfattede overordnede beskrivelser.
