Trin 01 — Upload en reference, og beskriv bevægelsen
Tilføj en referenceramme, og skriv derefter en kort prompt til kamerabevægelsen, handlingen og det lys eller den stemning, du vil bære igennem.
Byg korte sekvenser med 6 Cuts Multi-Shot, match tale med Native Lip-Sync, og start fra billedmateriale eller tekst—direkte i Cleep AI.






Fra en enkelt referenceramme til et filmisk klip — ingen opsætning, ingen plugins, ingen Discord.
Tilføj en referenceramme, og skriv derefter en kort prompt til kamerabevægelsen, handlingen og det lys eller den stemning, du vil bære igennem.
Vælg kliplængde og billedformat, og læn dig op ad referencen for at holde atmosfære og udtryk ensartet på tværs af optagelserne.
Klik på generér, og vent et par minutter. Kling O3 laver dit klip. Download det, eller justér prompten og kør en hurtig variant.

Start med en kort sceneplan og angiv op til seks klip (6 Cuts Multi-Shot) med varighed, kameravinkel og overgang. Tilføj et referencebillede pr. klip eller generér billeder først, hvis du vil låse stil og karakterdesign. Kør et preview, og justér kun de klip, der afviger—i stedet for at regenerere hele sekvensen.

Teams bruger modellen til produktdemoer, hvor et problem–løsning–resultat-forløb kræver tydelige klipskift uden at miste stil. Den passer også til korte kampagnefilm, hvor samme karakter skal gå igen på tværs af flere shots, samt til forklaringsvideoer med dialog, hvor Native Lip-Sync skal ramme mundbevægelserne. Til socialt indhold kan man starte med billedgenerering til et mini-storyboard og derefter bygge videoen ud fra de valgte frames.

Brug Visual Chain-of-Thought (vCoT) som en visuel tjekliste til at gennemgå, om nøgleobjekter, rekvisitter og handlinger følger den samme logik fra klip 1 til 6. Til dialogsekvenser køres en hurtig lip-sync-verifikation, hvor man kontrollerer konsonanter, tempo og hovedbevægelser i close-ups. Hvis noget glipper, kan man låse referencebilleder eller justere prompten pr. klip for at stabilisere resultatet.

Det centrale er multi-shot styring, hvor hver scene kan beskrives og evalueres som et selvstændigt klip, men stadig hænger sammen som en sekvens. Kombinér billedgenerering til stilretning med billed-til-video for at holde looket stabilt, før du skalerer til flere variationer. For teams giver det en mere forudsigelig godkendelsesproces: først storyboard, så preview, og til sidst målrettede rettelser.

Kør en kort test med to klip først, og udvid derefter til seks, når stil og tempo er låst. Upload et ansigtsreferencebillede til Native Lip-Sync, og brug vCoT-review til at fange kontinuitetsfejl, før du deler med teamet. Når previewet sidder, kan du eksportere og gentage processen for nye varianter.
