Hvad Wan 2.2 billede til video gør
Wan 2.2, udgivet i juli 2025 under Apache 2.0-licensen, er efterfølgeren til Wan 2.1 i Alibabas række af åbne videomodeller. Billede-til-video-varianten, Wan2.2-I2V-A14B, bruger en mixture-of-experts diffusion transformer: én ekspert tager sig af de tidlige, støjfyldte trin, der fastlægger den overordnede opbygning, en anden af de sene trin, der finpudser detaljerne. Cirka 14 milliarder parametre er aktive pr. trin ud af 27 milliarder i alt. En mindre hybridmodel, Wan2.2-TI2V-5B, tager både tekst og et billede og kører på et enkelt almindeligt grafikkort.
Du giver modellen et billede, som bliver klippets første frame, og en prompt, der siger, hvad der skal bevæge sig. Den genererer 81 frames ved 16 billeder i sekundet, cirka fem sekunder, og bygger klippet på det billede: ansigter, tøj og lys holder sig tæt på kilden, mens kameraet eller motivet bevæger sig.
Sådan skriver du bevægelsesprompten
Billedet bærer allerede motivet, stilen og kompositionen, så prompten skal kun beskrive forandringen. Skriv én eller to korte sætninger: hvem eller hvad bevæger sig, hvordan, og hvad kameraet gør. "The woman turns her head to the right and smiles, soft wind in her hair, slow push-in" virker; en liste af stil-tags gør det ikke. Nævn kameraet udtrykkeligt, når det betyder noget: "static camera", "slow pan to the left", "the drone rises".
Hold bevægelsen realistisk for et klip på fem sekunder. Én handling pr. prompt er det sikre valg. Verber som walks, waves, blinks, flows, drifts, rotates giver forudsigelig bevægelse. Undgå at bede om ting, der ikke er på billedet: modellen kan flytte en bil, men den skal selv opfinde vejen bagved, og det er mindre pålideligt end det, billedet allerede viser. En negativ prompt har kun effekt, når guidance er over 1; workflows med 4-step Lightning LoRA kører ved 1 og ignorerer den. Ellers virker den sædvanlige liste: blurry, distorted hands, extra limbs, flickering, watermark, text.
Indstillinger, der betyder noget
- Opløsning: 480p er cirka tre gange hurtigere end 720p og ofte nok til sociale medier; brug 720p til et færdigt klip.
- Frames: 81 frames ved 16 fps er standardklippet på fem sekunder. Længere sekvenser driver væk; generer hellere to klip, og klip dem sammen.
- Steps: 40 sampling-steps i det officielle script, 20 i det grundlæggende ComfyUI-workflow. Med 4-step Lightning LoRA er 4 til 8 nok.
- Guidance (CFG): 3,5 som standard for 14B I2V-modellen og 1 med 4-step LoRA'et. Højere værdier følger prompten mere bogstaveligt, men giver flimmer.
- Seed: som i Stable Diffusion giver samme billede, prompt, indstillinger og seed samme klip; skift kun seedet for at få en anden bevægelse til det samme billede.
Test prompten i 480p, før du bruger tid på 720p. Seedet kan ikke overføres: i 720p har støjen en anden form, så bevægelsen ændrer sig.
Hvilke billeder animerer bedst?
Wan 2.2 arbejder ud fra ethvert foto eller AI-genereret billede, men nogle billeder er meget lettere. Et tydeligt hovedmotiv på en enkel baggrund giver ren bevægelse; fyldte scener tvinger modellen til at vælge, hvad der skal bevæge sig. Klippet overtager billedets sideforhold, så både stående og liggende format virker. I ComfyUI skal du sætte en bredde og højde med samme forhold, ellers beskæres billedet. Skarpe, velbelyste billeder holder detaljerne gennem klippet, hvis de er mindst lige så store som outputtet (832 pixels på den lange side ved 480p, 1280 ved 720p); en sløret eller hårdt komprimeret kilde giver en sløret video.
Billeder genereret med Stable Diffusion, SDXL eller Flux animerer rigtig godt, og det gør billede til video til den letteste vej til en kort video med et præcist udtryk: generer først præcis den frame, du vil have, og animer den derefter.
Kør Wan 2.2 I2V hjemme
Vægtene ligger på Hugging Face og kører i ComfyUI, i Diffusers og i det officielle Wan-repository. Med det officielle script, som Alibaba siger kræver et kort med 80 GB, topper 14B I2V-modellen ved cirka 41 GB VRAM i 480p og 60 GB i 720p. I ComfyUI kører den på et kort med 24 GB med de fp8-kvantiserede checkpoints og offloading, mod flere minutter pr. klip. 5B TI2V-modellen genererer et klip på fem sekunder i 720p på et RTX 4090 på under ti minutter og kræver cirka 24 GB VRAM med det officielle script; i ComfyUI kan den være på et kort med 8 GB. Under det må du bruge et GPU i skyen eller den gratis demo på dette websted.