Vad Wan 2.2 bild till video gör
Wan 2.2, som släpptes i juli 2025 under Apache 2.0-licensen, är efterföljaren till Wan 2.1 i Alibabas serie av öppna videomodeller. Bild-till-video-varianten, Wan2.2-I2V-A14B, använder en diffusionstransformer med expertblandning (mixture of experts): en expert sköter de tidiga, brusiga stegen som sätter den övergripande layouten, en annan sköter de sena stegen som förfinar detaljerna. Ungefär 14 miljarder parametrar är aktiva per steg av totalt 27 miljarder. En mindre hybridmodell, Wan2.2-TI2V-5B, tar emot både text och bild och körs på ett enda konsumentgrafikkort.
Du ger modellen en bild, som blir klippets första bildruta, och en prompt som säger vad som ska röra sig. Den genererar 81 bildrutor i 16 bilder per sekund, ungefär fem sekunder, och bygger klippet på den bilden: ansikten, kläder och ljus håller sig nära källan medan kameran eller motivet rör sig.
Så skriver du rörelseprompten
Bilden bär redan motivet, stilen och kompositionen, så prompten behöver bara beskriva förändringen. Skriv en eller två korta meningar: vem eller vad som rör sig, hur, och vad kameran gör. ”The woman turns her head to the right and smiles, soft wind in her hair, slow push-in” fungerar; en lista med stiltaggar gör det inte. Nämn kameran uttryckligen när det spelar roll: ”static camera”, ”slow pan to the left”, ”the drone rises”.
Håll rörelsen rimlig för ett klipp på fem sekunder. En handling per prompt är det säkra valet. Verb som walks, waves, blinks, flows, drifts, rotates ger förutsägbar rörelse. Undvik att be om saker som inte finns i bilden: modellen kan flytta en bil, men måste då hitta på vägen bakom, vilket är mindre pålitligt än det bilden redan visar. En negativ prompt har bara effekt när guidance är över 1; arbetsflödena med 4-stegs Lightning-LoRA körs på 1 och ignorerar den. Annars fungerar den vanliga listan: blurry, distorted hands, extra limbs, flickering, watermark, text.
Inställningar som spelar roll
- Upplösning: 480p är ungefär tre gånger snabbare än 720p och räcker ofta för sociala medier; använd 720p för ett slutgiltigt klipp.
- Bildrutor: 81 bildrutor i 16 fps är standardklippet på fem sekunder. Längre sekvenser driver iväg; generera hellre två klipp och klipp ihop dem.
- Steg: 40 samplingssteg i det officiella skriptet, 20 i det enkla ComfyUI-arbetsflödet. Med 4-stegs Lightning-LoRA räcker 4 till 8.
- Guidance (CFG): 3,5 som standard för 14B I2V-modellen och 1 med Lightning-LoRA på 4 steg. Högre värden följer prompten mer bokstavligt men ger flimmer.
- Seed: som i Stable Diffusion återskapar samma bild, prompt, inställningar och seed samma klipp; byt bara seed för att få en annan rörelse för samma bild.
Testa prompten i 480p innan du lägger tid på 720p. Seedet följer inte med: i 720p har bruset en annan form, så rörelsen ändras.
Vilka bilder animeras bäst?
Wan 2.2 fungerar med vilket foto eller vilken AI-genererad bild som helst, men vissa bilder är mycket enklare. Ett tydligt huvudmotiv mot en enkel bakgrund ger ren rörelse; fullpackade scener tvingar modellen att välja vad som ska röra sig. Klippet tar bildens bildförhållande, så både stående och liggande format fungerar. I ComfyUI sätter du bredd och höjd med samma förhållande, annars beskärs bilden. Skarpa, väl upplysta bilder behåller detaljerna genom hela klippet om de är minst lika stora som utdata (832 pixlar på långsidan i 480p, 1280 i 720p); en suddig eller hårt komprimerad källa ger en suddig video.
Bilder genererade med Stable Diffusion, SDXL eller Flux animeras mycket bra, vilket gör bild till video till det enklaste sättet att få en kort video med ett exakt utseende: generera först precis den bildruta du vill ha, animera den sedan.
Köra Wan 2.2 I2V hemma
Vikterna finns på Hugging Face och körs i ComfyUI, i Diffusers och i Wans officiella repo. Med det officiella skriptet, som Alibaba säger kräver ett 80 GB-kort, toppar 14B I2V-modellen på ungefär 41 GB VRAM i 480p och 60 GB i 720p. I ComfyUI körs den på ett 24 GB-kort med fp8-kvantiserade checkpoints och offloading, till priset av flera minuter per klipp. 5B TI2V-modellen genererar ett klipp på fem sekunder i 720p på ett RTX 4090 på under tio minuter och behöver ungefär 24 GB VRAM med det officiella skriptet; i ComfyUI får den plats på ett 8 GB-kort. Under det använder du ett GPU i molnet eller gratisdemon på den här webbplatsen.