Hur gör Wan 2.2 om en bild till en video?

Av Uppdaterad 5 min läsning

Wan 2.2 bild till video tar en stillbild och en kort mening som beskriver rörelsen, och ger ett klipp på ungefär fem sekunder i 480p eller 720p som behåller fotots motiv, färger och bildutsnitt. Det är en modell med öppna vikter från Alibaba, gratis att använda online här och att köra hemma på ett kraftfullt grafikkort.

Vad Wan 2.2 bild till video gör

Wan 2.2, som släpptes i juli 2025 under Apache 2.0-licensen, är efterföljaren till Wan 2.1 i Alibabas serie av öppna videomodeller. Bild-till-video-varianten, Wan2.2-I2V-A14B, använder en diffusionstransformer med expertblandning (mixture of experts): en expert sköter de tidiga, brusiga stegen som sätter den övergripande layouten, en annan sköter de sena stegen som förfinar detaljerna. Ungefär 14 miljarder parametrar är aktiva per steg av totalt 27 miljarder. En mindre hybridmodell, Wan2.2-TI2V-5B, tar emot både text och bild och körs på ett enda konsumentgrafikkort.

Du ger modellen en bild, som blir klippets första bildruta, och en prompt som säger vad som ska röra sig. Den genererar 81 bildrutor i 16 bilder per sekund, ungefär fem sekunder, och bygger klippet på den bilden: ansikten, kläder och ljus håller sig nära källan medan kameran eller motivet rör sig.

Så skriver du rörelseprompten

Bilden bär redan motivet, stilen och kompositionen, så prompten behöver bara beskriva förändringen. Skriv en eller två korta meningar: vem eller vad som rör sig, hur, och vad kameran gör. ”The woman turns her head to the right and smiles, soft wind in her hair, slow push-in” fungerar; en lista med stiltaggar gör det inte. Nämn kameran uttryckligen när det spelar roll: ”static camera”, ”slow pan to the left”, ”the drone rises”.

Håll rörelsen rimlig för ett klipp på fem sekunder. En handling per prompt är det säkra valet. Verb som walks, waves, blinks, flows, drifts, rotates ger förutsägbar rörelse. Undvik att be om saker som inte finns i bilden: modellen kan flytta en bil, men måste då hitta på vägen bakom, vilket är mindre pålitligt än det bilden redan visar. En negativ prompt har bara effekt när guidance är över 1; arbetsflödena med 4-stegs Lightning-LoRA körs på 1 och ignorerar den. Annars fungerar den vanliga listan: blurry, distorted hands, extra limbs, flickering, watermark, text.

Inställningar som spelar roll

  • Upplösning: 480p är ungefär tre gånger snabbare än 720p och räcker ofta för sociala medier; använd 720p för ett slutgiltigt klipp.
  • Bildrutor: 81 bildrutor i 16 fps är standardklippet på fem sekunder. Längre sekvenser driver iväg; generera hellre två klipp och klipp ihop dem.
  • Steg: 40 samplingssteg i det officiella skriptet, 20 i det enkla ComfyUI-arbetsflödet. Med 4-stegs Lightning-LoRA räcker 4 till 8.
  • Guidance (CFG): 3,5 som standard för 14B I2V-modellen och 1 med Lightning-LoRA på 4 steg. Högre värden följer prompten mer bokstavligt men ger flimmer.
  • Seed: som i Stable Diffusion återskapar samma bild, prompt, inställningar och seed samma klipp; byt bara seed för att få en annan rörelse för samma bild.

Testa prompten i 480p innan du lägger tid på 720p. Seedet följer inte med: i 720p har bruset en annan form, så rörelsen ändras.

Vilka bilder animeras bäst?

Wan 2.2 fungerar med vilket foto eller vilken AI-genererad bild som helst, men vissa bilder är mycket enklare. Ett tydligt huvudmotiv mot en enkel bakgrund ger ren rörelse; fullpackade scener tvingar modellen att välja vad som ska röra sig. Klippet tar bildens bildförhållande, så både stående och liggande format fungerar. I ComfyUI sätter du bredd och höjd med samma förhållande, annars beskärs bilden. Skarpa, väl upplysta bilder behåller detaljerna genom hela klippet om de är minst lika stora som utdata (832 pixlar på långsidan i 480p, 1280 i 720p); en suddig eller hårt komprimerad källa ger en suddig video.

Bilder genererade med Stable Diffusion, SDXL eller Flux animeras mycket bra, vilket gör bild till video till det enklaste sättet att få en kort video med ett exakt utseende: generera först precis den bildruta du vill ha, animera den sedan.

Köra Wan 2.2 I2V hemma

Vikterna finns på Hugging Face och körs i ComfyUI, i Diffusers och i Wans officiella repo. Med det officiella skriptet, som Alibaba säger kräver ett 80 GB-kort, toppar 14B I2V-modellen på ungefär 41 GB VRAM i 480p och 60 GB i 720p. I ComfyUI körs den på ett 24 GB-kort med fp8-kvantiserade checkpoints och offloading, till priset av flera minuter per klipp. 5B TI2V-modellen genererar ett klipp på fem sekunder i 720p på ett RTX 4090 på under tio minuter och behöver ungefär 24 GB VRAM med det officiella skriptet; i ComfyUI får den plats på ett 8 GB-kort. Under det använder du ett GPU i molnet eller gratisdemon på den här webbplatsen.

Andra vanliga frågor

Hur lång kan en video från Wan 2.2 vara?

Standardutdata är 81 bildrutor i 16 bilder per sekund, ungefär fem sekunder. Vissa gränssnitt tillåter fler bildrutor, men kvalitet och stabilitet sjunker; för en längre video genererar du flera klipp, vart och ett med start i det föregåendes sista bildruta, och klipper ihop dem.

Genererar Wan 2.2 ljud?

Nej. Wan 2.2 ger stum video; lägg till musik eller speakerröst i ett videoredigeringsprogram efteråt.

Är det gratis och får jag använda videorna?

Modellen släpps under Apache 2.0-licensen, som tillåter kommersiell användning, och Alibaba gör inga anspråk på videorna du genererar; en tjänst som kör modellen åt dig kan ha egna villkor. Demon på den här webbplatsen är gratis, men kön är delad, så ett klipp kan ta några minuter.