Hoe maakt Wan 2.2 een video van een afbeelding?

Door Bijgewerkt op 5 min leestijd

Wan 2.2 image-to-video neemt een stilstaand beeld en een korte zin over de beweging, en levert een clip van ongeveer vijf seconden in 480p of 720p die het onderwerp, de kleuren en het kader van de foto bewaart. Het is een model met open gewichten van Alibaba, gratis online te gebruiken en thuis te draaien op een krachtige GPU.

Wat Wan 2.2 image-to-video doet

Wan 2.2, uitgebracht in juli 2025 onder de Apache 2.0-licentie, is de opvolger van Wan 2.1 in de reeks open videomodellen van Alibaba. De image-to-video-variant, Wan2.2-I2V-A14B, gebruikt een mixture-of-experts diffusion transformer: één expert doet de vroege, ruizige stappen die de globale opbouw bepalen, een andere doet de late stappen die de details verfijnen. Per stap zijn ongeveer 14 miljard van de in totaal 27 miljard parameters actief. Een kleiner hybride model, Wan2.2-TI2V-5B, accepteert zowel tekst als een afbeelding en draait op één consumentenkaart.

Je geeft het model een beeld, dat het eerste frame van de clip wordt, en een prompt die zegt wat er moet bewegen. Het genereert 81 frames op 16 frames per seconde, ongeveer vijf seconden, en bouwt de clip op dat beeld: gezichten, kleding en belichting blijven dicht bij de bron terwijl de camera of het onderwerp beweegt.

Hoe schrijf je de bewegingsprompt?

De afbeelding bevat al het onderwerp, de stijl en de compositie, dus de prompt hoeft alleen de verandering te beschrijven. Schrijf één of twee korte zinnen: wie of wat beweegt, hoe, en wat de camera doet. "The woman turns her head to the right and smiles, soft wind in her hair, slow push-in" werkt; een lijst stijltags niet. Noem de camera expliciet als die ertoe doet: "static camera", "slow pan to the left", "the drone rises".

Houd de beweging geloofwaardig voor een clip van vijf seconden. Eén actie per prompt is de veilige keuze. Werkwoorden als walks, waves, blinks, flows, drifts, rotates geven voorspelbare beweging. Vraag niet om dingen die niet in beeld zijn: het model kan een auto laten rijden, maar moet dan de weg erachter verzinnen, en dat is minder betrouwbaar dan wat het beeld al laat zien. Een negatieve prompt heeft alleen effect als de guidance boven 1 staat; de 4-step Lightning LoRA-workflows draaien op 1 en negeren hem. Anders werkt de gebruikelijke lijst: blurry, distorted hands, extra limbs, flickering, watermark, text.

Instellingen die ertoe doen

  • Resolutie: 480p is ongeveer drie keer sneller dan 720p en vaak genoeg voor social media; gebruik 720p voor een definitieve clip.
  • Frames: 81 frames op 16 fps is de standaardclip van vijf seconden. Langere reeksen drijven af; genereer liever twee clips en monteer ze.
  • Steps: 40 sampling steps in het officiële script, 20 in de basisworkflow van ComfyUI. Met de 4-step Lightning LoRA zijn 4 tot 8 genoeg.
  • Guidance (CFG): standaard 3,5 voor het 14B I2V-model, en 1 met de 4-step LoRA. Hogere waarden volgen de prompt letterlijker maar voegen flikkering toe.
  • Seed: net als bij Stable Diffusion geven dezelfde afbeelding, prompt, instellingen en seed dezelfde clip; verander alleen de seed om een andere beweging voor hetzelfde beeld te krijgen.

Test de prompt in 480p voordat je tijd steekt in 720p. De seed gaat niet mee: in 720p heeft de ruis een andere vorm, dus de beweging verandert.

Welke afbeeldingen animeren het best?

Wan 2.2 werkt met elke foto of AI-gegenereerde afbeelding, maar sommige beelden zijn veel makkelijker. Een duidelijk hoofdonderwerp op een rustige achtergrond geeft schone beweging; drukke scènes dwingen het model te kiezen wat er beweegt. De clip neemt de beeldverhouding van de afbeelding over, dus staand en liggend werken allebei. Stel in ComfyUI een breedte en hoogte met dezelfde verhouding in, anders wordt het beeld bijgesneden. Scherpe, goed belichte beelden houden hun detail door de hele clip als ze minstens zo groot zijn als de uitvoer (832 pixels aan de lange zijde in 480p, 1280 in 720p); een onscherpe of zwaar gecomprimeerde bron levert een onscherpe video op.

Afbeeldingen gegenereerd met Stable Diffusion, SDXL of Flux animeren heel goed, waardoor image-to-video de makkelijkste weg is naar een korte video met een precieze look: genereer eerst exact het frame dat je wilt, en animeer het daarna.

Wan 2.2 I2V thuis draaien

De gewichten staan op Hugging Face en draaien in ComfyUI, in Diffusers en in de officiële Wan-repository. Met het officiële script, waarvoor Alibaba een kaart van 80 GB opgeeft, piekt het 14B I2V-model op ongeveer 41 GB VRAM in 480p en 60 GB in 720p. In ComfyUI draait het op een kaart van 24 GB met de fp8-gekwantiseerde checkpoints en offloading, ten koste van enkele minuten per clip. Het 5B TI2V-model genereert een clip van vijf seconden in 720p op een RTX 4090 in minder dan tien minuten en heeft met het officiële script ongeveer 24 GB VRAM nodig; in ComfyUI past het op een kaart van 8 GB. Daaronder gebruik je een cloud-GPU of de gratis demo op deze site.

Veelgestelde vragen

Hoe lang kan een Wan 2.2-video zijn?

De standaarduitvoer is 81 frames op 16 frames per seconde, ongeveer vijf seconden. Sommige interfaces staan meer frames toe, maar kwaliteit en consistentie zakken; genereer voor een langere video meerdere clips, elk vanaf het laatste frame van de vorige, en monteer ze aan elkaar.

Genereert Wan 2.2 geluid?

Nee. Wan 2.2 maakt video zonder geluid; voeg achteraf muziek of een voice-over toe in een video-editor.

Is het gratis en mag ik de video's gebruiken?

Het model verschijnt onder de Apache 2.0-licentie, die commercieel gebruik toestaat, en Alibaba claimt geen rechten op de video's die je genereert; een gehoste dienst kan eigen voorwaarden toevoegen. De demo op deze site is gratis, maar de wachtrij is gedeeld, dus een clip kan enkele minuten duren.