Hoe genereer je een video uit tekst met Wan 2.2?

Door Bijgewerkt op 4 min leestijd

Wan 2.2 text-to-video genereert een geluidloze clip van ongeveer vijf seconden, in 480p of 720p, uit één zin die de scène, de actie en de camera beschrijft. Het is het videomodel met open gewichten van Alibaba, uitgebracht in 2025 onder de Apache 2.0-licentie, en het draait thuis in ComfyUI of Diffusers.

Wat Wan 2.2 text-to-video is

Wan 2.2 verscheen met drie open modellen. Wan2.2-T2V-A14B is het text-to-video-model: een mixture-of-experts diffusion transformer met 27 miljard parameters, waarvan 14 miljard actief per stap, waarbij een high-noise expert de globale opbouw bepaalt en een low-noise expert de details verfijnt. Wan2.2-I2V-A14B animeert een bestaande afbeelding, en Wan2.2-TI2V-5B is een kleinere hybride die beide doet en op een consumentenkaart draait in 720p op 24 frames per seconde.

Vergeleken met Wan 2.1 zijn de 2.2-modellen getraind op 66% meer afbeeldingen en 83% meer video's, met gedetailleerde labels voor belichting, compositie, contrast en kleurtoon. Daarom kan een prompt het licht en het kader benoemen met filmtermen als "soft lighting", "warm colors" of "low angle shot", allemaal uit de eigen promptwoordenschat van Alibaba.

Hoe schrijf je een videoprompt?

Een videoprompt beschrijft een korte scène, geen stilstaand beeld. Een opbouw die werkt is onderwerp, actie, omgeving, camera, stijl: "A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic".

  • Onderwerp en actie: één onderwerp, één duidelijke actie met een werkwoord. Vijf seconden is genoeg voor een gebaar, een wandeling, een zwaai, niet voor een verhaal.
  • Omgeving: de plek en het tijdstip bepalen het licht.
  • Camera: static, pan, tilt, tracking, push-in, drone shot. Benoem het, anders kiest het model.
  • Stijl: cinematic, documentary, anime, claymation, 35 mm film. Eén stijlwoord is genoeg.

Schrijf de actie in gewone zinnen; trefwoorden kunnen het licht en het kader bepalen, zoals in de voorbeeldprompts van Alibaba zelf, maar een lijst tags beschrijft geen beweging. Gebruik de negatieve prompt voor de klassieke fouten (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Hij heeft alleen effect als de guidance boven 1 staat; de 4-step Lightning LoRA-workflows draaien op 1 en negeren hem.

Instellingen en generatietijd

De officiële standaardwaarden zijn 81 frames op 16 fps, 480p of 720p, 40 steps en een guidance scale van 3 tot 4; ComfyUI-workflows gebruiken 20 steps op een guidance van 3,5, of 4 steps op 1 met de Lightning LoRA. Met de officiële instellingen duurt een clip in 480p ongeveer vijf en een halve minuut op één H100-datacenter-GPU, en 720p ongeveer drie keer zo lang voor hetzelfde aantal frames. De seed werkt zoals bij beeldgeneratie: zet hem vast om twee prompts te vergelijken, verander hem voor een andere take van dezelfde prompt. De beeldverhouding kies je vóór het genereren, meestal 16:9 of 9:16; het model kan die achteraf niet meer veranderen.

Omdat elke poging traag is, test je de prompt in 480p en draai je pas daarna opnieuw in 720p. De seed van een take in 480p geeft in 720p een andere clip, omdat de ruis een andere vorm heeft. De meeste slechte resultaten komen van prompts met te veel acties of tegenstrijdige camera-instructies, niet van de instellingen.

Wat text-to-video nog niet kan

Vijf seconden, 81 frames, is de lengte waarvoor het model is ingesteld; langere generaties drijven af. Lange tekst in de video is onbetrouwbaar. Handen en snelle, complexe interacties tussen meerdere mensen gaan nog vaak mis. De fysica klopt ongeveer, niet exact: water, stof en haar bewegen goed, maar een bal kan verkeerd stuiteren. Er is geen geluid. Voor een precieze look is image-to-video makkelijker: genereer het eerste frame met Stable Diffusion, SDXL of Flux, en animeer het daarna met Wan 2.2.

Wan 2.2 T2V lokaal draaien

De gewichten staan op Hugging Face en draaien in ComfyUI, Diffusers en de officiële repository. Met het officiële script, waarvoor Alibaba een kaart van 80 GB opgeeft, piekt het 14B T2V-model op ongeveer 41 GB VRAM in 480p en 60 GB in 720p. In ComfyUI draait het op een kaart van 24 GB met fp8-checkpoints en offloading, met enkele minuten per clip. Het 5B-model maakt een clip van vijf seconden in 720p op een RTX 4090 in minder dan tien minuten. In ComfyUI past het op een kaart van 8 GB; daaronder gebruik je een cloud-GPU of de gratis demo op deze site, die vertrekt van een afbeelding als eerste frame.

Veelgestelde vragen

Is Wan 2.2 beter dan Wan 2.1?

Ja, volgens Alibaba, op bewegingskwaliteit, promptopvolging en esthetische controle: de mixture-of-experts-modellen en de rijkere trainingslabels mikken op vloeiendere beweging en nauwkeurigere controle over belichting en compositie. Op bescheiden GPU's neemt het 5B-model van Wan 2.2 het over van Wan 2.1.

Kan Wan 2.2 een video maken uit een afbeelding én tekst?

Ja. Het I2V-model gebruikt een afbeelding als eerste frame plus een prompt die de beweging beschrijft, en het 5B TI2V-model accepteert tekst alleen of tekst met een afbeelding. De Wan 2.2-demo op deze site werkt vanuit een afbeelding.

Mag ik de video's commercieel gebruiken?

De modellen verschijnen onder de Apache 2.0-licentie, die commercieel gebruik toestaat, en Alibaba claimt geen rechten op de video's die je genereert. Controleer de voorwaarden van de gehoste dienst die je gebruikt.