Wat Wan 2.2 text-to-video is
Wan 2.2 verscheen met drie open modellen. Wan2.2-T2V-A14B is het text-to-video-model: een mixture-of-experts diffusion transformer met 27 miljard parameters, waarvan 14 miljard actief per stap, waarbij een high-noise expert de globale opbouw bepaalt en een low-noise expert de details verfijnt. Wan2.2-I2V-A14B animeert een bestaande afbeelding, en Wan2.2-TI2V-5B is een kleinere hybride die beide doet en op een consumentenkaart draait in 720p op 24 frames per seconde.
Vergeleken met Wan 2.1 zijn de 2.2-modellen getraind op 66% meer afbeeldingen en 83% meer video's, met gedetailleerde labels voor belichting, compositie, contrast en kleurtoon. Daarom kan een prompt het licht en het kader benoemen met filmtermen als "soft lighting", "warm colors" of "low angle shot", allemaal uit de eigen promptwoordenschat van Alibaba.
Hoe schrijf je een videoprompt?
Een videoprompt beschrijft een korte scène, geen stilstaand beeld. Een opbouw die werkt is onderwerp, actie, omgeving, camera, stijl: "A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic".
- Onderwerp en actie: één onderwerp, één duidelijke actie met een werkwoord. Vijf seconden is genoeg voor een gebaar, een wandeling, een zwaai, niet voor een verhaal.
- Omgeving: de plek en het tijdstip bepalen het licht.
- Camera: static, pan, tilt, tracking, push-in, drone shot. Benoem het, anders kiest het model.
- Stijl: cinematic, documentary, anime, claymation, 35 mm film. Eén stijlwoord is genoeg.
Schrijf de actie in gewone zinnen; trefwoorden kunnen het licht en het kader bepalen, zoals in de voorbeeldprompts van Alibaba zelf, maar een lijst tags beschrijft geen beweging. Gebruik de negatieve prompt voor de klassieke fouten (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Hij heeft alleen effect als de guidance boven 1 staat; de 4-step Lightning LoRA-workflows draaien op 1 en negeren hem.
Instellingen en generatietijd
De officiële standaardwaarden zijn 81 frames op 16 fps, 480p of 720p, 40 steps en een guidance scale van 3 tot 4; ComfyUI-workflows gebruiken 20 steps op een guidance van 3,5, of 4 steps op 1 met de Lightning LoRA. Met de officiële instellingen duurt een clip in 480p ongeveer vijf en een halve minuut op één H100-datacenter-GPU, en 720p ongeveer drie keer zo lang voor hetzelfde aantal frames. De seed werkt zoals bij beeldgeneratie: zet hem vast om twee prompts te vergelijken, verander hem voor een andere take van dezelfde prompt. De beeldverhouding kies je vóór het genereren, meestal 16:9 of 9:16; het model kan die achteraf niet meer veranderen.
Omdat elke poging traag is, test je de prompt in 480p en draai je pas daarna opnieuw in 720p. De seed van een take in 480p geeft in 720p een andere clip, omdat de ruis een andere vorm heeft. De meeste slechte resultaten komen van prompts met te veel acties of tegenstrijdige camera-instructies, niet van de instellingen.
Wat text-to-video nog niet kan
Vijf seconden, 81 frames, is de lengte waarvoor het model is ingesteld; langere generaties drijven af. Lange tekst in de video is onbetrouwbaar. Handen en snelle, complexe interacties tussen meerdere mensen gaan nog vaak mis. De fysica klopt ongeveer, niet exact: water, stof en haar bewegen goed, maar een bal kan verkeerd stuiteren. Er is geen geluid. Voor een precieze look is image-to-video makkelijker: genereer het eerste frame met Stable Diffusion, SDXL of Flux, en animeer het daarna met Wan 2.2.
Wan 2.2 T2V lokaal draaien
De gewichten staan op Hugging Face en draaien in ComfyUI, Diffusers en de officiële repository. Met het officiële script, waarvoor Alibaba een kaart van 80 GB opgeeft, piekt het 14B T2V-model op ongeveer 41 GB VRAM in 480p en 60 GB in 720p. In ComfyUI draait het op een kaart van 24 GB met fp8-checkpoints en offloading, met enkele minuten per clip. Het 5B-model maakt een clip van vijf seconden in 720p op een RTX 4090 in minder dan tien minuten. In ComfyUI past het op een kaart van 8 GB; daaronder gebruik je een cloud-GPU of de gratis demo op deze site, die vertrekt van een afbeelding als eerste frame.