Hvad Wan 2.2 tekst til video er
Wan 2.2 blev lanceret med tre åbne modeller. Wan2.2-T2V-A14B er tekst-til-video-modellen: en mixture-of-experts diffusion transformer med 27 milliarder parametre, 14 milliarder aktive ved hvert trin, hvor en ekspert til høj støj fastlægger den overordnede opbygning, og en ekspert til lav støj finpudser detaljerne. Wan2.2-I2V-A14B animerer et eksisterende billede, og Wan2.2-TI2V-5B er en mindre hybrid, der gør begge dele og kører på et almindeligt grafikkort i 720p og 24 billeder i sekundet.
Sammenlignet med Wan 2.1 er 2.2-modellerne trænet på 66 % flere billeder og 83 % flere videoer, med detaljerede annoteringer for lys, komposition, kontrast og farvetone. Det er derfor, en prompt kan angive lys og beskæring med filmudtryk som "soft lighting", "warm colors" eller "low angle shot", alle hentet fra Alibabas eget promptordforråd.
Sådan skriver du en videoprompt
En videoprompt beskriver en kort scene, ikke et stillbillede. En struktur, der virker, er motiv, handling, sted, kamera, stil: "A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic".
- Motiv og handling: ét motiv, én tydelig handling med et verbum. Fem sekunder rækker til en gestus, en gåtur, et vink, ikke til en historie.
- Sted: stedet og tidspunktet på dagen bestemmer lyset.
- Kamera: static, pan, tilt, tracking, push-in, drone shot. Nævn det, ellers vælger modellen.
- Stil: cinematic, documentary, anime, claymation, 35 mm film. Ét stilord er nok.
Skriv handlingen i almindelige sætninger; nøgleord kan sætte lys og beskæring, som i Alibabas egne eksempelprompts, men en liste af tags beskriver ikke en bevægelse. Brug den negative prompt til de klassiske fejl (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Den har kun effekt, når guidance er over 1; workflows med 4-step Lightning LoRA kører ved 1 og ignorerer den.
Indstillinger og genereringstid
De officielle standardværdier er 81 frames ved 16 fps, 480p eller 720p, 40 steps og en guidance-skala på 3 til 4; ComfyUI-workflows bruger 20 steps ved guidance 3,5 eller 4 steps ved 1 med Lightning LoRA'et. Med de officielle indstillinger tager et klip i 480p cirka fem et halvt minut på ét H100-datacenterkort, og 720p cirka tre gange så længe for samme antal frames. Seedet virker som ved billedgenerering: fastlås det for at sammenligne to prompts, skift det for at få en ny udgave af samme prompt. Sideforholdet vælges før genereringen, typisk 16:9 eller 9:16; modellen kan ikke ændre det bagefter.
Fordi hvert forsøg er langsomt, bør du teste prompten i 480p og først derefter køre igen i 720p. Seedet fra en 480p-udgave giver et andet klip i 720p, fordi støjen har en anden form. De fleste dårlige resultater skyldes prompts med for mange handlinger eller modstridende kamerainstruktioner, ikke indstillingerne.
Hvad tekst til video ikke kan endnu
Fem sekunder, 81 frames, er den længde, modellen er indrettet til; længere genereringer driver væk. Lang tekst inde i videoen er upålidelig. Hænder og hurtige, komplekse interaktioner mellem flere personer fejler stadig ofte. Fysikken er plausibel snarere end nøjagtig: vand, stof og hår bevæger sig flot, men en bold kan hoppe forkert. Der er ingen lyd. Vil du have et præcist udtryk, er billede til video lettere: generer første frame med Stable Diffusion, SDXL eller Flux, og animer den så med Wan 2.2.
Kør Wan 2.2 T2V lokalt
Vægtene ligger på Hugging Face og kører i ComfyUI, Diffusers og det officielle repository. Med det officielle script, som Alibaba siger kræver et kort med 80 GB, topper 14B T2V-modellen ved cirka 41 GB VRAM i 480p og 60 GB i 720p. I ComfyUI kører den på et kort med 24 GB med fp8-checkpoints og offloading, mod flere minutter pr. klip. 5B-modellen laver et klip på fem sekunder i 720p på et RTX 4090 på under ti minutter. I ComfyUI kan den være på et kort med 8 GB; under det må du bruge et GPU i skyen eller den gratis demo på dette websted, som tager udgangspunkt i et billede brugt som første frame.