Hvordan laver man en video ud fra tekst med Wan 2.2?

Af Opdateret 4 min. læsning

Wan 2.2 tekst til video genererer et stumt klip på cirka fem sekunder i 480p eller 720p ud fra en enkelt sætning, der beskriver scenen, handlingen og kameraet. Det er Alibabas videomodel med åbne vægte, udgivet i 2025 under Apache 2.0-licensen, og den kører hjemme i ComfyUI eller Diffusers.

Hvad Wan 2.2 tekst til video er

Wan 2.2 blev lanceret med tre åbne modeller. Wan2.2-T2V-A14B er tekst-til-video-modellen: en mixture-of-experts diffusion transformer med 27 milliarder parametre, 14 milliarder aktive ved hvert trin, hvor en ekspert til høj støj fastlægger den overordnede opbygning, og en ekspert til lav støj finpudser detaljerne. Wan2.2-I2V-A14B animerer et eksisterende billede, og Wan2.2-TI2V-5B er en mindre hybrid, der gør begge dele og kører på et almindeligt grafikkort i 720p og 24 billeder i sekundet.

Sammenlignet med Wan 2.1 er 2.2-modellerne trænet på 66 % flere billeder og 83 % flere videoer, med detaljerede annoteringer for lys, komposition, kontrast og farvetone. Det er derfor, en prompt kan angive lys og beskæring med filmudtryk som "soft lighting", "warm colors" eller "low angle shot", alle hentet fra Alibabas eget promptordforråd.

Sådan skriver du en videoprompt

En videoprompt beskriver en kort scene, ikke et stillbillede. En struktur, der virker, er motiv, handling, sted, kamera, stil: "A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic".

  • Motiv og handling: ét motiv, én tydelig handling med et verbum. Fem sekunder rækker til en gestus, en gåtur, et vink, ikke til en historie.
  • Sted: stedet og tidspunktet på dagen bestemmer lyset.
  • Kamera: static, pan, tilt, tracking, push-in, drone shot. Nævn det, ellers vælger modellen.
  • Stil: cinematic, documentary, anime, claymation, 35 mm film. Ét stilord er nok.

Skriv handlingen i almindelige sætninger; nøgleord kan sætte lys og beskæring, som i Alibabas egne eksempelprompts, men en liste af tags beskriver ikke en bevægelse. Brug den negative prompt til de klassiske fejl (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Den har kun effekt, når guidance er over 1; workflows med 4-step Lightning LoRA kører ved 1 og ignorerer den.

Indstillinger og genereringstid

De officielle standardværdier er 81 frames ved 16 fps, 480p eller 720p, 40 steps og en guidance-skala på 3 til 4; ComfyUI-workflows bruger 20 steps ved guidance 3,5 eller 4 steps ved 1 med Lightning LoRA'et. Med de officielle indstillinger tager et klip i 480p cirka fem et halvt minut på ét H100-datacenterkort, og 720p cirka tre gange så længe for samme antal frames. Seedet virker som ved billedgenerering: fastlås det for at sammenligne to prompts, skift det for at få en ny udgave af samme prompt. Sideforholdet vælges før genereringen, typisk 16:9 eller 9:16; modellen kan ikke ændre det bagefter.

Fordi hvert forsøg er langsomt, bør du teste prompten i 480p og først derefter køre igen i 720p. Seedet fra en 480p-udgave giver et andet klip i 720p, fordi støjen har en anden form. De fleste dårlige resultater skyldes prompts med for mange handlinger eller modstridende kamerainstruktioner, ikke indstillingerne.

Hvad tekst til video ikke kan endnu

Fem sekunder, 81 frames, er den længde, modellen er indrettet til; længere genereringer driver væk. Lang tekst inde i videoen er upålidelig. Hænder og hurtige, komplekse interaktioner mellem flere personer fejler stadig ofte. Fysikken er plausibel snarere end nøjagtig: vand, stof og hår bevæger sig flot, men en bold kan hoppe forkert. Der er ingen lyd. Vil du have et præcist udtryk, er billede til video lettere: generer første frame med Stable Diffusion, SDXL eller Flux, og animer den så med Wan 2.2.

Kør Wan 2.2 T2V lokalt

Vægtene ligger på Hugging Face og kører i ComfyUI, Diffusers og det officielle repository. Med det officielle script, som Alibaba siger kræver et kort med 80 GB, topper 14B T2V-modellen ved cirka 41 GB VRAM i 480p og 60 GB i 720p. I ComfyUI kører den på et kort med 24 GB med fp8-checkpoints og offloading, mod flere minutter pr. klip. 5B-modellen laver et klip på fem sekunder i 720p på et RTX 4090 på under ti minutter. I ComfyUI kan den være på et kort med 8 GB; under det må du bruge et GPU i skyen eller den gratis demo på dette websted, som tager udgangspunkt i et billede brugt som første frame.

Spørgsmål, andre også stiller

Er Wan 2.2 bedre end Wan 2.1?

Ja, ifølge Alibaba, på bevægelseskvalitet, promptfølgsomhed og æstetisk kontrol: mixture-of-experts-modellerne og de rigere træningsannoteringer sigter mod jævnere bevægelse og tættere styring af lys og komposition. På beskedne grafikkort tager 5B-modellen fra Wan 2.2 over efter Wan 2.1.

Kan Wan 2.2 lave en video ud fra et billede og en tekst?

Ja. I2V-modellen bruger et billede som første frame plus en prompt, der beskriver bevægelsen, og 5B TI2V-modellen tager tekst alene eller tekst med et billede. Wan 2.2-demoen på dette websted arbejder ud fra et billede.

Må jeg bruge videoerne kommercielt?

Modellerne er udgivet under Apache 2.0-licensen, som tillader kommerciel brug, og Alibaba gør ikke krav på de videoer, du genererer. Tjek vilkårene hos den hostede tjeneste, du bruger.