Vad Wan 2.2 text till video är
Wan 2.2 lanserades med tre öppna modeller. Wan2.2-T2V-A14B är text-till-video-modellen: en diffusionstransformer med expertblandning på 27 miljarder parametrar, 14 miljarder aktiva i varje steg, där en högbrusexpert sätter den övergripande layouten och en lågbrusexpert förfinar detaljerna. Wan2.2-I2V-A14B animerar en befintlig bild, och Wan2.2-TI2V-5B är en mindre hybrid som gör båda och körs på ett konsumentgrafikkort i 720p och 24 bilder per sekund.
Jämfört med Wan 2.1 tränades 2.2-modellerna på 66 % fler bilder och 83 % fler videor, med detaljerade etiketter för ljus, komposition, kontrast och färgton. Det är därför en prompt kan ange ljus och bildutsnitt med filmtermer som ”soft lighting”, ”warm colors” eller ”low angle shot”, alla hämtade från Alibabas eget promptordförråd.
Så skriver du en videoprompt
En videoprompt beskriver en kort scen, inte en stillbild. En struktur som fungerar är motiv, handling, miljö, kamera, stil: ”A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic”.
- Motiv och handling: ett motiv, en tydlig handling med ett verb. Fem sekunder räcker för en gest, en promenad, en vinkning, inte för en berättelse.
- Miljö: platsen och tiden på dygnet sätter ljuset.
- Kamera: static, pan, tilt, tracking, push-in, drone shot. Ange den, annars väljer modellen.
- Stil: cinematic, documentary, anime, claymation, 35 mm film. Ett stilord räcker.
Skriv handlingen i vanliga meningar; nyckelord kan sätta ljus och bildutsnitt, som i Alibabas egna exempelprompts, men en lista med taggar beskriver ingen rörelse. Använd den negativa prompten för de klassiska felen (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Den har bara effekt när guidance är över 1; arbetsflödena med 4-stegs Lightning-LoRA körs på 1 och ignorerar den.
Inställningar och genereringstid
De officiella standardvärdena är 81 bildrutor i 16 fps, 480p eller 720p, 40 steg och en guidance-skala på 3 till 4; ComfyUI-arbetsflöden använder 20 steg med guidance 3,5, eller 4 steg på 1 med Lightning-LoRA. Med de officiella inställningarna tar ett 480p-klipp ungefär fem och en halv minut på ett H100-datacenterkort, och 720p ungefär tre gånger längre för samma antal bildrutor. Seedet fungerar som vid bildgenerering: fixera det för att jämföra två prompts, byt det för att få en annan tagning av samma prompt. Bildförhållandet väljs före genereringen, oftast 16:9 eller 9:16; modellen kan inte ändra det efteråt.
Eftersom varje försök är långsamt testar du prompten i 480p och kör om i 720p först när den sitter. Seedet från en 480p-tagning ger ett annat klipp i 720p, eftersom bruset har en annan form. De flesta dåliga resultat kommer från prompts med för många handlingar eller motstridiga kamerainstruktioner, inte från inställningarna.
Vad text till video inte klarar än
Fem sekunder, 81 bildrutor, är längden modellen är gjord för; längre genereringar driver iväg. Lång text inne i videon är opålitlig. Händer och snabba, komplexa interaktioner mellan flera personer misslyckas fortfarande ofta. Fysiken är rimlig snarare än exakt: vatten, tyg och hår rör sig bra, men en boll kan studsa fel. Det finns inget ljud. För ett exakt utseende är bild till video enklare: generera första bildrutan med Stable Diffusion, SDXL eller Flux och animera den sedan med Wan 2.2.
Köra Wan 2.2 T2V lokalt
Vikterna finns på Hugging Face och körs i ComfyUI, Diffusers och det officiella repot. Med det officiella skriptet, som Alibaba säger kräver ett 80 GB-kort, toppar 14B T2V-modellen på ungefär 41 GB VRAM i 480p och 60 GB i 720p. I ComfyUI körs den på ett 24 GB-kort med fp8-checkpoints och offloading, med flera minuter per klipp. 5B-modellen ger ett klipp på fem sekunder i 720p på ett RTX 4090 på under tio minuter. I ComfyUI får den plats på ett 8 GB-kort; under det använder du ett GPU i molnet eller gratisdemon på den här webbplatsen, som utgår från en bild som första bildruta.