Czym jest Wan 2.2 text to video
Wan 2.2 ukazał się w trzech otwartych wariantach. Wan2.2-T2V-A14B to model tekst na wideo: transformer dyfuzyjny typu mixture-of-experts z 27 miliardami parametrów, z których 14 miliardów jest aktywnych na każdym kroku, gdzie ekspert od wysokiego szumu ustala ogólny układ, a ekspert od niskiego szumu dopracowuje detale. Wan2.2-I2V-A14B ożywia istniejący obraz, a Wan2.2-TI2V-5B to mniejsza hybryda, która robi jedno i drugie i działa na karcie konsumenckiej w 720p przy 24 klatkach na sekundę.
W porównaniu z Wan 2.1 modele 2.2 trenowano na o 66% większej liczbie obrazów i o 83% większej liczbie filmów, z dokładnymi etykietami oświetlenia, kompozycji, kontrastu i tonacji kolorów. Dlatego prompt może nazwać światło i kadr terminami filmowymi, takimi jak „soft lighting”, „warm colors” czy „low angle shot”, wziętymi wprost ze słownika promptów Alibaby.
Jak napisać prompt do wideo
Prompt do wideo opisuje krótką scenę, a nie nieruchomy kadr. Struktura, która działa, to temat, akcja, miejsce, kamera, styl: „A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic”.
- Temat i akcja: jeden obiekt, jedna wyraźna akcja z czasownikiem. Pięć sekund wystarcza na gest, przejście, machnięcie ręką, nie na historię.
- Miejsce: lokalizacja i pora dnia ustalają światło.
- Kamera: static, pan, tilt, tracking, push-in, drone shot. Nazwij ją, inaczej model wybierze sam.
- Styl: cinematic, documentary, anime, claymation, 35 mm film. Jedno słowo o stylu wystarczy.
Akcję pisz zwykłymi zdaniami; słowa kluczowe mogą ustawić światło i kadr, jak w przykładowych promptach Alibaby, ale lista tagów nie opisuje ruchu. Negatywnego promptu używaj do klasycznych wad (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Ma efekt tylko wtedy, gdy guidance jest większe niż 1; workflow z 4-krokową LoRA Lightning działają przy 1 i go ignorują.
Ustawienia i czas generowania
Oficjalne wartości domyślne to 81 klatek przy 16 fps, 480p lub 720p, 40 kroków i guidance 3–4; workflow ComfyUI używają 20 kroków przy guidance 3,5 albo 4 kroków przy 1 z LoRA Lightning. Z oficjalnymi ustawieniami klip 480p zajmuje około pięciu i pół minuty na jednym serwerowym GPU H100, a 720p około trzy razy dłużej przy tej samej liczbie klatek. Seed działa jak przy generowaniu obrazów: ustal go, żeby porównać dwa prompty, zmień, żeby dostać inne ujęcie tego samego promptu. Proporcje wybierasz przed generowaniem, zwykle 16:9 lub 9:16; model nie może ich potem zmienić.
Ponieważ każda próba jest powolna, testuj prompt w 480p i dopiero potem uruchom ponownie w 720p. Seed ujęcia 480p daje w 720p inny klip, bo szum ma inny kształt. Większość złych wyników bierze się z promptów ze zbyt wieloma akcjami lub sprzecznymi instrukcjami dla kamery, a nie z ustawień.
Czego text to video jeszcze nie potrafi
Pięć sekund, 81 klatek, to długość, do której model jest przygotowany; dłuższe generacje tracą spójność. Długi tekst w wideo jest zawodny. Dłonie oraz szybkie, złożone interakcje między kilkoma osobami wciąż często zawodzą. Fizyka jest wiarygodna, ale nie dokładna: woda, tkanina i włosy poruszają się dobrze, ale piłka może odbić się źle. Nie ma dźwięku. Gdy zależy ci na precyzyjnym wyglądzie, łatwiejsze jest image to video: wygeneruj pierwszą klatkę w Stable Diffusion, SDXL lub Flux, a potem ożyw ją w Wan 2.2.
Uruchamianie Wan 2.2 T2V lokalnie
Wagi są na Hugging Face i działają w ComfyUI, Diffusers i oficjalnym repozytorium. Z oficjalnym skryptem, który według Alibaby wymaga karty 80 GB, model T2V 14B zużywa w szczycie około 41 GB VRAM w 480p i 60 GB w 720p. W ComfyUI działa na karcie 24 GB z checkpointami fp8 i offloadingiem, po kilka minut na klip. Model 5B tworzy pięciosekundowy klip 720p na RTX 4090 w niecałe dziesięć minut. W ComfyUI mieści się na karcie 8 GB; poniżej tego skorzystaj z GPU w chmurze lub z darmowego dema na tej stronie, które startuje od obrazu użytego jako pierwsza klatka.