Jak Wan 2.2 zamienia obraz w wideo?

Autor: Zaktualizowano 4 min czytania

Wan 2.2 image to video bierze nieruchome zdjęcie i krótkie zdanie opisujące ruch, a zwraca klip o długości około pięciu sekund w 480p lub 720p, który zachowuje obiekt, kolory i kadr zdjęcia. To model o otwartych wagach od Alibaby, darmowy online na tej stronie i możliwy do uruchomienia w domu na mocnej karcie graficznej.

Co robi Wan 2.2 image to video

Wan 2.2, wydany w lipcu 2025 roku na licencji Apache 2.0, to następca Wan 2.1 w linii otwartych modeli wideo Alibaby. Wariant obraz na wideo, Wan2.2-I2V-A14B, używa transformera dyfuzyjnego typu mixture-of-experts: jeden ekspert obsługuje wczesne, zaszumione kroki, które ustalają ogólny układ, drugi późne kroki, które dopracowują detale. Na każdym kroku aktywnych jest około 14 miliardów parametrów z 27 miliardów łącznie. Mniejszy model hybrydowy, Wan2.2-TI2V-5B, przyjmuje zarówno tekst, jak i obraz, i działa na pojedynczej karcie konsumenckiej.

Podajesz modelowi obraz, który staje się pierwszą klatką klipu, oraz prompt mówiący, co ma się poruszać. Model generuje 81 klatek przy 16 klatkach na sekundę, czyli około pięciu sekund, i buduje klip na tym obrazie: twarze, ubrania i światło pozostają bliskie źródłu, podczas gdy kamera lub obiekt się porusza.

Jak napisać prompt opisujący ruch

Obraz niesie już temat, styl i kompozycję, więc prompt musi opisać tylko zmianę. Napisz jedno lub dwa krótkie zdania: kto lub co się porusza, jak, i co robi kamera. „The woman turns her head to the right and smiles, soft wind in her hair, slow push-in” działa; lista tagów stylu nie. Gdy kamera ma znaczenie, nazwij ją wprost: „static camera”, „slow pan to the left”, „the drone rises”.

Ruch musi być wiarygodny w pięciosekundowym klipie. Jedna akcja na prompt to bezpieczny wybór. Czasowniki takie jak walks, waves, blinks, flows, drifts, rotates dają przewidywalny ruch. Nie proś o rzeczy, których nie ma na obrazie: model potrafi ruszyć samochód, ale musi wymyślić drogę za nim, a to mniej pewne niż to, co obraz już pokazuje. Negatywny prompt ma efekt tylko wtedy, gdy guidance jest większe niż 1; workflow z 4-krokową LoRA Lightning działają przy 1 i go ignorują. W pozostałych przypadkach sprawdza się zwykła lista: blurry, distorted hands, extra limbs, flickering, watermark, text.

Ustawienia, które mają znaczenie

  • Rozdzielczość: 480p jest około trzy razy szybsze niż 720p i często wystarcza do mediów społecznościowych; 720p zostaw na finalny klip.
  • Klatki: 81 klatek przy 16 fps to standardowy pięciosekundowy klip. Dłuższe sekwencje tracą spójność; lepiej wygenerować dwa klipy i je zmontować.
  • Kroki: 40 kroków samplowania w oficjalnym skrypcie, 20 w podstawowym workflow ComfyUI. Z 4-krokową LoRA Lightning wystarczy 4–8.
  • Guidance (CFG): domyślnie 3,5 dla modelu I2V 14B i 1 z 4-krokową LoRA. Wyższe wartości trzymają się promptu dosłowniej, ale dodają migotanie.
  • Seed: jak w Stable Diffusion, ten sam obraz, prompt, ustawienia i seed odtwarzają ten sam klip; zmień tylko seed, żeby dostać inny ruch dla tego samego obrazu.

Testuj prompt w 480p, zanim poświęcisz czas na 720p. Seed się nie przenosi: w 720p szum ma inny kształt, więc ruch się zmienia.

Które obrazy animują się najlepiej

Wan 2.2 działa z każdym zdjęciem lub obrazem wygenerowanym przez AI, ale niektóre obrazy są znacznie łatwiejsze. Wyraźny główny obiekt na prostym tle daje czysty ruch; zatłoczone sceny zmuszają model do wyboru, co poruszyć. Klip przejmuje proporcje obrazu, więc działa zarówno pion, jak i poziom. W ComfyUI ustaw szerokość i wysokość o tych samych proporcjach, inaczej obraz zostanie przycięty. Ostre, dobrze oświetlone zdjęcia utrzymują detale przez cały klip, jeśli są co najmniej tak duże jak wyjście (832 piksele na dłuższym boku w 480p, 1280 w 720p); rozmyte lub mocno skompresowane źródło daje rozmyte wideo.

Obrazy wygenerowane w Stable Diffusion, SDXL lub Flux animują się bardzo dobrze, co czyni image to video najłatwiejszą drogą do krótkiego wideo o precyzyjnym wyglądzie: najpierw wygeneruj dokładnie tę klatkę, którą chcesz, a potem ją ożyw.

Uruchamianie Wan 2.2 I2V w domu

Wagi są na Hugging Face i działają w ComfyUI, w Diffusers i w oficjalnym repozytorium Wan. Z oficjalnym skryptem, który według Alibaby wymaga karty 80 GB, model I2V 14B zużywa w szczycie około 41 GB VRAM w 480p i 60 GB w 720p. W ComfyUI działa na karcie 24 GB z checkpointami skwantyzowanymi do fp8 i offloadingiem, kosztem kilku minut na klip. Model TI2V 5B generuje pięciosekundowy klip 720p na RTX 4090 w niecałe dziesięć minut i potrzebuje około 24 GB VRAM z oficjalnym skryptem; w ComfyUI mieści się na karcie 8 GB. Poniżej tego skorzystaj z GPU w chmurze lub z darmowego dema na tej stronie.

Wypróbuj teraz, za darmoOżyw obraz w Wan 2.2, za darmo →

Podobne pytania

Jak długie może być wideo z Wan 2.2?

Standardowe wyjście to 81 klatek przy 16 klatkach na sekundę, czyli około pięciu sekund. Niektóre interfejsy pozwalają na więcej klatek, ale jakość i spójność spadają; na dłuższe wideo wygeneruj kilka klipów, każdy zaczynając od ostatniej klatki poprzedniego, i zmontuj je razem.

Czy Wan 2.2 generuje dźwięk?

Nie. Wan 2.2 tworzy nieme wideo; muzykę lub lektora dodaj potem w edytorze wideo.

Czy to darmowe i czy mogę używać tych filmów?

Model jest wydany na licencji Apache 2.0, która pozwala na użytek komercyjny, a Alibaba nie rości sobie praw do wygenerowanych filmów; usługa udostępniająca model online może dodać własne warunki. Demo na tej stronie jest darmowe, ale kolejka jest wspólna, więc klip może zająć kilka minut.