Hogyan generálj videót szövegből a Wan 2.2-vel?

Írta: Frissítve 4 perc olvasás

A Wan 2.2 szövegből videó modellje egyetlen mondatból, amely a jelenetet, a cselekvést és a kamerát írja le, körülbelül ötmásodperces, néma klipet generál 480p-ben vagy 720p-ben. Az Alibaba nyílt súlyú videómodellje, 2025-ben jelent meg Apache 2.0 licenc alatt, és otthon ComfyUI-ban vagy Diffusersben futtatható.

Mi a Wan 2.2 szövegből videó modellje

A Wan 2.2 három nyílt modellel indult. A Wan2.2-T2V-A14B a szövegből videó modell: szakértők keverékére épülő diffúziós transzformer 27 milliárd paraméterrel, amelyből lépésenként 14 milliárd aktív; a magas zajú szakértő rögzíti az elrendezést, az alacsony zajú finomítja a részleteket. A Wan2.2-I2V-A14B meglévő képet kelt életre, a Wan2.2-TI2V-5B pedig egy kisebb hibrid, amely mindkettőt tudja, és otthoni kártyán fut 720p-ben, másodpercenként 24 képkockával.

A Wan 2.1-hez képest a 2.2-es modelleket 66%-kal több képen és 83%-kal több videón tanították, részletes címkékkel a fényre, a kompozícióra, a kontrasztra és a színtónusra. Ezért nevezheti meg a prompt a fényt és a képkivágást filmes kifejezésekkel, például „soft lighting”, „warm colors” vagy „low angle shot”, amelyek mind az Alibaba saját promptszótárából származnak.

Hogyan írj videópromptot

A videóprompt rövid jelenetet ír le, nem állóképet. Bevált felépítés: téma, cselekvés, helyszín, kamera, stílus: „A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic”.

  • Téma és cselekvés: egy téma, egy világos cselekvés igével. Öt másodperc elég egy gesztusra, egy sétára, egy integetésre, egy történetre nem.
  • Helyszín: a hely és a napszak adja a fényt.
  • Kamera: static, pan, tilt, tracking, push-in, drone shot. Nevezd meg, különben a modell választ.
  • Stílus: cinematic, documentary, anime, claymation, 35 mm film. Egy stílusszó elég.

A cselekvést egyszerű mondatokban írd le; a fényt és a képkivágást kulcsszavak is beállíthatják, ahogy az Alibaba saját példapromptjaiban, de egy címkelista nem ír le mozgást. A klasszikus hibákra használd a negatív promptot (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Csak akkor van hatása, ha a guidance 1 fölött van; a 4 lépéses Lightning LoRA workflow-k 1-en futnak, és figyelmen kívül hagyják.

Beállítások és generálási idő

A hivatalos alapértékek: 81 képkocka 16 fps-sel, 480p vagy 720p, 40 lépés és 3–4 közötti guidance; a ComfyUI workflow-k 20 lépést használnak 3,5-ös guidance-szel, vagy 4 lépést 1-en a Lightning LoRA-val. A hivatalos beállításokkal egy 480p-s klip körülbelül öt és fél percig tart egyetlen H100-as adatközponti GPU-n, a 720p pedig nagyjából háromszor tovább ugyanannyi képkockánál. A seed úgy működik, mint képgenerálásnál: rögzítsd két prompt összevetéséhez, változtasd meg, ha ugyanabból a promptból másik felvételt akarsz. A képarányt generálás előtt választod ki, általában 16:9 vagy 9:16; a modell utólag nem tudja módosítani.

Mivel minden próbálkozás lassú, teszteld a promptot 480p-n, és csak utána futtasd újra 720p-n. Egy 480p-s felvétel seedje 720p-n más klipet ad, mert a zaj alakja más. A legtöbb rossz eredmény a túl sok cselekvést vagy ellentmondó kamerautasításokat tartalmazó promptból ered, nem a beállításokból.

Mit nem tud még a szövegből videó

Öt másodperc, 81 képkocka az a hossz, amelyre a modellt beállították; a hosszabb generálások elcsúsznak. A videóban megjelenő hosszú szöveg megbízhatatlan. A kezek és a több ember közötti gyors, összetett interakciók még gyakran hibásak. A fizika hihető, nem pontos: a víz, a ruha és a haj szépen mozog, de egy labda rosszul pattanhat. Hang nincs. Pontos kinézethez a képből videó egyszerűbb: generáld le az első képkockát Stable Diffusionnal, SDXL-lel vagy Fluxszal, majd keltsd életre a Wan 2.2-vel.

A Wan 2.2 T2V futtatása helyben

A súlyok a Hugging Face-en vannak, és a ComfyUI-ban, a Diffusersben és a hivatalos repóban futnak. A hivatalos szkripttel, amelyhez az Alibaba szerint 80 GB-os kártya kell, a 14B T2V modell csúcsban körülbelül 41 GB VRAM-ot használ 480p-n és 60 GB-ot 720p-n. A ComfyUI-ban 24 GB-os kártyán fut fp8 checkpointokkal és offloadinggal, klipenként több perc alatt. Az 5B modell egy RTX 4090-en tíz percen belül készít 720p-s, ötmásodperces klipet. A ComfyUI-ban 8 GB-os kártyára is elfér; ez alatt használj felhőalapú GPU-t vagy az oldal ingyenes demóját, amely egy első képkockaként használt képből indul.

Gyakori kérdések a témában

Jobb a Wan 2.2 a Wan 2.1-nél?

Az Alibaba szerint igen, a mozgás minőségében, a promptkövetésben és az esztétikai kontrollban: a szakértők keverékére épülő modellek és a gazdagabb tanítócímkék simább mozgást és a fény és a kompozíció pontosabb irányítását célozzák. Szerényebb GPU-kon az 5B-s Wan 2.2 modell veszi át a Wan 2.1 helyét.

Tud a Wan 2.2 videót készíteni képből és szövegből?

Igen. Az I2V modell egy képet használ első képkockaként, plusz a mozgást leíró promptot, az 5B TI2V modell pedig szöveget önmagában vagy képpel együtt fogad el. Az oldal Wan 2.2 demója képből dolgozik.

Használhatom a videókat kereskedelmi célra?

A modellek Apache 2.0 licenc alatt jelentek meg, amely engedi a kereskedelmi használatot, és az Alibaba nem formál jogot a generált videókra. Ellenőrizd az általad használt online szolgáltató feltételeit.