Mi a Wan 2.2 szövegből videó modellje
A Wan 2.2 három nyílt modellel indult. A Wan2.2-T2V-A14B a szövegből videó modell: szakértők keverékére épülő diffúziós transzformer 27 milliárd paraméterrel, amelyből lépésenként 14 milliárd aktív; a magas zajú szakértő rögzíti az elrendezést, az alacsony zajú finomítja a részleteket. A Wan2.2-I2V-A14B meglévő képet kelt életre, a Wan2.2-TI2V-5B pedig egy kisebb hibrid, amely mindkettőt tudja, és otthoni kártyán fut 720p-ben, másodpercenként 24 képkockával.
A Wan 2.1-hez képest a 2.2-es modelleket 66%-kal több képen és 83%-kal több videón tanították, részletes címkékkel a fényre, a kompozícióra, a kontrasztra és a színtónusra. Ezért nevezheti meg a prompt a fényt és a képkivágást filmes kifejezésekkel, például „soft lighting”, „warm colors” vagy „low angle shot”, amelyek mind az Alibaba saját promptszótárából származnak.
Hogyan írj videópromptot
A videóprompt rövid jelenetet ír le, nem állóképet. Bevált felépítés: téma, cselekvés, helyszín, kamera, stílus: „A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic”.
- Téma és cselekvés: egy téma, egy világos cselekvés igével. Öt másodperc elég egy gesztusra, egy sétára, egy integetésre, egy történetre nem.
- Helyszín: a hely és a napszak adja a fényt.
- Kamera: static, pan, tilt, tracking, push-in, drone shot. Nevezd meg, különben a modell választ.
- Stílus: cinematic, documentary, anime, claymation, 35 mm film. Egy stílusszó elég.
A cselekvést egyszerű mondatokban írd le; a fényt és a képkivágást kulcsszavak is beállíthatják, ahogy az Alibaba saját példapromptjaiban, de egy címkelista nem ír le mozgást. A klasszikus hibákra használd a negatív promptot (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Csak akkor van hatása, ha a guidance 1 fölött van; a 4 lépéses Lightning LoRA workflow-k 1-en futnak, és figyelmen kívül hagyják.
Beállítások és generálási idő
A hivatalos alapértékek: 81 képkocka 16 fps-sel, 480p vagy 720p, 40 lépés és 3–4 közötti guidance; a ComfyUI workflow-k 20 lépést használnak 3,5-ös guidance-szel, vagy 4 lépést 1-en a Lightning LoRA-val. A hivatalos beállításokkal egy 480p-s klip körülbelül öt és fél percig tart egyetlen H100-as adatközponti GPU-n, a 720p pedig nagyjából háromszor tovább ugyanannyi képkockánál. A seed úgy működik, mint képgenerálásnál: rögzítsd két prompt összevetéséhez, változtasd meg, ha ugyanabból a promptból másik felvételt akarsz. A képarányt generálás előtt választod ki, általában 16:9 vagy 9:16; a modell utólag nem tudja módosítani.
Mivel minden próbálkozás lassú, teszteld a promptot 480p-n, és csak utána futtasd újra 720p-n. Egy 480p-s felvétel seedje 720p-n más klipet ad, mert a zaj alakja más. A legtöbb rossz eredmény a túl sok cselekvést vagy ellentmondó kamerautasításokat tartalmazó promptból ered, nem a beállításokból.
Mit nem tud még a szövegből videó
Öt másodperc, 81 képkocka az a hossz, amelyre a modellt beállították; a hosszabb generálások elcsúsznak. A videóban megjelenő hosszú szöveg megbízhatatlan. A kezek és a több ember közötti gyors, összetett interakciók még gyakran hibásak. A fizika hihető, nem pontos: a víz, a ruha és a haj szépen mozog, de egy labda rosszul pattanhat. Hang nincs. Pontos kinézethez a képből videó egyszerűbb: generáld le az első képkockát Stable Diffusionnal, SDXL-lel vagy Fluxszal, majd keltsd életre a Wan 2.2-vel.
A Wan 2.2 T2V futtatása helyben
A súlyok a Hugging Face-en vannak, és a ComfyUI-ban, a Diffusersben és a hivatalos repóban futnak. A hivatalos szkripttel, amelyhez az Alibaba szerint 80 GB-os kártya kell, a 14B T2V modell csúcsban körülbelül 41 GB VRAM-ot használ 480p-n és 60 GB-ot 720p-n. A ComfyUI-ban 24 GB-os kártyán fut fp8 checkpointokkal és offloadinggal, klipenként több perc alatt. Az 5B modell egy RTX 4090-en tíz percen belül készít 720p-s, ötmásodperces klipet. A ComfyUI-ban 8 GB-os kártyára is elfér; ez alatt használj felhőalapú GPU-t vagy az oldal ingyenes demóját, amely egy első képkockaként használt képből indul.