Cos'è Wan 2.2 da testo a video
Wan 2.2 esiste in tre modelli aperti. Wan2.2-T2V-A14B è il modello da testo a video: un transformer di diffusione a miscela di esperti da 27 miliardi di parametri, 14 miliardi attivi a ogni passo, in cui un esperto ad alto rumore imposta il movimento e un esperto a basso rumore rifinisce texture e luce. Wan2.2-I2V-A14B anima un'immagine esistente, e Wan2.2-TI2V-5B è un ibrido più piccolo che fa entrambe le cose e gira su una scheda consumer a 720p e 24 fotogrammi al secondo.
Rispetto a Wan 2.1, i modelli 2.2 sono stati addestrati su molto più video, con etichette per illuminazione, composizione, colore e movimento di camera. Per questo il prompt può chiedere "controluce dell'ora dorata" o "camera a mano" e ottenerlo, cosa che i modelli aperti precedenti per lo più ignoravano.
Come scrivere un prompt video
Un prompt video descrive una breve scena, non un'immagine fissa. La struttura affidabile è soggetto, azione, ambiente, camera, stile: "Una volpe rossa cammina nella neve fresca di una pineta, gira la testa verso la camera, carrellata dal basso, luce morbida del mattino, cinematografico". Ogni elemento risponde a una domanda che il modello altrimenti indovinerebbe.
- Soggetto e azione: un soggetto, un'azione chiara con un verbo. Cinque secondi bastano per un gesto, una camminata, un saluto, non per una storia.
- Ambiente: il luogo e l'ora del giorno fissano la luce.
- Camera: fissa, panoramica, inclinazione, carrellata, avvicinamento, ripresa da drone. Nominala, o sceglie il modello.
- Stile: cinematografico, documentario, anime, plastilina, pellicola 35 mm. Basta una parola di stile.
Scrivi in frasi semplici; gli elenchi di parole chiave che funzionano in Stable Diffusion qui danno un movimento statico e incoerente. Usa il prompt negativo per i difetti classici: sfocato, sfarfallio, mani deformate, dita in più, filigrana, sottotitoli.
Impostazioni e tempi di generazione
I valori predefiniti sono 81 fotogrammi a 16 fps, 480p o 720p, da 20 a 30 passi e una guidance intorno a 5. In 480p una clip richiede da uno a due minuti su una GPU da data center; il 720p richiede quattro volte tanto a parità di fotogrammi. Il seed funziona come nella generazione di immagini: fissalo per confrontare due prompt, cambialo per ottenere un'altra ripresa dello stesso prompt. Le proporzioni si scelgono prima della generazione, di solito 16:9 o 9:16; il modello non può cambiarle dopo.
Poiché ogni tentativo è lento, prova il prompt in 480p, annota il seed della ripresa che ti piace e solo allora rilancia in 720p. La maggior parte dei cattivi risultati viene da prompt con troppe azioni o istruzioni di camera contraddittorie, non dalle impostazioni.
Cosa da testo a video non sa ancora fare
Cinque secondi sono il limite pratico di una clip coerente; le generazioni più lunghe derivano e il soggetto cambia volto o abiti. Il testo dentro il video è inaffidabile. Le mani e le interazioni rapide e complesse tra più persone falliscono ancora spesso. La fisica è plausibile più che esatta: acqua, tessuto e capelli si muovono bene, ma una palla può rimbalzare male. Non c'è audio. Per un aspetto preciso, da immagine a video è più facile: genera il primo fotogramma con Stable Diffusion, SDXL o FLUX, poi animalo con Wan 2.2.
Eseguire Wan 2.2 T2V in locale
I pesi sono su Hugging Face e girano in ComfyUI, Diffusers e nel repository ufficiale. Il modello T2V da 14B richiede circa 80 GB di VRAM in piena precisione, oppure una scheda da 24 GB con checkpoint fp8 e scarico, a diversi minuti per clip. Il modello da 5B produce una clip 720p di cinque secondi su una RTX 4090 in meno di dieci minuti. Sotto i 16 GB di VRAM, usa una GPU nel cloud o la demo gratuita di questo sito, che accetta anche un'immagine come primo fotogramma.