Come si genera un video dal testo con Wan 2.2?

Di Aggiornato il 4 min di lettura

Wan 2.2 da testo a video genera una clip di circa cinque secondi, in 480p o 720p, da una sola frase che descrive scena, azione e camera. È il modello video aperto di Alibaba, pubblicato nel 2025 con licenza Apache 2.0, uno dei pochi modelli aperti il cui movimento e la cui luce reggono il confronto con i servizi commerciali.

Cos'è Wan 2.2 da testo a video

Wan 2.2 esiste in tre modelli aperti. Wan2.2-T2V-A14B è il modello da testo a video: un transformer di diffusione a miscela di esperti da 27 miliardi di parametri, 14 miliardi attivi a ogni passo, in cui un esperto ad alto rumore imposta il movimento e un esperto a basso rumore rifinisce texture e luce. Wan2.2-I2V-A14B anima un'immagine esistente, e Wan2.2-TI2V-5B è un ibrido più piccolo che fa entrambe le cose e gira su una scheda consumer a 720p e 24 fotogrammi al secondo.

Rispetto a Wan 2.1, i modelli 2.2 sono stati addestrati su molto più video, con etichette per illuminazione, composizione, colore e movimento di camera. Per questo il prompt può chiedere "controluce dell'ora dorata" o "camera a mano" e ottenerlo, cosa che i modelli aperti precedenti per lo più ignoravano.

Come scrivere un prompt video

Un prompt video descrive una breve scena, non un'immagine fissa. La struttura affidabile è soggetto, azione, ambiente, camera, stile: "Una volpe rossa cammina nella neve fresca di una pineta, gira la testa verso la camera, carrellata dal basso, luce morbida del mattino, cinematografico". Ogni elemento risponde a una domanda che il modello altrimenti indovinerebbe.

  • Soggetto e azione: un soggetto, un'azione chiara con un verbo. Cinque secondi bastano per un gesto, una camminata, un saluto, non per una storia.
  • Ambiente: il luogo e l'ora del giorno fissano la luce.
  • Camera: fissa, panoramica, inclinazione, carrellata, avvicinamento, ripresa da drone. Nominala, o sceglie il modello.
  • Stile: cinematografico, documentario, anime, plastilina, pellicola 35 mm. Basta una parola di stile.

Scrivi in frasi semplici; gli elenchi di parole chiave che funzionano in Stable Diffusion qui danno un movimento statico e incoerente. Usa il prompt negativo per i difetti classici: sfocato, sfarfallio, mani deformate, dita in più, filigrana, sottotitoli.

Impostazioni e tempi di generazione

I valori predefiniti sono 81 fotogrammi a 16 fps, 480p o 720p, da 20 a 30 passi e una guidance intorno a 5. In 480p una clip richiede da uno a due minuti su una GPU da data center; il 720p richiede quattro volte tanto a parità di fotogrammi. Il seed funziona come nella generazione di immagini: fissalo per confrontare due prompt, cambialo per ottenere un'altra ripresa dello stesso prompt. Le proporzioni si scelgono prima della generazione, di solito 16:9 o 9:16; il modello non può cambiarle dopo.

Poiché ogni tentativo è lento, prova il prompt in 480p, annota il seed della ripresa che ti piace e solo allora rilancia in 720p. La maggior parte dei cattivi risultati viene da prompt con troppe azioni o istruzioni di camera contraddittorie, non dalle impostazioni.

Cosa da testo a video non sa ancora fare

Cinque secondi sono il limite pratico di una clip coerente; le generazioni più lunghe derivano e il soggetto cambia volto o abiti. Il testo dentro il video è inaffidabile. Le mani e le interazioni rapide e complesse tra più persone falliscono ancora spesso. La fisica è plausibile più che esatta: acqua, tessuto e capelli si muovono bene, ma una palla può rimbalzare male. Non c'è audio. Per un aspetto preciso, da immagine a video è più facile: genera il primo fotogramma con Stable Diffusion, SDXL o FLUX, poi animalo con Wan 2.2.

Eseguire Wan 2.2 T2V in locale

I pesi sono su Hugging Face e girano in ComfyUI, Diffusers e nel repository ufficiale. Il modello T2V da 14B richiede circa 80 GB di VRAM in piena precisione, oppure una scheda da 24 GB con checkpoint fp8 e scarico, a diversi minuti per clip. Il modello da 5B produce una clip 720p di cinque secondi su una RTX 4090 in meno di dieci minuti. Sotto i 16 GB di VRAM, usa una GPU nel cloud o la demo gratuita di questo sito, che accetta anche un'immagine come primo fotogramma.

Domande frequenti

Wan 2.2 è meglio di Wan 2.1?

Sì per qualità del movimento, aderenza al prompt e controllo estetico: i modelli a miscela di esperti e le etichette di addestramento più ricche danno un movimento più fluido e istruzioni di luce e camera affidabili. Wan 2.1 resta utile sulle GPU piccole, dove il modello 5B di Wan 2.2 è il sostituto naturale.

Wan 2.2 può fare un video da un'immagine e un testo?

Sì. Il modello I2V usa un'immagine come primo fotogramma più un testo che descrive il movimento, e il modello TI2V da 5B accetta solo testo o testo con immagine. La demo Wan 2.2 di questo sito parte da un'immagine.

Posso usare i video a fini commerciali?

I modelli sono pubblicati con licenza Apache 2.0, che consente l'uso commerciale dei risultati. Verifica le condizioni del servizio di hosting su cui generi.