Cosa fa Wan 2.2 da immagine a video
Wan 2.2 è la generazione 2025 dei modelli video aperti di Alibaba, pubblicata a luglio 2025 con licenza Apache 2.0. La variante da immagine a video, Wan2.2-I2V-A14B, è un transformer di diffusione a miscela di esperti: un esperto gestisce i primi passi, molto rumorosi, che decidono il movimento generale, un altro gli ultimi passi che rifiniscono il dettaglio. Circa 14 miliardi di parametri sono attivi a ogni passo su 27 miliardi in totale. Un modello ibrido più piccolo, Wan2.2-TI2V-5B, accetta testo e immagine e gira su una sola scheda consumer.
Si dà al modello un'immagine, che diventa il primo fotogramma della clip, e un prompt che dice cosa deve muoversi. Genera 81 fotogrammi a 16 al secondo, circa cinque secondi, e mantiene l'identità del soggetto molto meglio dei modelli aperti precedenti: volti, abiti e luce restano coerenti mentre la camera o il soggetto si muovono.
Come scrivere il prompt di movimento
L'immagine porta già soggetto, stile e composizione, quindi il prompt deve descrivere solo il cambiamento. Scrivi una o due frasi brevi: chi o cosa si muove, come, e cosa fa la camera. "La donna gira la testa a destra e sorride, vento leggero tra i capelli, lento avvicinamento" funziona; un elenco di tag di stile no. Nomina la camera quando conta: "camera fissa", "lenta panoramica a sinistra", "il drone sale".
Resta plausibile per cinque secondi. Un'azione per prompt si anima in modo pulito; tre azioni di seguito danno un risultato a scatti o troncato. Verbi come cammina, saluta, sbatte le palpebre, scorre, fluttua, ruota danno un movimento prevedibile. Non chiedere ciò che non è nell'immagine: il modello può muovere un'auto, non inventerà la strada dietro in modo convincente. Come prompt negativo basta la lista abituale: sfocato, mani deformate, arti in più, sfarfallio, filigrana, testo.
Le impostazioni che contano
- Risoluzione: il 480p è quattro volte più veloce del 720p e spesso basta per i social; usa il 720p per la clip finale.
- Fotogrammi: 81 fotogrammi a 16 fps sono la clip standard di cinque secondi. Le sequenze più lunghe derivano; meglio generare due clip e montare.
- Passi: da 20 a 30 passi di campionamento. Sotto 15 il movimento è impastato, sopra 40 il guadagno è invisibile.
- Guidance (CFG): da 4 a 6. Valori più alti seguono il prompt più alla lettera ma aggiungono sfarfallio.
- Seed: come in Stable Diffusion, stessa immagine, prompt e seed riproducono la stessa clip; cambia solo il seed per ottenere un altro movimento sulla stessa immagine.
Una clip 720p richiede diversi minuti su una GPU demo condivisa: valida il prompt in 480p, poi rilancia in 720p con lo stesso seed.
Quali immagini si animano meglio
Wan 2.2 parte da qualsiasi foto o immagine generata, ma alcune sono molto più facili. Un soggetto principale nitido su uno sfondo semplice dà un movimento pulito; una scena affollata costringe il modello a scegliere cosa muovere. Il formato orizzontale corrisponde alle proporzioni del video, le immagini verticali vengono ritagliate o riempite. Un'immagine nitida e ben illuminata di almeno 1024 pixel sul lato lungo conserva il dettaglio per tutta la clip; una sorgente sfocata o molto compressa produce un video sfocato.
Le immagini generate con Stable Diffusion, SDXL o FLUX si animano molto bene, il che rende da immagine a video il modo più semplice per ottenere un breve video dall'aspetto preciso: genera prima esattamente il fotogramma che vuoi, poi animalo.
Eseguire Wan 2.2 I2V a casa
I pesi sono su Hugging Face e girano in ComfyUI, in Diffusers e nel repository ufficiale Wan. Il modello I2V da 14B richiede circa 80 GB di VRAM in piena precisione, oppure una scheda da 24 GB con i checkpoint quantizzati fp8 e lo scarico su CPU, al prezzo di diversi minuti per clip. Il modello TI2V da 5B genera una clip 720p di cinque secondi su una RTX 4090 in meno di dieci minuti con circa 24 GB di VRAM. Con schede più piccole, usa il cloud o la demo gratuita di questo sito.