O que faz o Wan 2.2 imagem para vídeo
O Wan 2.2, lançado em julho de 2025 sob a licença Apache 2.0, é o sucessor do Wan 2.1 na linha de modelos de vídeo abertos da Alibaba. A variante de imagem para vídeo, Wan2.2-I2V-A14B, usa um transformer de difusão com mistura de especialistas (mixture-of-experts): um especialista cuida dos primeiros passos, ainda cheios de ruído, que definem a composição geral; outro cuida dos últimos passos, que refinam os detalhes. Cerca de 14 bilhões de parâmetros ficam ativos a cada passo, de um total de 27 bilhões. Um modelo híbrido menor, o Wan2.2-TI2V-5B, aceita tanto texto quanto imagem e roda em uma única placa de vídeo doméstica.
Você entrega ao modelo uma imagem, que será o primeiro quadro do clipe, e um prompt que diz o que deve se mover. Ele gera 81 quadros a 16 quadros por segundo, cerca de cinco segundos, e constrói o clipe em cima dessa imagem: rostos, roupas e iluminação permanecem próximos do original enquanto a câmera ou o assunto se move.
Como escrever o prompt de movimento
A imagem já traz o assunto, o estilo e a composição, então o prompt só precisa descrever a mudança. Escreva uma ou duas frases curtas: quem ou o que se move, como, e o que a câmera faz. “The woman turns her head to the right and smiles, soft wind in her hair, slow push-in” funciona; uma lista de tags de estilo, não. Mencione a câmera de forma explícita quando ela for importante: “static camera”, “slow pan to the left”, “the drone rises”.
Mantenha o movimento plausível para um clipe de cinco segundos. Uma ação por prompt é a escolha segura. Verbos como walks, waves, blinks, flows, drifts, rotates dão movimentos previsíveis. Evite pedir coisas que não estão na imagem: o modelo consegue mover um carro, mas precisa inventar a estrada atrás dele, e isso é menos confiável do que aquilo que a imagem já mostra. O prompt negativo só tem efeito quando o guidance está acima de 1; os workflows com o LoRA Lightning de 4 passos rodam em 1 e o ignoram. Nos demais casos, a lista de sempre funciona: blurry, distorted hands, extra limbs, flickering, watermark, text.
As configurações que fazem diferença
- Resolução: 480p é cerca de três vezes mais rápido que 720p e muitas vezes basta para redes sociais; use 720p para o clipe final.
- Quadros: 81 quadros a 16 fps é o clipe padrão de cinco segundos. Sequências mais longas perdem a consistência; é melhor gerar dois clipes e fazer um corte.
- Passos: 40 passos de amostragem no script oficial, 20 no workflow básico do ComfyUI. Com o LoRA Lightning de 4 passos, de 4 a 8 bastam.
- Guidance (CFG): 3,5 por padrão no modelo I2V de 14B e 1 com o LoRA de 4 passos. Valores mais altos seguem o prompt mais ao pé da letra, mas acrescentam cintilação (flicker).
- Seed: como no Stable Diffusion, a mesma imagem, o mesmo prompt, as mesmas configurações e a mesma seed reproduzem o mesmo clipe; mude só a seed para obter outro movimento para a mesma imagem.
Teste o prompt em 480p antes de gastar tempo com o 720p. A seed não vale de uma resolução para a outra: em 720p, o ruído tem outro formato, então o movimento muda.
Quais imagens rendem as melhores animações
O Wan 2.2 funciona com qualquer foto ou imagem gerada por IA, mas algumas imagens são muito mais fáceis. Um assunto principal bem definido sobre um fundo simples dá um movimento limpo; cenas cheias de elementos obrigam o modelo a escolher o que mover. O clipe adota a proporção da imagem, então tanto o formato vertical quanto o horizontal funcionam. No ComfyUI, defina uma largura e uma altura com a mesma proporção; caso contrário, a imagem é cortada. Imagens nítidas e bem iluminadas mantêm os detalhes ao longo do clipe se tiverem pelo menos o tamanho da saída (832 pixels no lado maior em 480p, 1280 em 720p); uma imagem de origem borrada ou muito comprimida produz um vídeo borrado.
Imagens geradas com Stable Diffusion, SDXL ou Flux rendem ótimas animações, o que faz do modo imagem para vídeo o caminho mais fácil para conseguir um vídeo curto com um visual preciso: primeiro gere exatamente o quadro que você quer e depois anime-o.
Como rodar o Wan 2.2 I2V em casa
Os pesos estão no Hugging Face e rodam no ComfyUI, no Diffusers e no repositório oficial do Wan. Com o script oficial, que segundo a Alibaba exige uma placa de 80 GB, o modelo I2V de 14B chega a um pico de cerca de 41 GB de VRAM em 480p e de 60 GB em 720p. No ComfyUI, ele roda em uma placa de 24 GB com os checkpoints quantizados em fp8 e offloading, ao custo de vários minutos por clipe. O modelo TI2V de 5B gera um clipe de cinco segundos em 720p em uma RTX 4090 em menos de dez minutos e precisa de cerca de 24 GB de VRAM com o script oficial; no ComfyUI, ele cabe em uma placa de 8 GB. Abaixo disso, use uma GPU na nuvem ou a demo gratuita deste site.