Como gerar um vídeo a partir de texto com o Wan 2.2?

Por Atualizado em 5 min de leitura

O Wan 2.2 texto para vídeo gera um clipe sem som de uns cinco segundos, em 480p ou 720p, a partir de uma única frase descrevendo a cena, a ação e a câmera. Modelo de vídeo de pesos abertos da Alibaba, lançado em 2025 sob licença Apache 2.0, roda em casa no ComfyUI ou no Diffusers.

O que é o Wan 2.2 texto para vídeo

O Wan 2.2 foi lançado com três modelos abertos. O Wan2.2-T2V-A14B é o modelo de texto para vídeo: um transformer de difusão com mistura de especialistas (mixture-of-experts), de 27 bilhões de parâmetros, 14 bilhões ativos a cada passo, em que um especialista de alto ruído define a composição geral e um especialista de baixo ruído refina os detalhes. O Wan2.2-I2V-A14B anima uma imagem existente, e o Wan2.2-TI2V-5B é um híbrido menor que faz as duas coisas e roda em uma placa de vídeo doméstica em 720p e 24 quadros por segundo.

Em comparação com o Wan 2.1, os modelos 2.2 foram treinados com 66% mais imagens e 83% mais vídeos, com rótulos detalhados de iluminação, composição, contraste e tom de cor. É por isso que o prompt pode indicar a luz e o enquadramento com termos de cinema como “soft lighting”, “warm colors” ou “low angle shot”, todos tirados do vocabulário de prompts da própria Alibaba.

Como escrever um prompt de vídeo

Um prompt de vídeo descreve uma cena curta, não uma imagem parada. Uma estrutura que funciona é assunto, ação, cenário, câmera, estilo: “A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic”. Cada elemento responde a uma pergunta que, sem ele, o modelo teria de adivinhar.

  • Assunto e ação: um único assunto, uma única ação clara, com um verbo. Cinco segundos bastam para um gesto, uma caminhada, um aceno, não para uma história.
  • Cenário: o lugar e a hora do dia definem a luz.
  • Câmera: static, pan, tilt, tracking, push-in, drone shot. Diga qual, ou o modelo escolhe por você.
  • Estilo: cinematic, documentary, anime, claymation, 35 mm film. Uma palavra de estilo basta.

Escreva a ação em frases simples; palavras-chave podem definir a luz e o enquadramento, como nos prompts de exemplo da própria Alibaba, mas uma lista de tags não descreve um movimento. Use o prompt negativo para os defeitos clássicos (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Ele só tem efeito quando o guidance está acima de 1; os workflows com o LoRA Lightning de 4 passos rodam em 1 e o ignoram.

Configurações e tempo de geração

Os valores padrão oficiais são 81 quadros a 16 fps, 480p ou 720p, 40 passos e um guidance scale de 3 a 4; os workflows do ComfyUI usam 20 passos com guidance de 3,5, ou 4 passos com guidance de 1 e o LoRA Lightning. Com as configurações oficiais, um clipe em 480p leva cerca de cinco minutos e meio em uma única H100, uma GPU de data center; em 720p, leva cerca de três vezes mais para o mesmo número de quadros. A seed funciona como na geração de imagens: fixe-a para comparar dois prompts, mude-a para obter outra versão do mesmo prompt. A proporção é escolhida antes da geração, normalmente 16:9 ou 9:16; o modelo não consegue mudá-la depois.

Como cada tentativa é lenta, teste o prompt em 480p e só então gere de novo em 720p. A seed de uma versão em 480p dá outro clipe em 720p, porque o ruído tem outro formato. A maioria dos resultados ruins vem de prompts com ações demais ou com instruções de câmera contraditórias, não das configurações.

O que o texto para vídeo ainda não consegue fazer

Cinco segundos, ou 81 quadros, é a duração para a qual o modelo foi configurado; gerações mais longas perdem a consistência. Textos longos dentro do vídeo não são confiáveis. Mãos e interações rápidas e complexas entre várias pessoas ainda falham com frequência. A física é plausível, mas não exata: água, tecido e cabelo se movem bem, mas uma bola pode quicar errado. Não há áudio. Para um visual preciso, o modo imagem para vídeo é mais fácil: gere o primeiro quadro com Stable Diffusion, SDXL ou Flux e depois anime-o com o Wan 2.2.

Como rodar o Wan 2.2 T2V localmente

Os pesos estão no Hugging Face e rodam no ComfyUI, no Diffusers e no repositório oficial. Com o script oficial, que segundo a Alibaba exige uma placa de 80 GB, o modelo T2V de 14B chega a um pico de cerca de 41 GB de VRAM em 480p e de 60 GB em 720p. No ComfyUI, ele roda em uma placa de 24 GB com checkpoints fp8 e offloading, levando vários minutos por clipe. O modelo de 5B produz um clipe de cinco segundos em 720p em uma RTX 4090 em menos de dez minutos. No ComfyUI, ele cabe em uma placa de 8 GB; abaixo disso, use uma GPU na nuvem ou a demo gratuita deste site, que parte de uma imagem, usada como primeiro quadro.

Perguntas frequentes

O Wan 2.2 é melhor que o Wan 2.1?

Sim, segundo a Alibaba, em qualidade de movimento, fidelidade ao prompt e controle estético: os modelos com mistura de especialistas e os rótulos de treinamento mais ricos buscam movimentos mais suaves e um controle mais preciso da iluminação e da composição. Em GPUs pequenas, o modelo 5B do Wan 2.2 assume o lugar do Wan 2.1.

O Wan 2.2 consegue fazer um vídeo a partir de uma imagem e de um texto?

Sim. O modelo I2V usa uma imagem como primeiro quadro, mais um texto que descreve o movimento, e o modelo TI2V de 5B aceita só texto ou texto com imagem. A demo do Wan 2.2 deste site funciona a partir de uma imagem.

Posso usar os vídeos comercialmente?

Os modelos são distribuídos sob a licença Apache 2.0, que permite o uso comercial, e a Alibaba não reivindica nenhum direito sobre os vídeos que você gera. Confira os termos de uso da plataforma em que você gera os vídeos.