¿Cómo generar un vídeo a partir de texto con Wan 2.2?

Por Actualizado el 4 min de lectura

Wan 2.2 texto a vídeo genera un clip de unos cinco segundos, en 480p o 720p, a partir de una frase que describe la escena, la acción y la cámara. Es el modelo de vídeo abierto de Alibaba, publicado en 2025 bajo licencia Apache 2.0, uno de los pocos modelos abiertos cuyo movimiento y luz compiten con los servicios comerciales.

Qué es Wan 2.2 texto a vídeo

Wan 2.2 existe en tres modelos abiertos. Wan2.2-T2V-A14B es el modelo texto a vídeo: un transformador de difusión con mezcla de expertos de 27.000 millones de parámetros, 14.000 millones activos en cada paso, donde un experto de ruido alto plantea el movimiento y un experto de ruido bajo afina texturas y luz. Wan2.2-I2V-A14B anima una imagen existente, y Wan2.2-TI2V-5B es un híbrido más pequeño que hace ambas cosas y funciona en una tarjeta de consumo a 720p y 24 fotogramas por segundo.

Frente a Wan 2.1, los modelos 2.2 se entrenaron con mucho más vídeo, con etiquetas de iluminación, composición, color y movimiento de cámara. Por eso el prompt puede pedir "contraluz de hora dorada" o "cámara en mano" y conseguirlo, algo que los modelos abiertos anteriores casi siempre ignoraban.

Cómo escribir un prompt de vídeo

Un prompt de vídeo describe una escena corta, no una imagen fija. La estructura fiable es sujeto, acción, escenario, cámara, estilo: "Un zorro rojo camina por la nieve fresca de un bosque de pinos, gira la cabeza hacia la cámara, travelling en contrapicado, luz suave de la mañana, cinematográfico". Cada elemento responde a una pregunta que el modelo adivinaría de otro modo.

  • Sujeto y acción: un sujeto, una acción clara con un verbo. Cinco segundos bastan para un gesto, un paseo, un saludo, no para una historia.
  • Escenario: el lugar y la hora del día fijan la luz.
  • Cámara: fija, panorámica, inclinación, travelling, acercamiento, plano de dron. Nómbrala, o el modelo elige.
  • Estilo: cinematográfico, documental, anime, plastilina, película de 35 mm. Basta una palabra de estilo.

Escribe en frases sencillas; las listas de palabras clave que funcionan en Stable Diffusion dan aquí un movimiento estático e incoherente. Usa el prompt negativo para los defectos clásicos: borroso, parpadeo, manos deformadas, dedos de más, marca de agua, subtítulos.

Ajustes y tiempo de generación

Los valores por defecto son 81 fotogramas a 16 fps, 480p o 720p, de 20 a 30 pasos y una guidance en torno a 5. En 480p un clip tarda de uno a dos minutos en una GPU de centro de datos; el 720p tarda cuatro veces más para el mismo número de fotogramas. La seed funciona como en la generación de imágenes: fíjala para comparar dos prompts, cámbiala para obtener otra toma del mismo prompt. La proporción se elige antes de generar, normalmente 16:9 o 9:16; el modelo no puede cambiarla después.

Como cada intento es lento, prueba el prompt en 480p, guarda la seed de la toma que te guste y solo entonces relanza en 720p. La mayoría de los malos resultados vienen de prompts con demasiadas acciones o instrucciones de cámara contradictorias, no de los ajustes.

Lo que texto a vídeo aún no puede hacer

Cinco segundos es el límite práctico de un clip coherente; las generaciones más largas derivan y el sujeto cambia de cara o de ropa. El texto dentro del vídeo no es fiable. Las manos y las interacciones rápidas y complejas entre varias personas todavía fallan a menudo. La física es plausible más que exacta: el agua, la tela y el pelo se mueven bien, pero una pelota puede botar mal. No hay audio. Para un aspecto preciso, imagen a vídeo es más fácil: genera el primer fotograma con Stable Diffusion, SDXL o FLUX y anímalo después con Wan 2.2.

Ejecutar Wan 2.2 T2V en local

Los pesos están en Hugging Face y funcionan en ComfyUI, Diffusers y el repositorio oficial. El modelo T2V de 14B necesita unos 80 GB de VRAM en precisión completa, o una tarjeta de 24 GB con checkpoints fp8 y descarga, a varios minutos por clip. El modelo de 5B produce un clip 720p de cinco segundos en una RTX 4090 en menos de diez minutos. Por debajo de 16 GB de VRAM, usa una GPU en la nube o la demo gratuita de este sitio, que también acepta una imagen como primer fotograma.

Preguntas frecuentes

¿Es Wan 2.2 mejor que Wan 2.1?

Sí en calidad de movimiento, respeto del prompt y control estético: los modelos con mezcla de expertos y las etiquetas de entrenamiento más ricas dan un movimiento más fluido e instrucciones de luz y cámara fiables. Wan 2.1 sigue siendo útil en GPU pequeñas, donde el modelo 5B de Wan 2.2 es el sustituto natural.

¿Puede Wan 2.2 hacer un vídeo a partir de una imagen y un texto?

Sí. El modelo I2V usa una imagen como primer fotograma más un texto que describe el movimiento, y el modelo TI2V de 5B acepta solo texto o texto con imagen. La demo de Wan 2.2 de este sitio parte de una imagen.

¿Puedo usar los vídeos comercialmente?

Los modelos se publican bajo licencia Apache 2.0, que permite el uso comercial de los resultados. Comprueba las condiciones del servicio de alojamiento en el que generes.