¿Cómo convierte Wan 2.2 una imagen en vídeo?

Por Actualizado el 4 min de lectura

Wan 2.2 imagen a vídeo toma una foto y una frase corta que describe el movimiento, y devuelve un clip de unos cinco segundos en 480p o 720p que conserva el sujeto, los colores y el encuadre de la imagen. Es un modelo abierto de Alibaba, gratis en línea aquí y utilizable en casa con una tarjeta gráfica grande.

Qué hace Wan 2.2 imagen a vídeo

Wan 2.2 es la generación 2025 de los modelos de vídeo abiertos de Alibaba, publicada en julio de 2025 bajo licencia Apache 2.0. La variante imagen a vídeo, Wan2.2-I2V-A14B, es un transformador de difusión con mezcla de expertos: un experto se ocupa de los primeros pasos, muy ruidosos, que deciden el movimiento general, y otro de los últimos pasos que afinan el detalle. Unos 14.000 millones de parámetros están activos en cada paso de un total de 27.000 millones. Un modelo híbrido más pequeño, Wan2.2-TI2V-5B, acepta texto e imagen y funciona en una sola tarjeta de consumo.

Se le da al modelo una imagen, que se convierte en el primer fotograma del clip, y un prompt que dice qué debe moverse. Genera 81 fotogramas a 16 por segundo, unos cinco segundos, y mantiene la identidad del sujeto mucho mejor que los modelos abiertos anteriores: caras, ropa y luz siguen coherentes mientras la cámara o el sujeto se mueven.

Cómo escribir el prompt de movimiento

La imagen ya aporta el sujeto, el estilo y la composición, así que el prompt solo debe describir el cambio. Escribe una o dos frases cortas: quién o qué se mueve, cómo, y qué hace la cámara. "La mujer gira la cabeza a la derecha y sonríe, viento suave en el pelo, lento acercamiento" funciona; una lista de etiquetas de estilo no. Nombra la cámara cuando importe: "cámara fija", "panorámica lenta a la izquierda", "el dron asciende".

Mantén el movimiento plausible para cinco segundos. Una acción por prompt se anima con limpieza; tres acciones seguidas dan un resultado a saltos o cortado. Verbos como camina, saluda, parpadea, fluye, se desliza, gira dan un movimiento previsible. No pidas lo que no está en la imagen: el modelo puede mover un coche, pero no inventará la carretera detrás de forma convincente. Como prompt negativo basta la lista habitual: borroso, manos deformadas, extremidades de más, parpadeo, marca de agua, texto.

Los ajustes que importan

  • Resolución: 480p es cuatro veces más rápido que 720p y suele bastar para redes sociales; usa 720p para el clip final.
  • Fotogramas: 81 fotogramas a 16 fps es el clip estándar de cinco segundos. Las secuencias más largas derivan; mejor generar dos clips y montar.
  • Pasos: de 20 a 30 pasos de muestreo. Por debajo de 15 el movimiento se emborrona, por encima de 40 la mejora es invisible.
  • Guidance (CFG): de 4 a 6. Valores más altos siguen el prompt más al pie de la letra pero añaden parpadeo.
  • Seed: como en Stable Diffusion, la misma imagen, prompt y seed reproducen el mismo clip; cambia solo la seed para obtener otro movimiento con la misma imagen.

Un clip en 720p tarda varios minutos en una GPU de demo compartida: valida el prompt en 480p y vuelve a lanzar en 720p con la misma seed.

Qué imágenes se animan mejor

Wan 2.2 parte de cualquier foto o imagen generada, pero algunas son mucho más fáciles. Un sujeto principal nítido sobre un fondo sencillo da un movimiento limpio; una escena cargada obliga al modelo a elegir qué mover. El formato apaisado coincide con la proporción del vídeo, así que las imágenes verticales se recortan o se rellenan. Una imagen nítida y bien iluminada de al menos 1024 píxeles en el lado largo conserva el detalle durante el clip; una fuente borrosa o muy comprimida produce un vídeo borroso.

Las imágenes generadas con Stable Diffusion, SDXL o FLUX se animan muy bien, lo que hace de imagen a vídeo la forma más sencilla de obtener un vídeo corto con un aspecto preciso: genera primero exactamente el fotograma que quieres y luego anímalo.

Ejecutar Wan 2.2 I2V en casa

Los pesos están en Hugging Face y funcionan en ComfyUI, en Diffusers y en el repositorio oficial de Wan. El modelo I2V de 14B necesita unos 80 GB de VRAM en precisión completa, o una tarjeta de 24 GB con los checkpoints cuantizados fp8 y descarga a la CPU, a cambio de varios minutos por clip. El modelo TI2V de 5B genera un clip 720p de cinco segundos en una RTX 4090 en menos de diez minutos con unos 24 GB de VRAM. Con tarjetas más pequeñas, usa la nube o la demo gratuita de este sitio.

Preguntas frecuentes

¿Cuánto puede durar un vídeo de Wan 2.2?

La salida estándar son 81 fotogramas a 16 por segundo, unos cinco segundos. Algunas interfaces permiten más fotogramas, pero la calidad y la coherencia bajan; para un vídeo más largo, genera varios clips a partir del último fotograma del anterior y móntalos.

¿Wan 2.2 genera sonido?

No. Wan 2.2 produce vídeo mudo; añade música o voz después en un editor de vídeo.

¿Es gratis y puedo usar los vídeos?

El modelo se publica bajo licencia Apache 2.0, que permite el uso personal y comercial de los resultados. La demo de este sitio es gratuita; la cola es compartida, así que un clip puede tardar unos minutos.