Qué es Wan 2.2 texto a vídeo
Wan 2.2 existe en tres modelos abiertos. Wan2.2-T2V-A14B es el modelo texto a vídeo: un transformador de difusión con mezcla de expertos de 27.000 millones de parámetros, 14.000 millones activos en cada paso, donde un experto de ruido alto plantea el movimiento y un experto de ruido bajo afina texturas y luz. Wan2.2-I2V-A14B anima una imagen existente, y Wan2.2-TI2V-5B es un híbrido más pequeño que hace ambas cosas y funciona en una tarjeta de consumo a 720p y 24 fotogramas por segundo.
Frente a Wan 2.1, los modelos 2.2 se entrenaron con mucho más vídeo, con etiquetas de iluminación, composición, color y movimiento de cámara. Por eso el prompt puede pedir "contraluz de hora dorada" o "cámara en mano" y conseguirlo, algo que los modelos abiertos anteriores casi siempre ignoraban.
Cómo escribir un prompt de vídeo
Un prompt de vídeo describe una escena corta, no una imagen fija. La estructura fiable es sujeto, acción, escenario, cámara, estilo: "Un zorro rojo camina por la nieve fresca de un bosque de pinos, gira la cabeza hacia la cámara, travelling en contrapicado, luz suave de la mañana, cinematográfico". Cada elemento responde a una pregunta que el modelo adivinaría de otro modo.
- Sujeto y acción: un sujeto, una acción clara con un verbo. Cinco segundos bastan para un gesto, un paseo, un saludo, no para una historia.
- Escenario: el lugar y la hora del día fijan la luz.
- Cámara: fija, panorámica, inclinación, travelling, acercamiento, plano de dron. Nómbrala, o el modelo elige.
- Estilo: cinematográfico, documental, anime, plastilina, película de 35 mm. Basta una palabra de estilo.
Escribe en frases sencillas; las listas de palabras clave que funcionan en Stable Diffusion dan aquí un movimiento estático e incoherente. Usa el prompt negativo para los defectos clásicos: borroso, parpadeo, manos deformadas, dedos de más, marca de agua, subtítulos.
Ajustes y tiempo de generación
Los valores por defecto son 81 fotogramas a 16 fps, 480p o 720p, de 20 a 30 pasos y una guidance en torno a 5. En 480p un clip tarda de uno a dos minutos en una GPU de centro de datos; el 720p tarda cuatro veces más para el mismo número de fotogramas. La seed funciona como en la generación de imágenes: fíjala para comparar dos prompts, cámbiala para obtener otra toma del mismo prompt. La proporción se elige antes de generar, normalmente 16:9 o 9:16; el modelo no puede cambiarla después.
Como cada intento es lento, prueba el prompt en 480p, guarda la seed de la toma que te guste y solo entonces relanza en 720p. La mayoría de los malos resultados vienen de prompts con demasiadas acciones o instrucciones de cámara contradictorias, no de los ajustes.
Lo que texto a vídeo aún no puede hacer
Cinco segundos es el límite práctico de un clip coherente; las generaciones más largas derivan y el sujeto cambia de cara o de ropa. El texto dentro del vídeo no es fiable. Las manos y las interacciones rápidas y complejas entre varias personas todavía fallan a menudo. La física es plausible más que exacta: el agua, la tela y el pelo se mueven bien, pero una pelota puede botar mal. No hay audio. Para un aspecto preciso, imagen a vídeo es más fácil: genera el primer fotograma con Stable Diffusion, SDXL o FLUX y anímalo después con Wan 2.2.
Ejecutar Wan 2.2 T2V en local
Los pesos están en Hugging Face y funcionan en ComfyUI, Diffusers y el repositorio oficial. El modelo T2V de 14B necesita unos 80 GB de VRAM en precisión completa, o una tarjeta de 24 GB con checkpoints fp8 y descarga, a varios minutos por clip. El modelo de 5B produce un clip 720p de cinco segundos en una RTX 4090 en menos de diez minutos. Por debajo de 16 GB de VRAM, usa una GPU en la nube o la demo gratuita de este sitio, que también acepta una imagen como primer fotograma.