Ce qu'est Wan 2.2 texte vers vidéo
Wan 2.2 existe en trois modèles ouverts. Wan2.2-T2V-A14B est le modèle texte vers vidéo : un transformeur de diffusion à mélange d'experts de 27 milliards de paramètres, 14 milliards actifs à chaque étape, où un expert « haut bruit » pose le mouvement et un expert « bas bruit » affine textures et lumière. Wan2.2-I2V-A14B anime une image existante, et Wan2.2-TI2V-5B est un hybride plus petit qui fait les deux et tourne sur une carte grand public en 720p à 24 images par seconde.
Par rapport à Wan 2.1, les modèles 2.2 ont été entraînés sur bien plus de vidéo, avec des annotations de lumière, de composition, de couleur et de mouvement de caméra. C'est pourquoi le prompt peut demander un « contre-jour d'heure dorée » ou une « caméra à l'épaule » et l'obtenir, ce que les modèles ouverts précédents ignoraient le plus souvent.
Comment écrire un prompt vidéo
Un prompt vidéo décrit une courte scène, pas une image fixe. La structure fiable est sujet, action, décor, caméra, style : « Un renard roux marche dans la neige fraîche d'une forêt de pins, tourne la tête vers la caméra, travelling en contre-plongée, lumière douce du matin, cinématographique ». Chaque élément répond à une question que le modèle devinerait sinon.
- Sujet et action : un sujet, une action claire avec un verbe. Cinq secondes suffisent pour un geste, une marche, un salut, pas pour une histoire.
- Décor : le lieu et l'heure fixent la lumière.
- Caméra : fixe, panoramique, inclinaison, travelling, avancée, plan de drone. Nommez-la, sinon le modèle choisit.
- Style : cinématographique, documentaire, anime, pâte à modeler, pellicule 35 mm. Un mot de style suffit.
Écrivez en phrases simples ; les listes de mots-clés qui marchent dans Stable Diffusion donnent ici un mouvement figé et incohérent. Réservez le prompt négatif aux défauts classiques : flou, scintillement, mains déformées, doigts en trop, filigrane, sous-titres.
Réglages et temps de génération
Les valeurs par défaut sont 81 images à 16 i/s, 480p ou 720p, 20 à 30 étapes et une guidance autour de 5. En 480p un clip prend une à deux minutes sur un GPU de centre de données ; le 720p prend quatre fois plus longtemps pour le même nombre d'images. La seed fonctionne comme en génération d'images : fixez-la pour comparer deux prompts, changez-la pour obtenir une autre prise du même prompt. Le format se choisit avant la génération, en général 16:9 ou 9:16 ; le modèle ne peut pas le changer ensuite.
Chaque essai étant lent, testez le prompt en 480p, notez la seed de la prise qui vous plaît, et relancez seulement alors en 720p. La plupart des mauvais résultats viennent de prompts à trop d'actions ou aux consignes de caméra contradictoires, pas des réglages.
Ce que le texte vers vidéo ne sait pas encore faire
Cinq secondes est la limite pratique d'un clip cohérent ; au-delà, la génération dérive et le sujet change de visage ou de vêtements. Le texte dans la vidéo est peu fiable. Les mains et les interactions rapides entre plusieurs personnes échouent encore souvent. La physique est plausible plutôt qu'exacte : eau, tissu et cheveux bougent bien, mais une balle peut rebondir de travers. Il n'y a pas de son. Pour un rendu précis, l'image vers vidéo est plus simple : générez la première frame avec Stable Diffusion, SDXL ou FLUX, puis animez-la avec Wan 2.2.
Faire tourner Wan 2.2 T2V en local
Les poids sont sur Hugging Face et fonctionnent dans ComfyUI, Diffusers et le dépôt officiel. Le modèle T2V 14B demande environ 80 Go de VRAM en pleine précision, ou une carte de 24 Go avec les checkpoints fp8 et le déchargement, à plusieurs minutes par clip. Le modèle 5B produit un clip 720p de cinq secondes sur une RTX 4090 en moins de dix minutes. Sous 16 Go de VRAM, utilisez un GPU dans le cloud ou la démo gratuite de ce site, qui accepte aussi une image comme première frame.