Comment Wan 2.2 transforme-t-il une image en vidéo ?

Par Mis à jour le 5 min de lecture

Wan 2.2 image vers vidéo prend une photo et une courte phrase qui décrit le mouvement, et renvoie un clip d'environ cinq secondes en 480p ou 720p qui conserve le sujet, les couleurs et le cadrage de l'image. C'est un modèle ouvert d'Alibaba, gratuit en ligne ici et utilisable chez soi avec une grosse carte graphique.

Ce que fait Wan 2.2 image vers vidéo

Wan 2.2 est la génération 2025 des modèles vidéo ouverts d'Alibaba, publiée en juillet 2025 sous licence Apache 2.0. La variante image vers vidéo, Wan2.2-I2V-A14B, est un transformeur de diffusion à mélange d'experts : un expert gère les premières étapes, très bruitées, qui décident du mouvement d'ensemble, un autre les dernières étapes qui affinent le détail. Environ 14 milliards de paramètres sont actifs à chaque étape sur 27 milliards au total. Un modèle hybride plus petit, Wan2.2-TI2V-5B, accepte texte et image et tourne sur une seule carte grand public.

On donne au modèle une image, qui devient la première frame du clip, et un prompt qui dit ce qui doit bouger. Il génère 81 images à 16 images par seconde, soit environ cinq secondes, et garde l'identité du sujet bien mieux que les modèles ouverts précédents : visages, vêtements et lumière restent cohérents pendant que la caméra ou le sujet se déplace.

Comment écrire le prompt de mouvement

L'image porte déjà le sujet, le style et la composition : le prompt n'a besoin de décrire que le changement. Écrivez une ou deux phrases courtes : qui ou quoi bouge, comment, et ce que fait la caméra. « La femme tourne la tête vers la droite et sourit, vent léger dans les cheveux, lent travelling avant » fonctionne ; une liste de mots-clés de style non. Nommez la caméra quand elle compte : « caméra fixe », « lent panoramique vers la gauche », « le drone s'élève ».

Restez plausible pour cinq secondes. Une action par prompt s'anime proprement ; trois actions à la suite donnent un résultat saccadé ou tronqué. Les verbes marche, salue, cligne, coule, dérive, tourne donnent un mouvement prévisible. Ne demandez pas ce qui n'est pas dans l'image : le modèle peut déplacer une voiture, il n'inventera pas la route derrière elle de façon convaincante. En prompt négatif, la liste habituelle suffit : flou, mains déformées, membres en trop, scintillement, filigrane, texte.

Les réglages qui comptent

  • Résolution : le 480p est quatre fois plus rapide que le 720p et suffit souvent pour les réseaux sociaux ; gardez le 720p pour le clip final.
  • Nombre d'images : 81 images à 16 i/s, le clip standard de cinq secondes. Les séquences plus longues dérivent ; mieux vaut générer deux clips et monter.
  • Étapes : 20 à 30 étapes d'échantillonnage. Sous 15 le mouvement est baveux, au-delà de 40 le gain est invisible.
  • Guidance (CFG) : 4 à 6. Plus haut, le prompt est suivi plus littéralement mais le scintillement augmente.
  • Seed : comme dans Stable Diffusion, mêmes image, prompt et seed reproduisent le même clip ; ne changez que la seed pour obtenir un autre mouvement sur la même image.

Un clip 720p prend plusieurs minutes sur un GPU de démo partagé : validez le prompt en 480p, puis relancez en 720p avec la même seed.

Quelles images s'animent le mieux

Wan 2.2 part de n'importe quelle photo ou image générée, mais certaines sont bien plus faciles. Un sujet principal net sur un fond simple donne un mouvement propre ; une scène chargée oblige le modèle à choisir ce qui bouge. Le format paysage correspond au ratio de la vidéo, une image en portrait est recadrée ou complétée. Une image nette et bien éclairée d'au moins 1024 pixels sur le grand côté garde son détail pendant le clip ; une source floue ou très compressée donne une vidéo floue.

Les images générées avec Stable Diffusion, SDXL ou FLUX s'animent très bien, ce qui fait de l'image vers vidéo le moyen le plus simple d'obtenir une courte vidéo au rendu précis : générez d'abord exactement la frame voulue, puis animez-la.

Faire tourner Wan 2.2 I2V chez soi

Les poids sont sur Hugging Face et fonctionnent dans ComfyUI, dans Diffusers et dans le dépôt officiel Wan. Le modèle I2V 14B demande environ 80 Go de VRAM en pleine précision, ou une carte de 24 Go avec les checkpoints quantifiés fp8 et le déchargement vers le CPU, au prix de plusieurs minutes par clip. Le modèle TI2V 5B génère un clip 720p de cinq secondes sur une RTX 4090 en moins de dix minutes avec environ 24 Go de VRAM. Avec une carte plus petite, passez par le cloud ou par la démo gratuite de ce site.

Essayer maintenant, gratuitementAnimer une image avec Wan 2.2, gratuit →

Questions fréquentes

Quelle durée peut avoir une vidéo Wan 2.2 ?

La sortie standard fait 81 images à 16 images par seconde, soit environ cinq secondes. Certaines interfaces autorisent plus d'images, mais la qualité et la cohérence baissent ; pour une vidéo plus longue, générez plusieurs clips à partir de la dernière image du précédent et montez-les.

Wan 2.2 génère-t-il du son ?

Non. Wan 2.2 produit une vidéo muette ; ajoutez ensuite musique ou voix dans un logiciel de montage.

Est-ce gratuit et puis-je utiliser les vidéos ?

Le modèle est publié sous licence Apache 2.0, qui autorise l'usage personnel et commercial des résultats. La démo de ce site est gratuite ; la file est partagée, un clip peut prendre quelques minutes.