Wie macht Wan 2.2 aus einem Bild ein Video?

Von Aktualisiert am 4 Min. Lesezeit

Wan 2.2 Bild zu Video nimmt ein Foto und einen kurzen Satz, der die Bewegung beschreibt, und liefert einen Clip von etwa fünf Sekunden in 480p oder 720p, der Motiv, Farben und Bildausschnitt des Fotos bewahrt. Es ist ein offenes Modell von Alibaba, hier kostenlos online nutzbar und zu Hause auf einer großen Grafikkarte lauffähig.

Was Wan 2.2 Bild zu Video macht

Wan 2.2 ist die Generation 2025 der offenen Videomodelle von Alibaba, veröffentlicht im Juli 2025 unter der Apache-2.0-Lizenz. Die Variante Bild zu Video, Wan2.2-I2V-A14B, ist ein Diffusions-Transformer mit Mixture-of-Experts: ein Experte übernimmt die frühen, stark verrauschten Schritte, die die Gesamtbewegung festlegen, ein anderer die späten Schritte, die Details verfeinern. Pro Schritt sind etwa 14 Milliarden von insgesamt 27 Milliarden Parametern aktiv. Ein kleineres Hybridmodell, Wan2.2-TI2V-5B, nimmt Text und Bild an und läuft auf einer einzelnen Consumer-Karte.

Man gibt dem Modell ein Bild, das zum ersten Frame des Clips wird, und einen Prompt, der sagt, was sich bewegen soll. Es erzeugt 81 Frames mit 16 Bildern pro Sekunde, also etwa fünf Sekunden, und bewahrt die Identität des Motivs deutlich besser als frühere offene Modelle: Gesichter, Kleidung und Licht bleiben konsistent, während sich Kamera oder Motiv bewegen.

So schreibt man den Bewegungs-Prompt

Das Bild liefert bereits Motiv, Stil und Komposition, der Prompt muss nur die Veränderung beschreiben. Schreiben Sie ein bis zwei kurze Sätze: wer oder was sich bewegt, wie, und was die Kamera tut. „Die Frau dreht den Kopf nach rechts und lächelt, leichter Wind im Haar, langsame Kamerafahrt nach vorn“ funktioniert; eine Liste von Stil-Tags nicht. Nennen Sie die Kamera, wenn es darauf ankommt: „statische Kamera“, „langsamer Schwenk nach links“, „die Drohne steigt“.

Bleiben Sie für fünf Sekunden plausibel. Eine Aktion pro Prompt wird sauber animiert; drei Aktionen hintereinander ergeben ruckelige oder abgeschnittene Ergebnisse. Verben wie geht, winkt, blinzelt, fließt, treibt, dreht sich geben vorhersehbare Bewegung. Verlangen Sie nichts, was nicht im Bild ist: das Modell kann ein Auto bewegen, die Straße dahinter erfindet es nicht überzeugend. Als negativer Prompt reicht die übliche Liste: unscharf, verzerrte Hände, zusätzliche Gliedmaßen, Flackern, Wasserzeichen, Text.

Die Einstellungen, die zählen

  • Auflösung: 480p ist viermal schneller als 720p und reicht oft für soziale Netzwerke; 720p für den fertigen Clip.
  • Frames: 81 Frames bei 16 fps sind der Standardclip von fünf Sekunden. Längere Sequenzen driften; besser zwei Clips erzeugen und schneiden.
  • Schritte: 20 bis 30 Sampling-Schritte. Unter 15 verschmiert die Bewegung, über 40 ist der Gewinn unsichtbar.
  • Guidance (CFG): 4 bis 6. Höhere Werte folgen dem Prompt wörtlicher, bringen aber Flackern.
  • Seed: wie in Stable Diffusion erzeugen gleiches Bild, Prompt und Seed denselben Clip; ändern Sie nur den Seed, um eine andere Bewegung für dasselbe Bild zu bekommen.

Ein 720p-Clip braucht auf einer geteilten Demo-GPU mehrere Minuten: prüfen Sie den Prompt in 480p und starten Sie dann in 720p mit demselben Seed erneut.

Welche Bilder sich am besten animieren lassen

Wan 2.2 arbeitet mit jedem Foto oder KI-Bild, aber manche Bilder sind viel einfacher. Ein klares Hauptmotiv vor einfachem Hintergrund ergibt saubere Bewegung; in vollen Szenen muss das Modell wählen, was sich bewegt. Querformat entspricht dem Seitenverhältnis des Videos, Hochformatbilder werden beschnitten oder aufgefüllt. Scharfe, gut beleuchtete Bilder mit mindestens 1024 Pixeln an der langen Seite behalten ihre Details im Clip; eine unscharfe oder stark komprimierte Quelle ergibt ein unscharfes Video.

Mit Stable Diffusion, SDXL oder FLUX erzeugte Bilder lassen sich sehr gut animieren. Bild zu Video ist deshalb der einfachste Weg zu einem kurzen Video mit genau dem gewünschten Look: erst den exakten Frame erzeugen, dann animieren.

Wan 2.2 I2V zu Hause ausführen

Die Gewichte liegen auf Hugging Face und laufen in ComfyUI, in Diffusers und im offiziellen Wan-Repository. Das I2V-Modell mit 14B braucht in voller Präzision etwa 80 GB VRAM, oder eine 24-GB-Karte mit den fp8-quantisierten Checkpoints und CPU-Offloading, dann dauert ein Clip mehrere Minuten. Das TI2V-Modell mit 5B erzeugt einen 720p-Clip von fünf Sekunden auf einer RTX 4090 in unter zehn Minuten und braucht etwa 24 GB VRAM. Auf kleineren Karten nutzen Sie die Cloud oder die kostenlose Demo auf dieser Seite.

Häufige Fragen

Wie lang kann ein Wan-2.2-Video sein?

Die Standardausgabe sind 81 Frames bei 16 Bildern pro Sekunde, etwa fünf Sekunden. Manche Oberflächen erlauben mehr Frames, aber Qualität und Konsistenz sinken; für ein längeres Video erzeugen Sie mehrere Clips aus dem letzten Frame des vorherigen und schneiden sie zusammen.

Erzeugt Wan 2.2 Ton?

Nein. Wan 2.2 liefert stummes Video; Musik oder Sprache fügen Sie anschließend in einem Videoeditor hinzu.

Ist es kostenlos und darf ich die Videos nutzen?

Das Modell steht unter der Apache-2.0-Lizenz, die private und kommerzielle Nutzung der Ergebnisse erlaubt. Die Demo auf dieser Seite ist kostenlos; die Warteschlange ist geteilt, ein Clip kann einige Minuten dauern.