Wie erzeugt man mit Wan 2.2 ein Video aus Text?

Von Aktualisiert am 4 Min. Lesezeit

Wan 2.2 Text zu Video erzeugt aus einem einzigen Satz, der Szene, Handlung und Kamera beschreibt, einen Clip von etwa fünf Sekunden in 480p oder 720p. Es ist das offene Videomodell von Alibaba, 2025 unter der Apache-2.0-Lizenz veröffentlicht, und eines der wenigen offenen Modelle, deren Bewegung und Licht mit kommerziellen Diensten mithalten.

Was Wan 2.2 Text zu Video ist

Wan 2.2 gibt es als drei offene Modelle. Wan2.2-T2V-A14B ist das Text-zu-Video-Modell: ein Diffusions-Transformer mit Mixture-of-Experts, 27 Milliarden Parameter, 14 Milliarden pro Schritt aktiv, bei dem ein Experte für starkes Rauschen die Bewegung anlegt und ein Experte für schwaches Rauschen Texturen und Licht verfeinert. Wan2.2-I2V-A14B animiert ein vorhandenes Bild, und Wan2.2-TI2V-5B ist ein kleineres Hybridmodell, das beides kann und auf einer Consumer-Karte in 720p mit 24 Bildern pro Sekunde läuft.

Gegenüber Wan 2.1 wurden die 2.2-Modelle mit weit mehr Video trainiert, mit Annotationen für Licht, Komposition, Farbe und Kamerabewegung. Deshalb kann der Prompt „Gegenlicht zur goldenen Stunde“ oder „Handkamera“ verlangen und bekommt es, was frühere offene Modelle meist ignorierten.

So schreibt man einen Video-Prompt

Ein Video-Prompt beschreibt eine kurze Szene, kein Standbild. Die verlässliche Struktur ist Motiv, Handlung, Ort, Kamera, Stil: „Ein Rotfuchs geht durch frischen Schnee in einem Kiefernwald, dreht den Kopf zur Kamera, Kamerafahrt aus der Froschperspektive, weiches Morgenlicht, filmisch“. Jedes Element beantwortet eine Frage, die das Modell sonst raten müsste.

  • Motiv und Handlung: ein Motiv, eine klare Handlung mit Verb. Fünf Sekunden reichen für eine Geste, einen Gang, ein Winken, nicht für eine Geschichte.
  • Ort: Ort und Tageszeit bestimmen das Licht.
  • Kamera: statisch, Schwenk, Neigung, Fahrt, Heranfahrt, Drohnenaufnahme. Benennen Sie sie, sonst wählt das Modell.
  • Stil: filmisch, dokumentarisch, Anime, Knetanimation, 35-mm-Film. Ein Stilwort genügt.

Schreiben Sie in einfachen Sätzen; Schlagwortlisten, die in Stable Diffusion funktionieren, ergeben hier statische, unzusammenhängende Bewegung. Den negativen Prompt nutzen Sie für die klassischen Fehler: unscharf, Flackern, verzerrte Hände, zusätzliche Finger, Wasserzeichen, Untertitel.

Einstellungen und Rechenzeit

Die Voreinstellungen sind 81 Frames bei 16 fps, 480p oder 720p, 20 bis 30 Schritte und eine Guidance um 5. In 480p dauert ein Clip auf einer Rechenzentrums-GPU ein bis zwei Minuten; 720p dauert bei gleicher Framezahl viermal so lang. Der Seed funktioniert wie bei der Bilderzeugung: fixieren, um zwei Prompts zu vergleichen, ändern, um eine andere Version desselben Prompts zu bekommen. Das Seitenverhältnis wird vor der Erzeugung gewählt, meist 16:9 oder 9:16; nachträglich kann das Modell es nicht ändern.

Da jeder Versuch langsam ist, testen Sie den Prompt in 480p, merken sich den Seed der gelungenen Version und starten erst dann in 720p. Die meisten schlechten Ergebnisse stammen von Prompts mit zu vielen Handlungen oder widersprüchlichen Kameraanweisungen, nicht von den Einstellungen.

Was Text zu Video noch nicht kann

Fünf Sekunden sind die praktische Grenze für einen konsistenten Clip; längere Erzeugungen driften, und das Motiv wechselt Gesicht oder Kleidung. Text im Video ist unzuverlässig. Hände und schnelle, komplexe Interaktionen mehrerer Personen scheitern noch oft. Die Physik ist plausibel statt exakt: Wasser, Stoff und Haare bewegen sich gut, ein Ball kann falsch abprallen. Es gibt keinen Ton. Für einen präzisen Look ist Bild zu Video einfacher: den ersten Frame mit Stable Diffusion, SDXL oder FLUX erzeugen und dann mit Wan 2.2 animieren.

Wan 2.2 T2V lokal ausführen

Die Gewichte liegen auf Hugging Face und laufen in ComfyUI, Diffusers und dem offiziellen Repository. Das T2V-Modell mit 14B braucht in voller Präzision etwa 80 GB VRAM, oder eine 24-GB-Karte mit fp8-Checkpoints und Offloading bei mehreren Minuten pro Clip. Das 5B-Modell erzeugt einen 720p-Clip von fünf Sekunden auf einer RTX 4090 in unter zehn Minuten. Unter 16 GB VRAM nutzen Sie eine Cloud-GPU oder die kostenlose Demo auf dieser Seite, die auch ein Bild als ersten Frame annimmt.

Häufige Fragen

Ist Wan 2.2 besser als Wan 2.1?

Ja, bei Bewegungsqualität, Prompt-Treue und ästhetischer Kontrolle: die Mixture-of-Experts-Modelle und die reicheren Trainingsannotationen ergeben flüssigere Bewegung und verlässliche Licht- und Kameraanweisungen. Wan 2.1 bleibt auf kleinen GPUs nützlich, wo das 5B-Modell von Wan 2.2 der natürliche Ersatz ist.

Kann Wan 2.2 ein Video aus Bild und Text machen?

Ja. Das I2V-Modell nutzt ein Bild als ersten Frame plus einen Text, der die Bewegung beschreibt, und das 5B-TI2V-Modell nimmt Text allein oder Text mit Bild an. Die Wan-2.2-Demo auf dieser Seite arbeitet mit einem Bild.

Darf ich die Videos kommerziell nutzen?

Die Modelle stehen unter der Apache-2.0-Lizenz, die kommerzielle Nutzung der Ergebnisse erlaubt. Prüfen Sie die Bedingungen des Hosting-Dienstes, auf dem Sie erzeugen.