Wan 2.2 テキストから動画とは
Wan 2.2 には3つのオープンモデルがあります。Wan2.2-T2V-A14B がテキストから動画のモデルで、270億パラメータ、各ステップで140億が動作する専門家混合型の拡散トランスフォーマーです。高ノイズ側の専門家が動きを組み立て、低ノイズ側の専門家が質感と光を仕上げます。Wan2.2-I2V-A14B は既存の画像を動かし、Wan2.2-TI2V-5B は両方をこなす小型のハイブリッドで、民生用 GPU で 720p・24 fps で動きます。
Wan 2.1 と比べ、2.2 のモデルははるかに多くの動画で学習され、照明・構図・色・カメラワークのラベルが付いています。だからプロンプトで「ゴールデンアワーの逆光」や「手持ちカメラ」を求めればその通りになります。以前のオープンモデルではほぼ無視されていたことです。
動画プロンプトの書き方
動画プロンプトは静止画ではなく短い場面を描写します。確実な構成は、被写体・動作・舞台・カメラ・スタイルです:「赤いキツネが松林の新雪を歩き、カメラの方へ顔を向ける、ローアングルのトラッキングショット、柔らかな朝の光、シネマティック」。各要素は、書かなければモデルが勝手に決める点を埋めます。
- 被写体と動作:被写体は1つ、動詞のあるはっきりした動作を1つ。5秒で足りるのは仕草、歩き、手振りまでで、物語には足りません。
- 舞台:場所と時間帯が光を決めます。
- カメラ:固定、パン、ティルト、トラッキング、寄り、ドローン撮影。指定しなければモデルが選びます。
- スタイル:シネマティック、ドキュメンタリー、アニメ、クレイアニメ、35mm フィルム。スタイル語は1つで十分。
平易な文で書きます。Stable Diffusion で効くキーワードの羅列は、ここでは止まったような支離滅裂な動きになります。ネガティブプロンプトは定番の欠陥に:ぼやけ、ちらつき、歪んだ手、余分な指、透かし、字幕。
設定と生成時間
既定値は 16 fps で81フレーム、480p または 720p、ステップ20〜30、ガイダンス5前後です。480p ならデータセンター用 GPU で1〜2分、720p は同じフレーム数で4倍かかります。シードは画像生成と同じで、固定すれば2つのプロンプトを比べられ、変えれば同じプロンプトの別テイクが得られます。アスペクト比は生成前に選び、通常は 16:9 か 9:16。後から変えることはできません。
1回ごとに時間がかかるので、480p でプロンプトを試し、気に入ったテイクのシードを控えてから 720p で再実行します。悪い結果の多くは、動作が多すぎるプロンプトや矛盾したカメラ指示が原因で、設定のせいではありません。
テキストから動画がまだできないこと
一貫したクリップの実用的な上限は5秒で、それ以上は崩れて被写体の顔や服が変わります。動画内の文字は信頼できません。手や、複数人の速く複雑なやり取りはまだよく失敗します。物理は正確というより「もっともらしい」程度で、水・布・髪はよく動きますが、ボールの跳ね方は間違うことがあります。音声はありません。狙った見た目が欲しいなら画像から動画の方が簡単です。Stable Diffusion、SDXL、FLUX で最初のフレームを作り、Wan 2.2 で動かしましょう。
Wan 2.2 T2V をローカルで動かす
ウェイトは Hugging Face にあり、ComfyUI、Diffusers、公式リポジトリで動きます。14B の T2V モデルはフル精度で約 80 GB の VRAM が必要で、fp8 チェックポイントとオフロードなら 24 GB のカードでも動きますが1本に数分かかります。5B モデルは RTX 4090 で 720p の5秒クリップを10分以内に生成します。VRAM が 16 GB 未満なら、クラウド GPU か、画像を最初のフレームとして受け付けるこのサイトの無料デモをお使いください。