Wan 2.2 画像から動画の仕組み
Wan 2.2 は、アリババが2025年7月に Apache 2.0 ライセンスで公開したオープン動画モデルの2025年世代です。画像から動画の Wan2.2-I2V-A14B は、専門家混合(MoE)型の拡散トランスフォーマーです。ノイズの多い序盤のステップで全体の動きを決める専門家と、終盤のステップで細部を仕上げる専門家に分かれ、総計270億のパラメータのうち各ステップで約140億が動作します。より小さなハイブリッドモデル Wan2.2-TI2V-5B はテキストと画像の両方を受け付け、民生用 GPU 1枚で動きます。
モデルにはクリップの最初のフレームになる画像と、何を動かすかを伝えるプロンプトを渡します。16 fps で81フレーム、つまり約5秒を生成し、以前のオープンモデルよりはるかに被写体の同一性を保ちます。カメラや被写体が動いても、顔・服・光は一貫したままです。
動きのプロンプトの書き方
被写体・スタイル・構図はすでに画像が持っているので、プロンプトは変化だけを説明すれば十分です。誰が、何が、どう動くか、カメラは何をするかを1〜2文で書きます。「女性が右を向いて微笑む、髪にそよ風、ゆっくり寄るカメラ」は機能しますが、スタイルタグの羅列は機能しません。カメラが重要なら明示します:「固定カメラ」「左へゆっくりパン」「ドローンが上昇」。
5秒に収まる自然な動きにとどめます。プロンプトごとに1つの動作ならきれいに動き、3つ続けるとカクついたり途中で切れたりします。歩く、手を振る、まばたきする、流れる、漂う、回転するといった動詞は予測しやすい動きになります。画像にないものは頼まないこと。車は動かせても、その後ろの道路を説得力をもって作り出すことはできません。ネガティブプロンプトは定番で十分です:ぼやけ、歪んだ手、余分な手足、ちらつき、透かし、文字。
重要な設定
- 解像度:480p は 720p の4倍速く、SNS 用なら十分なことが多い。最終版は 720p。
- フレーム数:16 fps で81フレームが標準の5秒クリップ。長くすると崩れるので、2本作ってつなぐ方がよい。
- ステップ数:20〜30。15未満では動きがにじみ、40を超えても差は見えない。
- ガイダンス(CFG):4〜6。高いほどプロンプトに忠実だがちらつきが増える。
- シード:Stable Diffusion と同じく、同じ画像・プロンプト・シードなら同じクリップが再現される。同じ画像で別の動きが欲しければシードだけ変える。
共有デモの GPU では 720p のクリップに数分かかります。まず 480p でプロンプトを確認し、同じシードで 720p を再実行しましょう。
動かしやすい画像
Wan 2.2 はどんな写真や生成画像からでも動きますが、向き不向きがあります。シンプルな背景にはっきりした主役があると動きはきれいで、ごちゃごちゃした場面では何を動かすかをモデルが選ぶことになります。横長の構図は動画のアスペクト比に合い、縦長の画像は切り抜かれるか余白が足されます。長辺 1024 ピクセル以上でシャープかつ明るい画像はクリップ全体で細部を保ち、ぼやけた画像や強く圧縮された画像からはぼやけた動画になります。
Stable Diffusion、SDXL、FLUX で生成した画像はとてもよく動きます。だからこそ画像から動画は、狙った見た目の短い動画を得るいちばん簡単な方法です。まず欲しいフレームを正確に生成し、それを動かしましょう。
Wan 2.2 I2V を自宅で動かす
ウェイトは Hugging Face にあり、ComfyUI、Diffusers、公式の Wan リポジトリで動きます。14B の I2V モデルはフル精度で約 80 GB の VRAM が必要で、fp8 量子化チェックポイントと CPU オフロードを使えば 24 GB のカードでも動きますが、1本に数分かかります。5B の TI2V モデルは RTX 4090 で 720p の5秒クリップを10分以内に生成し、約 24 GB の VRAM を使います。それより小さいカードなら、クラウドかこのサイトの無料デモをお使いください。