Wan 2.2 图生视频做什么
Wan 2.2 是阿里巴巴开放视频模型的 2025 年版本,于 2025 年 7 月以 Apache 2.0 许可证发布。图生视频版本 Wan2.2-I2V-A14B 是一个混合专家(MoE)扩散 Transformer:一位专家负责噪声很大的前期步骤,决定整体运动;另一位专家负责后期步骤,打磨细节。总参数 270 亿,每一步约有 140 亿参数在工作。更小的混合模型 Wan2.2-TI2V-5B 同时接受文字和图片,可在一张消费级显卡上运行。
你给模型一张图片作为短片的第一帧,再给一句提示词说明什么该动。模型以每秒 16 帧生成 81 帧,约五秒,并且比以往的开放模型更好地保持主体身份:镜头或主体移动时,面孔、衣着和光线始终一致。
如何写运动提示词
图片本身已经包含主体、风格和构图,提示词只需描述变化。写一两句短句:谁或什么在动、怎么动、镜头做什么。“女人向右转头微笑,微风吹动头发,镜头缓慢推近”是可行的;一串风格标签则不行。镜头重要时要明确写出:“固定镜头”“向左缓慢横摇”“无人机上升”。
运动要在五秒内合理。每条提示词只写一个动作,画面会很干净;连写三个动作会卡顿或被截断。走、挥手、眨眼、流动、飘动、旋转这类动词能给出可预期的运动。不要要求图片里没有的东西:模型能让汽车移动,却无法令人信服地凭空造出车后的道路。反向提示词用常规列表即可:模糊、手部畸形、多余肢体、闪烁、水印、文字。
关键参数
- 分辨率:480p 比 720p 快四倍,发社交媒体往往够用;成片再用 720p。
- 帧数:每秒 16 帧、81 帧是标准的五秒短片。更长的序列会漂移,不如生成两段再剪辑。
- 步数:20 到 30 步采样。低于 15 步运动会糊,高于 40 步看不出提升。
- 引导系数(CFG):4 到 6。数值越高越贴近提示词,但闪烁也越多。
- 种子:和 Stable Diffusion 一样,相同的图片、提示词和种子会复现同一段短片;只改种子就能让同一张图得到另一种运动。
在共享的演示 GPU 上,一段 720p 短片要花好几分钟:先用 480p 验证提示词,再用同一个种子重跑 720p。
哪些图片最容易动起来
Wan 2.2 可以从任何照片或 AI 图片出发,但有些图片容易得多。简单背景上有清晰主体的图片运动干净;画面拥挤时模型得自己决定动什么。横构图与视频比例一致,竖图会被裁剪或补边。长边至少 1024 像素、清晰且光线充足的图片能在整段短片中保留细节;模糊或压缩严重的原图只会得到模糊的视频。
用 Stable Diffusion、SDXL 或 FLUX 生成的图片动起来效果很好,这使图生视频成为获得精确画面感短片的最简单途径:先生成你想要的那一帧,再让它动起来。
在本地运行 Wan 2.2 I2V
权重在 Hugging Face 上,可在 ComfyUI、Diffusers 和 Wan 官方仓库中运行。14B 的 I2V 模型在全精度下需要约 80 GB 显存;使用 fp8 量化检查点并把部分计算卸载到 CPU,24 GB 显卡也能跑,代价是每段几分钟。5B 的 TI2V 模型在 RTX 4090 上不到十分钟就能生成一段 720p 五秒短片,需要约 24 GB 显存。显卡更小的话,请使用云端或本站的免费演示。