Wan 2.2 是如何把图片变成视频的?

作者 更新于 2 分钟阅读

Wan 2.2 图生视频(I2V)接收一张静态图片和一句描述运动的短句,输出一段约五秒、480p 或 720p 的短片,并保留原图的主体、色彩和构图。它是阿里巴巴发布的开放权重模型,在本站可免费在线使用,有大显存显卡的话也能在家运行。

Wan 2.2 图生视频做什么

Wan 2.2 是阿里巴巴开放视频模型的 2025 年版本,于 2025 年 7 月以 Apache 2.0 许可证发布。图生视频版本 Wan2.2-I2V-A14B 是一个混合专家(MoE)扩散 Transformer:一位专家负责噪声很大的前期步骤,决定整体运动;另一位专家负责后期步骤,打磨细节。总参数 270 亿,每一步约有 140 亿参数在工作。更小的混合模型 Wan2.2-TI2V-5B 同时接受文字和图片,可在一张消费级显卡上运行。

你给模型一张图片作为短片的第一帧,再给一句提示词说明什么该动。模型以每秒 16 帧生成 81 帧,约五秒,并且比以往的开放模型更好地保持主体身份:镜头或主体移动时,面孔、衣着和光线始终一致。

如何写运动提示词

图片本身已经包含主体、风格和构图,提示词只需描述变化。写一两句短句:谁或什么在动、怎么动、镜头做什么。“女人向右转头微笑,微风吹动头发,镜头缓慢推近”是可行的;一串风格标签则不行。镜头重要时要明确写出:“固定镜头”“向左缓慢横摇”“无人机上升”。

运动要在五秒内合理。每条提示词只写一个动作,画面会很干净;连写三个动作会卡顿或被截断。走、挥手、眨眼、流动、飘动、旋转这类动词能给出可预期的运动。不要要求图片里没有的东西:模型能让汽车移动,却无法令人信服地凭空造出车后的道路。反向提示词用常规列表即可:模糊、手部畸形、多余肢体、闪烁、水印、文字。

关键参数

  • 分辨率:480p 比 720p 快四倍,发社交媒体往往够用;成片再用 720p。
  • 帧数:每秒 16 帧、81 帧是标准的五秒短片。更长的序列会漂移,不如生成两段再剪辑。
  • 步数:20 到 30 步采样。低于 15 步运动会糊,高于 40 步看不出提升。
  • 引导系数(CFG):4 到 6。数值越高越贴近提示词,但闪烁也越多。
  • 种子:和 Stable Diffusion 一样,相同的图片、提示词和种子会复现同一段短片;只改种子就能让同一张图得到另一种运动。

在共享的演示 GPU 上,一段 720p 短片要花好几分钟:先用 480p 验证提示词,再用同一个种子重跑 720p。

哪些图片最容易动起来

Wan 2.2 可以从任何照片或 AI 图片出发,但有些图片容易得多。简单背景上有清晰主体的图片运动干净;画面拥挤时模型得自己决定动什么。横构图与视频比例一致,竖图会被裁剪或补边。长边至少 1024 像素、清晰且光线充足的图片能在整段短片中保留细节;模糊或压缩严重的原图只会得到模糊的视频。

用 Stable Diffusion、SDXL 或 FLUX 生成的图片动起来效果很好,这使图生视频成为获得精确画面感短片的最简单途径:先生成你想要的那一帧,再让它动起来。

在本地运行 Wan 2.2 I2V

权重在 Hugging Face 上,可在 ComfyUI、Diffusers 和 Wan 官方仓库中运行。14B 的 I2V 模型在全精度下需要约 80 GB 显存;使用 fp8 量化检查点并把部分计算卸载到 CPU,24 GB 显卡也能跑,代价是每段几分钟。5B 的 TI2V 模型在 RTX 4090 上不到十分钟就能生成一段 720p 五秒短片,需要约 24 GB 显存。显卡更小的话,请使用云端或本站的免费演示。

常见问题

Wan 2.2 的视频最长能多久?

标准输出是每秒 16 帧、共 81 帧,约五秒。有些界面允许更多帧,但质量和一致性会下降;想要更长的视频,就从上一段的最后一帧继续生成下一段,再剪辑到一起。

Wan 2.2 会生成声音吗?

不会。Wan 2.2 生成的是无声视频,之后在视频编辑软件里加上音乐或配音即可。

它免费吗?视频可以使用吗?

模型以 Apache 2.0 许可证发布,允许个人和商业使用生成结果。本站演示免费;队列是共享的,一段短片可能需要几分钟。