Wan 2.2 文生视频是什么
Wan 2.2 有三个开放模型。Wan2.2-T2V-A14B 是文生视频模型:混合专家扩散 Transformer,总参数 270 亿,每步激活 140 亿,由高噪声专家搭建运动、低噪声专家打磨质感和光线。Wan2.2-I2V-A14B 让现有图片动起来,Wan2.2-TI2V-5B 是两者兼备的小型混合模型,可在消费级显卡上以 720p、每秒 24 帧运行。
与 Wan 2.1 相比,2.2 系列用多得多的视频训练,并带有光照、构图、色彩和镜头运动的标注。因此提示词可以要求“黄金时刻逆光”或“手持镜头”并真正得到它们,而以往的开放模型大多会忽略这些。
如何写视频提示词
视频提示词描述的是一个短场景,而不是一张静态画面。可靠的结构是:主体、动作、场景、镜头、风格。“一只赤狐走过松林里的新雪,转头看向镜头,低角度跟拍,柔和的晨光,电影感”。每个要素都回答了一个模型否则只能猜的问题。
- 主体与动作:一个主体,一个带动词的清晰动作。五秒够做一个手势、一段行走、一次挥手,不够讲一个故事。
- 场景:地点和时段决定光线。
- 镜头:固定、横摇、俯仰、跟拍、推近、无人机镜头。要写明,否则由模型自选。
- 风格:电影感、纪录片、动画、黏土动画、35 毫米胶片。一个风格词就够。
用平实的句子写。Stable Diffusion 里管用的关键词堆砌,在这里会得到僵硬、不连贯的运动。反向提示词留给经典缺陷:模糊、闪烁、手部畸形、多余手指、水印、字幕。
参数与生成时间
默认值是每秒 16 帧、81 帧,480p 或 720p,20 到 30 步,引导系数 5 左右。480p 一段在数据中心 GPU 上需要一到两分钟;同样帧数的 720p 要四倍时间。种子的用法与图片生成相同:固定种子比较两条提示词,更换种子得到同一提示词的另一条结果。画幅比例要在生成前选定,通常是 16:9 或 9:16,模型事后无法更改。
因为每次尝试都很慢,先用 480p 测试提示词,记下满意那条的种子,然后再用 720p 重跑。大多数糟糕的结果来自动作太多或镜头指令自相矛盾的提示词,而不是参数。
文生视频目前还做不到的事
五秒是保持一致性的实际上限;更长的生成会漂移,主体的面孔或衣着会改变。视频内的文字不可靠。手部以及多人之间快速、复杂的互动仍常常失败。物理效果是“看着合理”而非精确:水、布料和头发动得不错,但球可能弹错方向。没有音频。想要精确的画面,用图生视频更容易:先用 Stable Diffusion、SDXL 或 FLUX 生成第一帧,再用 Wan 2.2 让它动起来。
在本地运行 Wan 2.2 T2V
权重在 Hugging Face 上,可在 ComfyUI、Diffusers 和官方仓库中运行。14B 的 T2V 模型在全精度下需要约 80 GB 显存;用 fp8 检查点加卸载,24 GB 显卡也能跑,每段几分钟。5B 模型在 RTX 4090 上不到十分钟就能生成一段 720p 五秒短片。显存不足 16 GB 的话,请使用云端 GPU,或本站的免费演示,它也接受一张图片作为第一帧。