Tạo video từ văn bản với Wan 2.2 như thế nào?

Tác giả: Cập nhật: 6 phút đọc

Wan 2.2 text-to-video tạo clip không tiếng dài khoảng năm giây, 480p hoặc 720p, chỉ từ một câu mô tả cảnh, hành động và máy quay. Đây là mô hình video trọng số mở của Alibaba, phát hành năm 2025 theo giấy phép Apache 2.0, và chạy được trên máy cá nhân bằng ComfyUI hoặc Diffusers.

Wan 2.2 text-to-video là gì

Wan 2.2 ra mắt với ba mô hình mở. Wan2.2-T2V-A14B là mô hình tạo video từ văn bản: một diffusion transformer theo kiến trúc mixture-of-experts với 27 tỷ tham số, trong đó 14 tỷ hoạt động ở mỗi bước: một “chuyên gia” cho giai đoạn nhiễu cao (high-noise) định ra bố cục tổng thể và một “chuyên gia” cho giai đoạn nhiễu thấp (low-noise) trau chuốt chi tiết. Wan2.2-I2V-A14B làm chuyển động một bức ảnh có sẵn, còn Wan2.2-TI2V-5B là mô hình lai nhỏ hơn, làm được cả hai và chạy trên card phổ thông ở 720p, 24 khung hình mỗi giây.

So với Wan 2.1, các mô hình 2.2 được huấn luyện trên lượng ảnh nhiều hơn 66% và lượng video nhiều hơn 83%, có gắn nhãn chi tiết về ánh sáng, bố cục, độ tương phản và tông màu. Nhờ vậy, prompt có thể gọi tên ánh sáng và khung hình bằng thuật ngữ điện ảnh như “soft lighting”, “warm colors” hay “low angle shot”, đều lấy từ bộ từ vựng prompt của chính Alibaba.

Cách viết prompt video

Prompt video mô tả một cảnh ngắn chứ không phải một bức ảnh tĩnh. Một cấu trúc hiệu quả là chủ thể, hành động, bối cảnh, máy quay, phong cách: “A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic”. Mỗi yếu tố trả lời một câu hỏi mà nếu thiếu thì mô hình sẽ phải tự đoán.

  • Chủ thể và hành động: một chủ thể, một hành động rõ ràng, có động từ. Năm giây là đủ cho một cử chỉ, một đoạn đi bộ, một cái vẫy tay, chứ không đủ cho cả một câu chuyện.
  • Bối cảnh: địa điểm và thời điểm trong ngày quyết định ánh sáng.
  • Máy quay: static, pan, tilt, tracking, push-in, drone shot. Nên ghi rõ kiểu máy quay, nếu không mô hình sẽ tự chọn.
  • Phong cách: cinematic, documentary, anime, claymation, 35 mm film. Một từ về phong cách là đủ.

Hãy mô tả hành động bằng câu văn bình thường; từ khóa có thể dùng để định ánh sáng và khung hình, như trong các prompt mẫu của chính Alibaba, nhưng một danh sách tag thì không diễn tả được chuyển động. Dùng negative prompt cho các lỗi kinh điển (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Negative prompt chỉ có tác dụng khi guidance lớn hơn 1; các workflow dùng Lightning LoRA 4 bước chạy ở guidance 1 nên bỏ qua negative prompt.

Thiết lập và thời gian tạo video

Mặc định chính thức là 81 khung hình ở 16 fps, 480p hoặc 720p, 40 bước và guidance scale từ 3 đến 4; các workflow ComfyUI dùng 20 bước với guidance 3.5, hoặc 4 bước với guidance 1 khi có Lightning LoRA. Với thiết lập chính thức, một clip 480p mất khoảng năm phút rưỡi trên một GPU H100 dành cho trung tâm dữ liệu, còn 720p lâu hơn khoảng ba lần với cùng số khung hình. Seed hoạt động như khi tạo ảnh: cố định seed để so sánh hai prompt, đổi seed để có một phiên bản khác của cùng prompt. Tỷ lệ khung hình được chọn trước khi tạo, thường là 16:9 hoặc 9:16; mô hình không thể đổi nó về sau.

Vì mỗi lần thử đều chậm, hãy thử prompt ở 480p rồi mới chạy lại ở 720p. Seed của một phiên bản 480p sẽ cho ra clip khác ở 720p, vì nhiễu có hình dạng khác. Phần lớn kết quả tệ là do prompt có quá nhiều hành động hoặc chỉ dẫn máy quay mâu thuẫn nhau, chứ không phải do thiết lập.

Những gì text-to-video chưa làm được

Năm giây, tức 81 khung hình, là độ dài mặc định của mô hình; tạo dài hơn thì hình ảnh bị trôi. Các đoạn chữ dài trong video chưa ổn định. Bàn tay và những tương tác nhanh, phức tạp giữa nhiều người vẫn thường hỏng. Vật lý chỉ ở mức hợp lý chứ chưa chính xác: nước, vải và tóc chuyển động đẹp, nhưng một quả bóng có thể nảy sai. Không có âm thanh. Muốn hình ảnh đúng ý thì image-to-video dễ hơn: tạo khung hình đầu tiên bằng Stable Diffusion, SDXL hoặc Flux, rồi làm nó chuyển động bằng Wan 2.2.

Chạy Wan 2.2 T2V trên máy của bạn

Trọng số có trên Hugging Face và chạy được trong ComfyUI, Diffusers và kho mã chính thức. Script chính thức, theo Alibaba, cần card 80 GB; chạy script này, mô hình T2V 14B dùng tối đa khoảng 41 GB VRAM ở 480p và 60 GB ở 720p. Trong ComfyUI, mô hình này chạy được trên card 24 GB với checkpoint fp8 và offloading, mỗi clip mất vài phút. Mô hình 5B tạo một clip 720p dài năm giây trên RTX 4090 trong chưa đầy mười phút. Trong ComfyUI, mô hình 5B chạy vừa trên card 8 GB; dưới mức đó, hãy dùng GPU trên đám mây hoặc bản demo miễn phí trên trang này, vốn tạo video từ một bức ảnh dùng làm khung hình đầu tiên.

Câu hỏi thường gặp

Wan 2.2 có tốt hơn Wan 2.1 không?

Có, theo Alibaba, về chất lượng chuyển động, độ bám prompt và khả năng kiểm soát thẩm mỹ: các mô hình mixture-of-experts cùng bộ nhãn huấn luyện phong phú hơn nhằm đem lại chuyển động mượt hơn và kiểm soát ánh sáng, bố cục chặt chẽ hơn. Trên GPU ít VRAM, mô hình Wan 2.2 5B thay thế cho Wan 2.1.

Wan 2.2 có tạo được video từ một bức ảnh kèm văn bản không?

Có. Mô hình I2V dùng một bức ảnh làm khung hình đầu tiên cùng đoạn văn bản mô tả chuyển động, còn mô hình TI2V 5B nhận văn bản đơn thuần hoặc văn bản kèm ảnh. Bản demo Wan 2.2 trên trang này tạo video từ một bức ảnh.

Tôi có được dùng video cho mục đích thương mại không?

Các mô hình được phát hành theo giấy phép Apache 2.0, cho phép sử dụng thương mại, và Alibaba không đòi quyền gì đối với video bạn tạo ra. Hãy kiểm tra điều khoản của dịch vụ mà bạn dùng để tạo video.