Wan 2.2 text-to-video là gì
Wan 2.2 ra mắt với ba mô hình mở. Wan2.2-T2V-A14B là mô hình tạo video từ văn bản: một diffusion transformer theo kiến trúc mixture-of-experts với 27 tỷ tham số, trong đó 14 tỷ hoạt động ở mỗi bước: một “chuyên gia” cho giai đoạn nhiễu cao (high-noise) định ra bố cục tổng thể và một “chuyên gia” cho giai đoạn nhiễu thấp (low-noise) trau chuốt chi tiết. Wan2.2-I2V-A14B làm chuyển động một bức ảnh có sẵn, còn Wan2.2-TI2V-5B là mô hình lai nhỏ hơn, làm được cả hai và chạy trên card phổ thông ở 720p, 24 khung hình mỗi giây.
So với Wan 2.1, các mô hình 2.2 được huấn luyện trên lượng ảnh nhiều hơn 66% và lượng video nhiều hơn 83%, có gắn nhãn chi tiết về ánh sáng, bố cục, độ tương phản và tông màu. Nhờ vậy, prompt có thể gọi tên ánh sáng và khung hình bằng thuật ngữ điện ảnh như “soft lighting”, “warm colors” hay “low angle shot”, đều lấy từ bộ từ vựng prompt của chính Alibaba.
Cách viết prompt video
Prompt video mô tả một cảnh ngắn chứ không phải một bức ảnh tĩnh. Một cấu trúc hiệu quả là chủ thể, hành động, bối cảnh, máy quay, phong cách: “A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic”. Mỗi yếu tố trả lời một câu hỏi mà nếu thiếu thì mô hình sẽ phải tự đoán.
- Chủ thể và hành động: một chủ thể, một hành động rõ ràng, có động từ. Năm giây là đủ cho một cử chỉ, một đoạn đi bộ, một cái vẫy tay, chứ không đủ cho cả một câu chuyện.
- Bối cảnh: địa điểm và thời điểm trong ngày quyết định ánh sáng.
- Máy quay: static, pan, tilt, tracking, push-in, drone shot. Nên ghi rõ kiểu máy quay, nếu không mô hình sẽ tự chọn.
- Phong cách: cinematic, documentary, anime, claymation, 35 mm film. Một từ về phong cách là đủ.
Hãy mô tả hành động bằng câu văn bình thường; từ khóa có thể dùng để định ánh sáng và khung hình, như trong các prompt mẫu của chính Alibaba, nhưng một danh sách tag thì không diễn tả được chuyển động. Dùng negative prompt cho các lỗi kinh điển (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Negative prompt chỉ có tác dụng khi guidance lớn hơn 1; các workflow dùng Lightning LoRA 4 bước chạy ở guidance 1 nên bỏ qua negative prompt.
Thiết lập và thời gian tạo video
Mặc định chính thức là 81 khung hình ở 16 fps, 480p hoặc 720p, 40 bước và guidance scale từ 3 đến 4; các workflow ComfyUI dùng 20 bước với guidance 3.5, hoặc 4 bước với guidance 1 khi có Lightning LoRA. Với thiết lập chính thức, một clip 480p mất khoảng năm phút rưỡi trên một GPU H100 dành cho trung tâm dữ liệu, còn 720p lâu hơn khoảng ba lần với cùng số khung hình. Seed hoạt động như khi tạo ảnh: cố định seed để so sánh hai prompt, đổi seed để có một phiên bản khác của cùng prompt. Tỷ lệ khung hình được chọn trước khi tạo, thường là 16:9 hoặc 9:16; mô hình không thể đổi nó về sau.
Vì mỗi lần thử đều chậm, hãy thử prompt ở 480p rồi mới chạy lại ở 720p. Seed của một phiên bản 480p sẽ cho ra clip khác ở 720p, vì nhiễu có hình dạng khác. Phần lớn kết quả tệ là do prompt có quá nhiều hành động hoặc chỉ dẫn máy quay mâu thuẫn nhau, chứ không phải do thiết lập.
Những gì text-to-video chưa làm được
Năm giây, tức 81 khung hình, là độ dài mặc định của mô hình; tạo dài hơn thì hình ảnh bị trôi. Các đoạn chữ dài trong video chưa ổn định. Bàn tay và những tương tác nhanh, phức tạp giữa nhiều người vẫn thường hỏng. Vật lý chỉ ở mức hợp lý chứ chưa chính xác: nước, vải và tóc chuyển động đẹp, nhưng một quả bóng có thể nảy sai. Không có âm thanh. Muốn hình ảnh đúng ý thì image-to-video dễ hơn: tạo khung hình đầu tiên bằng Stable Diffusion, SDXL hoặc Flux, rồi làm nó chuyển động bằng Wan 2.2.
Chạy Wan 2.2 T2V trên máy của bạn
Trọng số có trên Hugging Face và chạy được trong ComfyUI, Diffusers và kho mã chính thức. Script chính thức, theo Alibaba, cần card 80 GB; chạy script này, mô hình T2V 14B dùng tối đa khoảng 41 GB VRAM ở 480p và 60 GB ở 720p. Trong ComfyUI, mô hình này chạy được trên card 24 GB với checkpoint fp8 và offloading, mỗi clip mất vài phút. Mô hình 5B tạo một clip 720p dài năm giây trên RTX 4090 trong chưa đầy mười phút. Trong ComfyUI, mô hình 5B chạy vừa trên card 8 GB; dưới mức đó, hãy dùng GPU trên đám mây hoặc bản demo miễn phí trên trang này, vốn tạo video từ một bức ảnh dùng làm khung hình đầu tiên.