Wan 2.2 biến ảnh thành video như thế nào?

Tác giả: Cập nhật: 6 phút đọc

Wan 2.2 image-to-video nhận một ảnh tĩnh và một câu ngắn mô tả chuyển động, rồi trả về clip khoảng năm giây ở 480p hoặc 720p, giữ nguyên chủ thể, màu sắc và bố cục của ảnh. Đây là mô hình trọng số mở của Alibaba, dùng miễn phí trực tuyến tại đây hoặc tự chạy trên GPU mạnh.

Wan 2.2 image-to-video làm được gì

Wan 2.2, phát hành tháng 7 năm 2025 theo giấy phép Apache 2.0, là bản kế nhiệm Wan 2.1 trong dòng mô hình video mở của Alibaba. Biến thể tạo video từ ảnh, Wan2.2-I2V-A14B, dùng một diffusion transformer theo kiến trúc mixture-of-experts: một “chuyên gia” xử lý các bước đầu còn nhiều nhiễu, nơi định ra bố cục tổng thể, một chuyên gia khác xử lý các bước cuối để trau chuốt chi tiết. Ở mỗi bước có khoảng 14 tỷ tham số hoạt động trên tổng số 27 tỷ. Một mô hình lai nhỏ hơn, Wan2.2-TI2V-5B, nhận cả văn bản lẫn hình ảnh và chạy được trên một card phổ thông.

Bạn đưa cho mô hình một bức ảnh, tức khung hình đầu tiên của clip, cùng một prompt cho biết thứ gì cần chuyển động. Nó tạo ra 81 khung hình ở tốc độ 16 khung hình mỗi giây, tức khoảng năm giây, và dựng clip trên chính bức ảnh đó: khuôn mặt, quần áo và ánh sáng vẫn bám sát ảnh gốc trong khi máy quay hoặc chủ thể di chuyển.

Cách viết prompt chuyển động

Bức ảnh đã mang sẵn chủ thể, phong cách và bố cục, nên prompt chỉ cần mô tả sự thay đổi. Hãy viết một hai câu ngắn: ai hoặc cái gì chuyển động, chuyển động ra sao, và máy quay làm gì. “The woman turns her head to the right and smiles, soft wind in her hair, slow push-in” thì hiệu quả; một danh sách tag phong cách thì không. Khi cần, nhớ ghi rõ chuyển động máy quay: “static camera”, “slow pan to the left”, “the drone rises”.

Chuyển động nên vừa với độ dài một clip năm giây. Mỗi prompt một hành động là lựa chọn an toàn. Các động từ như walks, waves, blinks, flows, drifts, rotates cho chuyển động dễ đoán. Tránh yêu cầu những thứ không có trong ảnh: mô hình di chuyển được chiếc xe, nhưng con đường phía sau thì phải tự bịa ra, và phần bịa ra ấy kém tin cậy hơn những gì đã có sẵn trong ảnh. Negative prompt chỉ có tác dụng khi guidance lớn hơn 1; các workflow dùng Lightning LoRA 4 bước chạy ở guidance 1 nên bỏ qua negative prompt. Ngoài trường hợp đó, danh sách quen thuộc vẫn dùng tốt: blurry, distorted hands, extra limbs, flickering, watermark, text.

Những thiết lập quan trọng

  • Độ phân giải: 480p nhanh hơn 720p khoảng ba lần và thường là đủ cho mạng xã hội; hãy dùng 720p cho clip hoàn chỉnh.
  • Số khung hình: 81 khung hình ở 16 fps là clip năm giây tiêu chuẩn. Chuỗi dài hơn sẽ mất dần tính nhất quán; tốt hơn là tạo hai clip rồi cắt ghép.
  • Số bước: 40 bước lấy mẫu (sampling steps) trong script chính thức, 20 trong workflow cơ bản của ComfyUI. Với Lightning LoRA 4 bước, 4 đến 8 bước là đủ.
  • Guidance (CFG): mặc định là 3.5 cho mô hình I2V 14B, và là 1 khi dùng LoRA 4 bước. Giá trị cao hơn bám prompt sát từng chữ hơn nhưng gây thêm nhấp nháy.
  • Seed: giống như trong Stable Diffusion, cùng ảnh, prompt, thiết lập và seed sẽ tái tạo cùng một clip; chỉ đổi seed để có chuyển động khác cho cùng bức ảnh.

Hãy thử prompt ở 480p trước khi bỏ thời gian cho 720p. Seed thì không mang sang được: ở 720p, nhiễu có hình dạng khác nên chuyển động cũng khác.

Ảnh nào dễ làm chuyển động nhất

Wan 2.2 xử lý được mọi bức ảnh chụp hay ảnh do AI tạo, nhưng có những ảnh dễ hơn hẳn. Một chủ thể chính rõ ràng trên nền đơn giản cho chuyển động gọn gàng; cảnh đông đúc buộc mô hình phải tự chọn thứ để làm chuyển động. Clip lấy theo tỷ lệ khung hình của bức ảnh, nên ảnh dọc hay ảnh ngang đều dùng được. Trong ComfyUI, hãy đặt chiều rộng và chiều cao theo đúng tỷ lệ đó, nếu không ảnh sẽ bị cắt bớt. Ảnh sắc nét, đủ sáng sẽ giữ được chi tiết suốt cả clip nếu có kích thước ít nhất bằng đầu ra (cạnh dài 832 pixel ở 480p, 1280 pixel ở 720p); ảnh gốc mờ hoặc bị nén mạnh sẽ cho ra video mờ.

Ảnh tạo bằng Stable Diffusion, SDXL hay Flux rất dễ làm chuyển động, nhờ đó image-to-video là cách dễ nhất để có một video ngắn với hình ảnh đúng ý: trước hết tạo đúng khung hình bạn muốn, sau đó làm cho nó chuyển động.

Chạy Wan 2.2 I2V trên máy cá nhân

Trọng số có trên Hugging Face và chạy được trong ComfyUI, trong Diffusers và trong kho mã chính thức của Wan. Script chính thức, theo Alibaba, cần card 80 GB; chạy script này, mô hình I2V 14B dùng tối đa khoảng 41 GB VRAM ở 480p và 60 GB ở 720p. Trong ComfyUI, mô hình này chạy được trên card 24 GB nhờ các checkpoint lượng tử hóa fp8 và offloading, đổi lại mỗi clip mất vài phút. Mô hình TI2V 5B tạo một clip 720p dài năm giây trên RTX 4090 trong chưa đầy mười phút và cần khoảng 24 GB VRAM với script chính thức; trong ComfyUI, mô hình này chạy vừa trên card 8 GB. Dưới mức đó, hãy dùng GPU trên đám mây hoặc bản demo miễn phí trên trang này.

Câu hỏi thường gặp

Video Wan 2.2 dài được bao lâu?

Đầu ra tiêu chuẩn là 81 khung hình ở 16 khung hình mỗi giây, tức khoảng năm giây. Một số giao diện cho phép nhiều khung hình hơn, nhưng chất lượng và độ nhất quán giảm đi; muốn video dài hơn, hãy tạo nhiều clip, mỗi clip bắt đầu từ khung hình cuối của clip trước, rồi dựng ghép lại với nhau.

Wan 2.2 có tạo âm thanh không?

Không. Wan 2.2 tạo video không tiếng; hãy thêm nhạc hoặc lời thuyết minh sau đó bằng phần mềm dựng video.

Có miễn phí không, và tôi có được dùng video không?

Mô hình được phát hành theo giấy phép Apache 2.0, cho phép sử dụng thương mại, và Alibaba không đòi quyền gì đối với video bạn tạo ra; một dịch vụ trực tuyến có thể đặt thêm điều khoản riêng. Bản demo trên trang này miễn phí, nhưng hàng chờ dùng chung, nên một clip có thể mất vài phút.