สร้างวิดีโอจากข้อความด้วย Wan 2.2 อย่างไร?

โดย อัปเดต 2 นาทีในการอ่าน

Wan 2.2 text-to-video สร้างคลิปห้าวินาที ที่ 480p หรือ 720p จากประโยคเดียวที่บรรยายฉาก การกระทำ และกล้อง เป็นโมเดลวิดีโอ open-weights ของ Alibaba รันที่บ้านได้ใน ComfyUI หรือ Diffusers

Wan 2.2 text-to-video คืออะไร

Wan 2.2 เปิดตัวพร้อมโมเดลเปิดสามตัว Wan2.2-T2V-A14B คือโมเดล text-to-video: diffusion transformer แบบ mixture-of-experts ที่มีพารามิเตอร์ 27 พันล้าน ทำงานจริง 14 พันล้านในแต่ละ step โดย expert ฝั่งสัญญาณรบกวนสูงกำหนดโครงภาพรวม และ expert ฝั่งสัญญาณรบกวนต่ำเก็บรายละเอียด Wan2.2-I2V-A14B ทำให้ภาพที่มีอยู่ขยับ ส่วน Wan2.2-TI2V-5B เป็นโมเดลลูกผสมตัวเล็กที่ทำได้ทั้งสองอย่าง และรันบนการ์ดจอทั่วไปที่ 720p และ 24 เฟรมต่อวินาที

เทียบกับ Wan 2.1 โมเดล 2.2 ถูกฝึกด้วยภาพมากขึ้น 66% และวิดีโอมากขึ้น 83% พร้อมป้ายกำกับละเอียดเรื่องแสง องค์ประกอบ คอนทราสต์ และโทนสี นี่คือเหตุผลที่ prompt ระบุแสงและการจัดเฟรมด้วยศัพท์ภาพยนตร์อย่าง "soft lighting" "warm colors" หรือ "low angle shot" ได้ ซึ่งทั้งหมดมาจากคลังคำ prompt ของ Alibaba เอง

วิธีเขียน prompt วิดีโอ

prompt วิดีโอบรรยายฉากสั้น ๆ ไม่ใช่ภาพนิ่ง โครงสร้างที่ได้ผลคือ ตัวแบบ การกระทำ สถานที่ กล้อง สไตล์: "A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic"

  • ตัวแบบและการกระทำ: หนึ่งตัวแบบ หนึ่งการกระทำที่ชัดเจนพร้อมกริยา ห้าวินาทีพอสำหรับท่าทาง การเดิน การโบกมือ ไม่พอสำหรับเล่าเรื่อง
  • สถานที่: สถานที่และเวลาของวันกำหนดแสง
  • กล้อง: static, pan, tilt, tracking, push-in, drone shot ระบุไป ไม่อย่างนั้นโมเดลจะเลือกเอง
  • สไตล์: cinematic, documentary, anime, claymation, 35 mm film คำสไตล์คำเดียวก็พอ

เขียนการกระทำเป็นประโยคธรรมดา คีย์เวิร์ดใช้กำหนดแสงและการจัดเฟรมได้ เหมือนใน prompt ตัวอย่างของ Alibaba เอง แต่รายการแท็กไม่ได้บรรยายการเคลื่อนไหว ใช้ negative prompt สำหรับข้อบกพร่องคลาสสิก (blurry, flicker, distorted hands, extra fingers, watermark, subtitles) มันมีผลก็ต่อเมื่อ guidance สูงกว่า 1 ส่วน workflow แบบ 4 step ด้วย Lightning LoRA รันที่ 1 จึงมองข้ามมัน

การตั้งค่าและเวลาที่ใช้

ค่าเริ่มต้นทางการคือ 81 เฟรมที่ 16 fps, 480p หรือ 720p, 40 step และ guidance scale 3 ถึง 4 ส่วน workflow ของ ComfyUI ใช้ 20 step ที่ guidance 3.5 หรือ 4 step ที่ 1 เมื่อใช้ Lightning LoRA ด้วยค่าทางการ คลิป 480p ใช้เวลาราวห้านาทีครึ่งบน GPU H100 ระดับศูนย์ข้อมูลหนึ่งใบ และ 720p นานกว่าราวสามเท่าที่จำนวนเฟรมเท่ากัน seed ทำงานเหมือนตอนสร้างภาพ: ล็อกไว้เพื่อเปรียบเทียบสอง prompt เปลี่ยนเพื่อได้เทคใหม่จาก prompt เดิม สัดส่วนภาพเลือกก่อนสร้าง มักเป็น 16:9 หรือ 9:16 โมเดลเปลี่ยนทีหลังไม่ได้

เพราะแต่ละครั้งช้า ทดสอบ prompt ที่ 480p ก่อน แล้วค่อยรันใหม่ที่ 720p seed ของเทค 480p ให้คลิปคนละแบบที่ 720p เพราะสัญญาณรบกวนมีรูปร่างอื่น ผลลัพธ์แย่ส่วนใหญ่มาจาก prompt ที่มีการกระทำเยอะเกินหรือคำสั่งกล้องขัดกัน ไม่ใช่จากการตั้งค่า

สิ่งที่ text-to-video ยังทำไม่ได้

ห้าวินาที 81 เฟรม คือความยาวที่โมเดลถูกตั้งค่ามา ยาวกว่านั้นจะเพี้ยน ข้อความยาว ๆ ในวิดีโอยังไม่น่าเชื่อถือ มือ และปฏิสัมพันธ์ที่เร็วและซับซ้อนระหว่างหลายคนยังพังบ่อย ฟิสิกส์แค่ดูสมเหตุสมผล ไม่ได้เป๊ะ: น้ำ ผ้า และผมขยับได้ดี แต่ลูกบอลอาจเด้งผิด ไม่มีเสียง ถ้าต้องการให้ภาพออกมาตรงใจเป๊ะ image-to-video ง่ายกว่า: สร้างเฟรมแรกด้วย Stable Diffusion SDXL หรือ Flux แล้วทำให้ขยับด้วย Wan 2.2

รัน Wan 2.2 T2V ในเครื่อง

weights อยู่บน Hugging Face และรันได้ใน ComfyUI Diffusers และ repository ทางการ ด้วยสคริปต์ทางการ ซึ่ง Alibaba บอกว่าต้องใช้การ์ด 80 GB โมเดล T2V 14B ใช้ VRAM สูงสุดราว 41 GB ที่ 480p และ 60 GB ที่ 720p ใน ComfyUI รันบนการ์ด 24 GB ได้ด้วย checkpoint แบบ fp8 และการ offload ใช้เวลาหลายนาทีต่อคลิป โมเดล 5B สร้างคลิป 720p ห้าวินาทีบน RTX 4090 ได้ในไม่ถึงสิบนาที ใน ComfyUI รันบนการ์ด 8 GB ได้ ต่ำกว่านั้น ใช้ GPU บนคลาวด์หรือเดโมฟรีบนเว็บไซต์นี้ ซึ่งเริ่มจากภาพที่ใช้เป็นเฟรมแรก

คำถามที่พบบ่อย

Wan 2.2 ดีกว่า Wan 2.1 ไหม?

ดีกว่า ตามที่ Alibaba ระบุ ทั้งคุณภาพการเคลื่อนไหว การทำตาม prompt และการควบคุมความสวยงาม: โมเดล mixture-of-experts และป้ายกำกับฝึกที่ละเอียดขึ้นมุ่งให้การเคลื่อนไหวลื่นขึ้นและควบคุมแสงกับองค์ประกอบได้ใกล้ชิดขึ้น บนการ์ดจอรุ่นเล็ก โมเดล Wan 2.2 5B มาแทน Wan 2.1

Wan 2.2 สร้างวิดีโอจากภาพและข้อความพร้อมกันได้ไหม?

ได้ โมเดล I2V ใช้ภาพเป็นเฟรมแรกบวก prompt ที่บรรยายการเคลื่อนไหว ส่วนโมเดล TI2V 5B รับข้อความอย่างเดียวหรือข้อความพร้อมภาพก็ได้ เดโม Wan 2.2 บนเว็บไซต์นี้ทำงานจากภาพ

เอาวิดีโอไปใช้เชิงพาณิชย์ได้ไหม?

โมเดลเผยแพร่ภายใต้ใบอนุญาต Apache 2.0 ซึ่งอนุญาตการใช้เชิงพาณิชย์ และ Alibaba ไม่อ้างสิทธิ์ในวิดีโอที่คุณสร้าง ตรวจสอบเงื่อนไขของบริการที่คุณใช้รันโมเดลด้วย