Stable Diffusion ทำงานอย่างไร?
Stable Diffusion เป็น latent diffusion model ระหว่างการฝึก มันเรียนรู้วิธีลบสัญญาณรบกวนออกจากภาพหลายร้อยล้านภาพที่มาพร้อมคำบรรยาย ตอนสร้างภาพ มันเริ่มจากสัญญาณรบกวนแบบสุ่มล้วน ๆ แล้วค่อย ๆ ลดสัญญาณรบกวนทีละ step ไปในทิศทางของข้อความที่คุณพิมพ์ หลังจาก 20 ถึง 30 step สัญญาณรบกวนนั้นจะกลายเป็นภาพที่ตรงกับ prompt
มีสามส่วนทำงานร่วมกัน: text encoder ที่แปลงคำของคุณเป็นตัวเลข U-Net (หรือตั้งแต่เวอร์ชัน 3 คือ diffusion transformer) ที่ทำหน้าที่ลดสัญญาณรบกวน และ decoder ที่แปลงภาพ latent ขนาดกะทัดรัดให้เป็นพิกเซล การลดสัญญาณรบกวนทำงานบนภาพ latent ขนาดเล็กนั้น นี่คือเหตุผลที่โมเดลเร็วพอจะรันบน GPU ของผู้ใช้ทั่วไป
มีเวอร์ชันอะไรบ้าง?
- Stable Diffusion 1.5 (2022): ภาพ 512×512 มีโมเดล fine-tune และ LoRA จากชุมชนหลายพันตัว
- SDXL 1.0 (กรกฎาคม 2023): ขนาดพื้นฐาน 1024×1024 มือ ใบหน้า และองค์ประกอบภาพดีขึ้น มีโมเดล refiner สำหรับเก็บรายละเอียด
- Stable Diffusion 3 Medium (มิถุนายน 2024): ใช้ diffusion transformer แสดงตัวอักษรในภาพและเข้าใจ prompt ได้ดีขึ้นมาก
- Stable Diffusion 3.5 (ตุลาคม 2024): รุ่นปัจจุบัน มีขนาด Large, Large Turbo และ Medium ทำตาม prompt ได้แม่นยำขึ้นและสไตล์หลากหลายขึ้น
ดูการเปรียบเทียบโดยละเอียดได้ใน SDXL vs Stable Diffusion 3
ใช้ทำอะไรได้บ้าง?
การสร้างภาพจากข้อความเป็นเพียงจุดเริ่มต้น โมเดลเดียวกันนี้ทำ image-to-image (แปลงภาพร่างหรือภาพถ่าย) inpainting (วาดใหม่เฉพาะบางส่วน) outpainting (ขยายขอบภาพออกไป) การขยายภาพด้วยโมเดล super-resolution เฉพาะทาง และเมื่อใช้กับ ControlNet ก็สร้างภาพตามท่าทาง แผนที่ความลึก หรือเส้นขอบได้ ส่วนเสริมที่เรียกว่า LoRA ซึ่งเป็นไฟล์เล็ก ๆ แยกต่างหาก ช่วยสอนสไตล์หรือตัวละครให้โมเดล
บนเว็บไซต์นี้ คุณลอง inpainting และ การขยายภาพ ได้โดยไม่ต้องมีบัญชี สร้างภาพด้วย SDXL หรือ Stable Diffusion 3 และเปิดดูสไตล์ศิลปิน 1,731 คน กับ prompt 82 ตัวอย่างพร้อมคำอธิบาย เพื่อเรียนรู้ว่า prompt แต่ละแบบให้ผลอย่างไร
ต่างจาก DALL-E หรือ Midjourney อย่างไร?
สองอย่าง: weights ของโมเดลเป็นสาธารณะ และ รันในเครื่องของคุณเองได้ คุณดาวน์โหลดโมเดลมารันบนคอมพิวเตอร์ของตัวเองได้ฟรี ดัดแปลงได้ และเก็บภาพไว้เป็นส่วนตัว ส่วน Midjourney และโมเดลภาพของ OpenAI (DALL-E ซึ่งตอนนี้คือ GPT Image) เป็นบริการปิด: คุณจ่ายแบบสมัครสมาชิกหรือต่อภาพ และโมเดลไม่เคยออกจากเซิร์ฟเวอร์ของพวกเขา ในทางกลับกัน Stable Diffusion ต้องการให้คุณลงแรงมากกว่า คุณต้องเลือกโมเดล เขียน prompt และ negative prompt ให้ชัดเจน และเข้าใจว่า seed คืออะไร
ต้องใช้คอมพิวเตอร์แรง ๆ ไหม?
ถ้าจะรันเอง การ์ด NVIDIA รุ่นใหม่ที่มี VRAM 6 GB ก็พอสำหรับ SD 1.5 และ 8 GB สำหรับ SDXL การ์ด AMD ใช้ได้ผ่าน ROCm บน Linux ส่วน Apple Silicon ใช้ได้ผ่าน MPS backend ถ้าไม่มีสักอย่าง เครื่องมือบนเว็บไซต์นี้ไม่ต้องใช้ฮาร์ดแวร์ของคุณเลย: บางตัวรันบน GPU ของเรา แสดงคิวและความคืบหน้าแบบสด ๆ บางตัวเป็นเดโมที่ฝังอยู่ในหน้าเว็บ เมื่อพร้อมแล้ว อ่านวิธีติดตั้ง Stable Diffusion ในเครื่องได้เลย