ตารางเปรียบเทียบ
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| เปิดตัว | ตุลาคม 2022 | กรกฎาคม 2023 | มิถุนายน 2024 | ตุลาคม 2024 |
| พารามิเตอร์ | 0.9 B | 2.6 B (+ refiner) | 2 B | 8 B |
| ขนาดพื้นฐาน | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM (fp16) | 4–6 GB | 8 GB | 10 GB | 19 GB (11 GB แบบ fp8) |
| ความเร็ว (GPU 12 GB ของเรา) | ~4 วินาที | ~20 วินาที | — | — |
| ความเข้าใจ prompt | คีย์เวิร์ด | คีย์เวิร์ด องค์ประกอบดีขึ้น | ประโยค หลายหัวข้อ | ดีที่สุด |
| ตัวอักษรในภาพ | ไม่ได้ | นาน ๆ ครั้ง | ได้ สั้น ๆ | ได้ |
| ชื่อศิลปิน | แรง | แรง | อ่อนกว่า | อ่อนกว่า |
| โมเดลชุมชน | เยอะมาก | เยอะที่สุด รวม Pony และ Illustrious | น้อย | น้อย |
| ใบอนุญาต | OpenRAIL-M | OpenRAIL++ | Community licence (ฟรีถ้ารายได้ต่ำกว่า 1 ล้านดอลลาร์) | |
| ลองบนเว็บนี้ | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5: ม้างานตัวจริง
เล็ก เร็ว และถูกปรับแต่งมาไม่รู้จบ มีโมเดล fine-tune แนวสมจริงและอนิเมะ โมเดล ControlNet LoRA และ embedding สำหรับทุกอย่าง จุดอ่อนคือความละเอียดพื้นฐาน 512 px มือ และการตีความ prompt แบบตรงตัว ยังเป็นตัวเลือกที่ใช่สำหรับการ์ด 6 GB สำหรับแอนิเมชันด้วย AnimateDiff และงานที่ใช้ ControlNet หนัก ๆ หน้า txt2img สำหรับสมาชิกบนเว็บไซต์นี้รันโมเดล SD 1.5 แบบปรับแต่งเอง
SDXL 1.0: รายละเอียดและสไตล์
SDXL มีพิกเซลมากกว่าสี่เท่า มี text encoder ตัวที่สอง และ refiner สำหรับ step ท้าย ๆ ใบหน้า มือ และองค์ประกอบดีขึ้นมาก และชื่อศิลปินให้ผลที่แรงและคาดเดาได้ นี่คือเหตุผลที่การเปรียบเทียบศิลปิน 1,731 คนของเราสร้างด้วย SDXL มันต้องใช้ 8 GB และช้ากว่า 1.5 หลายเท่า: ราว 20 วินาทีเทียบกับ 4 วินาทีต่อภาพบน GPU ของเรา เวอร์ชันที่ distill มา (SDXL Turbo, LCM LoRA) ใช้แค่หนึ่งถึงแปด step แทนที่จะเป็น 25 ถึง 30 โดยแลกกับคุณภาพบ้าง
Stable Diffusion 3 และ 3.5: ความเข้าใจและตัวอักษร
สถาปัตยกรรมใหม่ (diffusion transformer พร้อม text encoder สามตัว) ที่ทำตามประโยคแทนรายการคีย์เวิร์ด: ส่วนใหญ่แล้ว "a red cube on a blue sphere, to the left of a green cone" ออกมาถูกต้อง และข้อความสั้น ๆ ในเครื่องหมายคำพูดอ่านออก 3 Medium มีปัญหาเรื่องกายวิภาคซึ่ง 3.5 ลดลงไปได้ 3.5 Large เก่งที่สุดในตระกูล ส่วน 3.5 Medium คือตัวที่สมดุล ชื่อศิลปินและนิสัยเก่า ๆ เรื่อง negative prompt มีผลน้อยลง ลอง Stable Diffusion 3 Medium ได้ที่นี่
ควรเลือกตัวไหน?
- เรียนรู้, การ์ด 6 GB, ControlNet, AnimateDiff: SD 1.5
- ภาพประกอบ ภาพบุคคล สไตล์ศิลปิน 8–12 GB: SDXL
- โปสเตอร์ที่มีตัวอักษร ฉากซับซ้อน 12–16 GB ขึ้นไป: SD 3.5 Medium หรือ Large
- ไม่มี GPU: เครื่องมือออนไลน์บนเว็บไซต์นี้ ไม่ต้องมีบัญชี