Bảng so sánh
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| Phát hành | Tháng 10/2022 | Tháng 7/2023 | Tháng 6/2024 | Tháng 10/2024 |
| Số tham số | 0,9 tỷ | 2,6 tỷ (+ refiner) | 2 tỷ | 8 tỷ |
| Độ phân giải gốc | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM (fp16) | 4–6 GB | 8 GB | 10 GB | 19 GB (11 GB với fp8) |
| Tốc độ (GPU 12 GB của chúng tôi) | ~4 giây | ~20 giây | — | — |
| Khả năng hiểu prompt | từ khóa | từ khóa, bố cục tốt hơn | câu văn, nhiều chủ thể | tốt nhất |
| Chữ trong ảnh | không | hiếm khi | có, chữ ngắn | có |
| Tên nghệ sĩ | mạnh | mạnh | yếu hơn | yếu hơn |
| Mô hình cộng đồng | rất nhiều | nhiều nhất, tính cả Pony và Illustrious | ít | ít |
| Giấy phép | OpenRAIL-M | OpenRAIL++ | Community Licence (miễn phí nếu doanh thu dưới 1 triệu USD) | |
| Thử trên trang này | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5: mô hình “quốc dân”
Nhỏ gọn, nhanh, được tùy biến không biết bao nhiêu mà kể. Bản fine-tune ảnh chân thực và anime, mô hình ControlNet, LoRA và embedding: thứ gì cũng có. Điểm yếu của nó là độ phân giải gốc 512 px, bàn tay, và cách hiểu prompt theo đúng từng chữ. Nó vẫn là lựa chọn đúng cho card 6 GB, cho việc làm animation bằng AnimateDiff và cho những công việc dùng nhiều ControlNet. Công cụ txt2img dành cho thành viên trên trang này chạy một mô hình SD 1.5 tùy biến.
SDXL 1.0: chi tiết và phong cách
Số điểm ảnh gấp bốn lần, thêm bộ mã hóa văn bản thứ hai, và một refiner cho những bước cuối. Khuôn mặt, bàn tay và bố cục cải thiện rất nhiều, còn tên nghệ sĩ có tác dụng mạnh và dễ đoán, đó là lý do bảng so sánh 1.731 nghệ sĩ của chúng tôi được tạo bằng SDXL. Nó cần 8 GB và chậm hơn bản 1.5 vài lần: khoảng 20 giây so với 4 giây mỗi ảnh trên GPU của chúng tôi. Các phiên bản distilled (chưng cất) như SDXL Turbo hay LCM LoRA chỉ cần từ một đến tám bước thay vì 25 đến 30, đổi lại chất lượng giảm đi phần nào.
Stable Diffusion 3 và 3.5: hiểu prompt và viết chữ
Một kiến trúc mới (diffusion transformer với ba bộ mã hóa văn bản) làm theo câu văn thay vì danh sách từ khóa: “a red cube on a blue sphere, to the left of a green cone” thường cho ra đúng như mô tả, và chữ ngắn đặt trong ngoặc kép thường đọc được. Bản 3 Medium gặp vấn đề về giải phẫu mà bản 3.5 đã giảm bớt; 3.5 Large là mô hình mạnh nhất của dòng này, 3.5 Medium là bản cân bằng. Tên nghệ sĩ và các thói quen cũ với negative prompt không còn quan trọng như trước. Hãy thử Stable Diffusion 3 Medium ngay tại đây.
Nên chọn bản nào?
- Mới học, card 6 GB, ControlNet, AnimateDiff: SD 1.5.
- Minh họa, chân dung, phong cách nghệ sĩ, 8–12 GB: SDXL.
- Poster có chữ, cảnh phức tạp, từ 12–16 GB trở lên: SD 3.5 Medium hoặc Large.
- Không có GPU: các công cụ trực tuyến trên trang này, không cần tài khoản.