Karşılaştırma tablosu
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| Çıkış tarihi | Eki 2022 | Tem 2023 | Haz 2024 | Eki 2024 |
| Parametre sayısı | 0,9 milyar | 2,6 milyar (+ refiner) | 2 milyar | 8 milyar |
| Doğal çözünürlük | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM (fp16) | 4–6 GB | 8 GB | 10 GB | 19 GB (fp8’de 11 GB) |
| Hız (12 GB’lık GPU’muz) | ~4 sn | ~20 sn | — | — |
| Prompt anlama | anahtar kelimeler | anahtar kelimeler, daha iyi kompozisyon | cümleler, birden fazla konu | en iyisi |
| Görselde yazı | yok | nadiren | var, kısa | var |
| Sanatçı adları | güçlü | güçlü | daha zayıf | daha zayıf |
| Topluluk modelleri | pek çok | en fazla, Pony ve Illustrious dahil | az | az |
| Lisans | OpenRAIL-M | OpenRAIL++ | Community Licence (gelir 1 milyon $’ın altındaysa ücretsiz) | |
| Bu sitede deneyin | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5: her işe koşulan emektar
Küçük, hızlı ve sayısız kez özelleştirilmiş bir model. Fotogerçekçi ve anime tarzı ince ayarlı sürümler, ControlNet modelleri, LoRA’lar ve embedding dosyaları her konu için mevcuttur. Zayıf yanları 512 piksellik temel çözünürlüğü, eller ve promptları harfi harfine yorumlamasıdır. 6 GB’lık bir kart, AnimateDiff ile animasyon ve ControlNet’in yoğun kullanıldığı işler için hâlâ doğru seçimdir. Bu sitenin üyelere özel txt2img aracı özelleştirilmiş bir SD 1.5 modeliyle çalışır.
SDXL 1.0: ayrıntı ve stil
Dört kat daha fazla piksel, ikinci bir metin kodlayıcı ve son adımlar için bir refiner. Yüzler, eller ve kompozisyon büyük ölçüde iyileşmiştir; sanatçı adlarının etkisi de güçlü ve öngörülebilirdir. 1.731 sanatçılık karşılaştırmamızı SDXL ile üretmemizin nedeni de budur. 8 GB ister ve 1.5’ten birkaç kat yavaştır: bizim GPU’muzda görsel başına 4 saniyeye karşılık yaklaşık 20 saniye. Damıtılmış sürümleri (SDXL Turbo, LCM LoRA), kaliteden bir miktar ödün vererek 25–30 adım yerine yalnızca bir ila sekiz adımla çalışır.
Stable Diffusion 3 ve 3.5: promptu anlama ve yazı
Anahtar kelime listeleri yerine cümleleri anlayan yeni bir mimari (üç metin kodlayıcılı diffusion transformer): “a red cube on a blue sphere, to the left of a green cone” çoğu zaman doğru çıkar, tırnak içindeki kısa metinler de çoğunlukla okunaklı olur. 3 Medium’un anatomi sorunları vardı, 3.5 bunları azalttı; 3.5 Large ailenin en yetenekli modelidir, 3.5 Medium ise dengeli olanıdır. Sanatçı adları ve eski negatif prompt alışkanlıkları burada daha az önem taşır. Stable Diffusion 3 Medium modelini burada deneyebilirsiniz.
Hangisini seçmelisiniz?
- Öğrenme, 6 GB’lık kart, ControlNet, AnimateDiff: SD 1.5.
- İllüstrasyon, portre, sanatçı stilleri, 8–12 GB: SDXL.
- Yazı içeren afişler, karmaşık sahneler, 12–16 GB ve üzeri: SD 3.5 Medium ya da Large.
- GPU yoksa: bu sitedeki çevrimiçi araçlar, hesap gerekmez.