Stable Diffusion nasıl çalışır?
Stable Diffusion bir latent difüzyon modelidir. Eğitim sırasında, açıklamalarıyla eşleştirilmiş yüz milyonlarca görseldeki gürültüyü gidermeyi öğrenmiştir. Görsel üretirken tamamen rastgele bir gürültüden yola çıkar ve bu gürültüyü adım adım, yazdığınız metnin gösterdiği yönde temizler: 20 ila 30 adımın sonunda gürültü, prompta uyan bir görsele dönüşmüş olur.
Bu işte üç parça birlikte çalışır: kelimelerinizi sayılara çeviren bir metin kodlayıcı, gürültüyü gideren bir U-Net (3. sürümden itibaren bir diffusion transformer) ve sıkıştırılmış latent görseli piksellere dönüştüren bir kod çözücü. Modeli tüketici sınıfı bir GPU’da yeterince hızlı kılan da işlemlerin bu sıkıştırılmış latent uzayda yapılmasıdır.
Hangi sürümleri var?
- Stable Diffusion 1.5 (2022): 512×512 görseller; topluluğun ürettiği binlerce ince ayarlı sürüm ve LoRA.
- SDXL 1.0 (Temmuz 2023): doğal çözünürlüğü 1024×1024; ellerde, yüzlerde ve kompozisyonda daha başarılı, ayrıntılar için ayrıca bir refiner modeli var.
- Stable Diffusion 3 Medium (Haziran 2024): diffusion transformer mimarisi; görsel içindeki yazılarda ve promptu anlamada çok daha başarılı.
- Stable Diffusion 3.5 (Ekim 2024): güncel sürüm; Large, Large Turbo ve Medium boyutlarında sunulur, prompta daha iyi uyar ve daha çeşitli stiller üretir.
Ayrıntılı karşılaştırmayı SDXL ve Stable Diffusion 3 karşılaştırması rehberinde bulabilirsiniz.
Stable Diffusion ile neler yapılabilir?
Metinden görsel üretmek yalnızca başlangıçtır. Aynı modeller görselden görsele (image-to-image: bir eskizi ya da fotoğrafı dönüştürme), inpainting (belirli bir alanı yeniden boyama), outpainting (görseli sınırlarının ötesine genişletme), özel süper çözünürlük modelleriyle görsel büyütme (upscaling) ve ControlNet sayesinde bir poza, bir derinlik haritasına ya da kenar çizgilerine göre yönlendirilen üretim işlerini de yapar. Her biri küçük, ayrı bir dosya olan ve LoRA adı verilen eklentiler ise modele yeni bir stil ya da karakter öğretir.
Bu sitede inpainting ve görsel büyütme araçlarını hesap açmadan deneyebilir, SDXL ya da Stable Diffusion 3 ile görsel üretebilir, bir promptun ne işe yaradığını öğrenmek için 1.731 sanatçı stiline ve belgelenmiş 82 prompta göz atabilirsiniz.
DALL-E ve Midjourney’den farkı nedir?
İki temel farkı var: model ağırlıkları herkese açıktır ve model yerel olarak çalışır. Modeli indirebilir, kendi bilgisayarınızda ücretsiz çalıştırabilir, değiştirebilir ve görsellerinizi kendinize saklayabilirsiniz. Midjourney ve OpenAI’ın görsel modelleri (DALL-E, şimdi GPT Image) ise kapalı hizmetlerdir: abonelikle ya da görsel başına ödeme yaparsınız ve model onların sunucularından hiç çıkmaz. Buna karşılık Stable Diffusion sizden daha fazla emek ister: bir model seçmeniz, özenli bir prompt ile bir negatif prompt yazmanız ve seed değerinin ne işe yaradığını bilmeniz gerekir.
Güçlü bir bilgisayar gerekir mi?
Modeli kendiniz çalıştıracaksanız SD 1.5 için en az 6 GB VRAM’li güncel bir NVIDIA ekran kartı yeterlidir; SDXL için ise 8 GB yeter. AMD kartlar Linux’ta ROCm üzerinden, Apple Silicon ise MPS arka ucu üzerinden çalışır. Bunların hiçbiri elinizde yoksa bu sitedeki araçlar donanım gerektirmez: bir kısmı bizim GPU’muzda çalışır ve kuyruk ile ilerleme durumu canlı olarak gösterilir, diğerleri ise sayfaya gömülü, başka bir sunucuda barındırılan demolardır. Hazır olduğunuzda Stable Diffusion’ı yerel olarak kurma rehberini okuyabilirsiniz.