Stable Diffusion nedir?

Yazan: Güncelleme: 3 dk okuma

Stable Diffusion, yazılı bir açıklamayı görsele dönüştüren açık kaynaklı bir yapay zeka modelidir. Stability AI tarafından Ağustos 2022’de yayımlanmıştır; sıradan bir oyuncu ekran kartında çalışır, isteyen herkes ince ayar yapabilir ve bu sitedekiler de dahil pek çok ücretsiz aracın arkasında bu model vardır.

Stable Diffusion nasıl çalışır?

Stable Diffusion bir latent difüzyon modelidir. Eğitim sırasında, açıklamalarıyla eşleştirilmiş yüz milyonlarca görseldeki gürültüyü gidermeyi öğrenmiştir. Görsel üretirken tamamen rastgele bir gürültüden yola çıkar ve bu gürültüyü adım adım, yazdığınız metnin gösterdiği yönde temizler: 20 ila 30 adımın sonunda gürültü, prompta uyan bir görsele dönüşmüş olur.

Bu işte üç parça birlikte çalışır: kelimelerinizi sayılara çeviren bir metin kodlayıcı, gürültüyü gideren bir U-Net (3. sürümden itibaren bir diffusion transformer) ve sıkıştırılmış latent görseli piksellere dönüştüren bir kod çözücü. Modeli tüketici sınıfı bir GPU’da yeterince hızlı kılan da işlemlerin bu sıkıştırılmış latent uzayda yapılmasıdır.

Hangi sürümleri var?

  • Stable Diffusion 1.5 (2022): 512×512 görseller; topluluğun ürettiği binlerce ince ayarlı sürüm ve LoRA.
  • SDXL 1.0 (Temmuz 2023): doğal çözünürlüğü 1024×1024; ellerde, yüzlerde ve kompozisyonda daha başarılı, ayrıntılar için ayrıca bir refiner modeli var.
  • Stable Diffusion 3 Medium (Haziran 2024): diffusion transformer mimarisi; görsel içindeki yazılarda ve promptu anlamada çok daha başarılı.
  • Stable Diffusion 3.5 (Ekim 2024): güncel sürüm; Large, Large Turbo ve Medium boyutlarında sunulur, prompta daha iyi uyar ve daha çeşitli stiller üretir.

Ayrıntılı karşılaştırmayı SDXL ve Stable Diffusion 3 karşılaştırması rehberinde bulabilirsiniz.

Stable Diffusion ile neler yapılabilir?

Metinden görsel üretmek yalnızca başlangıçtır. Aynı modeller görselden görsele (image-to-image: bir eskizi ya da fotoğrafı dönüştürme), inpainting (belirli bir alanı yeniden boyama), outpainting (görseli sınırlarının ötesine genişletme), özel süper çözünürlük modelleriyle görsel büyütme (upscaling) ve ControlNet sayesinde bir poza, bir derinlik haritasına ya da kenar çizgilerine göre yönlendirilen üretim işlerini de yapar. Her biri küçük, ayrı bir dosya olan ve LoRA adı verilen eklentiler ise modele yeni bir stil ya da karakter öğretir.

Bu sitede inpainting ve görsel büyütme araçlarını hesap açmadan deneyebilir, SDXL ya da Stable Diffusion 3 ile görsel üretebilir, bir promptun ne işe yaradığını öğrenmek için 1.731 sanatçı stiline ve belgelenmiş 82 prompta göz atabilirsiniz.

DALL-E ve Midjourney’den farkı nedir?

İki temel farkı var: model ağırlıkları herkese açıktır ve model yerel olarak çalışır. Modeli indirebilir, kendi bilgisayarınızda ücretsiz çalıştırabilir, değiştirebilir ve görsellerinizi kendinize saklayabilirsiniz. Midjourney ve OpenAI’ın görsel modelleri (DALL-E, şimdi GPT Image) ise kapalı hizmetlerdir: abonelikle ya da görsel başına ödeme yaparsınız ve model onların sunucularından hiç çıkmaz. Buna karşılık Stable Diffusion sizden daha fazla emek ister: bir model seçmeniz, özenli bir prompt ile bir negatif prompt yazmanız ve seed değerinin ne işe yaradığını bilmeniz gerekir.

Güçlü bir bilgisayar gerekir mi?

Modeli kendiniz çalıştıracaksanız SD 1.5 için en az 6 GB VRAM’li güncel bir NVIDIA ekran kartı yeterlidir; SDXL için ise 8 GB yeter. AMD kartlar Linux’ta ROCm üzerinden, Apple Silicon ise MPS arka ucu üzerinden çalışır. Bunların hiçbiri elinizde yoksa bu sitedeki araçlar donanım gerektirmez: bir kısmı bizim GPU’muzda çalışır ve kuyruk ile ilerleme durumu canlı olarak gösterilir, diğerleri ise sayfaya gömülü, başka bir sunucuda barındırılan demolardır. Hazır olduğunuzda Stable Diffusion’ı yerel olarak kurma rehberini okuyabilirsiniz.

Sıkça sorulan sorular

Stable Diffusion ücretsiz mi?

Evet. Modeller açık lisanslarla yayımlanır: 1.5 için CreativeML OpenRAIL-M, SDXL için OpenRAIL++-M, 3.x için ise yıllık bir milyon doların altındaki gelirlerde ücretsiz olan Stability AI Community Licence. Yerel kullanımda tek maliyet elektriktir; bu sitedeki araçlar ise ücretsizdir ve reklamla finanse edilir.

Ürettiğim görsellerin sahibi kim?

Lisans açısından sahibi sizsiniz: Stability AI çıktılar üzerinde hiçbir hak talep etmez. Yapay zeka görsellerine ilişkin telif hukuku ise ülkeden ülkeye değişir ve henüz netleşmemiştir; AB’de ve ABD’de tamamen yapay zekayla üretilmiş görseller genellikle telif korumasından yararlanamaz.

Stable Diffusion görselin içine yazı yazabilir mi?

1.5 ve SDXL sürümleri yazıda zorlanır. Stable Diffusion 3 ve 3.5 ise kelimeleri promptta tırnak içine aldığınızda kısa metinleri ve başlıkları çok daha iyi yazar.