Jak działa Stable Diffusion?
Stable Diffusion to latentny model dyfuzyjny. Podczas treningu nauczył się usuwać szum z setek milionów obrazów opisanych podpisami. W trakcie generowania zaczyna od czystego losowego szumu i krok po kroku odszumia go w kierunku twojego tekstu: po 20–30 krokach szum staje się obrazem, który odpowiada promptowi.
Współpracują ze sobą trzy części: enkoder tekstu, który zamienia słowa na liczby, U-Net (a od wersji 3 transformer dyfuzyjny), który wykonuje odszumianie, i dekoder, który przekształca skompresowany obraz latentny w piksele. Odszumianie odbywa się na tym małym obrazie latentnym i właśnie dlatego model jest wystarczająco szybki dla konsumenckiego GPU.
Jakie wersje istnieją?
- Stable Diffusion 1.5 (2022): obrazy 512×512, tysiące modeli społeczności i LoRA.
- SDXL 1.0 (lipiec 2023): natywnie 1024×1024, lepsze dłonie, twarze i kompozycja, osobny model refiner do detali.
- Stable Diffusion 3 Medium (czerwiec 2024): transformer dyfuzyjny, znacznie lepsze renderowanie tekstu i rozumienie promptu.
- Stable Diffusion 3.5 (październik 2024): aktualne wydanie w rozmiarach Large, Large Turbo i Medium, z lepszym trzymaniem się promptu i bardziej zróżnicowanymi stylami.
Szczegółowe porównanie znajdziesz w poradniku SDXL vs Stable Diffusion 3.
Co można z nim zrobić?
Tekst na obraz to dopiero początek. Te same modele obsługują img2img (przekształcenie szkicu lub zdjęcia), inpainting (przemalowanie jednego fragmentu), outpainting (rozszerzenie obrazu), powiększanie obrazów dedykowanymi modelami superrozdzielczości, a z ControlNet także generowanie prowadzone pozą, mapą głębi lub krawędziami. Dodatki zwane LoRA, każdy w osobnym małym pliku, uczą model stylu lub postaci.
Na tej stronie możesz bez konta wypróbować inpainting i powiększanie obrazów, generować obrazy w SDXL lub Stable Diffusion 3 oraz przeglądać 1731 stylów artystów i 82 udokumentowane prompty, żeby zobaczyć, co robi dany prompt.
Czym różni się od DALL-E i Midjourney?
Dwiema rzeczami: wagi są publiczne i działa lokalnie. Możesz pobrać model, uruchomić go za darmo na własnym komputerze, modyfikować i zachować obrazy dla siebie. Midjourney i modele obrazów OpenAI (DALL-E, obecnie GPT Image) to zamknięte usługi: płacisz abonament lub za obraz, a model nigdy nie opuszcza ich serwerów. W zamian Stable Diffusion wymaga od ciebie więcej. Musisz wybrać model, napisać precyzyjny prompt i negatywny prompt oraz rozumieć, czym jest seed.
Czy potrzebuję mocnego komputera?
Żeby uruchomić go samodzielnie, wystarczy nowsza karta NVIDIA z 6 GB VRAM dla SD 1.5 i 8 GB dla SDXL. Karty AMD działają przez ROCm na Linuksie, a Apple Silicon przez backend MPS. Jeśli nie masz niczego z tych rzeczy, narzędzia na tej stronie nie wymagają sprzętu: część działa na naszym GPU, z kolejką i postępem pokazywanym na żywo, inne to dema uruchamiane na zewnętrznych serwerach i osadzone na stronie. Gdy będziesz gotowy, przeczytaj, jak zainstalować Stable Diffusion lokalnie.