Co to jest Stable Diffusion?

Autor: Zaktualizowano 3 min czytania

Stable Diffusion to otwarty model sztucznej inteligencji, który zamienia opis tekstowy w obraz. Wydany przez Stability AI w sierpniu 2022 roku, działa na zwykłej karcie graficznej do gier, każdy może go dotrenować na własnych danych, i napędza wiele darmowych narzędzi, w tym te na tej stronie.

Jak działa Stable Diffusion?

Stable Diffusion to latentny model dyfuzyjny. Podczas treningu nauczył się usuwać szum z setek milionów obrazów opisanych podpisami. W trakcie generowania zaczyna od czystego losowego szumu i krok po kroku odszumia go w kierunku twojego tekstu: po 20–30 krokach szum staje się obrazem, który odpowiada promptowi.

Współpracują ze sobą trzy części: enkoder tekstu, który zamienia słowa na liczby, U-Net (a od wersji 3 transformer dyfuzyjny), który wykonuje odszumianie, i dekoder, który przekształca skompresowany obraz latentny w piksele. Odszumianie odbywa się na tym małym obrazie latentnym i właśnie dlatego model jest wystarczająco szybki dla konsumenckiego GPU.

Jakie wersje istnieją?

  • Stable Diffusion 1.5 (2022): obrazy 512×512, tysiące modeli społeczności i LoRA.
  • SDXL 1.0 (lipiec 2023): natywnie 1024×1024, lepsze dłonie, twarze i kompozycja, osobny model refiner do detali.
  • Stable Diffusion 3 Medium (czerwiec 2024): transformer dyfuzyjny, znacznie lepsze renderowanie tekstu i rozumienie promptu.
  • Stable Diffusion 3.5 (październik 2024): aktualne wydanie w rozmiarach Large, Large Turbo i Medium, z lepszym trzymaniem się promptu i bardziej zróżnicowanymi stylami.

Szczegółowe porównanie znajdziesz w poradniku SDXL vs Stable Diffusion 3.

Co można z nim zrobić?

Tekst na obraz to dopiero początek. Te same modele obsługują img2img (przekształcenie szkicu lub zdjęcia), inpainting (przemalowanie jednego fragmentu), outpainting (rozszerzenie obrazu), powiększanie obrazów dedykowanymi modelami superrozdzielczości, a z ControlNet także generowanie prowadzone pozą, mapą głębi lub krawędziami. Dodatki zwane LoRA, każdy w osobnym małym pliku, uczą model stylu lub postaci.

Na tej stronie możesz bez konta wypróbować inpainting i powiększanie obrazów, generować obrazy w SDXL lub Stable Diffusion 3 oraz przeglądać 1731 stylów artystów i 82 udokumentowane prompty, żeby zobaczyć, co robi dany prompt.

Czym różni się od DALL-E i Midjourney?

Dwiema rzeczami: wagi są publiczne i działa lokalnie. Możesz pobrać model, uruchomić go za darmo na własnym komputerze, modyfikować i zachować obrazy dla siebie. Midjourney i modele obrazów OpenAI (DALL-E, obecnie GPT Image) to zamknięte usługi: płacisz abonament lub za obraz, a model nigdy nie opuszcza ich serwerów. W zamian Stable Diffusion wymaga od ciebie więcej. Musisz wybrać model, napisać precyzyjny prompt i negatywny prompt oraz rozumieć, czym jest seed.

Czy potrzebuję mocnego komputera?

Żeby uruchomić go samodzielnie, wystarczy nowsza karta NVIDIA z 6 GB VRAM dla SD 1.5 i 8 GB dla SDXL. Karty AMD działają przez ROCm na Linuksie, a Apple Silicon przez backend MPS. Jeśli nie masz niczego z tych rzeczy, narzędzia na tej stronie nie wymagają sprzętu: część działa na naszym GPU, z kolejką i postępem pokazywanym na żywo, inne to dema uruchamiane na zewnętrznych serwerach i osadzone na stronie. Gdy będziesz gotowy, przeczytaj, jak zainstalować Stable Diffusion lokalnie.

Podobne pytania

Czy Stable Diffusion jest darmowy?

Tak. Modele są wydawane na otwartych licencjach (CreativeML OpenRAIL-M dla 1.5, OpenRAIL++-M dla SDXL, a dla 3.x Stability AI Community Licence, bezpłatna poniżej miliona dolarów rocznego przychodu). Uruchomienie lokalne kosztuje tylko prąd; narzędzia na tej stronie są darmowe i utrzymywane z reklam.

Do kogo należą wygenerowane obrazy?

Z punktu widzenia licencji do ciebie: Stability AI nie rości sobie żadnych praw do wyników. Prawo autorskie do obrazów AI różni się między krajami i wciąż się kształtuje; w UE i USA obrazy wygenerowane w całości przez AI zwykle nie podlegają ochronie prawnoautorskiej.

Czy Stable Diffusion potrafi generować tekst na obrazach?

Wersje 1.5 i SDXL mają z tekstem kłopot. Stable Diffusion 3 i 3.5 renderują krótkie napisy i tytuły znacznie lepiej, gdy słowa umieścisz w prompcie w cudzysłowie.