Hogyan működik a Stable Diffusion?
A Stable Diffusion egy latens diffúziós modell. A tanítás során több százmillió, felirattal ellátott képen tanulta meg, hogyan távolítsa el a zajt. Generáláskor tiszta véletlen zajból indul, és lépésről lépésre a szöveged irányába zajtalanítja: 20–30 lépés után a zajból a promptnak megfelelő kép lesz.
Három rész dolgozik együtt: a szövegkódoló, amely a szavaidat számokká alakítja, a U-Net (a 3-as verziótól egy diffúziós transzformer), amely a zajtalanítást végzi, és a dekóder, amely a tömör latens képet pixelekké alakítja. A zajtalanítás ezen a tömör latens képen fut, ezért elég gyors a modell egy otthoni GPU-hoz.
Milyen verziók léteznek?
- Stable Diffusion 1.5 (2022): 512×512-es képek, több ezer közösségi finomhangolás és LoRA.
- SDXL 1.0 (2023. július): natív 1024×1024, jobb kezek, arcok és kompozíció, külön refiner modell a részletekhez.
- Stable Diffusion 3 Medium (2024. június): diffúziós transzformer, sokkal jobb szövegmegjelenítés és promptértelmezés.
- Stable Diffusion 3.5 (2024. október): a jelenlegi kiadás Large, Large Turbo és Medium méretben, pontosabb promptkövetéssel és változatosabb stílusokkal.
A részletes összehasonlítást az SDXL vs Stable Diffusion 3 útmutatóban találod.
Mire használhatod?
A szövegből kép csak a kezdet. Ugyanezek a modellek tudnak képből képet (img2img: vázlat vagy fotó átalakítása), inpaintinget (egy terület újrafestése), outpaintinget (a kép kiterjesztése), képnagyítást külön szuperfelbontású modellekkel, és ControlNettel póz, mélységtérkép vagy élek alapján vezérelt generálást. A LoRA nevű kiegészítők, egy-egy kis különálló fájl, stílust vagy karaktert tanítanak a modellnek.
Ezen az oldalon fiók nélkül kipróbálhatod az inpaintinget és a képnagyítást, képeket generálhatsz SDXL-lel vagy Stable Diffusion 3-mal, és böngészhetsz 1731 művészi stílus és 82 dokumentált prompt között, hogy lásd, mit csinál egy prompt.
Miben különbözik a DALL-E-től vagy a Midjourney-től?
Két dologban: a súlyok nyilvánosak, és helyben fut. Letöltheted a modellt, ingyen futtathatod a saját gépeden, módosíthatod, és a képeid nem hagyják el a gépedet. A Midjourney és az OpenAI képmodelljei (DALL-E, ma már GPT Image) zárt szolgáltatások: előfizetéssel vagy képenként fizetsz, a modell pedig sosem hagyja el a szervereiket. Cserébe a Stable Diffusion többet kér tőled: modellt kell választanod, pontos promptot és negatív promptot kell írnod, és értened kell a seedet.
Kell hozzá erős számítógép?
Ha magad futtatod, az SD 1.5-höz elég egy újabb, 6 GB VRAM-os NVIDIA kártya, az SDXL-hez 8 GB. Az AMD kártyák Linuxon ROCm-mel működnek, az Apple Silicon az MPS backenden keresztül. Ha egyik sincs, az oldal eszközeihez nem kell hardver: egy részük a mi GPU-nkon fut, élőben mutatott sorral és haladással, mások az oldalba ágyazott, külső szolgáltatónál futó demók. Ha készen állsz, olvasd el, hogyan telepítsd a Stable Diffusiont helyben.