Mi az a Stable Diffusion?

Írta: Frissítve 3 perc olvasás

A Stable Diffusion egy nyílt forráskódú AI-modell, amely egy szöveges leírásból képet készít. A Stability AI adta ki 2022 augusztusában; egy átlagos gamer videokártyán is fut, bárki finomhangolhatja, és rengeteg ingyenes eszköz épül rá, köztük azok is, amelyeket ezen az oldalon találsz.

Hogyan működik a Stable Diffusion?

A Stable Diffusion egy latens diffúziós modell. A tanítás során több százmillió, felirattal ellátott képen tanulta meg, hogyan távolítsa el a zajt. Generáláskor tiszta véletlen zajból indul, és lépésről lépésre a szöveged irányába zajtalanítja: 20–30 lépés után a zajból a promptnak megfelelő kép lesz.

Három rész dolgozik együtt: a szövegkódoló, amely a szavaidat számokká alakítja, a U-Net (a 3-as verziótól egy diffúziós transzformer), amely a zajtalanítást végzi, és a dekóder, amely a tömör latens képet pixelekké alakítja. A zajtalanítás ezen a tömör latens képen fut, ezért elég gyors a modell egy otthoni GPU-hoz.

Milyen verziók léteznek?

  • Stable Diffusion 1.5 (2022): 512×512-es képek, több ezer közösségi finomhangolás és LoRA.
  • SDXL 1.0 (2023. július): natív 1024×1024, jobb kezek, arcok és kompozíció, külön refiner modell a részletekhez.
  • Stable Diffusion 3 Medium (2024. június): diffúziós transzformer, sokkal jobb szövegmegjelenítés és promptértelmezés.
  • Stable Diffusion 3.5 (2024. október): a jelenlegi kiadás Large, Large Turbo és Medium méretben, pontosabb promptkövetéssel és változatosabb stílusokkal.

A részletes összehasonlítást az SDXL vs Stable Diffusion 3 útmutatóban találod.

Mire használhatod?

A szövegből kép csak a kezdet. Ugyanezek a modellek tudnak képből képet (img2img: vázlat vagy fotó átalakítása), inpaintinget (egy terület újrafestése), outpaintinget (a kép kiterjesztése), képnagyítást külön szuperfelbontású modellekkel, és ControlNettel póz, mélységtérkép vagy élek alapján vezérelt generálást. A LoRA nevű kiegészítők, egy-egy kis különálló fájl, stílust vagy karaktert tanítanak a modellnek.

Ezen az oldalon fiók nélkül kipróbálhatod az inpaintinget és a képnagyítást, képeket generálhatsz SDXL-lel vagy Stable Diffusion 3-mal, és böngészhetsz 1731 művészi stílus és 82 dokumentált prompt között, hogy lásd, mit csinál egy prompt.

Miben különbözik a DALL-E-től vagy a Midjourney-től?

Két dologban: a súlyok nyilvánosak, és helyben fut. Letöltheted a modellt, ingyen futtathatod a saját gépeden, módosíthatod, és a képeid nem hagyják el a gépedet. A Midjourney és az OpenAI képmodelljei (DALL-E, ma már GPT Image) zárt szolgáltatások: előfizetéssel vagy képenként fizetsz, a modell pedig sosem hagyja el a szervereiket. Cserébe a Stable Diffusion többet kér tőled: modellt kell választanod, pontos promptot és negatív promptot kell írnod, és értened kell a seedet.

Kell hozzá erős számítógép?

Ha magad futtatod, az SD 1.5-höz elég egy újabb, 6 GB VRAM-os NVIDIA kártya, az SDXL-hez 8 GB. Az AMD kártyák Linuxon ROCm-mel működnek, az Apple Silicon az MPS backenden keresztül. Ha egyik sincs, az oldal eszközeihez nem kell hardver: egy részük a mi GPU-nkon fut, élőben mutatott sorral és haladással, mások az oldalba ágyazott, külső szolgáltatónál futó demók. Ha készen állsz, olvasd el, hogyan telepítsd a Stable Diffusiont helyben.

Gyakori kérdések a témában

Ingyenes a Stable Diffusion?

Igen. A modellek nyílt licenc alatt jelennek meg (CreativeML OpenRAIL-M az 1.5-höz, OpenRAIL++-M az SDXL-hez, a 3.x-hez pedig a Stability AI Community licenc, amely évi egymillió dollár bevétel alatt ingyenes). A helyi futtatás csak áramba kerül; az oldal eszközei ingyenesek, hirdetésekből tartjuk fenn őket.

Kié a generált kép?

A licenc szerint a tiéd: a Stability AI nem formál jogot az elkészült képekre. Az AI-képek szerzői jogi megítélése országonként eltér, és még alakul; az EU-ban és az USA-ban a tisztán AI által generált képek általában nem állnak szerzői jogi védelem alatt.

Tud a Stable Diffusion szöveget írni a képbe?

Az 1.5 és az SDXL nehezen boldogul a szöveggel. A Stable Diffusion 3 és 3.5 sokkal jobban megjelenít rövid szövegeket és címeket, ha a szavakat idézőjelbe teszed a promptban.