Hoe werkt Stable Diffusion?
Stable Diffusion is een latent diffusiemodel. Tijdens de training leerde het ruis te verwijderen uit honderden miljoenen afbeeldingen met bijschriften. Bij het genereren begint het met pure willekeurige ruis en haalt die stap voor stap weg in de richting van je tekst: na 20 tot 30 steps is de ruis een beeld geworden dat bij de prompt past.
Drie onderdelen werken samen: een tekstencoder die je woorden omzet in getallen, een U-Net (of sinds versie 3 een diffusion transformer) die de ruis verwijdert, en een decoder die het compacte latente beeld omzet in pixels. Het ontruisen gebeurt op dat compacte latente beeld, en dat is precies waarom het model snel genoeg is voor een consumenten-GPU.
Welke versies bestaan er?
- Stable Diffusion 1.5 (2022): afbeeldingen van 512×512, duizenden finetunes en LoRA's van de community.
- SDXL 1.0 (juli 2023): 1024×1024 native, betere handen, gezichten en compositie, plus een refiner-model voor details.
- Stable Diffusion 3 Medium (juni 2024): diffusion transformer, veel betere tekstweergave en promptbegrip.
- Stable Diffusion 3.5 (oktober 2024): de huidige versie, in de maten Large, Large Turbo en Medium, met betere promptopvolging en meer variatie in stijlen.
Bekijk de uitgebreide vergelijking in SDXL vs Stable Diffusion 3.
Wat kun je ermee doen?
Tekst-naar-beeld is pas het begin. Dezelfde modellen doen ook img2img (een schets of foto transformeren), inpainting (één gebied opnieuw schilderen), outpainting (een beeld naar buiten uitbreiden), upscaling met speciale superresolutiemodellen en, met ControlNet, generatie gestuurd door een pose, een dieptekaart of randen. Add-ons die LoRA's heten, elk een klein los bestand, leren het model een stijl of een personage.
Op deze site kun je inpainting en upscaling proberen zonder account, afbeeldingen genereren met SDXL of Stable Diffusion 3, en door 1.731 kunstenaarsstijlen en 82 gedocumenteerde prompts bladeren om te leren wat een prompt doet.
Wat is het verschil met DALL-E of Midjourney?
Twee dingen: de gewichten zijn openbaar en het draait lokaal. Je kunt het model downloaden, gratis op je eigen computer draaien, aanpassen en je afbeeldingen privé houden. Midjourney en de beeldmodellen van OpenAI (DALL-E, nu GPT Image) zijn gesloten diensten: je betaalt per abonnement of per afbeelding, en het model verlaat hun servers nooit. Daar staat tegenover dat Stable Diffusion meer van je vraagt. Je moet een model kiezen, een precieze prompt en een negatieve prompt schrijven, en begrijpen wat de seed doet.
Heb ik een krachtige computer nodig?
Om het zelf te draaien volstaat een recente NVIDIA-kaart met 6 GB VRAM voor SD 1.5, en 8 GB voor SDXL. AMD-kaarten werken via ROCm op Linux, Apple Silicon via de MPS-backend. Heb je niets van dat alles, dan vragen de tools op deze site geen hardware: sommige draaien op onze GPU, met de wachtrij en de voortgang live in beeld, andere zijn gehoste demo's die in de pagina zijn ingebed. Lees hoe je Stable Diffusion lokaal installeert zodra je er klaar voor bent.