Vergelijkingstabel
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| Uitgebracht | okt 2022 | jul 2023 | jun 2024 | okt 2024 |
| Parameters | 0,9 mld | 2,6 mld (+ refiner) | 2 mld | 8 mld |
| Native grootte | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM (fp16) | 4–6 GB | 8 GB | 10 GB | 19 GB (11 GB in fp8) |
| Snelheid (onze GPU van 12 GB) | ~4 s | ~20 s | — | — |
| Promptbegrip | trefwoorden | trefwoorden, betere compositie | zinnen, meerdere onderwerpen | het beste |
| Tekst in beeld | nee | zelden | ja, kort | ja |
| Kunstenaarsnamen | sterk | sterk | zwakker | zwakker |
| Community-modellen | heel veel | de meeste, met Pony en Illustrious | weinig | weinig |
| Licentie | OpenRAIL-M | OpenRAIL++ | Community-licentie (gratis onder 1 miljoen dollar omzet) | |
| Proberen op deze site | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5: het werkpaard
Klein, snel, eindeloos aangepast. Er bestaan fotorealistische en anime-finetunes, ControlNet-modellen, LoRA's en embeddings voor alles. Zijn zwakke punten zijn de basisresolutie van 512 px, handen en een letterlijke lezing van prompts. Het blijft de juiste keuze voor een kaart met 6 GB, voor animatie met AnimateDiff en voor werk dat zwaar op ControlNet leunt. De txt2img-pagina voor leden op deze site draait een aangepast SD 1.5-model.
SDXL 1.0: detail en stijl
SDXL heeft vier keer zoveel pixels, een tweede tekstencoder en een refiner voor de laatste steps. Gezichten, handen en compositie zijn sterk verbeterd, en kunstenaarsnamen hebben een sterk, voorspelbaar effect, wat de reden is dat onze vergelijking van 1.731 kunstenaars met SDXL is gegenereerd. Het heeft 8 GB nodig en is een paar keer zo traag als 1.5: ongeveer 20 s tegenover 4 s per afbeelding op onze GPU. Gedistilleerde versies (SDXL Turbo, LCM LoRA) hebben maar één tot acht steps nodig in plaats van 25 tot 30, met enig kwaliteitsverlies.
Stable Diffusion 3 en 3.5: begrip en tekst
Een nieuwe architectuur (diffusion transformer met drie tekstencoders) die zinnen volgt in plaats van trefwoordenlijsten: "a red cube on a blue sphere, to the left of a green cone" komt er meestal goed uit en korte tekst tussen aanhalingstekens is leesbaar. 3 Medium had problemen met anatomie, die 3.5 heeft verminderd; 3.5 Large is het krachtigste model van de familie, 3.5 Medium het evenwichtige. Kunstenaarsnamen en oude gewoontes rond de negatieve prompt doen er minder toe. Probeer hier Stable Diffusion 3 Medium.
Welk model kies je?
- Leren, kaart met 6 GB, ControlNet, AnimateDiff: SD 1.5.
- Illustratie, portretten, kunstenaarsstijlen, 8–12 GB: SDXL.
- Posters met tekst, complexe scènes, 12–16 GB+: SD 3.5 Medium of Large.
- Geen GPU: de online tools op deze site, zonder account.