Sammenligningstabel
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| Udgivet | okt. 2022 | jul. 2023 | jun. 2024 | okt. 2024 |
| Parametre | 0,9 mia. | 2,6 mia. (+ refiner) | 2 mia. | 8 mia. |
| Nativ opløsning | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM (fp16) | 4–6 GB | 8 GB | 10 GB | 19 GB (11 GB i fp8) |
| Hastighed (vores 12 GB GPU) | ~4 s | ~20 s | — | — |
| Promptforståelse | nøgleord | nøgleord, bedre komposition | sætninger, flere motiver | bedst |
| Tekst i billeder | nej | sjældent | ja, kort | ja |
| Kunstnernavne | stærk effekt | stærk effekt | svagere | svagere |
| Community-modeller | rigtig mange | flest, med Pony og Illustrious | få | få |
| Licens | OpenRAIL-M | OpenRAIL++ | Community-licens (gratis under 1 mio. dollars i omsætning) | |
| Prøv på dette websted | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5: arbejdshesten
Lille, hurtig og tilpasset i det uendelige. Der findes fotorealistiske finjusteringer og anime-finjusteringer, ControlNet-modeller, LoRAs og embeddings til alt. Svaghederne er grundopløsningen på 512 px, hænderne og en bogstavelig læsning af prompten. Den er stadig det rigtige valg til et kort med 6 GB, til animation med AnimateDiff og til arbejde med meget ControlNet. Medlemmernes txt2img-side på dette websted kører en tilpasset SD 1.5-model.
SDXL 1.0: detaljer og stil
SDXL har fire gange så mange pixels, en ekstra tekst-encoder og en refiner til de sidste trin. Ansigter, hænder og komposition blev markant bedre, og kunstnernavne har en stærk, forudsigelig effekt, hvilket er grunden til, at vores sammenligning af 1.731 kunstnere blev genereret med SDXL. Den kræver 8 GB og er flere gange langsommere end 1.5: cirka 20 s mod 4 s pr. billede på vores GPU. Destillerede udgaver (SDXL Turbo, LCM LoRA) nøjes med ét til otte steps i stedet for 25 til 30, mod et vist tab af kvalitet.
Stable Diffusion 3 og 3.5: forståelse og tekst
En ny arkitektur (diffusion transformer med tre tekst-encodere), der følger sætninger i stedet for nøgleordslister: "a red cube on a blue sphere, to the left of a green cone" kommer som regel rigtigt ud, og korte tekster i anførselstegn kan læses. 3 Medium havde anatomiproblemer, som 3.5 har mindsket; 3.5 Large er familiens dygtigste, 3.5 Medium den afbalancerede. Kunstnernavne og gamle vaner med negative prompts betyder mindre. Prøv Stable Diffusion 3 Medium her.
Hvilken skal du vælge?
- Læring, kort med 6 GB, ControlNet, AnimateDiff: SD 1.5.
- Illustration, portrætter, kunstnerstile, 8–12 GB: SDXL.
- Plakater med tekst, komplekse scener, 12–16 GB+: SD 3.5 Medium eller Large.
- Intet grafikkort: onlineværktøjerne på dette websted, uden konto.