Tabella comparativa
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| Uscita | ott. 2022 | lug. 2023 | giu. 2024 | ott. 2024 |
| Parametri | 0,9 mld | 3,5 mld (+ refiner) | 2 mld | 8 mld |
| Dimensione nativa | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM (fp16) | 4–6 GB | 8 GB | 10 GB | 16 GB+ |
| Velocità (RTX 3060) | ~4 s | ~15 s | ~20 s | ~60 s |
| Comprensione del prompt | parole chiave | parole chiave, composizione migliore | frasi, più soggetti | la migliore |
| Testo nell’immagine | no | raramente | sì, breve | sì |
| Nomi di artisti | forte | forte | debole | debole |
| Modelli della community | migliaia | molti | pochi | in crescita |
| Licenza | OpenRAIL-M | OpenRAIL++ | Community licence (gratuita sotto 1 M$ di ricavi) | |
| Prova su questo sito | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5: il cavallo da tiro
Piccolo, veloce, personalizzato all’infinito. Esistono varianti fotorealistiche e anime, modelli ControlNet, LoRA ed embedding per tutto. I suoi punti deboli sono la risoluzione base di 512 px, le mani e una lettura letterale dei prompt. Resta la scelta giusta per una scheda da 6 GB, per le pipeline di animazione e per il lavoro intensivo con ControlNet. Il txt2img dei membri di questo sito gira su SD 1.5.
SDXL 1.0: dettaglio e stile
Quattro volte i pixel, un secondo codificatore di testo, un refiner per gli ultimi passi. Volti, mani e composizione sono migliorati molto, e i nomi degli artisti hanno un effetto forte e prevedibile, motivo per cui il nostro confronto di 1.731 artisti è stato generato con SDXL. Richiede 8 GB ed è tre o quattro volte più lento di 1.5. Le versioni distillate (SDXL Turbo, LCM LoRA) lo riportano a un secondo per immagine, a scapito di un po’ di qualità.
Stable Diffusion 3 e 3.5: comprensione e testo
Una nuova architettura (transformer di diffusione con tre codificatori di testo) che segue le frasi invece degli elenchi di parole chiave: «a red cube on a blue sphere, to the left of a green cone» viene bene, e un testo breve tra virgolette è reso correttamente. 3 Medium aveva problemi di anatomia che 3.5 ha corretto; 3.5 Large è il miglior modello aperto della famiglia, 3.5 Medium quello equilibrato. I nomi degli artisti e le vecchie abitudini del prompt negativo contano meno. Prova Stable Diffusion 3 Medium qui.
Quale scegliere?
- Imparare, scheda da 6 GB, ControlNet, animazione: SD 1.5.
- Illustrazione, ritratti, stili di artisti, 8–12 GB: SDXL.
- Poster con testo, scene complesse, 12–16 GB e oltre: SD 3.5 Medium o Large.
- Nessuna GPU: gli strumenti online di questo sito, senza account.