SDXL vs Stable Diffusion 3 vs SD 1.5: quale usare?

Di Aggiornato il 3 min di lettura

Usa Stable Diffusion 1.5 per velocità, poca VRAM e la scelta più ampia di modelli della community; SDXL 1.0 per immagini dettagliate a 1024×1024 e stili di artisti; Stable Diffusion 3.5 per prompt con più soggetti, testo leggibile e la qualità migliore se la tua GPU ha 12 GB o più.

Tabella comparativa

SD 1.5SDXL 1.0SD 3 MediumSD 3.5 Large
Uscitaott. 2022lug. 2023giu. 2024ott. 2024
Parametri0,9 mld3,5 mld (+ refiner)2 mld8 mld
Dimensione nativa512×5121024×10241024×10241024×1024
VRAM (fp16)4–6 GB8 GB10 GB16 GB+
Velocità (RTX 3060)~4 s~15 s~20 s~60 s
Comprensione del promptparole chiaveparole chiave, composizione migliorefrasi, più soggettila migliore
Testo nell’immaginenoraramentesì, brevesì
Nomi di artistifortefortedeboledebole
Modelli della communitymigliaiamoltipochiin crescita
LicenzaOpenRAIL-MOpenRAIL++Community licence (gratuita sotto 1 M$ di ricavi)
Prova su questo sitoSD 1.5SDXLSD 3—

Stable Diffusion 1.5: il cavallo da tiro

Piccolo, veloce, personalizzato all’infinito. Esistono varianti fotorealistiche e anime, modelli ControlNet, LoRA ed embedding per tutto. I suoi punti deboli sono la risoluzione base di 512 px, le mani e una lettura letterale dei prompt. Resta la scelta giusta per una scheda da 6 GB, per le pipeline di animazione e per il lavoro intensivo con ControlNet. Il txt2img dei membri di questo sito gira su SD 1.5.

SDXL 1.0: dettaglio e stile

Quattro volte i pixel, un secondo codificatore di testo, un refiner per gli ultimi passi. Volti, mani e composizione sono migliorati molto, e i nomi degli artisti hanno un effetto forte e prevedibile, motivo per cui il nostro confronto di 1.731 artisti è stato generato con SDXL. Richiede 8 GB ed è tre o quattro volte più lento di 1.5. Le versioni distillate (SDXL Turbo, LCM LoRA) lo riportano a un secondo per immagine, a scapito di un po’ di qualità.

Stable Diffusion 3 e 3.5: comprensione e testo

Una nuova architettura (transformer di diffusione con tre codificatori di testo) che segue le frasi invece degli elenchi di parole chiave: «a red cube on a blue sphere, to the left of a green cone» viene bene, e un testo breve tra virgolette è reso correttamente. 3 Medium aveva problemi di anatomia che 3.5 ha corretto; 3.5 Large è il miglior modello aperto della famiglia, 3.5 Medium quello equilibrato. I nomi degli artisti e le vecchie abitudini del prompt negativo contano meno. Prova Stable Diffusion 3 Medium qui.

Quale scegliere?

  • Imparare, scheda da 6 GB, ControlNet, animazione: SD 1.5.
  • Illustrazione, ritratti, stili di artisti, 8–12 GB: SDXL.
  • Poster con testo, scene complesse, 12–16 GB e oltre: SD 3.5 Medium o Large.
  • Nessuna GPU: gli strumenti online di questo sito, senza account.

Domande frequenti

SDXL è meglio di SD 1.5?

Così com’è, sì: risoluzione più alta, anatomia e composizione migliori. SD 1.5 mantiene il vantaggio in velocità, VRAM e ampiezza delle varianti della community.

Posso usare i LoRA di SD 1.5 con SDXL o SD 3?

No. Un LoRA è legato all’architettura su cui è stato addestrato; ogni famiglia ha bisogno dei propri LoRA.

E Flux?

Flux.1 di Black Forest Labs (agosto 2024) è un concorrente da 12 miliardi di parametri con ottima aderenza al prompt e resa del testo; richiede da 12 a 24 GB di VRAM e non è un modello Stable Diffusion, ma gli stessi strumenti (ComfyUI, Forge) lo eseguono.