Cos’è Stable Diffusion?

Di Aggiornato il 3 min di lettura

Stable Diffusion è un’intelligenza artificiale open source che trasforma una descrizione testuale in un’immagine. Pubblicata da Stability AI nell’agosto 2022, gira su una comune scheda grafica da gioco, chiunque può riaddestrarla e alimenta migliaia di strumenti gratuiti, compresi quelli di questo sito.

Come funziona Stable Diffusion?

Stable Diffusion è un modello di diffusione latente. Durante l’addestramento ha imparato a togliere il rumore da milioni di immagini accompagnate dalla loro didascalia. In fase di generazione parte da un rumore puramente casuale e, passo dopo passo, lo ripulisce nella direzione del tuo testo: dopo 20 o 30 passi il rumore è diventato un’immagine che corrisponde al prompt.

Collaborano tre componenti: un codificatore di testo che trasforma le parole in numeri, una U-Net (o, dalla versione 3, un transformer di diffusione) che rimuove il rumore, e un decodificatore che converte l’immagine latente compatta in pixel. Lavorare in quello spazio compresso è ciò che la rende abbastanza veloce per una GPU domestica.

Quali versioni esistono?

  • Stable Diffusion 1.5 (2022): immagini 512×512, il modello più personalizzato di sempre, migliaia di varianti e LoRA della community.
  • SDXL 1.0 (luglio 2023): 1024×1024 nativo, mani, volti e composizione migliori, un modello «refiner» per i dettagli.
  • Stable Diffusion 3 Medium (giugno 2024): transformer di diffusione, resa del testo e comprensione del prompt molto migliori.
  • Stable Diffusion 3.5 (ottobre 2024): la versione attuale, nelle taglie Large, Large Turbo e Medium, immagini più nitide e colori più ricchi.

Il confronto dettagliato è in SDXL contro Stable Diffusion 3.

Cosa si può fare?

Il testo-immagine è solo l’inizio. Gli stessi modelli fanno immagine-immagine (trasformare uno schizzo o una foto), inpainting (ridipingere una zona), outpainting (estendere un’immagine), ingrandimento con modelli di super-risoluzione e, con ControlNet, una generazione guidata da una posa, una mappa di profondità o dei contorni. Estensioni chiamate LoRA le insegnano uno stile o un personaggio in pochi megabyte.

Su questo sito puoi provare l’inpainting e l’ingrandimento senza account, generare immagini con SDXL o Stable Diffusion 3, e sfogliare 1.731 stili di artisti e 69 prompt documentati per capire cosa fa un prompt.

Che differenza c’è con DALL-E o Midjourney?

Due cose: i pesi sono pubblici e gira in locale. Puoi scaricare il modello, eseguirlo gratis sul tuo computer, modificarlo e tenere private le tue immagini. DALL-E e Midjourney sono servizi chiusi fatturati a immagine. In cambio Stable Diffusion ti chiede di più: scegliere un modello, scrivere un prompt preciso e un prompt negativo, e capire il seed.

Serve un computer potente?

Per farla girare da soli basta una scheda NVIDIA recente con almeno 6 GB di VRAM per SD 1.5, e 8 GB sono comodi per SDXL. Le schede AMD funzionano con ROCm su Linux e i Mac Apple Silicon con il backend MPS. Se non hai nulla di tutto questo, gli strumenti di questo sito girano sulla nostra GPU, con coda e avanzamento mostrati in diretta. Leggi come installare Stable Diffusion in locale quando sei pronto.

Domande frequenti

Stable Diffusion è gratis?

Sì. I modelli sono pubblicati con licenze aperte (CreativeML OpenRAIL-M per 1.5 e SDXL, Stability AI Community Licence per 3.x, gratuita sotto un milione di dollari di ricavi annui). In locale costa solo l’elettricità; gli strumenti di questo sito sono gratuiti.

Di chi sono le immagini che genero?

Tue, per quanto riguarda la licenza: Stability AI non rivendica alcun diritto sui risultati. Il diritto d’autore sulle immagini IA varia da paese a paese ed è ancora in evoluzione; nell’UE e negli Stati Uniti un’immagine generata interamente dall’IA in genere non è tutelabile.

Stable Diffusion può scrivere testo nelle immagini?

Le versioni 1.5 e SDXL fanno fatica. Stable Diffusion 3 e 3.5 rendono bene testi brevi, titoli e loghi se metti le parole tra virgolette nel prompt.