Come scrivere un prompt per Stable Diffusion?

Di Aggiornato il 3 min di lettura

Un prompt per Stable Diffusion è una descrizione testuale che guida l’immagine: prima un soggetto chiaro, poi lo stile, la luce, l’inquadratura e qualche parola di qualità, separati da virgole. Breve, concreto, ordinato dal più importante al meno importante: è così che si ottengono immagini prevedibili.

La struttura che funziona

  1. Soggetto: chi o cosa, che fa cosa, dove. a red fox sitting on a mossy rock in a pine forest
  2. Stile o tecnica: oil painting, 35mm photograph, watercolor, 3D render, oppure un artista: by Ivan Shishkin.
  3. Luce e atmosfera: golden hour, soft diffused light, dramatic rim light, foggy.
  4. Inquadratura e obiettivo: close-up, wide shot, 85mm, shallow depth of field.
  5. Parole di qualità: highly detailed, sharp focus, masterpiece. Ne bastano due o tre.

Le parole all’inizio del prompt pesano più di quelle alla fine. Tieni il soggetto per primo.

Un esempio commentato

portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed

Le prime cinque parole fissano il soggetto. Il nome dell’artista imposta tavolozza e pennellata (guarda quanto cambia un solo nome nelle pagine degli stili di artisti). Le parole di luce decidono l’atmosfera, quelle di inquadratura la composizione, e l’ultimo gruppo rifinisce. Prompt negativo: blurry, deformed hands, extra fingers, watermark, text, spiegato in cos’è un prompt negativo.

Pesi ed enfasi

In Automatic1111 e nella maggior parte delle interfacce, le parentesi aumentano il peso di un termine: (red scarf:1.3) significa il 30 % più importante, (background:0.7) meno. Le parentesi quadre lo riducono. Resta tra 0,6 e 1,4: oltre, l’immagine si rompe. Usa i pesi per recuperare un dettaglio che il modello continua a ignorare, non su ogni parola.

Errori comuni

  • Frasi complete e negazioni: «a room without windows» produce spesso finestre. Ciò che non vuoi va nel prompt negativo.
  • Troppe idee: un soggetto per immagine; 75 token (circa 60 parole) è il limite di un blocco CLIP per SD 1.5 e SDXL, e ciò che segue pesa meno.
  • Stili contraddittori: photorealistic watercolor dà un risultato confuso.
  • Cambiare tutto insieme: fissa il seed e cambia una parola alla volta per imparare cosa fa ciascuna.

Differenze tra modelli

SD 1.5 e SDXL rispondono a elenchi di parole chiave come l’esempio sopra. Stable Diffusion 3 e 3.5 capiscono meglio le frasi naturali, posizionano più soggetti («a cat on the left, a dog on the right») e rendono un testo breve tra virgolette. Qualunque sia il modello, i 69 prompt documentati di questo sito mostrano tutti i parametri dietro ogni immagine, e il generatore di prompt espande poche parole in un prompt completo.

Domande frequenti

Quanto deve essere lungo un prompt per Stable Diffusion?

Tra 15 e 60 parole. Sotto le 10 parole il modello riempie i vuoti a caso; oltre i 75 token (SD 1.5 e SDXL) il testo viene diviso in blocchi e la parte finale influisce meno.

I nomi degli artisti funzionano ancora?

Sì con SD 1.5 e SDXL, che conoscono migliaia di artisti: il nostro confronto di 1.731 nomi generati con lo stesso seed mostra l’effetto di ciascuno. Stable Diffusion 3 è stato addestrato con meno nomi di artisti e reagisce meno.

Devo scrivere il prompt in inglese?

Sì. I codificatori di testo sono stati addestrati soprattutto su didascalie inglesi. Un prompt in italiano funziona in parte ma perde precisione; traducilo, oppure usa il generatore di prompt.