La struttura che funziona
- Soggetto: chi o cosa, che fa cosa, dove. a red fox sitting on a mossy rock in a pine forest
- Stile o tecnica: oil painting, 35mm photograph, watercolor, 3D render, oppure un artista: by Ivan Shishkin.
- Luce e atmosfera: golden hour, soft diffused light, dramatic rim light, foggy.
- Inquadratura e obiettivo: close-up, wide shot, 85mm, shallow depth of field.
- Parole di qualità: highly detailed, sharp focus, masterpiece. Ne bastano due o tre.
Le parole all’inizio del prompt pesano più di quelle alla fine. Tieni il soggetto per primo.
Un esempio commentato
portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed
Le prime cinque parole fissano il soggetto. Il nome dell’artista imposta tavolozza e pennellata (guarda quanto cambia un solo nome nelle pagine degli stili di artisti). Le parole di luce decidono l’atmosfera, quelle di inquadratura la composizione, e l’ultimo gruppo rifinisce. Prompt negativo: blurry, deformed hands, extra fingers, watermark, text, spiegato in cos’è un prompt negativo.
Pesi ed enfasi
In Automatic1111 e nella maggior parte delle interfacce, le parentesi aumentano il peso di un termine: (red scarf:1.3) significa il 30 % più importante, (background:0.7) meno. Le parentesi quadre lo riducono. Resta tra 0,6 e 1,4: oltre, l’immagine si rompe. Usa i pesi per recuperare un dettaglio che il modello continua a ignorare, non su ogni parola.
Errori comuni
- Frasi complete e negazioni: «a room without windows» produce spesso finestre. Ciò che non vuoi va nel prompt negativo.
- Troppe idee: un soggetto per immagine; 75 token (circa 60 parole) è il limite di un blocco CLIP per SD 1.5 e SDXL, e ciò che segue pesa meno.
- Stili contraddittori: photorealistic watercolor dà un risultato confuso.
- Cambiare tutto insieme: fissa il seed e cambia una parola alla volta per imparare cosa fa ciascuna.
Differenze tra modelli
SD 1.5 e SDXL rispondono a elenchi di parole chiave come l’esempio sopra. Stable Diffusion 3 e 3.5 capiscono meglio le frasi naturali, posizionano più soggetti («a cat on the left, a dog on the right») e rendono un testo breve tra virgolette. Qualunque sia il modello, i 69 prompt documentati di questo sito mostrano tutti i parametri dietro ogni immagine, e il generatore di prompt espande poche parole in un prompt completo.