La structure qui fonctionne
- Sujet : qui ou quoi, en train de faire quoi, où. a red fox sitting on a mossy rock in a pine forest
- Style ou médium : oil painting, 35mm photograph, watercolor, 3D render, ou un artiste : by Ivan Shishkin.
- Lumière et ambiance : golden hour, soft diffused light, dramatic rim light, foggy.
- Cadrage et objectif : close-up, wide shot, 85mm, shallow depth of field.
- Mots de qualité : highly detailed, sharp focus, masterpiece. Deux ou trois suffisent.
Les mots du début pèsent plus que ceux de la fin. Gardez le sujet en premier.
Un exemple annoté
portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed
Les cinq premiers mots fixent le sujet. Le nom d’artiste règle la palette et la touche (voyez à quel point un seul nom change tout sur les pages styles d’artistes). Les mots de lumière décident de l’atmosphère, ceux de cadrage de la composition, et le dernier groupe polit. Prompt négatif : blurry, deformed hands, extra fingers, watermark, text, détaillé dans qu’est-ce qu’un prompt négatif.
Poids et emphase
Dans Automatic1111 et la plupart des interfaces, les parenthèses augmentent le poids d’un terme : (red scarf:1.3) signifie 30 % plus important, (background:0.7) moins. Les crochets le diminuent. Restez entre 0,6 et 1,4 : au-delà, l’image se casse. Utilisez les poids pour sauver un détail que le modèle ignore, pas sur chaque mot.
Les erreurs courantes
- Phrases complètes et négations : « a room without windows » produit souvent des fenêtres. Mettez ce que vous ne voulez pas dans le prompt négatif.
- Trop d’idées : un sujet par image ; 75 tokens (environ 60 mots) est la limite d’un bloc CLIP pour SD 1.5 et SDXL, et ce qui suit pèse moins.
- Styles contradictoires : photorealistic watercolor donne un résultat boueux.
- Tout changer d’un coup : fixez la seed et changez un mot à la fois pour apprendre l’effet de chacun.
Différences entre modèles
SD 1.5 et SDXL répondent aux listes de mots-clés comme l’exemple ci-dessus. Stable Diffusion 3 et 3.5 comprennent mieux les phrases naturelles, placent plusieurs sujets (« a cat on the left, a dog on the right ») et rendent un texte court entre guillemets. Quel que soit le modèle, les 69 prompts documentés de ce site montrent tous les paramètres derrière chaque image, et le générateur de prompts développe quelques mots en prompt complet.