Hur skriver man en prompt för Stable Diffusion?

Av Uppdaterad 3 min läsning

En prompt för Stable Diffusion är en textbeskrivning som styr bilden: först ett tydligt motiv, sedan stil, ljus, bildutsnitt och några kvalitetsord, åtskilda med kommatecken. En kort och konkret prompt, ordnad från det viktigaste till det minst viktiga, är det som ger förutsägbara bilder.

Strukturen som fungerar

  1. Motiv: vem eller vad, som gör vad, var. a red fox sitting on a mossy rock in a pine forest
  2. Stil eller medium: oil painting, 35mm photograph, watercolor, 3D render, eller en konstnär: by Ivan Shishkin.
  3. Ljus och stämning: golden hour, soft diffused light, dramatic rim light, foggy.
  4. Bildutsnitt och objektiv: close-up, wide shot, 85mm, shallow depth of field.
  5. Kvalitetsord: highly detailed, sharp focus, masterpiece. Två eller tre räcker.

Ord i början av prompten väger ofta tyngre än ord i slutet. Sätt motivet först.

Ett kommenterat exempel

portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed

De första fem orden låser motivet. Konstnärsnamnet bestämmer palett och penselföring (se hur mycket ett enda namn ändrar på sidorna med konstnärsstilar). Ljusorden avgör atmosfären, utsnittsorden kompositionen, och den sista gruppen putsar. Negativ prompt: blurry, deformed hands, extra fingers, watermark, text (mer i vad är en negativ prompt).

Vikter och betoning

I Automatic1111, Forge, Fooocus och ComfyUI sätter parenteser vikten på en term: (red scarf:1.3) betyder 30 % mer uppmärksamhet, (background:0.7) mindre. Hakparenteser sänker vikten i Automatic1111. Håll dig mellan 0,6 och 1,4: utanför det försämras bilden ofta. Använd vikter för att rädda en detalj som modellen envisas med att ignorera, inte på varje ord.

Vanliga misstag

  • Negationer: ”a room without windows” ger ofta fönster. Lägg det du inte vill ha i den negativa prompten.
  • För många idéer: ett motiv per bild. Med SD 1.5 och SDXL rymmer ett CLIP-block 75 token (ungefär 60 ord); Automatic1111 lägger det som kommer efter i ett andra block, och verktyg som inte delar upp texten klipper bort det.
  • Motstridiga stilar: photorealistic watercolor ger ett grumligt resultat.
  • Att ändra allt på en gång: fixera seedet och ändra ett ord i taget för att lära dig vad varje ord gör.

Skillnader mellan modeller

SD 1.5 och SDXL svarar på nyckelordslistor som exemplet ovan. Stable Diffusion 3 och 3.5 förstår naturliga meningar bättre, kan placera flera motiv (”a cat on the left, a dog on the right”) och återge kort text inom citattecken. Oavsett modell visar de 82 dokumenterade promptexemplen på den här webbplatsen parametrarna bakom varje bild, och promptgeneratorn bygger ut några ord till en komplett prompt.

Andra vanliga frågor

Hur lång bör en prompt för Stable Diffusion vara?

För SD 1.5 och SDXL är 15 till 60 ord ett bra spann. Under 10 ord fyller modellen luckorna slumpmässigt; över 75 token delar Automatic1111 upp texten i block, och verktyg utan den funktionen klipper bort resten.

Fungerar konstnärsnamn fortfarande?

Ja, med SD 1.5 och SDXL, som känner till tusentals konstnärer: vår jämförelse av 1 731 namn, renderade med samma fyra prompts och seeds, visar effekten av varje. Stable Diffusion 3 reagerar svagare på dem.

Ska jag skriva prompten på engelska?

Ja. Textkodarna tränades främst på engelska bildtexter. En prompt på svenska fungerar delvis men tappar precision; översätt den först.