A felépítés, ami működik
- Téma: ki vagy mi, mit csinál, hol. a red fox sitting on a mossy rock in a pine forest
- Stílus vagy médium: oil painting, 35mm photograph, watercolor, 3D render, vagy egy művész: by Ivan Shishkin.
- Fény és hangulat: golden hour, soft diffused light, dramatic rim light, foggy.
- Képkivágás és objektív: close-up, wide shot, 85mm, shallow depth of field.
- Minőségjelző szavak: highly detailed, sharp focus, masterpiece. Kettő-három elég.
A prompt elején álló szavak általában többet nyomnak a latban, mint a végén lévők. A téma maradjon elöl.
Egy kommentált példa
portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed
Az első öt szó rögzíti a témát. A művésznév adja a palettát és az ecsetkezelést (a művészi stílusok oldalain látod, mennyit változtat egyetlen név). A fényre utaló szavak döntik el a hangulatot, a képkivágásra utalók a kompozíciót, az utolsó csoport pedig csiszol. Negatív prompt: blurry, deformed hands, extra fingers, watermark, text (bővebben: mi az a negatív prompt).
Súlyozás és hangsúly
Az Automatic1111-ben, a Forge-ban, a Fooocusban és a ComfyUI-ban zárójellel adhatsz súlyt egy kifejezésnek: a (red scarf:1.3) 30%-kal több figyelmet jelent, a (background:0.7) kevesebbet. A szögletes zárójel az Automatic1111-ben csökkenti a súlyt. Maradj 0,6 és 1,4 között: ezen túl a kép gyakran szétesik. A súlyozást arra használd, hogy megments egy részletet, amelyet a modell folyton figyelmen kívül hagy, ne minden szóra.
Gyakori hibák
- Tagadás: az „a room without windows” gyakran ablakokat ad. A nemkívánatos dolgokat a negatív promptba írd.
- Túl sok ötlet: képenként egy téma. SD 1.5-tel és SDXL-lel egy CLIP-blokk 75 tokent (kb. 60 szót) fogad; az Automatic1111 a többit egy második blokkba teszi, a blokkokat nem kezelő eszközök pedig levágják.
- Ellentmondó stílusok: a photorealistic watercolor zavaros eredményt ad.
- Mindent egyszerre változtatsz: rögzítsd a seedet, és egyszerre csak egy szót cserélj, hogy megtanuld, melyik mit csinál.
Különbségek a modellek között
Az SD 1.5 és az SDXL a fenti példához hasonló kulcsszólistákra reagál. A Stable Diffusion 3 és 3.5 jobban érti a természetes mondatokat, több témát is el tud helyezni („a cat on the left, a dog on the right”), és idézőjelbe tett rövid szöveget is megjelenít. Bármelyik modellt használod, az oldal 82 dokumentált promptja megmutatja az egyes képek mögötti paramétereket, a promptgenerátor pedig néhány szóból teljes promptot készít.