Struktura, która działa
- Temat: kto lub co, co robi, gdzie. a red fox sitting on a mossy rock in a pine forest
- Styl lub medium: oil painting, 35mm photograph, watercolor, 3D render albo artysta: by Ivan Shishkin.
- Oświetlenie i nastrój: golden hour, soft diffused light, dramatic rim light, foggy.
- Kadr i obiektyw: close-up, wide shot, 85mm, shallow depth of field.
- Słowa o jakości: highly detailed, sharp focus, masterpiece. Dwa lub trzy wystarczą.
Słowa na początku promptu ważą zwykle więcej niż te na końcu. Temat zawsze na pierwszym miejscu.
Przykład z komentarzem
portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed
Pierwsze pięć słów ustala temat. Nazwisko artysty wyznacza paletę i sposób malowania (zobacz, jak wiele zmienia jedno nazwisko na stronach ze stylami artystów). Słowa o świetle decydują o atmosferze, słowa o kadrze o kompozycji, a ostatnia grupa dopieszcza całość. Negatywny prompt: blurry, deformed hands, extra fingers, watermark, text (więcej w poradniku co to jest negatywny prompt).
Wagi i podkreślanie
W Automatic1111, Forge, Fooocus i ComfyUI nawiasy okrągłe ustawiają wagę terminu: (red scarf:1.3) oznacza 30% więcej uwagi, (background:0.7) mniej. Nawiasy kwadratowe obniżają wagę w Automatic1111. Trzymaj się zakresu 0,6–1,4: poza nim obraz często się psuje. Używaj wag, żeby uratować detal, który model uparcie pomija, a nie na każdym słowie.
Częste błędy
- Przeczenia: „a room without windows” często daje okna. Niechciane rzeczy wpisz do negatywnego promptu.
- Za dużo pomysłów: jeden temat na obraz. W SD 1.5 i SDXL jeden blok CLIP mieści 75 tokenów (około 60 słów); Automatic1111 przenosi resztę do drugiego bloku, a narzędzia bez takiego podziału po prostu ją ucinają.
- Sprzeczne style: photorealistic watercolor daje mętny wynik.
- Zmienianie wszystkiego naraz: ustal seed i zmieniaj jedno słowo na raz, żeby zobaczyć, co robi każde z nich.
Różnice między modelami
SD 1.5 i SDXL reagują na listy słów kluczowych, jak w przykładzie wyżej. Stable Diffusion 3 i 3.5 lepiej rozumieją naturalne zdania, potrafią rozmieścić kilka obiektów („a cat on the left, a dog on the right”) i renderować krótki tekst w cudzysłowie. Niezależnie od modelu, 82 udokumentowane prompty na tej stronie pokazują parametry stojące za każdym obrazem, a generator promptów rozwija kilka słów w kompletny prompt.