Jak napisać prompt do Stable Diffusion?

Autor: Zaktualizowano 3 min czytania

Prompt do Stable Diffusion to opis tekstowy, który steruje obrazem: najpierw wyraźny temat, potem styl, oświetlenie, kadr i kilka słów o jakości, oddzielone przecinkami. Krótki, konkretny prompt, ułożony od najważniejszego do najmniej ważnego elementu, daje przewidywalne obrazy. Pisz go po angielsku, bo na takich opisach trenowano model.

Struktura, która działa

  1. Temat: kto lub co, co robi, gdzie. a red fox sitting on a mossy rock in a pine forest
  2. Styl lub medium: oil painting, 35mm photograph, watercolor, 3D render albo artysta: by Ivan Shishkin.
  3. Oświetlenie i nastrój: golden hour, soft diffused light, dramatic rim light, foggy.
  4. Kadr i obiektyw: close-up, wide shot, 85mm, shallow depth of field.
  5. Słowa o jakości: highly detailed, sharp focus, masterpiece. Dwa lub trzy wystarczą.

Słowa na początku promptu ważą zwykle więcej niż te na końcu. Temat zawsze na pierwszym miejscu.

Przykład z komentarzem

portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed

Pierwsze pięć słów ustala temat. Nazwisko artysty wyznacza paletę i sposób malowania (zobacz, jak wiele zmienia jedno nazwisko na stronach ze stylami artystów). Słowa o świetle decydują o atmosferze, słowa o kadrze o kompozycji, a ostatnia grupa dopieszcza całość. Negatywny prompt: blurry, deformed hands, extra fingers, watermark, text (więcej w poradniku co to jest negatywny prompt).

Wagi i podkreślanie

W Automatic1111, Forge, Fooocus i ComfyUI nawiasy okrągłe ustawiają wagę terminu: (red scarf:1.3) oznacza 30% więcej uwagi, (background:0.7) mniej. Nawiasy kwadratowe obniżają wagę w Automatic1111. Trzymaj się zakresu 0,6–1,4: poza nim obraz często się psuje. Używaj wag, żeby uratować detal, który model uparcie pomija, a nie na każdym słowie.

Częste błędy

  • Przeczenia: „a room without windows” często daje okna. Niechciane rzeczy wpisz do negatywnego promptu.
  • Za dużo pomysłów: jeden temat na obraz. W SD 1.5 i SDXL jeden blok CLIP mieści 75 tokenów (około 60 słów); Automatic1111 przenosi resztę do drugiego bloku, a narzędzia bez takiego podziału po prostu ją ucinają.
  • Sprzeczne style: photorealistic watercolor daje mętny wynik.
  • Zmienianie wszystkiego naraz: ustal seed i zmieniaj jedno słowo na raz, żeby zobaczyć, co robi każde z nich.

Różnice między modelami

SD 1.5 i SDXL reagują na listy słów kluczowych, jak w przykładzie wyżej. Stable Diffusion 3 i 3.5 lepiej rozumieją naturalne zdania, potrafią rozmieścić kilka obiektów („a cat on the left, a dog on the right”) i renderować krótki tekst w cudzysłowie. Niezależnie od modelu, 82 udokumentowane prompty na tej stronie pokazują parametry stojące za każdym obrazem, a generator promptów rozwija kilka słów w kompletny prompt.

Podobne pytania

Jak długi powinien być prompt do Stable Diffusion?

Dla SD 1.5 i SDXL dobry zakres to 15–60 słów. Poniżej 10 słów model wypełnia luki losowo; powyżej 75 tokenów Automatic1111 dzieli tekst na bloki, a narzędzia bez tej funkcji go ucinają.

Czy nazwiska artystów wciąż działają?

Tak, w SD 1.5 i SDXL, które znają tysiące artystów: nasze zestawienie 1731 nazwisk, wyrenderowanych z tymi samymi czterema promptami i seedami, pokazuje efekt każdego z nich. Stable Diffusion 3 reaguje na nie słabiej.

Czy prompty trzeba pisać po angielsku?

Tak. Enkodery tekstu trenowano głównie na angielskich podpisach. Prompt po polsku działa częściowo, ale traci precyzję; najpierw go przetłumacz.