Як написати промпт для Stable Diffusion?

Автор: Оновлено 3 хв читання

Промпт для Stable Diffusion — це текстовий опис, який спрямовує генерацію зображення: спочатку чіткий об’єкт, потім стиль, освітлення, кадрування й кілька слів про якість, усе розділене комами. Пишіть коротко й конкретно, від найважливішого до другорядного — саме так виходять передбачувані результати.

Структура, яка працює

  1. Об’єкт: хто або що, що робить і де. a red fox sitting on a mossy rock in a pine forest
  2. Стиль або техніка: oil painting, 35mm photograph, watercolor, 3D render або художник: by Arkhyp Kuindzhi.
  3. Освітлення й настрій: golden hour, soft diffused light, dramatic rim light, foggy.
  4. Кадрування й об’єктив: close-up, wide shot, 85mm, shallow depth of field.
  5. Слова про якість: highly detailed, sharp focus, masterpiece. Двох-трьох достатньо.

Слова на початку промпту зазвичай важать більше, ніж слова наприкінці. Тримайте об’єкт на першому місці.

Приклад із розбором

portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed

Перші п’ять слів задають об’єкт. Ім’я художника визначає палітру й манеру мазка (наскільки сильно одне ім’я змінює результат, видно на сторінках стилів художників). Слова про світло створюють атмосферу, слова про кадрування — композицію, а остання група шліфує результат. Негативний промпт: blurry, deformed hands, extra fingers, watermark, text — докладніше в посібнику що таке негативний промпт.

Ваги й акценти

В Automatic1111, Forge, Fooocus і ComfyUI круглі дужки задають вагу слова: (red scarf:1.3) означає «на 30 % більше уваги», (background:0.7) — менше. В Automatic1111 квадратні дужки вагу знижують. Тримайтеся в межах від 0.6 до 1.4: поза ними зображення часто погіршується. Вагами варто рятувати деталь, яку модель уперто ігнорує, а не розставляти їх на кожному слові.

Типові помилки

  • Заперечення: «a room without windows» часто дає саме вікна. Усе небажане записуйте в негативний промпт.
  • Забагато ідей: один об’єкт на зображення. У SD 1.5 і SDXL один блок CLIP вміщує 75 токенів (приблизно 60 слів); усе, що далі, Automatic1111 переносить у другий блок, а інструменти, які не ділять текст на блоки, обрізають.
  • Суперечливі стилі: photorealistic watercolor дає каламутний результат.
  • Змінювати все одразу: зафіксуйте seed і міняйте по одному слову, щоб зрозуміти, на що впливає кожне.

Відмінності між моделями

SD 1.5 і SDXL добре реагують на списки ключових слів, як у прикладі вище. Stable Diffusion 3 і 3.5 краще розуміють звичайні речення, вміють розмістити кілька об’єктів («a cat on the left, a dog on the right») і відтворити короткий текст у лапках. Хай яку модель ви обрали, 82 задокументовані промпти на цьому сайті показують параметри кожного зображення, а генератор промптів розгортає кілька слів у повноцінний промпт.

Спробуйте просто зараз, безкоштовноПереглянути 82 промпти з параметрами →

Часті запитання

Якої довжини має бути промпт для Stable Diffusion?

Для SD 1.5 і SDXL добре підходить довжина від 15 до 60 слів. Якщо слів менше ніж 10, модель заповнює прогалини навмання; після 75 токенів Automatic1111 ділить текст на блоки, а інструменти без такої функції його обрізають.

Чи досі працюють імена художників?

Так, у SD 1.5 і SDXL, які знають тисячі художників: наше порівняння 1731 імені, згенероване з тими самими чотирма промптами й тими самими seed, показує вплив кожного. Stable Diffusion 3 реагує на них слабше.

Чи треба писати промпти англійською?

Так. Текстові енкодери навчалися переважно на англомовних підписах. Промпт українською працює частково, але втрачає точність; спершу перекладіть його.