Структура, яка працює
- Об’єкт: хто або що, що робить і де. a red fox sitting on a mossy rock in a pine forest
- Стиль або техніка: oil painting, 35mm photograph, watercolor, 3D render або художник: by Arkhyp Kuindzhi.
- Освітлення й настрій: golden hour, soft diffused light, dramatic rim light, foggy.
- Кадрування й об’єктив: close-up, wide shot, 85mm, shallow depth of field.
- Слова про якість: highly detailed, sharp focus, masterpiece. Двох-трьох достатньо.
Слова на початку промпту зазвичай важать більше, ніж слова наприкінці. Тримайте об’єкт на першому місці.
Приклад із розбором
portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed
Перші п’ять слів задають об’єкт. Ім’я художника визначає палітру й манеру мазка (наскільки сильно одне ім’я змінює результат, видно на сторінках стилів художників). Слова про світло створюють атмосферу, слова про кадрування — композицію, а остання група шліфує результат. Негативний промпт: blurry, deformed hands, extra fingers, watermark, text — докладніше в посібнику що таке негативний промпт.
Ваги й акценти
В Automatic1111, Forge, Fooocus і ComfyUI круглі дужки задають вагу слова: (red scarf:1.3) означає «на 30 % більше уваги», (background:0.7) — менше. В Automatic1111 квадратні дужки вагу знижують. Тримайтеся в межах від 0.6 до 1.4: поза ними зображення часто погіршується. Вагами варто рятувати деталь, яку модель уперто ігнорує, а не розставляти їх на кожному слові.
Типові помилки
- Заперечення: «a room without windows» часто дає саме вікна. Усе небажане записуйте в негативний промпт.
- Забагато ідей: один об’єкт на зображення. У SD 1.5 і SDXL один блок CLIP вміщує 75 токенів (приблизно 60 слів); усе, що далі, Automatic1111 переносить у другий блок, а інструменти, які не ділять текст на блоки, обрізають.
- Суперечливі стилі: photorealistic watercolor дає каламутний результат.
- Змінювати все одразу: зафіксуйте seed і міняйте по одному слову, щоб зрозуміти, на що впливає кожне.
Відмінності між моделями
SD 1.5 і SDXL добре реагують на списки ключових слів, як у прикладі вище. Stable Diffusion 3 і 3.5 краще розуміють звичайні речення, вміють розмістити кілька об’єктів («a cat on the left, a dog on the right») і відтворити короткий текст у лапках. Хай яку модель ви обрали, 82 задокументовані промпти на цьому сайті показують параметри кожного зображення, а генератор промптів розгортає кілька слів у повноцінний промпт.