Що таке Stable Diffusion?

Автор: Оновлено 3 хв читання

Stable Diffusion — це штучний інтелект із відкритим кодом, який перетворює текстовий опис на зображення. Компанія Stability AI випустила його в серпні 2022 року. Він працює на звичайній ігровій відеокарті, його може донавчити будь-хто, і на ньому побудовано багато безкоштовних інструментів, зокрема й ті, що є на цьому сайті.

Як працює Stable Diffusion?

Stable Diffusion — це нейромережа, точніше латентна дифузійна модель. Під час навчання вона вчилася прибирати шум із сотень мільйонів зображень, до кожного з яких був підпис. Коли ви генеруєте зображення, модель починає з суцільного випадкового шуму й крок за кроком очищає його в напрямку, який задає ваш текст: за 20–30 кроків шум перетворюється на картинку, що відповідає промпту.

Разом працюють три складники: текстовий енкодер, який перетворює ваші слова на числа, U-Net (а починаючи з версії 3 — дифузійний трансформер), що виконує знешумлення, і декодер, який переводить компактне латентне зображення в пікселі. Саме завдяки роботі в цьому стисненому латентному просторі модель достатньо швидка для споживчої відеокарти.

Які є версії?

  • Stable Diffusion 1.5 (2022): зображення 512×512, тисячі донавчених версій і LoRA від спільноти.
  • SDXL 1.0 (липень 2023): нативна роздільна здатність 1024×1024, кращі руки, обличчя й композиція, окрема модель refiner для деталей.
  • Stable Diffusion 3 Medium (червень 2024): дифузійний трансформер, значно краще відтворює текст і розуміє промпт.
  • Stable Diffusion 3.5 (жовтень 2024): актуальний випуск у варіантах Large, Large Turbo та Medium, краще дотримання промпту й різноманітніші стилі.

Докладне порівняння — у посібнику SDXL чи Stable Diffusion 3.

Що можна робити зі Stable Diffusion?

Генерація зображень із тексту — лише початок. Ті самі моделі працюють у режимі image-to-image (перетворити ескіз або фото), роблять inpainting (перемалювати окрему ділянку) та outpainting (домалювати картинку за її межами), збільшують зображення (апскейл) за допомогою спеціальних моделей super-resolution, а з ControlNet генерують за позою, картою глибини чи контурами. Доповнення під назвою LoRA, кожне з яких — невеликий окремий файл, навчають модель стилю або персонажа.

На цьому сайті можна спробувати inpainting і збільшення зображень без облікового запису, генерувати зображення в SDXL або Stable Diffusion 3, а також переглянути 1731 стиль художників і 82 задокументовані промпти, щоб побачити, на що впливає промпт.

Чим Stable Diffusion відрізняється від DALL-E чи Midjourney?

Двома речами: ваги моделі відкриті, і вона працює локально. Модель можна завантажити, безкоштовно запускати на власному комп’ютері, змінювати, а зображення залишаються приватними. Midjourney і моделі OpenAI для генерації зображень (DALL-E, а тепер GPT Image) — закриті сервіси: ви платите за підписку або за кожне зображення, а модель ніколи не залишає їхніх серверів. Натомість Stable Diffusion вимагає від вас більше: вибрати модель, написати точний промпт і негативний промпт, розібратися, що таке seed.

Чи потрібен потужний комп’ютер?

Щоб запускати модель самостійно, для SD 1.5 вистачить сучасної відеокарти NVIDIA щонайменше з 6 ГБ VRAM, а для SDXL — з 8 ГБ. Карти AMD працюють через ROCm на Linux, Apple Silicon — через бекенд MPS. Якщо нічого з цього у вас немає, інструменти цього сайту не потребують власного обладнання: одні працюють на нашому GPU, і чергу та перебіг генерації видно в реальному часі, інші — це вбудовані в сторінку демо на зовнішньому хостингу. Коли будете готові, прочитайте, як встановити Stable Diffusion локально.

Спробуйте просто зараз, безкоштовноЗгенерувати зображення в Stable Diffusion XL →

Часті запитання

Чи безкоштовний Stable Diffusion?

Так. Моделі поширюються за відкритими ліцензіями: CreativeML OpenRAIL-M для 1.5, OpenRAIL++-M для SDXL, Stability AI Community License для 3.x (безкоштовно, якщо річний дохід менший за мільйон доларів). За локального запуску ви платите тільки за електроенергію, а інструменти цього сайту безкоштовні й існують завдяки рекламі.

Кому належать згенеровані зображення?

З погляду ліцензії — вам: Stability AI не заявляє жодних прав на результати. Авторське право на зображення, створені ШІ, у різних країнах різне й досі формується; у ЄС і США зображення, повністю згенеровані ШІ, зазвичай не охороняються авторським правом.

Чи вміє Stable Diffusion писати текст на зображеннях?

Версіям 1.5 і SDXL текст дається погано. Stable Diffusion 3 і 3.5 значно краще відтворюють короткі написи й заголовки, якщо в промпті взяти потрібні слова в лапки.