Як працює Stable Diffusion?
Stable Diffusion — це нейромережа, точніше латентна дифузійна модель. Під час навчання вона вчилася прибирати шум із сотень мільйонів зображень, до кожного з яких був підпис. Коли ви генеруєте зображення, модель починає з суцільного випадкового шуму й крок за кроком очищає його в напрямку, який задає ваш текст: за 20–30 кроків шум перетворюється на картинку, що відповідає промпту.
Разом працюють три складники: текстовий енкодер, який перетворює ваші слова на числа, U-Net (а починаючи з версії 3 — дифузійний трансформер), що виконує знешумлення, і декодер, який переводить компактне латентне зображення в пікселі. Саме завдяки роботі в цьому стисненому латентному просторі модель достатньо швидка для споживчої відеокарти.
Які є версії?
- Stable Diffusion 1.5 (2022): зображення 512×512, тисячі донавчених версій і LoRA від спільноти.
- SDXL 1.0 (липень 2023): нативна роздільна здатність 1024×1024, кращі руки, обличчя й композиція, окрема модель refiner для деталей.
- Stable Diffusion 3 Medium (червень 2024): дифузійний трансформер, значно краще відтворює текст і розуміє промпт.
- Stable Diffusion 3.5 (жовтень 2024): актуальний випуск у варіантах Large, Large Turbo та Medium, краще дотримання промпту й різноманітніші стилі.
Докладне порівняння — у посібнику SDXL чи Stable Diffusion 3.
Що можна робити зі Stable Diffusion?
Генерація зображень із тексту — лише початок. Ті самі моделі працюють у режимі image-to-image (перетворити ескіз або фото), роблять inpainting (перемалювати окрему ділянку) та outpainting (домалювати картинку за її межами), збільшують зображення (апскейл) за допомогою спеціальних моделей super-resolution, а з ControlNet генерують за позою, картою глибини чи контурами. Доповнення під назвою LoRA, кожне з яких — невеликий окремий файл, навчають модель стилю або персонажа.
На цьому сайті можна спробувати inpainting і збільшення зображень без облікового запису, генерувати зображення в SDXL або Stable Diffusion 3, а також переглянути 1731 стиль художників і 82 задокументовані промпти, щоб побачити, на що впливає промпт.
Чим Stable Diffusion відрізняється від DALL-E чи Midjourney?
Двома речами: ваги моделі відкриті, і вона працює локально. Модель можна завантажити, безкоштовно запускати на власному комп’ютері, змінювати, а зображення залишаються приватними. Midjourney і моделі OpenAI для генерації зображень (DALL-E, а тепер GPT Image) — закриті сервіси: ви платите за підписку або за кожне зображення, а модель ніколи не залишає їхніх серверів. Натомість Stable Diffusion вимагає від вас більше: вибрати модель, написати точний промпт і негативний промпт, розібратися, що таке seed.
Чи потрібен потужний комп’ютер?
Щоб запускати модель самостійно, для SD 1.5 вистачить сучасної відеокарти NVIDIA щонайменше з 6 ГБ VRAM, а для SDXL — з 8 ГБ. Карти AMD працюють через ROCm на Linux, Apple Silicon — через бекенд MPS. Якщо нічого з цього у вас немає, інструменти цього сайту не потребують власного обладнання: одні працюють на нашому GPU, і чергу та перебіг генерації видно в реальному часі, інші — це вбудовані в сторінку демо на зовнішньому хостингу. Коли будете готові, прочитайте, як встановити Stable Diffusion локально.