SDXL, Stable Diffusion 3 чи SD 1.5: яку модель обрати?

Автор: Оновлено 3 хв читання

Обирайте Stable Diffusion 1.5 заради швидкості, невисоких вимог до VRAM і величезного вибору моделей від спільноти; SDXL 1.0 — для деталізованих зображень 1024×1024 і стилів художників; Stable Diffusion 3.5 — для промптів із кількома об’єктами, розбірливого тексту й найвищої якості, якщо ваша відеокарта має 12 ГБ або більше.

Порівняльна таблиця

SD 1.5SDXL 1.0SD 3 MediumSD 3.5 Large
Релізжовтень 2022липень 2023червень 2024жовтень 2024
Параметри0,9 млрд2,6 млрд (+ refiner)2 млрд8 млрд
Нативний розмір512×5121024×10241024×10241024×1024
VRAM (fp16)4–6 ГБ8 ГБ10 ГБ19 ГБ (11 ГБ у fp8)
Швидкість (наш GPU на 12 ГБ)~4 с~20 с——
Розуміння промптуключові словаключові слова, краща композиціяречення, кілька об’єктівнайкраще
Текст на зображенняхнірідкотак, короткийтак
Імена художниківсильний впливсильний впливслабший впливслабший вплив
Моделі спільнотидуже багатонайбільше, разом із Pony та Illustriousмаломало
ЛіцензіяOpenRAIL-MOpenRAIL++Community License (безкоштовно за доходу до 1 млн доларів)
Спробувати на сайтіSD 1.5SDXLSD 3—

Stable Diffusion 1.5: робоча конячка

Невелика, швидка, з безліччю модифікацій. Фотореалістичні й аніме-версії, моделі ControlNet, LoRA та ембединги є буквально для всього. Слабкі місця — базова роздільна здатність 512 пікселів, руки й буквальне прочитання промптів. Вона лишається правильним вибором для карти з 6 ГБ, для анімації в AnimateDiff і для роботи, де багато ControlNet. Сторінка txt2img для зареєстрованих користувачів цього сайту працює на модифікованій моделі SD 1.5.

SDXL 1.0: деталі та стиль

Учетверо більше пікселів, другий текстовий енкодер, refiner для останніх кроків. Обличчя, руки й композиція помітно покращилися, а імена художників дають сильний і передбачуваний ефект — саме тому наше порівняння 1731 художника згенеровано в SDXL. Моделі потрібно 8 ГБ, і вона в кілька разів повільніша за 1.5: приблизно 20 с проти 4 с на зображення на нашому GPU. Дистильованим версіям (SDXL Turbo, LCM LoRA) вистачає від одного до восьми кроків замість 25–30, ціною певної втрати якості.

Stable Diffusion 3 і 3.5: розуміння й текст

Нова архітектура (дифузійний трансформер із трьома текстовими енкодерами) сприймає речення, а не списки ключових слів: «a red cube on a blue sphere, to the left of a green cone» здебільшого виходить правильно, а короткий текст у лапках зазвичай розбірливий. Версія 3 Medium мала проблеми з анатомією, яких у 3.5 поменшало; 3.5 Large — найпотужніша модель родини, 3.5 Medium — збалансована. Імена художників і старі звички щодо негативного промпту тут важать менше. Спробуйте Stable Diffusion 3 Medium на цьому сайті.

Що ж обрати?

  • Перші кроки, карта з 6 ГБ, ControlNet, AnimateDiff: SD 1.5.
  • Ілюстрація, портрети, стилі художників, 8–12 ГБ: SDXL.
  • Постери з текстом, складні сцени, 12–16 ГБ і більше: SD 3.5 Medium або Large.
  • Без відеокарти: онлайн-інструменти цього сайту, обліковий запис не потрібен.
Спробуйте просто зараз, безкоштовноСпробувати Stable Diffusion 3 Medium онлайн →

Часті запитання

Чи SDXL краща за SD 1.5?

Без додаткових налаштувань — так: вища роздільна здатність, краща анатомія й композиція. SD 1.5 зберігає перевагу у швидкості й вимогах до VRAM і досі має величезну бібліотеку донавчених моделей від спільноти.

Чи можна використовувати LoRA для SD 1.5 із SDXL або SD 3?

Ні. LoRA прив’язана до архітектури, на якій її навчали; кожній родині моделей потрібні власні LoRA.

А як щодо Flux?

Flux.1 від Black Forest Labs (серпень 2024) — конкурент на 12 млрд параметрів, який чудово дотримується промпту й відтворює текст; у листопаді 2025 року вийшов Flux.2. Жоден із них не є моделлю Stable Diffusion. ComfyUI запускає обидва, а Forge — Flux.1, повний чекпойнт якого важить 24 ГБ; квантовані версії вміщуються на карти з 6–12 ГБ.