Tabela porównawcza
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| Premiera | paź 2022 | lip 2023 | cze 2024 | paź 2024 |
| Parametry | 0,9 mld | 2,6 mld (+ refiner) | 2 mld | 8 mld |
| Natywny rozmiar | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM (fp16) | 4–6 GB | 8 GB | 10 GB | 19 GB (11 GB w fp8) |
| Szybkość (nasze GPU 12 GB) | ~4 s | ~20 s | — | — |
| Rozumienie promptu | słowa kluczowe | słowa kluczowe, lepsza kompozycja | zdania, kilka obiektów | najlepsze |
| Tekst na obrazach | nie | rzadko | tak, krótki | tak |
| Nazwiska artystów | silny efekt | silny efekt | słabszy | słabszy |
| Modele społeczności | bardzo dużo | najwięcej, w tym Pony i Illustrious | mało | mało |
| Licencja | OpenRAIL-M | OpenRAIL++ | Community licence (bezpłatna poniżej 1 mln USD przychodu) | |
| Wypróbuj na tej stronie | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5: koń roboczy
Mały, szybki, dostosowywany na niezliczone sposoby. Fotorealistyczne i anime fine-tune'y, modele ControlNet, LoRA i embeddingi istnieją do wszystkiego. Jego słabości to bazowa rozdzielczość 512 px, dłonie i dosłowne czytanie promptów. Pozostaje właściwym wyborem dla karty z 6 GB, do animacji w AnimateDiff i do pracy opartej na ControlNet. Strona txt2img dla zalogowanych w tym serwisie działa na własnym modelu SD 1.5.
SDXL 1.0: detale i styl
SDXL ma cztery razy więcej pikseli, drugi enkoder tekstu i refiner do ostatnich kroków. Twarze, dłonie i kompozycja znacznie się poprawiły, a nazwiska artystów mają silny, przewidywalny efekt, dlatego nasze zestawienie 1731 artystów wygenerowaliśmy w SDXL. Potrzebuje 8 GB i jest kilka razy wolniejszy od 1.5: około 20 s wobec 4 s na obraz na naszym GPU. Wersje destylowane (SDXL Turbo, LCM LoRA) potrzebują tylko od jednego do ośmiu kroków zamiast 25–30, kosztem pewnej utraty jakości.
Stable Diffusion 3 i 3.5: rozumienie i tekst
Nowa architektura (transformer dyfuzyjny z trzema enkoderami tekstu), która podąża za zdaniami zamiast za listami słów kluczowych: „a red cube on a blue sphere, to the left of a green cone” najczęściej wychodzi poprawnie, a krótki tekst w cudzysłowie jest czytelny. 3 Medium miał problemy z anatomią, które 3.5 ograniczył; 3.5 Large to najmocniejszy model rodziny, 3.5 Medium ten wyważony. Nazwiska artystów i stare nawyki z negatywnym promptem mają mniejsze znaczenie. Wypróbuj Stable Diffusion 3 Medium tutaj.
Który wybrać?
- Nauka, karta 6 GB, ControlNet, AnimateDiff: SD 1.5.
- Ilustracja, portrety, style artystów, 8–12 GB: SDXL.
- Plakaty z tekstem, złożone sceny, 12–16 GB+: SD 3.5 Medium lub Large.
- Brak GPU: narzędzia online na tej stronie, bez konta.