SDXL vs Stable Diffusion 3 vs SD 1.5: melyiket használd?

Írta: Frissítve 3 perc olvasás

A Stable Diffusion 1.5-öt válaszd a sebességért, a kevés VRAM-ért és a rengeteg közösségi modellért; az SDXL 1.0-át részletes 1024×1024-es képekhez és művészi stílusokhoz; a Stable Diffusion 3.5-öt több témájú promptokhoz, olvasható szöveghez és a legjobb minőséghez, ha a GPU-d legalább 12 GB-os.

Összehasonlító táblázat

SD 1.5SDXL 1.0SD 3 MediumSD 3.5 Large
Megjelenés2022. okt.2023. júl.2024. jún.2024. okt.
Paraméterek0,9 Mrd2,6 Mrd (+ refiner)2 Mrd8 Mrd
Natív méret512×5121024×10241024×10241024×1024
VRAM (fp16)4–6 GB8 GB10 GB19 GB (fp8-ban 11 GB)
Sebesség (a mi 12 GB-os GPU-nkon)~4 mp~20 mp——
Promptértelmezéskulcsszavakkulcsszavak, jobb kompozíciómondatok, több témaa legjobb
Szöveg a képennemritkánigen, rövidigen
Művésznevekerőserősgyengébbgyengébb
Közösségi modelleknagyon soka legtöbb, Ponyval és Illustriousszalkevéskevés
LicencOpenRAIL-MOpenRAIL++Community licenc (1 millió dollár bevétel alatt ingyenes)
Kipróbálás az oldalonSD 1.5SDXLSD 3—

Stable Diffusion 1.5: az igásló

Kicsi, gyors, végtelenül testreszabott. Mindenhez létezik fotorealisztikus és anime finomhangolás, ControlNet-modell, LoRA és embedding. Gyengéi az 512 px-es alapfelbontás, a kezek és a promptok szó szerinti olvasása. Továbbra is ez a jó választás 6 GB-os kártyához, AnimateDiff-animációhoz és ControlNet-igényes munkához. Az oldal tagoknak szóló txt2img oldala egy egyedi SD 1.5 modellt futtat.

SDXL 1.0: részlet és stílus

Az SDXL-nek négyszer annyi pixele, második szövegkódolója és az utolsó lépésekhez refinere van. Az arcok, a kezek és a kompozíció sokat javultak, a művésznevek pedig erős, kiszámítható hatásúak, ezért készült 1731 művészes összehasonlításunk SDXL-lel. 8 GB kell neki, és többszörösen lassabb az 1.5-nél: a mi GPU-nkon körülbelül 20 mp egy kép a 4 mp-cel szemben. A desztillált változatok (SDXL Turbo, LCM LoRA) 25–30 helyett egy-nyolc lépéssel beérik, némi minőségveszteség árán.

Stable Diffusion 3 és 3.5: értelmezés és szöveg

Új architektúra (diffúziós transzformer három szövegkódolóval), amely kulcsszólisták helyett mondatokat követ: az „a red cube on a blue sphere, to the left of a green cone” többnyire jól jön ki, és az idézőjelbe tett rövid szöveg olvasható. A 3 Mediumnak anatómiai gondjai voltak, ezeket a 3.5 mérsékelte; a 3.5 Large a család legtöbbet tudó tagja, a 3.5 Medium a kiegyensúlyozott. A művésznevek és a régi negatív prompt szokások kevésbé számítanak. Próbáld ki itt a Stable Diffusion 3 Mediumot.

Melyiket válaszd?

  • Tanulás, 6 GB-os kártya, ControlNet, AnimateDiff: SD 1.5.
  • Illusztráció, portrék, művészi stílusok, 8–12 GB: SDXL.
  • Szöveges plakátok, összetett jelenetek, 12–16 GB+: SD 3.5 Medium vagy Large.
  • Nincs GPU: az oldal online eszközei, fiók nélkül.

Gyakori kérdések a témában

Jobb az SDXL az SD 1.5-nél?

Alapból igen: nagyobb felbontás, jobb anatómia és kompozíció. Az SD 1.5 sebességben és VRAM-igényben tartja az előnyét, és még mindig hatalmas közösségi finomhangolás-könyvtára van.

Használhatok SD 1.5 LoRA-kat SDXL-lel vagy SD 3-mal?

Nem. A LoRA ahhoz az architektúrához kötődik, amelyen tanították; minden családnak saját LoRA-k kellenek.

És a Flux?

A Black Forest Labs Flux.1 modellje (2024. augusztus) egy 12 milliárd paraméteres versenytárs kiváló promptkövetéssel és szövegmegjelenítéssel; a Flux.2 2025 novemberében érkezett. Egyik sem Stable Diffusion modell. A ComfyUI mindkettőt futtatja, a Forge a Flux.1-et, amelynek teljes checkpointja 24 GB; a kvantált változatok elférnek 6–12 GB-os kártyán.