SDXL vs Stable Diffusion 3 vs SD 1.5: welches sollten Sie nutzen?

Von Aktualisiert am 2 Min. Lesezeit

Nehmen Sie Stable Diffusion 1.5 für Tempo, wenig VRAM und die größte Auswahl an Community-Modellen; SDXL 1.0 für detaillierte Bilder in 1024×1024 und Künstlerstile; Stable Diffusion 3.5 für Prompts mit mehreren Motiven, lesbaren Text und die beste Qualität, wenn Ihre GPU 12 GB oder mehr hat.

Vergleichstabelle

SD 1.5SDXL 1.0SD 3 MediumSD 3.5 Large
VeröffentlichungOkt. 2022Juli 2023Juni 2024Okt. 2024
Parameter0,9 Mrd.3,5 Mrd. (+ Refiner)2 Mrd.8 Mrd.
Native Größe512×5121024×10241024×10241024×1024
VRAM (fp16)4–6 GB8 GB10 GB16 GB+
Tempo (RTX 3060)~4 s~15 s~20 s~60 s
Prompt-VerständnisStichwörterStichwörter, bessere KompositionSätze, mehrere Motiveam besten
Text im Bildneinseltenja, kurzja
Künstlernamenstarkstarkschwachschwach
Community-ModelleTausendevielewenigewachsend
LizenzOpenRAIL-MOpenRAIL++Community-Lizenz (kostenlos unter 1 Mio. $ Umsatz)
Auf dieser Seite testenSD 1.5SDXLSD 3—

Stable Diffusion 1.5: das Arbeitspferd

Klein, schnell, endlos angepasst. Es gibt fotorealistische und Anime-Feintunings, ControlNet-Modelle, LoRAs und Embeddings für alles. Seine Schwächen sind die Basisauflösung von 512 px, Hände und ein wörtliches Lesen der Prompts. Für eine 6-GB-Karte, für Animations-Pipelines und ControlNet-lastige Arbeit bleibt es die richtige Wahl. Das txt2img für Mitglieder dieser Seite läuft mit SD 1.5.

SDXL 1.0: Detail und Stil

Viermal so viele Pixel, ein zweiter Text-Encoder, ein Refiner für die letzten Schritte. Gesichter, Hände und Komposition haben sich stark verbessert, und Künstlernamen wirken stark und vorhersehbar, weshalb unser Vergleich von 1.731 Künstlern mit SDXL erzeugt wurde. Es braucht 8 GB und ist drei- bis viermal langsamer als 1.5. Destillierte Varianten (SDXL Turbo, LCM LoRA) bringen es auf eine Sekunde pro Bild, bei etwas Qualitätsverlust.

Stable Diffusion 3 und 3.5: Verständnis und Text

Eine neue Architektur (Diffusion-Transformer mit drei Text-Encodern), die Sätzen statt Stichwortlisten folgt: „a red cube on a blue sphere, to the left of a green cone“ kommt richtig heraus, und kurzer Text in Anführungszeichen wird korrekt dargestellt. 3 Medium hatte Anatomieprobleme, die 3.5 behoben hat; 3.5 Large ist das beste offene Modell der Familie, 3.5 Medium das ausgewogene. Künstlernamen und alte Negativ-Prompt-Gewohnheiten zählen weniger. Testen Sie Stable Diffusion 3 Medium hier.

Welches sollten Sie wählen?

  • Lernen, 6-GB-Karte, ControlNet, Animation: SD 1.5.
  • Illustration, Porträts, Künstlerstile, 8–12 GB: SDXL.
  • Poster mit Text, komplexe Szenen, 12–16 GB+: SD 3.5 Medium oder Large.
  • Keine GPU: die Online-Werkzeuge dieser Seite, ohne Konto.

Häufige Fragen

Ist SDXL besser als SD 1.5?

Von Haus aus ja: höhere Auflösung, bessere Anatomie und Komposition. SD 1.5 behält den Vorsprung bei Tempo, VRAM und der Breite der Community-Feintunings.

Kann ich SD-1.5-LoRAs mit SDXL oder SD 3 verwenden?

Nein. Ein LoRA ist an die Architektur gebunden, auf der es trainiert wurde; jede Familie braucht ihre eigenen LoRAs.

Und Flux?

Flux.1 von Black Forest Labs (August 2024) ist ein Konkurrent mit 12 Milliarden Parametern, hervorragender Prompt-Treue und Textdarstellung; es braucht 12 bis 24 GB VRAM und ist kein Stable-Diffusion-Modell, läuft aber mit denselben Werkzeugen (ComfyUI, Forge).