Wie funktioniert Stable Diffusion?
Stable Diffusion ist ein latentes Diffusionsmodell. Beim Training hat es gelernt, aus Millionen von Bildern mit Bildunterschriften das Rauschen zu entfernen. Bei der Erzeugung startet es mit reinem Zufallsrauschen und entrauscht es Schritt für Schritt in Richtung Ihres Textes: Nach 20 bis 30 Schritten ist aus dem Rauschen ein Bild geworden, das zum Prompt passt.
Drei Teile arbeiten zusammen: ein Text-Encoder, der Ihre Wörter in Zahlen übersetzt, ein U-Net (seit Version 3 ein Diffusion-Transformer), das entrauscht, und ein Decoder, der das kompakte latente Bild in Pixel umwandelt. Die Arbeit in diesem komprimierten latenten Raum macht das Modell schnell genug für eine Consumer-GPU.
Welche Versionen gibt es?
- Stable Diffusion 1.5 (2022): Bilder in 512×512, das am stärksten angepasste Modell überhaupt, Tausende Community-Feintunings und LoRAs.
- SDXL 1.0 (Juli 2023): nativ 1024×1024, bessere Hände, Gesichter und Komposition, ein Refiner-Modell für Details.
- Stable Diffusion 3 Medium (Juni 2024): Diffusion-Transformer, deutlich bessere Textdarstellung und Prompt-Verständnis.
- Stable Diffusion 3.5 (Oktober 2024): die aktuelle Version in den Größen Large, Large Turbo und Medium, schärfere Bilder und reichere Farben.
Den ausführlichen Vergleich finden Sie unter SDXL gegen Stable Diffusion 3.
Was kann man damit machen?
Text-zu-Bild ist nur der Anfang. Dieselben Modelle beherrschen Bild-zu-Bild (eine Skizze oder ein Foto umwandeln), Inpainting (einen Bereich neu malen), Outpainting (ein Bild erweitern), Hochskalieren mit eigenen Superresolution-Modellen und, mit ControlNet, eine Erzeugung, die von einer Pose, einer Tiefenkarte oder Kanten geführt wird. Erweiterungen namens LoRA bringen dem Modell in wenigen Megabyte einen Stil oder eine Figur bei.
Auf dieser Seite können Sie Inpainting und Hochskalieren ohne Konto ausprobieren, Bilder mit SDXL oder Stable Diffusion 3 erzeugen und 1.731 Künstlerstile sowie 69 dokumentierte Prompts durchsehen, um zu verstehen, was ein Prompt bewirkt.
Worin unterscheidet es sich von DALL-E oder Midjourney?
In zwei Punkten: Die Gewichte sind öffentlich und es läuft lokal. Sie können das Modell herunterladen, kostenlos auf dem eigenen Rechner ausführen, verändern und Ihre Bilder für sich behalten. DALL-E und Midjourney sind geschlossene Dienste, die pro Bild abrechnen. Dafür verlangt Stable Diffusion mehr von Ihnen: ein Modell wählen, einen präzisen Prompt und einen Negativ-Prompt schreiben und den Seed verstehen.
Brauche ich einen starken Rechner?
Um es selbst zu betreiben, reicht für SD 1.5 eine aktuelle NVIDIA-Karte mit mindestens 6 GB VRAM, für SDXL sind 8 GB angenehm. AMD-Karten laufen über ROCm unter Linux, Apple Silicon über das MPS-Backend. Wenn Sie nichts davon haben, laufen die Werkzeuge dieser Seite auf unserer GPU, mit Warteschlange und Fortschritt in Echtzeit. Lesen Sie wie man Stable Diffusion lokal installiert, wenn Sie so weit sind.