Was ist Stable Diffusion?

Von Aktualisiert am 3 Min. Lesezeit

Stable Diffusion ist eine quelloffene künstliche Intelligenz, die eine Textbeschreibung in ein Bild verwandelt. Im August 2022 von Stability AI veröffentlicht, läuft sie auf einer gewöhnlichen Gaming-Grafikkarte, kann von jedem nachtrainiert werden und treibt Tausende kostenloser Werkzeuge an, auch die dieser Seite.

Wie funktioniert Stable Diffusion?

Stable Diffusion ist ein latentes Diffusionsmodell. Beim Training hat es gelernt, aus Millionen von Bildern mit Bildunterschriften das Rauschen zu entfernen. Bei der Erzeugung startet es mit reinem Zufallsrauschen und entrauscht es Schritt für Schritt in Richtung Ihres Textes: Nach 20 bis 30 Schritten ist aus dem Rauschen ein Bild geworden, das zum Prompt passt.

Drei Teile arbeiten zusammen: ein Text-Encoder, der Ihre Wörter in Zahlen übersetzt, ein U-Net (seit Version 3 ein Diffusion-Transformer), das entrauscht, und ein Decoder, der das kompakte latente Bild in Pixel umwandelt. Die Arbeit in diesem komprimierten latenten Raum macht das Modell schnell genug für eine Consumer-GPU.

Welche Versionen gibt es?

  • Stable Diffusion 1.5 (2022): Bilder in 512×512, das am stärksten angepasste Modell überhaupt, Tausende Community-Feintunings und LoRAs.
  • SDXL 1.0 (Juli 2023): nativ 1024×1024, bessere Hände, Gesichter und Komposition, ein Refiner-Modell für Details.
  • Stable Diffusion 3 Medium (Juni 2024): Diffusion-Transformer, deutlich bessere Textdarstellung und Prompt-Verständnis.
  • Stable Diffusion 3.5 (Oktober 2024): die aktuelle Version in den Größen Large, Large Turbo und Medium, schärfere Bilder und reichere Farben.

Den ausführlichen Vergleich finden Sie unter SDXL gegen Stable Diffusion 3.

Was kann man damit machen?

Text-zu-Bild ist nur der Anfang. Dieselben Modelle beherrschen Bild-zu-Bild (eine Skizze oder ein Foto umwandeln), Inpainting (einen Bereich neu malen), Outpainting (ein Bild erweitern), Hochskalieren mit eigenen Superresolution-Modellen und, mit ControlNet, eine Erzeugung, die von einer Pose, einer Tiefenkarte oder Kanten geführt wird. Erweiterungen namens LoRA bringen dem Modell in wenigen Megabyte einen Stil oder eine Figur bei.

Auf dieser Seite können Sie Inpainting und Hochskalieren ohne Konto ausprobieren, Bilder mit SDXL oder Stable Diffusion 3 erzeugen und 1.731 Künstlerstile sowie 69 dokumentierte Prompts durchsehen, um zu verstehen, was ein Prompt bewirkt.

Worin unterscheidet es sich von DALL-E oder Midjourney?

In zwei Punkten: Die Gewichte sind öffentlich und es läuft lokal. Sie können das Modell herunterladen, kostenlos auf dem eigenen Rechner ausführen, verändern und Ihre Bilder für sich behalten. DALL-E und Midjourney sind geschlossene Dienste, die pro Bild abrechnen. Dafür verlangt Stable Diffusion mehr von Ihnen: ein Modell wählen, einen präzisen Prompt und einen Negativ-Prompt schreiben und den Seed verstehen.

Brauche ich einen starken Rechner?

Um es selbst zu betreiben, reicht für SD 1.5 eine aktuelle NVIDIA-Karte mit mindestens 6 GB VRAM, für SDXL sind 8 GB angenehm. AMD-Karten laufen über ROCm unter Linux, Apple Silicon über das MPS-Backend. Wenn Sie nichts davon haben, laufen die Werkzeuge dieser Seite auf unserer GPU, mit Warteschlange und Fortschritt in Echtzeit. Lesen Sie wie man Stable Diffusion lokal installiert, wenn Sie so weit sind.

Häufige Fragen

Ist Stable Diffusion kostenlos?

Ja. Die Modelle stehen unter offenen Lizenzen (CreativeML OpenRAIL-M für 1.5 und SDXL, Stability AI Community Licence für 3.x, kostenlos unter einer Million Dollar Jahresumsatz). Lokal kostet der Betrieb nur Strom; die Werkzeuge dieser Seite sind kostenlos.

Wem gehören die erzeugten Bilder?

Ihnen, was die Lizenz betrifft: Stability AI beansprucht keine Rechte an den Ergebnissen. Das Urheberrecht an KI-Bildern ist je nach Land verschieden und noch im Fluss; in der EU und den USA sind rein KI-generierte Bilder in der Regel nicht schutzfähig.

Kann Stable Diffusion Text in Bildern erzeugen?

Die Versionen 1.5 und SDXL tun sich schwer damit. Stable Diffusion 3 und 3.5 stellen kurze Texte, Titel und Logos zuverlässig dar, wenn die Wörter im Prompt in Anführungszeichen stehen.