Was ist ein LoRA in Stable Diffusion?

Von Aktualisiert am 2 Min. Lesezeit

Ein LoRA (Low-Rank Adaptation) ist eine kleine Datei, meist 20 bis 150 MB, die einem bestehenden Stable-Diffusion-Modell einen Stil, eine Figur, ein Produkt oder ein Konzept hinzufügt, ohne es neu zu trainieren. Sie laden es neben dem Basismodell, rufen es im Prompt mit einem Gewicht auf und können mehrere zugleich kombinieren.

Wie ein LoRA funktioniert

Ein ganzes Modell feinzutunen heißt, Milliarden Gewichte umzuschreiben und eine 2 bis 7 GB große Datei zu erzeugen. Ein LoRA friert das Modell ein und trainiert nur zwei kleine Matrizen pro Attention-Schicht, deren Produkt die Änderung annähert. Das Ergebnis fasst „das Neue“ in wenigen Megabyte zusammen und wird zur Laufzeit mit einem Multiplikator angewendet. Zehn bis dreißig Bilder und ein paar Minuten auf einer Consumer-GPU reichen, um eines zu trainieren.

So verwenden Sie ein LoRA

  1. Laden Sie ein LoRA für Ihr Basismodell herunter: Ein SD-1.5-LoRA funktioniert nicht mit SDXL und umgekehrt; SD 3.5 hat eigene.
  2. Legen Sie die Datei in models/Lora von Automatic1111 (oder den entsprechenden Ordner von ComfyUI, Forge, Fooocus).
  3. Rufen Sie es im Prompt auf: <lora:dateiname:0.8>. Die Zahl ist das Gewicht; 0,6 bis 1,0 ist der übliche Bereich.
  4. Fügen Sie das Triggerwort des Autors hinzu, falls es eines gibt (ein Figurenname, ein Stil-Token).
  5. Justieren Sie: zu stark, und jedes Bild sieht gleich aus; zu schwach, und nichts ändert sich.

LoRAs kombinieren

Mehrere LoRAs lassen sich stapeln: ein Stil mit 0,7, eine Figur mit 0,8, ein Detailverstärker mit 0,4. Halten Sie die Summe der Gewichte bei höchstens etwa 1,5 bis 2 und fixieren Sie den Seed, während Sie sie abstimmen, sonst wissen Sie nicht, was jedes einzelne tut. LoRAs, die auf dasselbe Konzept trainiert wurden, bekämpfen sich; nehmen Sie eines.

LoRA, Embeddings, Checkpoints: was wählen?

TypGrößeAm besten fürAnwendung
Checkpoint (Feintuning)2–7 GBeine ganze Ästhetik (realistisch, Anime)ersetzt das Basismodell
LoRA20–150 MBein Stil, eine Figur, ein Objekt, eine Pose<lora:name:gewicht> im Prompt
Textual Inversion (Embedding)10–100 KBein einzelnes Token, oft negativder Token-Name im Prompt

Die meisten fahren mit einem guten Checkpoint und wechseln die LoRAs je nach Bild.

Wo man LoRAs findet

Civitai und Hugging Face hosten Zehntausende, mit Beispielbildern, Triggerwörtern und dem benötigten Basismodell. Prüfen Sie die Lizenz: Viele verbieten kommerzielle Nutzung oder die Nachbildung realer Personen. Unser Künstlerstil-Vergleich ist eine gute Alternative für Stile: Ein Name im Prompt bewirkt oft, was ein Stil-LoRA bewirken würde, ganz ohne Download.

Häufige Fragen

Verlangsamt ein LoRA die Erzeugung?

Kaum: Es fügt pro Schritt ein paar kleine Matrixmultiplikationen hinzu. Das erste Laden dauert ein bis zwei Sekunden, danach ist der Aufwand vernachlässigbar.

Kann ich LoRAs auf dieser Seite verwenden?

Noch nicht: Die öffentlichen Werkzeuge laufen mit festen Modellen. Die txt2img-Seiten für Mitglieder könnten künftig bestimmte LoRAs anbieten.

Was bedeutet die Zahl in <lora:name:0.8>?

Die Stärke, mit der die Änderungen des LoRA angewendet werden: 1,0 entspricht dem, was der Autor trainiert hat, 0,5 dem halben Effekt, Werte über 1,2 verzerren das Bild meist.