Mi az a LoRA a Stable Diffusionban?

Írta: Frissítve 3 perc olvasás

A LoRA (Low-Rank Adaptation) egy kis, néhány megabájtos vagy legfeljebb néhány száz megabájtos fájl, amely stílust, karaktert, terméket vagy fogalmat ad egy meglévő Stable Diffusion modellhez anélkül, hogy újra kellene tanítani. Az alapmodell mellé töltöd be, súlyt adsz neki, és egyszerre többet is kombinálhatsz.

Hogyan működik a LoRA

Egy teljes modell finomhangolása több százmillió vagy milliárd súly átírását jelenti, az eredmény pedig 2–7 GB-os fájl SD 1.5-höz vagy SDXL-hez. A LoRA befagyasztja a modellt, és csak kis mátrixpárokat tanít, főleg az attention rétegek mellett; a párok szorzata közelíti a változást. Az eredmény egy kis fájlban ragadja meg az „újdonságot”, és generáláskor egy szorzóval alkalmazza a program. Tíz-harminc kép gyakran elég egy LoRA betanításához otthoni GPU-n, az alapmodelltől függően perceken belül vagy néhány óra alatt.

Hogyan használj LoRA-t

  1. Tölts le egy, az alapmodelledhez készült LoRA-t: az SD 1.5-ös LoRA nem működik SDXL-lel, és fordítva; az SD 3.5-nek sajátja van.
  2. Tedd a fájlt az Automatic1111 models/Lora mappájába (vagy a ComfyUI, a Forge, illetve a Fooocus megfelelő mappájába).
  3. Az Automatic1111-ben, a Forge-ban és a Fooocusban a promptból hívd meg így: <lora:filename:0.8>; a ComfyUI-ban ehelyett adj hozzá egy Load LoRA csomópontot. A szám a súly; 0,6–1,0 a szokásos tartomány.
  4. Add hozzá a szerző által megadott trigger szót, ha van (karakternév, stílustoken).
  5. Hangold be: ha túl erős, minden kép egyforma lesz, ha túl gyenge, semmi sem változik.

LoRA-k kombinálása

Több LoRA egymásra rakható: egy stílus 0,7-en, egy karakter 0,8-on, egy részletjavító 0,4-en. Minél többet adsz hozzá, annál lejjebb vedd az egyes súlyokat, és hangolás közben rögzítsd a seedet, különben nem tudod megmondani, melyik mit csinál. Az azonos fogalomra tanított LoRA-k egymás ellen dolgoznak; válassz egyet.

LoRA, embedding, checkpoint: melyiket válaszd?

TípusMéretMire jóHogyan használod
Checkpoint (finomhangolás)2–7 GB (SD 1.5, SDXL)egy teljes esztétika (realisztikus, anime)az alapmodell helyére lép
LoRAnéhány MB-tól néhány száz MB-igstílus, karakter, tárgy, póz<lora:name:weight> a promptban, vagy Load LoRA csomópont a ComfyUI-ban
Textual inversion (embedding)néhány KB-tól 100 KB-igegyetlen token, gyakran negatíva token neve a promptban

Bevált felállás egy jó checkpoint, képenként cserélt LoRA-kkal.

Hol találsz LoRA-kat

A Civitai és a Hugging Face tízezreket tárol mintaképekkel, trigger szavakkal és a szükséges alapmodell megjelölésével. Nézd meg a licencet: némelyik tiltja a kereskedelmi használatot, a Civitai pedig 2025 májusában eltávolította a valós személyekről készült LoRA-kat. Stílusokhoz jó alternatíva a művészi stílusok összehasonlítása: egy név a promptban gyakran ugyanazt tudja, mint egy stílus-LoRA, letöltés nélkül.

Gyakori kérdések a témában

Lassítja a LoRA a generálást?

Alig: az Automatic1111 és a ComfyUI a mintavételezés előtt beolvasztja a LoRA-t a modell súlyaiba, így minden lépés ugyanannyiba kerül. Csak maga a beolvasztás tart egy pillanatig, amikor betöltesz vagy cserélsz egy LoRA-t.

Használhatok LoRA-kat ezen az oldalon?

Sajátot nem. Az eszközök rögzített modellekkel futnak, amelyekhez az oldal már hozzáad kis részlet- és noise-offset LoRA-kat. A tagok txt2img oldalain a jövőben elérhetővé válhatnak konkrét LoRA-k.

Mit jelent a szám a <lora:name:0.8>-ban?

Azt az erősséget, amellyel a LoRA változásai érvényesülnek: az 1,0 az, amit a szerző betanított, a 0,5 a fele, az 1,2 fölötti értékek általában eltorzítják a képet.