Stable Diffusion の LoRA とは?

著者 更新日 2 分で読めます

LoRA(Low-Rank Adaptation)は通常 20〜150 MB の小さなファイルで、既存の Stable Diffusion モデルを再学習することなく、画風、キャラクター、製品、概念を追加します。ベースモデルの隣に置き、プロンプトから重み付きで呼び出し、複数を同時に組み合わせることもできます。

LoRA の仕組み

モデル全体を追加学習すると数十億の重みを書き換え、2〜7 GB のファイルができます。LoRA はモデルを凍結し、各アテンション層で二つの小さな行列だけを学習します。その積が変化を近似します。結果として「新しく覚えたこと」が数メガバイトに収まり、生成時に係数を掛けてその場で適用されます。10〜30枚の画像と家庭用 GPU で数分あれば一つ学習できます。

LoRA の使い方

  1. 自分のベースモデル向けの LoRA をダウンロードします。SD 1.5 用は SDXL では動かず、逆も同じです。SD 3.5 には専用のものがあります。
  2. ファイルを Automatic1111 の models/Lora(ComfyUI、Forge、Fooocus では相当するフォルダ)に置きます。
  3. プロンプトで呼び出します:<lora:ファイル名:0.8>。数値が重みで、0.6〜1.0 が通常の範囲です。
  4. 作者が指定するトリガーワードがあれば追加します(キャラクター名や画風のトークン)。
  5. 調整します。強すぎると全画像が同じに見え、弱すぎると何も変わりません。

LoRA の組み合わせ

複数の LoRA は重ねられます。画風を 0.7、キャラクターを 0.8、ディテール強化を 0.4 といった具合です。重みの合計は多くても 1.5〜2 程度に抑え、調整中はシードを固定してください。そうしないとどれが何をしているのか分かりません。同じ概念で学習した LoRA 同士はぶつかるので、一つに絞りましょう。

LoRA・embedding・checkpoint、どれを選ぶか

種類サイズ向いている用途使い方
Checkpoint(追加学習モデル)2〜7 GB全体的な作風(リアル系、アニメ系)ベースモデルを置き換える
LoRA20〜150 MB画風、キャラクター、物体、ポーズプロンプトに <lora:名前:重み>
Textual inversion(embedding)10〜100 KB単一トークン、ネガティブ用が多いプロンプトにトークン名

多くの人は良い checkpoint を一つ使い、画像ごとに LoRA を切り替えています。

LoRA の入手先

Civitai と Hugging Face には数万本の LoRA が、サンプル画像、トリガーワード、必要なベースモデルとともに公開されています。ライセンスを確認してください。商用利用や実在の人物の再現を禁じるものが多くあります。画風なら当サイトの画家スタイル比較も良い代替手段です。プロンプトに画家名を書くだけで、画風 LoRA と同じ効果が得られることがよくあり、何もダウンロードせずに済みます。

よくある質問

LoRA を使うと生成は遅くなりますか?

ほとんど変わりません。各ステップに小さな行列の掛け算が少し増えるだけです。初回の読み込みに1〜2秒かかりますが、その後の負荷は無視できます。

このサイトで LoRA は使えますか?

まだ使えません。公開ツールは固定のモデルで動いています。会員向けの txt2img ページで将来特定の LoRA を提供するかもしれません。

<lora:名前:0.8> の数値は何ですか?

LoRA の変更を適用する強さです。1.0 が作者の学習どおり、0.5 が半分の効果で、1.2 を超えるとたいてい画像が歪みます。