SDXL vs Stable Diffusion 3 vs SD 1.5:どれを使うべきか?

著者 更新日 2 分で読めます

速さ、少ない VRAM、最多のコミュニティモデルなら Stable Diffusion 1.5。1024×1024 の精細な画像と画家スタイルなら SDXL 1.0。複数の被写体、読める文字、最高品質を求め、GPU に 12 GB 以上あるなら Stable Diffusion 3.5 を選んでください。

比較表

SD 1.5SDXL 1.0SD 3 MediumSD 3.5 Large
公開2022年10月2023年7月2024年6月2024年10月
パラメータ数9億35億(+ refiner)20億80億
ネイティブ解像度512×5121024×10241024×10241024×1024
VRAM(fp16)4〜6 GB8 GB10 GB16 GB 以上
速度(RTX 3060)約4秒約15秒約20秒約60秒
プロンプト理解キーワードキーワード、構図は改善文章、複数の被写体最良
画像内の文字不可まれに短い文字なら可可
画家名強い強い弱い弱い
コミュニティモデル数千多数少数増加中
ライセンスOpenRAIL-MOpenRAIL++Community licence(売上100万ドル未満は無料)
当サイトで試すSD 1.5SDXLSD 3—

Stable Diffusion 1.5:働き者

小さく、速く、際限なくカスタマイズされています。フォトリアル系とアニメ系の派生モデル、ControlNet、LoRA、embedding が何でも揃っています。弱点は基本解像度 512 px、手、そしてプロンプトの字義どおりの解釈です。6 GB のカード、アニメーション制作、ControlNet 中心の作業では今も正しい選択です。当サイトの会員向け txt2img は SD 1.5 で動いています。

SDXL 1.0:精細さと画風

ピクセル数は4倍、テキストエンコーダは二つ、最後のステップ用に refiner。顔、手、構図が大きく改善され、画家名の効果が強く予測しやすいため、当サイトの1,731人の画家比較は SDXL で生成しました。8 GB が必要で、1.5 より3〜4倍遅くなります。蒸留版(SDXL Turbo、LCM LoRA)なら品質を少し犠牲にして一枚1秒程度に戻せます。

Stable Diffusion 3 と 3.5:理解力と文字

三つのテキストエンコーダを持つ拡散トランスフォーマーという新しいアーキテクチャで、キーワードの列ではなく文章に従います。「a red cube on a blue sphere, to the left of a green cone」が正しく出力され、引用符で囲んだ短い文字も正しく描かれます。3 Medium にあった人体の崩れは 3.5 で修正されました。3.5 Large はこの系列で最良のオープンモデル、3.5 Medium はバランス型です。画家名や従来のネガティブプロンプトの習慣は重要度が下がります。Stable Diffusion 3 Medium をここで試せます。

どれを選ぶか

  • 学習用、6 GB のカード、ControlNet、アニメーション:SD 1.5。
  • イラスト、ポートレート、画家スタイル、8〜12 GB:SDXL。
  • 文字入りポスター、複雑なシーン、12〜16 GB 以上:SD 3.5 Medium または Large。
  • GPU なし:当サイトのオンラインツール、アカウント不要。

よくある質問

SDXL は SD 1.5 より優れていますか?

素の状態ではそうです。解像度が高く、人体と構図が良くなっています。SD 1.5 は速度、VRAM、コミュニティ派生モデルの幅で今も優位です。

SD 1.5 用の LoRA を SDXL や SD 3 で使えますか?

使えません。LoRA は学習したアーキテクチャに結び付いており、系列ごとに専用の LoRA が必要です。

Flux はどうですか?

Black Forest Labs の Flux.1(2024年8月)は120億パラメータの競合モデルで、プロンプトへの忠実さと文字描画が優れています。VRAM を 12〜24 GB 必要とし、Stable Diffusion ではありませんが、同じツール(ComfyUI、Forge)で動きます。