比較表
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| 公開 | 2022年10月 | 2023年7月 | 2024年6月 | 2024年10月 |
| パラメータ数 | 9億 | 35億(+ refiner) | 20億 | 80億 |
| ネイティブ解像度 | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM(fp16) | 4〜6 GB | 8 GB | 10 GB | 16 GB 以上 |
| 速度(RTX 3060) | 約4秒 | 約15秒 | 約20秒 | 約60秒 |
| プロンプト理解 | キーワード | キーワード、構図は改善 | 文章、複数の被写体 | 最良 |
| 画像内の文字 | 不可 | まれに | 短い文字なら可 | 可 |
| 画家名 | 強い | 強い | 弱い | 弱い |
| コミュニティモデル | 数千 | 多数 | 少数 | 増加中 |
| ライセンス | OpenRAIL-M | OpenRAIL++ | Community licence(売上100万ドル未満は無料) | |
| 当サイトで試す | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5:働き者
小さく、速く、際限なくカスタマイズされています。フォトリアル系とアニメ系の派生モデル、ControlNet、LoRA、embedding が何でも揃っています。弱点は基本解像度 512 px、手、そしてプロンプトの字義どおりの解釈です。6 GB のカード、アニメーション制作、ControlNet 中心の作業では今も正しい選択です。当サイトの会員向け txt2img は SD 1.5 で動いています。
SDXL 1.0:精細さと画風
ピクセル数は4倍、テキストエンコーダは二つ、最後のステップ用に refiner。顔、手、構図が大きく改善され、画家名の効果が強く予測しやすいため、当サイトの1,731人の画家比較は SDXL で生成しました。8 GB が必要で、1.5 より3〜4倍遅くなります。蒸留版(SDXL Turbo、LCM LoRA)なら品質を少し犠牲にして一枚1秒程度に戻せます。
Stable Diffusion 3 と 3.5:理解力と文字
三つのテキストエンコーダを持つ拡散トランスフォーマーという新しいアーキテクチャで、キーワードの列ではなく文章に従います。「a red cube on a blue sphere, to the left of a green cone」が正しく出力され、引用符で囲んだ短い文字も正しく描かれます。3 Medium にあった人体の崩れは 3.5 で修正されました。3.5 Large はこの系列で最良のオープンモデル、3.5 Medium はバランス型です。画家名や従来のネガティブプロンプトの習慣は重要度が下がります。Stable Diffusion 3 Medium をここで試せます。
どれを選ぶか
- 学習用、6 GB のカード、ControlNet、アニメーション:SD 1.5。
- イラスト、ポートレート、画家スタイル、8〜12 GB:SDXL。
- 文字入りポスター、複雑なシーン、12〜16 GB 以上:SD 3.5 Medium または Large。
- GPU なし:当サイトのオンラインツール、アカウント不要。