Stable Diffusion はどう動くのか
Stable Diffusion は潜在拡散モデルです。学習時には、キャプション付きの数百万枚の画像からノイズを取り除くことを覚えました。生成時には完全にランダムなノイズから出発し、あなたの文章の方向へ一歩ずつノイズを除去していきます。20〜30ステップ後には、ノイズはプロンプトに合った一枚の絵になっています。
三つの部品が協力します。言葉を数値に変えるテキストエンコーダ、ノイズ除去を担う U-Net(バージョン3以降は拡散トランスフォーマー)、そして圧縮された潜在画像をピクセルに戻すデコーダです。この圧縮された潜在空間で処理することが、家庭用 GPU でも十分速く動く理由です。
どのバージョンがあるのか
- Stable Diffusion 1.5(2022年):512×512 の画像。史上もっともカスタマイズされたモデルで、コミュニティ製の派生モデルと LoRA が数千本あります。
- SDXL 1.0(2023年7月):1024×1024 がネイティブ。手・顔・構図が改善され、細部用の refiner モデルが付属。
- Stable Diffusion 3 Medium(2024年6月):拡散トランスフォーマー。文字の描画とプロンプト理解が大幅に向上。
- Stable Diffusion 3.5(2024年10月):現行版。Large・Large Turbo・Medium の3サイズで、より鮮明な画像と豊かな色彩。
詳しい比較は SDXL と Stable Diffusion 3 の比較をご覧ください。
何ができるのか
テキストから画像を作るのは入口にすぎません。同じモデルで画像から画像(スケッチや写真の変換)、インペインティング(一部だけ描き直す)、アウトペインティング(画像の外側を描き足す)、超解像モデルによる拡大、そして ControlNet を使えばポーズ・深度マップ・輪郭に沿った生成もできます。LoRA と呼ばれる追加ファイルは、数メガバイトで画風やキャラクターを教え込みます。
このサイトでは、アカウントなしでインペインティングと拡大を試し、SDXL や Stable Diffusion 3 で画像を生成し、1,731人の画家のスタイルと69本の記録付きプロンプトを眺めて、プロンプトが何を変えるのかを学べます。
DALL-E や Midjourney と何が違うのか
二点です。重みが公開されていること、そしてローカルで動くことです。モデルをダウンロードして自分のパソコンで無料で動かし、改造し、生成した画像を手元に置いておけます。DALL-E と Midjourney は画像ごとに課金される閉じたサービスです。その代わり Stable Diffusion は、モデルを選び、正確なプロンプトとネガティブプロンプトを書き、シードを理解するという手間を求めます。
高性能なパソコンが必要か
自分で動かすなら、SD 1.5 には VRAM 6 GB 以上の比較的新しい NVIDIA カードで十分で、SDXL には 8 GB あると快適です。AMD カードは Linux 上の ROCm で、Apple Silicon は MPS バックエンドで動きます。どれもない場合でも、このサイトのツールは私たちの GPU で動作し、待ち行列と進捗をリアルタイムで表示します。準備ができたらStable Diffusion をローカルに導入する方法をお読みください。