Stable Diffusion 如何工作?
Stable Diffusion 是一个潜在扩散模型。训练时,它从数百万张带有描述文字的图片中学会了去除噪声。生成时,它从纯随机噪声出发,按照你的文字一步步去噪:经过 20 到 30 步后,噪声就变成了一幅符合提示词的图像。
三个部分协同工作:把文字转换为数字的文本编码器,负责去噪的 U-Net(从第 3 版起改为扩散 Transformer),以及把紧凑的潜在图像还原为像素的解码器。正是在这个压缩的潜在空间中运算,才让它在消费级显卡上也足够快。
有哪些版本?
- Stable Diffusion 1.5(2022 年):512×512 图像,有史以来被定制最多的模型,社区微调模型和 LoRA 数以千计。
- SDXL 1.0(2023 年 7 月):原生 1024×1024,手部、面部和构图更好,并附带用于细节的 refiner 模型。
- Stable Diffusion 3 Medium(2024 年 6 月):扩散 Transformer,文字渲染和提示词理解大幅提升。
- Stable Diffusion 3.5(2024 年 10 月):当前版本,分 Large、Large Turbo 和 Medium 三种规模,图像更清晰、色彩更丰富。
详细对比见SDXL 与 Stable Diffusion 3 对比。
能用它做什么?
文生图只是开始。同样的模型还能做图生图(把草图或照片变成新图)、局部重绘(只重画一个区域)、扩图(向外延伸画面)、用超分辨率模型放大,配合 ControlNet 还能按姿势、深度图或边缘来引导生成。名为 LoRA 的小型扩展文件只需几兆字节就能教会它一种画风或一个角色。
在本站,你可以免注册体验局部重绘和放大,用 SDXL 或 Stable Diffusion 3 生成图像,并浏览 1,731 位画家的风格和 69 条带参数的提示词,了解提示词到底改变了什么。
它与 DALL-E 或 Midjourney 有什么不同?
两点:权重是公开的,而且可以在本地运行。你可以下载模型,在自己的电脑上免费运行、修改,并把图片留在本地。DALL-E 和 Midjourney 是按张收费的封闭服务。作为交换,Stable Diffusion 对你要求更多:选择模型,写出精确的提示词和负面提示词,理解种子。
需要高性能电脑吗?
自己运行的话,SD 1.5 只需一张显存 6 GB 以上的较新 NVIDIA 显卡,SDXL 有 8 GB 会更舒适。AMD 显卡可通过 Linux 上的 ROCm 运行,Apple Silicon 则通过 MPS 后端。如果这些都没有,本站的工具运行在我们的 GPU 上,排队和进度实时显示。准备好后,请阅读如何在本地安装 Stable Diffusion。