什么是 Stable Diffusion?

作者 更新于 2 分钟阅读

Stable Diffusion 是一款开源的人工智能,能把一段文字描述变成图像。它由 Stability AI 于 2022 年 8 月发布,可以在普通的游戏显卡上运行,任何人都能对它进行微调,它驱动着成千上万的免费工具,包括本站的工具。

Stable Diffusion 如何工作?

Stable Diffusion 是一个潜在扩散模型。训练时,它从数百万张带有描述文字的图片中学会了去除噪声。生成时,它从纯随机噪声出发,按照你的文字一步步去噪:经过 20 到 30 步后,噪声就变成了一幅符合提示词的图像。

三个部分协同工作:把文字转换为数字的文本编码器,负责去噪的 U-Net(从第 3 版起改为扩散 Transformer),以及把紧凑的潜在图像还原为像素的解码器。正是在这个压缩的潜在空间中运算,才让它在消费级显卡上也足够快。

有哪些版本?

  • Stable Diffusion 1.5(2022 年):512×512 图像,有史以来被定制最多的模型,社区微调模型和 LoRA 数以千计。
  • SDXL 1.0(2023 年 7 月):原生 1024×1024,手部、面部和构图更好,并附带用于细节的 refiner 模型。
  • Stable Diffusion 3 Medium(2024 年 6 月):扩散 Transformer,文字渲染和提示词理解大幅提升。
  • Stable Diffusion 3.5(2024 年 10 月):当前版本,分 Large、Large Turbo 和 Medium 三种规模,图像更清晰、色彩更丰富。

详细对比见SDXL 与 Stable Diffusion 3 对比。

能用它做什么?

文生图只是开始。同样的模型还能做图生图(把草图或照片变成新图)、局部重绘(只重画一个区域)、扩图(向外延伸画面)、用超分辨率模型放大,配合 ControlNet 还能按姿势、深度图或边缘来引导生成。名为 LoRA 的小型扩展文件只需几兆字节就能教会它一种画风或一个角色。

在本站,你可以免注册体验局部重绘和放大,用 SDXL 或 Stable Diffusion 3 生成图像,并浏览 1,731 位画家的风格和 69 条带参数的提示词,了解提示词到底改变了什么。

它与 DALL-E 或 Midjourney 有什么不同?

两点:权重是公开的,而且可以在本地运行。你可以下载模型,在自己的电脑上免费运行、修改,并把图片留在本地。DALL-E 和 Midjourney 是按张收费的封闭服务。作为交换,Stable Diffusion 对你要求更多:选择模型,写出精确的提示词和负面提示词,理解种子。

需要高性能电脑吗?

自己运行的话,SD 1.5 只需一张显存 6 GB 以上的较新 NVIDIA 显卡,SDXL 有 8 GB 会更舒适。AMD 显卡可通过 Linux 上的 ROCm 运行,Apple Silicon 则通过 MPS 后端。如果这些都没有,本站的工具运行在我们的 GPU 上,排队和进度实时显示。准备好后,请阅读如何在本地安装 Stable Diffusion。

常见问题

Stable Diffusion 免费吗?

免费。模型以开放许可证发布(1.5 和 SDXL 为 CreativeML OpenRAIL-M,3.x 为 Stability AI Community Licence,年收入低于一百万美元时免费)。在本地运行只花电费;本站的工具也是免费的。

我生成的图像归谁所有?

就许可证而言归你:Stability AI 不对生成结果主张任何权利。AI 图像的著作权因国家而异且仍在演变;在欧盟和美国,纯 AI 生成的图像通常不受著作权保护。

Stable Diffusion 能在图中写字吗?

1.5 和 SDXL 做得不好。Stable Diffusion 3 和 3.5 在提示词中把文字放进引号后,能可靠地渲染短文本、标题和标志。