SDXL、Stable Diffusion 3 与 SD 1.5:该用哪一个?

作者 更新于 2 分钟阅读

要速度、低显存和最多的社区模型,选 Stable Diffusion 1.5;要 1024×1024 的精细图像和画家风格,选 SDXL 1.0;要多主体提示词、可读的文字和最佳画质,且显卡有 12 GB 以上显存,选 Stable Diffusion 3.5。下面的表格汇总了差异。

对比表

SD 1.5SDXL 1.0SD 3 MediumSD 3.5 Large
发布2022 年 10 月2023 年 7 月2024 年 6 月2024 年 10 月
参数量9 亿35 亿(+ refiner)20 亿80 亿
原生尺寸512×5121024×10241024×10241024×1024
显存(fp16)4–6 GB8 GB10 GB16 GB+
速度(RTX 3060)约 4 秒约 15 秒约 20 秒约 60 秒
提示词理解关键词关键词,构图更好句子,多主体最佳
图中文字否偶尔可,短文本可
画家名强强弱弱
社区模型数千很多较少增长中
许可证OpenRAIL-MOpenRAIL++Community licence(收入低于 100 万美元免费)
在本站试用SD 1.5SDXLSD 3—

Stable Diffusion 1.5:老黄牛

小、快、被无限定制。写实和动漫微调模型、ControlNet 模型、LoRA 和 embedding 应有尽有。弱点是 512 px 的基础分辨率、手部,以及对提示词的字面理解。对于 6 GB 显卡、动画流程和重度使用 ControlNet 的工作,它仍是正确的选择。本站会员的 txt2img 就运行在 SD 1.5 上。

SDXL 1.0:细节与风格

四倍的像素、第二个文本编码器、负责最后几步的 refiner。面部、手部和构图大幅改善,画家名的效果强而可预测,因此本站的 1,731 位画家对比用 SDXL 生成。它需要 8 GB 显存,比 1.5 慢三到四倍。蒸馏版本(SDXL Turbo、LCM LoRA)能把速度拉回每张一秒,画质略有损失。

Stable Diffusion 3 与 3.5:理解力与文字

全新架构(带三个文本编码器的扩散 Transformer),理解的是句子而非关键词列表:「a red cube on a blue sphere, to the left of a green cone」能正确生成,引号内的短文本也能正确渲染。3 Medium 曾有人体结构问题,3.5 已修正;3.5 Large 是该系列最好的开放模型,3.5 Medium 则最均衡。画家名和旧的负面提示词习惯重要性下降。在这里试试 Stable Diffusion 3 Medium。

该选哪个?

  • 学习、6 GB 显卡、ControlNet、动画:SD 1.5。
  • 插画、肖像、画家风格、8–12 GB:SDXL。
  • 带文字的海报、复杂场景、12–16 GB 以上:SD 3.5 Medium 或 Large。
  • 没有显卡:本站的在线工具,无需账户。

常见问题

SDXL 比 SD 1.5 好吗?

原生状态下是的:分辨率更高,人体结构和构图更好。SD 1.5 在速度、显存和社区微调模型的广度上仍占优势。

SD 1.5 的 LoRA 能用在 SDXL 或 SD 3 上吗?

不能。LoRA 绑定于训练它的架构,每个系列都需要自己的 LoRA。

Flux 怎么样?

Black Forest Labs 的 Flux.1(2024 年 8 月)是拥有 120 亿参数的竞争者,提示词遵循和文字渲染都很出色;它需要 12 到 24 GB 显存,不属于 Stable Diffusion,但同样的工具(ComfyUI、Forge)可以运行它。