对比表
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| 发布 | 2022 年 10 月 | 2023 年 7 月 | 2024 年 6 月 | 2024 年 10 月 |
| 参数量 | 9 亿 | 35 亿(+ refiner) | 20 亿 | 80 亿 |
| 原生尺寸 | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| 显存(fp16) | 4–6 GB | 8 GB | 10 GB | 16 GB+ |
| 速度(RTX 3060) | 约 4 秒 | 约 15 秒 | 约 20 秒 | 约 60 秒 |
| 提示词理解 | 关键词 | 关键词,构图更好 | 句子,多主体 | 最佳 |
| 图中文字 | 否 | 偶尔 | 可,短文本 | 可 |
| 画家名 | 强 | 强 | 弱 | 弱 |
| 社区模型 | 数千 | 很多 | 较少 | 增长中 |
| 许可证 | OpenRAIL-M | OpenRAIL++ | Community licence(收入低于 100 万美元免费) | |
| 在本站试用 | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5:老黄牛
小、快、被无限定制。写实和动漫微调模型、ControlNet 模型、LoRA 和 embedding 应有尽有。弱点是 512 px 的基础分辨率、手部,以及对提示词的字面理解。对于 6 GB 显卡、动画流程和重度使用 ControlNet 的工作,它仍是正确的选择。本站会员的 txt2img 就运行在 SD 1.5 上。
SDXL 1.0:细节与风格
四倍的像素、第二个文本编码器、负责最后几步的 refiner。面部、手部和构图大幅改善,画家名的效果强而可预测,因此本站的 1,731 位画家对比用 SDXL 生成。它需要 8 GB 显存,比 1.5 慢三到四倍。蒸馏版本(SDXL Turbo、LCM LoRA)能把速度拉回每张一秒,画质略有损失。
Stable Diffusion 3 与 3.5:理解力与文字
全新架构(带三个文本编码器的扩散 Transformer),理解的是句子而非关键词列表:「a red cube on a blue sphere, to the left of a green cone」能正确生成,引号内的短文本也能正确渲染。3 Medium 曾有人体结构问题,3.5 已修正;3.5 Large 是该系列最好的开放模型,3.5 Medium 则最均衡。画家名和旧的负面提示词习惯重要性下降。在这里试试 Stable Diffusion 3 Medium。
该选哪个?
- 学习、6 GB 显卡、ControlNet、动画:SD 1.5。
- 插画、肖像、画家风格、8–12 GB:SDXL。
- 带文字的海报、复杂场景、12–16 GB 以上:SD 3.5 Medium 或 Large。
- 没有显卡:本站的在线工具,无需账户。