Tabela comparativa
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| Lançamento | out. 2022 | jul. 2023 | jun. 2024 | out. 2024 |
| Parâmetros | 0,9 bi | 2,6 bi (+ refiner) | 2 bi | 8 bi |
| Resolução nativa | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM (fp16) | 4–6 GB | 8 GB | 10 GB | 19 GB (11 GB em fp8) |
| Velocidade (nossa GPU de 12 GB) | ~4 s | ~20 s | — | — |
| Compreensão do prompt | palavras-chave | palavras-chave, composição melhor | frases, vários elementos | a melhor |
| Texto na imagem | não | raramente | sim, curto | sim |
| Nomes de artistas | efeito forte | efeito forte | efeito mais fraco | efeito mais fraco |
| Modelos da comunidade | muitíssimos | a maior oferta, com Pony e Illustrious | poucos | poucos |
| Licença | OpenRAIL-M | OpenRAIL++ | Community License (gratuita abaixo de US$ 1 milhão de receita) | |
| Teste neste site | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5: o pau para toda obra
Pequeno, rápido e personalizado à exaustão. Existem fine-tunes fotorrealistas e de anime, modelos de ControlNet, LoRAs e embeddings para tudo. Seus pontos fracos são a resolução base de 512 px, as mãos e uma leitura literal dos prompts. Continua sendo a escolha certa para uma placa de 6 GB, para animação com o AnimateDiff e para trabalhos que dependem muito do ControlNet. O txt2img para membros deste site roda um modelo SD 1.5 personalizado.
SDXL 1.0: detalhe e estilo
Quatro vezes mais pixels, um segundo codificador de texto, um refiner para os últimos passos. Rostos, mãos e composição melhoraram muito, e os nomes de artistas têm um efeito forte e previsível; por isso a nossa comparação de 1.731 artistas foi gerada com o SDXL. Ele precisa de 8 GB e é várias vezes mais lento que o 1.5: cerca de 20 s contra 4 s por imagem na nossa GPU. As versões destiladas (SDXL Turbo, LCM LoRA) precisam de apenas um a oito passos, em vez de 25 a 30, com alguma perda de qualidade.
Stable Diffusion 3 e 3.5: compreensão e texto
Uma arquitetura nova (transformer de difusão com três codificadores de texto) que segue frases em vez de listas de palavras-chave: na maioria das vezes, “a red cube on a blue sphere, to the left of a green cone” sai certo, e textos curtos entre aspas ficam legíveis. O 3 Medium tinha problemas de anatomia que o 3.5 reduziu; o 3.5 Large é o mais capaz da família, e o 3.5 Medium, o mais equilibrado. Os nomes de artistas e os velhos hábitos de prompt negativo contam menos. Teste o Stable Diffusion 3 Medium aqui.
Qual escolher?
- Para aprender, placa de 6 GB, ControlNet, AnimateDiff: SD 1.5.
- Ilustração, retratos, estilos de artistas, 8–12 GB: SDXL.
- Pôsteres com texto, cenas complexas, 12–16 GB ou mais: SD 3.5 Medium ou Large.
- Sem GPU: as ferramentas online deste site, sem precisar de conta.