Como o Stable Diffusion funciona?
O Stable Diffusion é um modelo de difusão latente. No treinamento, ele aprendeu a remover o ruído de centenas de milhões de imagens acompanhadas de legendas. Na hora de gerar, ele parte de um ruído totalmente aleatório e, passo a passo, vai limpando esse ruído na direção do seu texto: depois de 20 a 30 passos, o ruído virou uma imagem que corresponde ao prompt.
Três componentes trabalham juntos: um codificador de texto, que converte suas palavras em números; uma U-Net (ou, a partir da versão 3, um transformer de difusão), que faz a remoção do ruído; e um decodificador, que transforma a imagem latente compacta em pixels. É por trabalhar nesse espaço latente comprimido que ele fica rápido o bastante para uma GPU doméstica.
Quais versões existem?
- Stable Diffusion 1.5 (2022): imagens de 512×512, com milhares de fine-tunes e LoRAs da comunidade.
- SDXL 1.0 (julho de 2023): 1024×1024 nativo, mãos, rostos e composição melhores, um modelo refiner para os detalhes.
- Stable Diffusion 3 Medium (junho de 2024): transformer de difusão, com renderização de texto e compreensão do prompt muito superiores.
- Stable Diffusion 3.5 (outubro de 2024): a versão atual, nos tamanhos Large, Large Turbo e Medium, com mais fidelidade ao prompt e estilos mais variados.
Veja a comparação detalhada em SDXL vs Stable Diffusion 3.
O que dá para fazer com ele?
O texto para imagem é só o começo. Os mesmos modelos fazem imagem para imagem (transformar um esboço ou uma foto), inpainting (repintar uma área), outpainting (expandir uma imagem), upscaling com modelos dedicados de super-resolução e, com o ControlNet, geração guiada por uma pose, um mapa de profundidade ou contornos. Complementos chamados LoRA, cada um em um pequeno arquivo à parte, ensinam ao modelo um estilo ou um personagem.
Neste site você pode testar o inpainting e o upscaling sem cadastro, gerar imagens com SDXL ou Stable Diffusion 3 e explorar 1.731 estilos de artistas e 82 prompts documentados para entender o que um prompt faz.
Qual é a diferença em relação ao DALL-E ou ao Midjourney?
Duas coisas: os pesos são públicos e ele roda localmente. Você pode baixar o modelo, rodá-lo de graça no seu próprio computador, modificá-lo e manter suas imagens privadas. O Midjourney e os modelos de imagem da OpenAI (o DALL-E, hoje GPT Image) são serviços fechados: você paga por assinatura ou por imagem, e o modelo nunca sai dos servidores deles. Em contrapartida, o Stable Diffusion exige mais de você: escolher um modelo, escrever um prompt preciso e um prompt negativo, e entender a seed.
Preciso de um computador potente?
Para rodar por conta própria, uma placa NVIDIA recente com pelo menos 6 GB de VRAM basta para o SD 1.5, e 8 GB são suficientes para o SDXL. As placas AMD funcionam via ROCm no Linux, e o Apple Silicon, pelo backend MPS. Se você não tem nada disso, as ferramentas deste site não exigem hardware nenhum: algumas rodam na nossa GPU, com a fila e o progresso exibidos em tempo real, e outras são demos hospedadas externamente, incorporadas à página. Quando estiver pronto, leia como instalar o Stable Diffusion localmente.