O que é Stable Diffusion?

Por Atualizado em 4 min de leitura

O Stable Diffusion é uma inteligência artificial de código aberto que gera uma imagem a partir de uma descrição em texto. Lançado pela Stability AI em agosto de 2022, roda em uma placa de vídeo gamer comum, pode ser personalizado com fine-tuning por qualquer pessoa e está por trás de muitas ferramentas gratuitas, inclusive as deste site.

Como o Stable Diffusion funciona?

O Stable Diffusion é um modelo de difusão latente. No treinamento, ele aprendeu a remover o ruído de centenas de milhões de imagens acompanhadas de legendas. Na hora de gerar, ele parte de um ruído totalmente aleatório e, passo a passo, vai limpando esse ruído na direção do seu texto: depois de 20 a 30 passos, o ruído virou uma imagem que corresponde ao prompt.

Três componentes trabalham juntos: um codificador de texto, que converte suas palavras em números; uma U-Net (ou, a partir da versão 3, um transformer de difusão), que faz a remoção do ruído; e um decodificador, que transforma a imagem latente compacta em pixels. É por trabalhar nesse espaço latente comprimido que ele fica rápido o bastante para uma GPU doméstica.

Quais versões existem?

  • Stable Diffusion 1.5 (2022): imagens de 512×512, com milhares de fine-tunes e LoRAs da comunidade.
  • SDXL 1.0 (julho de 2023): 1024×1024 nativo, mãos, rostos e composição melhores, um modelo refiner para os detalhes.
  • Stable Diffusion 3 Medium (junho de 2024): transformer de difusão, com renderização de texto e compreensão do prompt muito superiores.
  • Stable Diffusion 3.5 (outubro de 2024): a versão atual, nos tamanhos Large, Large Turbo e Medium, com mais fidelidade ao prompt e estilos mais variados.

Veja a comparação detalhada em SDXL vs Stable Diffusion 3.

O que dá para fazer com ele?

O texto para imagem é só o começo. Os mesmos modelos fazem imagem para imagem (transformar um esboço ou uma foto), inpainting (repintar uma área), outpainting (expandir uma imagem), upscaling com modelos dedicados de super-resolução e, com o ControlNet, geração guiada por uma pose, um mapa de profundidade ou contornos. Complementos chamados LoRA, cada um em um pequeno arquivo à parte, ensinam ao modelo um estilo ou um personagem.

Neste site você pode testar o inpainting e o upscaling sem cadastro, gerar imagens com SDXL ou Stable Diffusion 3 e explorar 1.731 estilos de artistas e 82 prompts documentados para entender o que um prompt faz.

Qual é a diferença em relação ao DALL-E ou ao Midjourney?

Duas coisas: os pesos são públicos e ele roda localmente. Você pode baixar o modelo, rodá-lo de graça no seu próprio computador, modificá-lo e manter suas imagens privadas. O Midjourney e os modelos de imagem da OpenAI (o DALL-E, hoje GPT Image) são serviços fechados: você paga por assinatura ou por imagem, e o modelo nunca sai dos servidores deles. Em contrapartida, o Stable Diffusion exige mais de você: escolher um modelo, escrever um prompt preciso e um prompt negativo, e entender a seed.

Preciso de um computador potente?

Para rodar por conta própria, uma placa NVIDIA recente com pelo menos 6 GB de VRAM basta para o SD 1.5, e 8 GB são suficientes para o SDXL. As placas AMD funcionam via ROCm no Linux, e o Apple Silicon, pelo backend MPS. Se você não tem nada disso, as ferramentas deste site não exigem hardware nenhum: algumas rodam na nossa GPU, com a fila e o progresso exibidos em tempo real, e outras são demos hospedadas externamente, incorporadas à página. Quando estiver pronto, leia como instalar o Stable Diffusion localmente.

Perguntas frequentes

O Stable Diffusion é gratuito?

Sim. Os modelos são distribuídos sob licenças abertas (CreativeML OpenRAIL-M para o 1.5; OpenRAIL++-M para o SDXL; Stability AI Community License para as versões 3.x, gratuita abaixo de um milhão de dólares de receita anual). Rodar localmente custa apenas a energia elétrica; as ferramentas deste site são gratuitas e mantidas por publicidade.

De quem são as imagens que eu gero?

São suas, no que depender da licença: a Stability AI não reivindica nenhum direito sobre as imagens geradas. As leis de direitos autorais sobre imagens de IA variam de país para país e ainda estão sendo definidas; na União Europeia e nos Estados Unidos, imagens geradas exclusivamente por IA em geral não podem ser protegidas por direito autoral.

O Stable Diffusion consegue gerar texto dentro das imagens?

As versões 1.5 e SDXL têm dificuldade com texto. O Stable Diffusion 3 e o 3.5 renderizam textos curtos e títulos muito melhor quando você coloca as palavras entre aspas no prompt.