Como escrever um prompt para o Stable Diffusion?

Por Atualizado em 3 min de leitura

Um prompt do Stable Diffusion é uma descrição em texto que orienta a geração da imagem: primeiro um assunto claro, depois o estilo, a iluminação, o enquadramento e algumas palavras de qualidade, separados por vírgulas. Curto, concreto e ordenado do mais para o menos importante: é isso que gera imagens previsíveis.

A estrutura que funciona

  1. Assunto: quem ou o quê, fazendo o quê, onde. a red fox sitting on a mossy rock in a pine forest
  2. Estilo ou técnica: oil painting, 35mm photograph, watercolor, 3D render, ou um artista: by Ivan Shishkin.
  3. Iluminação e clima: golden hour, soft diffused light, dramatic rim light, foggy.
  4. Enquadramento e lente: close-up, wide shot, 85mm, shallow depth of field.
  5. Palavras de qualidade: highly detailed, sharp focus, masterpiece. Duas ou três bastam.

As palavras do início do prompt tendem a pesar mais do que as do final. Mantenha o assunto em primeiro lugar.

Um exemplo comentado

portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed

As cinco primeiras palavras definem o assunto. O token do artista determina a paleta e a pincelada (veja o quanto um único nome muda o resultado nas páginas de estilos de artistas). As palavras de luz decidem a atmosfera; as de enquadramento, a composição; e o último grupo dá o acabamento. Prompt negativo: blurry, deformed hands, extra fingers, watermark, text — saiba mais em o que é um prompt negativo.

Pesos e ênfase

No Automatic1111, no Forge, no Fooocus e no ComfyUI, os parênteses definem o peso de um termo: (red scarf:1.3) significa 30% mais atenção; (background:0.7), menos. No Automatic1111, os colchetes diminuem o peso. Fique entre 0,6 e 1,4: fora dessa faixa, a imagem costuma se degradar. Use os pesos para salvar um detalhe que o modelo insiste em ignorar, não em todas as palavras.

Erros comuns

  • Negações: “a room without windows” costuma gerar janelas. Coloque no prompt negativo aquilo que você não quer.
  • Ideias demais: um assunto por imagem. No SD 1.5 e no SDXL, 75 tokens (cerca de 60 palavras) é o limite de um bloco do CLIP; o que vem depois vai para um segundo bloco no Automatic1111 e é cortado nas ferramentas que não fazem essa divisão.
  • Estilos contraditórios: photorealistic watercolor dá um resultado confuso.
  • Mudar tudo de uma vez: fixe a seed e mude uma palavra por vez para aprender o que cada uma faz.

Diferenças entre os modelos

O SD 1.5 e o SDXL respondem a listas de palavras-chave, como no exemplo acima. O Stable Diffusion 3 e o 3.5 entendem melhor frases naturais, conseguem posicionar vários elementos (“a cat on the left, a dog on the right”) e renderizam textos curtos entre aspas. Seja qual for o modelo, os 82 prompts documentados deste site mostram os parâmetros por trás de cada imagem, e o gerador de prompts transforma poucas palavras em um prompt completo.

Perguntas frequentes

Qual deve ser o tamanho de um prompt do Stable Diffusion?

No SD 1.5 e no SDXL, de 15 a 60 palavras é uma boa medida. Com menos de 10 palavras, o modelo preenche as lacunas ao acaso; acima de 75 tokens, o Automatic1111 divide o texto em blocos, e as ferramentas sem esse recurso cortam o excedente.

Nomes de artistas ainda funcionam?

Sim, com o SD 1.5 e o SDXL, que conhecem milhares de artistas: nossa comparação de 1.731 nomes, gerados com os mesmos quatro prompts e as mesmas seeds, mostra o efeito de cada um. O Stable Diffusion 3 reage menos a eles.

Devo escrever os prompts em inglês?

Sim. Os codificadores de texto foram treinados principalmente com legendas em inglês. Um prompt em português funciona em parte, mas perde precisão; traduza-o antes.