A estrutura que funciona
- Assunto: quem ou o quê, fazendo o quê, onde. a red fox sitting on a mossy rock in a pine forest
- Estilo ou técnica: oil painting, 35mm photograph, watercolor, 3D render, ou um artista: by Ivan Shishkin.
- Iluminação e clima: golden hour, soft diffused light, dramatic rim light, foggy.
- Enquadramento e lente: close-up, wide shot, 85mm, shallow depth of field.
- Palavras de qualidade: highly detailed, sharp focus, masterpiece. Duas ou três bastam.
As palavras do início do prompt tendem a pesar mais do que as do final. Mantenha o assunto em primeiro lugar.
Um exemplo comentado
portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed
As cinco primeiras palavras definem o assunto. O token do artista determina a paleta e a pincelada (veja o quanto um único nome muda o resultado nas páginas de estilos de artistas). As palavras de luz decidem a atmosfera; as de enquadramento, a composição; e o último grupo dá o acabamento. Prompt negativo: blurry, deformed hands, extra fingers, watermark, text — saiba mais em o que é um prompt negativo.
Pesos e ênfase
No Automatic1111, no Forge, no Fooocus e no ComfyUI, os parênteses definem o peso de um termo: (red scarf:1.3) significa 30% mais atenção; (background:0.7), menos. No Automatic1111, os colchetes diminuem o peso. Fique entre 0,6 e 1,4: fora dessa faixa, a imagem costuma se degradar. Use os pesos para salvar um detalhe que o modelo insiste em ignorar, não em todas as palavras.
Erros comuns
- Negações: “a room without windows” costuma gerar janelas. Coloque no prompt negativo aquilo que você não quer.
- Ideias demais: um assunto por imagem. No SD 1.5 e no SDXL, 75 tokens (cerca de 60 palavras) é o limite de um bloco do CLIP; o que vem depois vai para um segundo bloco no Automatic1111 e é cortado nas ferramentas que não fazem essa divisão.
- Estilos contraditórios: photorealistic watercolor dá um resultado confuso.
- Mudar tudo de uma vez: fixe a seed e mude uma palavra por vez para aprender o que cada uma faz.
Diferenças entre os modelos
O SD 1.5 e o SDXL respondem a listas de palavras-chave, como no exemplo acima. O Stable Diffusion 3 e o 3.5 entendem melhor frases naturais, conseguem posicionar vários elementos (“a cat on the left, a dog on the right”) e renderizam textos curtos entre aspas. Seja qual for o modelo, os 82 prompts documentados deste site mostram os parâmetros por trás de cada imagem, e o gerador de prompts transforma poucas palavras em um prompt completo.