La estructura que funciona
- Sujeto: quién o qué, haciendo qué, dónde. a red fox sitting on a mossy rock in a pine forest
- Estilo o medio: oil painting, 35mm photograph, watercolor, 3D render, o un artista: by Ivan Shishkin.
- Luz y ambiente: golden hour, soft diffused light, dramatic rim light, foggy.
- Encuadre y objetivo: close-up, wide shot, 85mm, shallow depth of field.
- Palabras de calidad: highly detailed, sharp focus, masterpiece. Con dos o tres basta.
Las palabras del principio pesan más que las del final. Mantén el sujeto en primer lugar.
Un ejemplo comentado
portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed
Las cinco primeras palabras fijan el sujeto. El nombre del artista define la paleta y la pincelada (mira cuánto cambia un solo nombre en las páginas de estilos de artistas). Las palabras de luz deciden la atmósfera, las de encuadre la composición, y el último grupo pule. Prompt negativo: blurry, deformed hands, extra fingers, watermark, text, explicado en qué es un prompt negativo.
Pesos y énfasis
En Automatic1111 y en la mayoría de interfaces, los paréntesis aumentan el peso de un término: (red scarf:1.3) significa un 30 % más importante, (background:0.7) menos. Los corchetes lo reducen. Quédate entre 0,6 y 1,4: más allá, la imagen se rompe. Usa los pesos para rescatar un detalle que el modelo ignora, no en cada palabra.
Errores habituales
- Frases completas y negaciones: «a room without windows» suele producir ventanas. Lo que no quieres va en el prompt negativo.
- Demasiadas ideas: un sujeto por imagen; 75 tokens (unas 60 palabras) es el límite de un bloque CLIP en SD 1.5 y SDXL, y lo que sigue pesa menos.
- Estilos contradictorios: photorealistic watercolor da un resultado turbio.
- Cambiarlo todo a la vez: fija la seed y cambia una palabra cada vez para aprender qué hace cada una.
Diferencias entre modelos
SD 1.5 y SDXL responden a listas de palabras clave como el ejemplo anterior. Stable Diffusion 3 y 3.5 entienden mejor las frases naturales, colocan varios sujetos («a cat on the left, a dog on the right») y renderizan un texto corto entre comillas. Sea cual sea el modelo, los 69 prompts documentados de este sitio muestran todos los parámetros de cada imagen, y el generador de prompts convierte unas pocas palabras en un prompt completo.