¿Cómo escribir un prompt de Stable Diffusion?

Por Actualizado el 3 min de lectura

Un prompt de Stable Diffusion es una descripción de texto que guía la imagen: un sujeto claro primero, luego el estilo, la luz, el encuadre y unas pocas palabras de calidad, separados por comas. Corto, concreto y ordenado de lo más a lo menos importante: así se obtienen imágenes predecibles.

La estructura que funciona

  1. Sujeto: quién o qué, haciendo qué, dónde. a red fox sitting on a mossy rock in a pine forest
  2. Estilo o medio: oil painting, 35mm photograph, watercolor, 3D render, o un artista: by Ivan Shishkin.
  3. Luz y ambiente: golden hour, soft diffused light, dramatic rim light, foggy.
  4. Encuadre y objetivo: close-up, wide shot, 85mm, shallow depth of field.
  5. Palabras de calidad: highly detailed, sharp focus, masterpiece. Con dos o tres basta.

Las palabras del principio pesan más que las del final. Mantén el sujeto en primer lugar.

Un ejemplo comentado

portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed

Las cinco primeras palabras fijan el sujeto. El nombre del artista define la paleta y la pincelada (mira cuánto cambia un solo nombre en las páginas de estilos de artistas). Las palabras de luz deciden la atmósfera, las de encuadre la composición, y el último grupo pule. Prompt negativo: blurry, deformed hands, extra fingers, watermark, text, explicado en qué es un prompt negativo.

Pesos y énfasis

En Automatic1111 y en la mayoría de interfaces, los paréntesis aumentan el peso de un término: (red scarf:1.3) significa un 30 % más importante, (background:0.7) menos. Los corchetes lo reducen. Quédate entre 0,6 y 1,4: más allá, la imagen se rompe. Usa los pesos para rescatar un detalle que el modelo ignora, no en cada palabra.

Errores habituales

  • Frases completas y negaciones: «a room without windows» suele producir ventanas. Lo que no quieres va en el prompt negativo.
  • Demasiadas ideas: un sujeto por imagen; 75 tokens (unas 60 palabras) es el límite de un bloque CLIP en SD 1.5 y SDXL, y lo que sigue pesa menos.
  • Estilos contradictorios: photorealistic watercolor da un resultado turbio.
  • Cambiarlo todo a la vez: fija la seed y cambia una palabra cada vez para aprender qué hace cada una.

Diferencias entre modelos

SD 1.5 y SDXL responden a listas de palabras clave como el ejemplo anterior. Stable Diffusion 3 y 3.5 entienden mejor las frases naturales, colocan varios sujetos («a cat on the left, a dog on the right») y renderizan un texto corto entre comillas. Sea cual sea el modelo, los 69 prompts documentados de este sitio muestran todos los parámetros de cada imagen, y el generador de prompts convierte unas pocas palabras en un prompt completo.

Preguntas frecuentes

¿Cuánto debe medir un prompt de Stable Diffusion?

Entre 15 y 60 palabras. Con menos de 10, el modelo rellena los huecos al azar; por encima de 75 tokens (SD 1.5 y SDXL) el texto se parte en bloques y la parte final influye menos.

¿Siguen funcionando los nombres de artistas?

Sí con SD 1.5 y SDXL, que conocen miles de artistas: nuestra comparación de 1.731 nombres generados con la misma seed muestra el efecto de cada uno. Stable Diffusion 3 se entrenó con menos nombres de artistas y reacciona menos a ellos.

¿Debo escribir el prompt en inglés?

Sí. Los codificadores de texto se entrenaron sobre todo con descripciones en inglés. Un prompt en español funciona a medias pero pierde precisión; tradúcelo o usa el generador de prompts.