¿Cómo funciona Stable Diffusion?
Stable Diffusion es un modelo de difusión latente. Durante el entrenamiento aprendió a quitar ruido de millones de imágenes acompañadas de su descripción. Al generar, parte de un ruido puramente aleatorio y, paso a paso, lo limpia en la dirección de tu texto: tras 20 o 30 pasos el ruido se ha convertido en una imagen que corresponde al prompt.
Cooperan tres piezas: un codificador de texto que convierte tus palabras en números, una U-Net (o, desde la versión 3, un transformador de difusión) que elimina el ruido, y un decodificador que convierte la imagen latente compacta en píxeles. Trabajar en ese espacio comprimido es lo que la hace lo bastante rápida para una tarjeta doméstica.
¿Qué versiones existen?
- Stable Diffusion 1.5 (2022): imágenes de 512×512, el modelo más personalizado de la historia, miles de variantes y LoRA de la comunidad.
- SDXL 1.0 (julio de 2023): 1024×1024 nativo, mejores manos, caras y composición, un modelo «refiner» para los detalles.
- Stable Diffusion 3 Medium (junio de 2024): transformador de difusión, mucho mejor renderizado de texto y comprensión del prompt.
- Stable Diffusion 3.5 (octubre de 2024): la versión actual, en tamaños Large, Large Turbo y Medium, imágenes más nítidas y colores más ricos.
Comparación detallada en SDXL frente a Stable Diffusion 3.
¿Qué se puede hacer con ella?
El texto a imagen es solo el principio. Los mismos modelos hacen imagen a imagen (transformar un boceto o una foto), inpainting (repintar una zona), outpainting (ampliar una imagen), escalado con modelos de superresolución y, con ControlNet, generación guiada por una pose, un mapa de profundidad o unos bordes. Unos complementos llamados LoRA le enseñan un estilo o un personaje en pocos megabytes.
En este sitio puedes probar el inpainting y el escalado sin cuenta, generar imágenes con SDXL o Stable Diffusion 3, y explorar 1.731 estilos de artistas y 69 prompts documentados para entender qué hace un prompt.
¿En qué se diferencia de DALL-E o Midjourney?
En dos cosas: los pesos son públicos y funciona en local. Puedes descargar el modelo, ejecutarlo gratis en tu ordenador, modificarlo y mantener tus imágenes en privado. DALL-E y Midjourney son servicios cerrados que cobran por imagen. A cambio, Stable Diffusion te pide más: elegir un modelo, escribir un prompt preciso y un prompt negativo, y entender la seed.
¿Necesito un ordenador potente?
Para ejecutarla tú mismo basta una tarjeta NVIDIA reciente con al menos 6 GB de VRAM para SD 1.5, y 8 GB son cómodos para SDXL. Las tarjetas AMD funcionan con ROCm en Linux y los Mac con Apple Silicon mediante el backend MPS. Si no tienes nada de eso, las herramientas de este sitio funcionan en nuestra GPU, con la cola y el progreso en directo. Lee cómo instalar Stable Diffusion en local cuando estés listo.