¿Qué es Stable Diffusion?

Por Actualizado el 3 min de lectura

Stable Diffusion es una inteligencia artificial de código abierto que convierte una descripción de texto en una imagen. Publicada por Stability AI en agosto de 2022, funciona en una tarjeta gráfica de juego corriente, cualquiera puede reentrenarla y alimenta miles de herramientas gratuitas, incluidas las de este sitio.

¿Cómo funciona Stable Diffusion?

Stable Diffusion es un modelo de difusión latente. Durante el entrenamiento aprendió a quitar ruido de millones de imágenes acompañadas de su descripción. Al generar, parte de un ruido puramente aleatorio y, paso a paso, lo limpia en la dirección de tu texto: tras 20 o 30 pasos el ruido se ha convertido en una imagen que corresponde al prompt.

Cooperan tres piezas: un codificador de texto que convierte tus palabras en números, una U-Net (o, desde la versión 3, un transformador de difusión) que elimina el ruido, y un decodificador que convierte la imagen latente compacta en píxeles. Trabajar en ese espacio comprimido es lo que la hace lo bastante rápida para una tarjeta doméstica.

¿Qué versiones existen?

  • Stable Diffusion 1.5 (2022): imágenes de 512×512, el modelo más personalizado de la historia, miles de variantes y LoRA de la comunidad.
  • SDXL 1.0 (julio de 2023): 1024×1024 nativo, mejores manos, caras y composición, un modelo «refiner» para los detalles.
  • Stable Diffusion 3 Medium (junio de 2024): transformador de difusión, mucho mejor renderizado de texto y comprensión del prompt.
  • Stable Diffusion 3.5 (octubre de 2024): la versión actual, en tamaños Large, Large Turbo y Medium, imágenes más nítidas y colores más ricos.

Comparación detallada en SDXL frente a Stable Diffusion 3.

¿Qué se puede hacer con ella?

El texto a imagen es solo el principio. Los mismos modelos hacen imagen a imagen (transformar un boceto o una foto), inpainting (repintar una zona), outpainting (ampliar una imagen), escalado con modelos de superresolución y, con ControlNet, generación guiada por una pose, un mapa de profundidad o unos bordes. Unos complementos llamados LoRA le enseñan un estilo o un personaje en pocos megabytes.

En este sitio puedes probar el inpainting y el escalado sin cuenta, generar imágenes con SDXL o Stable Diffusion 3, y explorar 1.731 estilos de artistas y 69 prompts documentados para entender qué hace un prompt.

¿En qué se diferencia de DALL-E o Midjourney?

En dos cosas: los pesos son públicos y funciona en local. Puedes descargar el modelo, ejecutarlo gratis en tu ordenador, modificarlo y mantener tus imágenes en privado. DALL-E y Midjourney son servicios cerrados que cobran por imagen. A cambio, Stable Diffusion te pide más: elegir un modelo, escribir un prompt preciso y un prompt negativo, y entender la seed.

¿Necesito un ordenador potente?

Para ejecutarla tú mismo basta una tarjeta NVIDIA reciente con al menos 6 GB de VRAM para SD 1.5, y 8 GB son cómodos para SDXL. Las tarjetas AMD funcionan con ROCm en Linux y los Mac con Apple Silicon mediante el backend MPS. Si no tienes nada de eso, las herramientas de este sitio funcionan en nuestra GPU, con la cola y el progreso en directo. Lee cómo instalar Stable Diffusion en local cuando estés listo.

Preguntas frecuentes

¿Stable Diffusion es gratis?

Sí. Los modelos se publican con licencias abiertas (CreativeML OpenRAIL-M para 1.5 y SDXL, Stability AI Community Licence para 3.x, gratuita por debajo de un millón de dólares de ingresos anuales). En local solo cuesta la electricidad; las herramientas de este sitio son gratuitas.

¿De quién son las imágenes que genero?

Tuyas, en lo que respecta a la licencia: Stability AI no reclama ningún derecho sobre los resultados. El derecho de autor sobre imágenes de IA varía según el país y aún se está definiendo; en la UE y en Estados Unidos, una imagen generada íntegramente por IA en general no puede protegerse.

¿Puede Stable Diffusion escribir texto dentro de las imágenes?

Las versiones 1.5 y SDXL lo hacen mal. Stable Diffusion 3 y 3.5 renderizan bien textos cortos, títulos y logotipos si pones las palabras entre comillas en el prompt.