SDXL vs Stable Diffusion 3 vs SD 1.5: ¿cuál usar?

Por Actualizado el 3 min de lectura

Usa Stable Diffusion 1.5 por velocidad, poca VRAM y la mayor oferta de modelos de la comunidad; SDXL 1.0 para imágenes detalladas de 1024×1024 y estilos de artistas; Stable Diffusion 3.5 para prompts con varios sujetos, texto legible y la mejor calidad si tu GPU tiene 12 GB o más.

Tabla comparativa

SD 1.5SDXL 1.0SD 3 MediumSD 3.5 Large
Lanzamientooct. 2022jul. 2023jun. 2024oct. 2024
Parámetros0,9 B3,5 B (+ refiner)2 B8 B
Tamaño nativo512×5121024×10241024×10241024×1024
VRAM (fp16)4–6 GB8 GB10 GB16 GB+
Velocidad (RTX 3060)~4 s~15 s~20 s~60 s
Comprensión del promptpalabras clavepalabras clave, mejor composiciónfrases, varios sujetosla mejor
Texto en la imagennorara vezsí, cortosí
Nombres de artistasfuertefuertedébildébil
Modelos de la comunidadmilesmuchospocosen aumento
LicenciaOpenRAIL-MOpenRAIL++Community licence (gratis por debajo de 1 M$ de ingresos)
Probar en este sitioSD 1.5SDXLSD 3—

Stable Diffusion 1.5: el caballo de batalla

Pequeño, rápido, personalizado hasta el infinito. Hay variantes fotorrealistas y anime, modelos ControlNet, LoRA y embeddings para todo. Sus puntos débiles son la resolución base de 512 px, las manos y una lectura literal de los prompts. Sigue siendo la opción correcta para una tarjeta de 6 GB, para cadenas de animación y para trabajo intensivo con ControlNet. El txt2img para miembros de este sitio usa SD 1.5.

SDXL 1.0: detalle y estilo

Cuatro veces más píxeles, un segundo codificador de texto, un refiner para los últimos pasos. Caras, manos y composición mejoraron mucho, y los nombres de artistas tienen un efecto fuerte y predecible, por eso nuestra comparación de 1.731 artistas se generó con SDXL. Necesita 8 GB y es tres o cuatro veces más lento que 1.5. Las versiones destiladas (SDXL Turbo, LCM LoRA) lo devuelven a un segundo por imagen a costa de algo de calidad.

Stable Diffusion 3 y 3.5: comprensión y texto

Una nueva arquitectura (transformador de difusión con tres codificadores de texto) que sigue frases en lugar de listas de palabras clave: «a red cube on a blue sphere, to the left of a green cone» sale bien, y un texto corto entre comillas se renderiza correctamente. 3 Medium tenía problemas de anatomía que 3.5 corrigió; 3.5 Large es el mejor modelo abierto de la familia, 3.5 Medium el equilibrado. Los nombres de artistas y las viejas costumbres del prompt negativo importan menos. Prueba Stable Diffusion 3 Medium aquí.

¿Cuál elegir?

  • Aprender, tarjeta de 6 GB, ControlNet, animación: SD 1.5.
  • Ilustración, retratos, estilos de artistas, 8–12 GB: SDXL.
  • Carteles con texto, escenas complejas, 12–16 GB o más: SD 3.5 Medium o Large.
  • Sin GPU: las herramientas en línea de este sitio, sin cuenta.

Preguntas frecuentes

¿SDXL es mejor que SD 1.5?

Tal cual, sí: más resolución, mejor anatomía y composición. SD 1.5 conserva la ventaja en velocidad, VRAM y amplitud de variantes de la comunidad.

¿Puedo usar LoRA de SD 1.5 con SDXL o SD 3?

No. Un LoRA está ligado a la arquitectura con la que se entrenó; cada familia necesita sus propios LoRA.

¿Y Flux?

Flux.1 de Black Forest Labs (agosto de 2024) es un competidor de 12.000 millones de parámetros con excelente seguimiento del prompt y del texto; necesita entre 12 y 24 GB de VRAM y no es un modelo Stable Diffusion, pero las mismas herramientas (ComfyUI, Forge) lo ejecutan.