Tabla comparativa
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| Lanzamiento | oct. 2022 | jul. 2023 | jun. 2024 | oct. 2024 |
| Parámetros | 0,9 B | 3,5 B (+ refiner) | 2 B | 8 B |
| Tamaño nativo | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM (fp16) | 4–6 GB | 8 GB | 10 GB | 16 GB+ |
| Velocidad (RTX 3060) | ~4 s | ~15 s | ~20 s | ~60 s |
| Comprensión del prompt | palabras clave | palabras clave, mejor composición | frases, varios sujetos | la mejor |
| Texto en la imagen | no | rara vez | sí, corto | sí |
| Nombres de artistas | fuerte | fuerte | débil | débil |
| Modelos de la comunidad | miles | muchos | pocos | en aumento |
| Licencia | OpenRAIL-M | OpenRAIL++ | Community licence (gratis por debajo de 1 M$ de ingresos) | |
| Probar en este sitio | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5: el caballo de batalla
Pequeño, rápido, personalizado hasta el infinito. Hay variantes fotorrealistas y anime, modelos ControlNet, LoRA y embeddings para todo. Sus puntos débiles son la resolución base de 512 px, las manos y una lectura literal de los prompts. Sigue siendo la opción correcta para una tarjeta de 6 GB, para cadenas de animación y para trabajo intensivo con ControlNet. El txt2img para miembros de este sitio usa SD 1.5.
SDXL 1.0: detalle y estilo
Cuatro veces más píxeles, un segundo codificador de texto, un refiner para los últimos pasos. Caras, manos y composición mejoraron mucho, y los nombres de artistas tienen un efecto fuerte y predecible, por eso nuestra comparación de 1.731 artistas se generó con SDXL. Necesita 8 GB y es tres o cuatro veces más lento que 1.5. Las versiones destiladas (SDXL Turbo, LCM LoRA) lo devuelven a un segundo por imagen a costa de algo de calidad.
Stable Diffusion 3 y 3.5: comprensión y texto
Una nueva arquitectura (transformador de difusión con tres codificadores de texto) que sigue frases en lugar de listas de palabras clave: «a red cube on a blue sphere, to the left of a green cone» sale bien, y un texto corto entre comillas se renderiza correctamente. 3 Medium tenía problemas de anatomía que 3.5 corrigió; 3.5 Large es el mejor modelo abierto de la familia, 3.5 Medium el equilibrado. Los nombres de artistas y las viejas costumbres del prompt negativo importan menos. Prueba Stable Diffusion 3 Medium aquí.
¿Cuál elegir?
- Aprender, tarjeta de 6 GB, ControlNet, animación: SD 1.5.
- Ilustración, retratos, estilos de artistas, 8–12 GB: SDXL.
- Carteles con texto, escenas complejas, 12–16 GB o más: SD 3.5 Medium o Large.
- Sin GPU: las herramientas en línea de este sitio, sin cuenta.