Tableau comparatif
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| Sortie | oct. 2022 | juil. 2023 | juin 2024 | oct. 2024 |
| Paramètres | 0,9 Md | 3,5 Md (+ refiner) | 2 Md | 8 Md |
| Taille native | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM (fp16) | 4–6 Go | 8 Go | 10 Go | 16 Go+ |
| Vitesse (RTX 3060) | ~4 s | ~15 s | ~20 s | ~60 s |
| Compréhension du prompt | mots-clés | mots-clés, meilleure composition | phrases, plusieurs sujets | la meilleure |
| Texte dans l’image | non | rarement | oui, court | oui |
| Noms d’artistes | fort | fort | faible | faible |
| Modèles communautaires | des milliers | nombreux | peu | en croissance |
| Licence | OpenRAIL-M | OpenRAIL++ | Community licence (gratuite sous 1 M$ de CA) | |
| Essayer sur ce site | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5 : le cheval de trait
Petit, rapide, personnalisé à l’infini. Il existe des variantes photoréalistes et anime, des modèles ControlNet, des LoRA et des embeddings pour tout. Ses faiblesses : la résolution de base de 512 px, les mains, et une lecture littérale des prompts. Il reste le bon choix pour une carte de 6 Go, les chaînes d’animation et le travail intensif avec ControlNet. Le txt2img des membres de ce site tourne sur SD 1.5.
SDXL 1.0 : détail et style
Quatre fois plus de pixels, un second encodeur de texte, un refiner pour les dernières étapes. Visages, mains et composition ont beaucoup progressé, et les noms d’artistes ont un effet fort et prévisible, raison pour laquelle notre comparaison de 1 731 artistes a été générée avec SDXL. Il demande 8 Go et est trois à quatre fois plus lent que 1.5. Les versions distillées (SDXL Turbo, LCM LoRA) le ramènent à une seconde par image au prix d’un peu de qualité.
Stable Diffusion 3 et 3.5 : compréhension et texte
Une nouvelle architecture (transformeur de diffusion à trois encodeurs de texte) qui suit des phrases plutôt que des listes de mots-clés : « a red cube on a blue sphere, to the left of a green cone » sort juste, et un texte court entre guillemets s’affiche correctement. 3 Medium avait des problèmes d’anatomie que 3.5 a corrigés ; 3.5 Large est le meilleur modèle ouvert de la famille, 3.5 Medium le plus équilibré. Les noms d’artistes et les vieilles habitudes de prompt négatif comptent moins. Essayez Stable Diffusion 3 Medium ici.
Lequel choisir ?
- Apprentissage, carte de 6 Go, ControlNet, animation : SD 1.5.
- Illustration, portraits, styles d’artistes, 8–12 Go : SDXL.
- Affiches avec texte, scènes complexes, 12–16 Go et plus : SD 3.5 Medium ou Large.
- Pas de GPU : les outils en ligne de ce site, sans compte.