SDXL vs Stable Diffusion 3 vs SD 1.5 : lequel utiliser ?

Par Mis à jour le 3 min de lecture

Utilisez Stable Diffusion 1.5 pour la vitesse, la faible VRAM et le plus grand choix de modèles communautaires ; SDXL 1.0 pour des images détaillées en 1024×1024 et les styles d’artistes ; Stable Diffusion 3.5 pour les prompts à plusieurs sujets, le texte lisible et la meilleure qualité si votre GPU a 12 Go ou plus.

Tableau comparatif

SD 1.5SDXL 1.0SD 3 MediumSD 3.5 Large
Sortieoct. 2022juil. 2023juin 2024oct. 2024
Paramètres0,9 Md3,5 Md (+ refiner)2 Md8 Md
Taille native512×5121024×10241024×10241024×1024
VRAM (fp16)4–6 Go8 Go10 Go16 Go+
Vitesse (RTX 3060)~4 s~15 s~20 s~60 s
Compréhension du promptmots-clésmots-clés, meilleure compositionphrases, plusieurs sujetsla meilleure
Texte dans l’imagenonrarementoui, courtoui
Noms d’artistesfortfortfaiblefaible
Modèles communautairesdes milliersnombreuxpeuen croissance
LicenceOpenRAIL-MOpenRAIL++Community licence (gratuite sous 1 M$ de CA)
Essayer sur ce siteSD 1.5SDXLSD 3—

Stable Diffusion 1.5 : le cheval de trait

Petit, rapide, personnalisé à l’infini. Il existe des variantes photoréalistes et anime, des modèles ControlNet, des LoRA et des embeddings pour tout. Ses faiblesses : la résolution de base de 512 px, les mains, et une lecture littérale des prompts. Il reste le bon choix pour une carte de 6 Go, les chaînes d’animation et le travail intensif avec ControlNet. Le txt2img des membres de ce site tourne sur SD 1.5.

SDXL 1.0 : détail et style

Quatre fois plus de pixels, un second encodeur de texte, un refiner pour les dernières étapes. Visages, mains et composition ont beaucoup progressé, et les noms d’artistes ont un effet fort et prévisible, raison pour laquelle notre comparaison de 1 731 artistes a été générée avec SDXL. Il demande 8 Go et est trois à quatre fois plus lent que 1.5. Les versions distillées (SDXL Turbo, LCM LoRA) le ramènent à une seconde par image au prix d’un peu de qualité.

Stable Diffusion 3 et 3.5 : compréhension et texte

Une nouvelle architecture (transformeur de diffusion à trois encodeurs de texte) qui suit des phrases plutôt que des listes de mots-clés : « a red cube on a blue sphere, to the left of a green cone » sort juste, et un texte court entre guillemets s’affiche correctement. 3 Medium avait des problèmes d’anatomie que 3.5 a corrigés ; 3.5 Large est le meilleur modèle ouvert de la famille, 3.5 Medium le plus équilibré. Les noms d’artistes et les vieilles habitudes de prompt négatif comptent moins. Essayez Stable Diffusion 3 Medium ici.

Lequel choisir ?

  • Apprentissage, carte de 6 Go, ControlNet, animation : SD 1.5.
  • Illustration, portraits, styles d’artistes, 8–12 Go : SDXL.
  • Affiches avec texte, scènes complexes, 12–16 Go et plus : SD 3.5 Medium ou Large.
  • Pas de GPU : les outils en ligne de ce site, sans compte.
Essayer maintenant, gratuitementEssayer Stable Diffusion 3 Medium en ligne →

Questions fréquentes

SDXL est-il meilleur que SD 1.5 ?

Tel quel, oui : résolution plus élevée, meilleure anatomie et composition. SD 1.5 garde l’avantage en vitesse, en VRAM et par l’étendue des variantes communautaires.

Peut-on utiliser des LoRA SD 1.5 avec SDXL ou SD 3 ?

Non. Un LoRA est lié à l’architecture sur laquelle il a été entraîné ; chaque famille a besoin de ses propres LoRA.

Et Flux ?

Flux.1 de Black Forest Labs (août 2024) est un concurrent de 12 milliards de paramètres au suivi de prompt et au texte excellents ; il demande 12 à 24 Go de VRAM et n’est pas un modèle Stable Diffusion, mais les mêmes outils (ComfyUI, Forge) le font tourner.