Comment fonctionne Stable Diffusion ?
Stable Diffusion est un modèle de diffusion latente. Pendant l’entraînement, il a appris à retirer du bruit sur des millions d’images accompagnées de leur légende. À la génération, il part d’un bruit purement aléatoire et, étape par étape, le débruite dans la direction de votre texte : après 20 à 30 étapes, le bruit est devenu une image qui correspond au prompt.
Trois éléments coopèrent : un encodeur de texte qui transforme vos mots en nombres, un U-Net (ou, depuis la version 3, un transformeur de diffusion) qui débruite, et un décodeur qui convertit l’image latente compacte en pixels. Travailler dans cet espace compressé est ce qui le rend assez rapide pour une carte grand public.
Quelles versions existent ?
- Stable Diffusion 1.5 (2022) : images 512×512, le modèle le plus personnalisé de l’histoire, des milliers de variantes et de LoRA communautaires.
- SDXL 1.0 (juillet 2023) : 1024×1024 en natif, meilleures mains, visages et compositions, un modèle « refiner » pour les détails.
- Stable Diffusion 3 Medium (juin 2024) : transformeur de diffusion, rendu du texte et compréhension du prompt bien meilleurs.
- Stable Diffusion 3.5 (octobre 2024) : la version actuelle, en tailles Large, Large Turbo et Medium, images plus nettes et couleurs plus riches.
Comparaison détaillée dans SDXL contre Stable Diffusion 3.
Que peut-on faire avec ?
Le texte vers image n’est que le début. Les mêmes modèles font de l’image vers image (transformer un croquis ou une photo), de l’inpainting (repeindre une zone), de l’outpainting (prolonger une image), de l’agrandissement avec des modèles de super-résolution et, avec ControlNet, une génération guidée par une pose, une carte de profondeur ou des contours. Des extensions appelées LoRA lui apprennent un style ou un personnage en quelques mégaoctets.
Sur ce site, vous pouvez essayer l’inpainting et l’agrandissement sans compte, générer des images avec SDXL ou Stable Diffusion 3, et parcourir 1 731 styles d’artistes et 69 prompts documentés pour comprendre ce que fait un prompt.
Quelle différence avec DALL-E ou Midjourney ?
Deux choses : les poids sont publics et le modèle tourne en local. Vous pouvez le télécharger, l’exécuter gratuitement sur votre ordinateur, le modifier et garder vos images privées. DALL-E et Midjourney sont des services fermés facturés à l’image. En contrepartie, Stable Diffusion demande davantage : choisir un modèle, écrire un prompt précis et un prompt négatif, comprendre la seed.
Faut-il un ordinateur puissant ?
Pour le faire tourner soi-même, une carte NVIDIA récente avec au moins 6 Go de mémoire vidéo suffit pour SD 1.5, et 8 Go sont confortables pour SDXL. Les cartes AMD fonctionnent via ROCm sous Linux et les Mac Apple Silicon via le backend MPS. Sans cela, les outils de ce site tournent sur notre GPU, avec la file d’attente et la progression affichées en direct. Lisez comment installer Stable Diffusion en local quand vous serez prêt.