Hur fungerar Stable Diffusion?
Stable Diffusion är en latent diffusionsmodell. Under träningen lärde den sig att ta bort brus från hundratals miljoner bilder med tillhörande bildtexter. När du genererar startar den från rent slumpbrus och avbrusar det steg för steg i riktning mot din text: efter 20 till 30 steg har bruset blivit en bild som matchar prompten.
Tre delar samarbetar: en textkodare som omvandlar dina ord till tal, ett U-Net (eller, sedan version 3, en diffusionstransformer) som sköter avbrusningen, och en avkodare som omvandlar den kompakta latenta bilden till pixlar. Avbrusningen sker i den kompakta latenta bilden, och det är därför modellen är snabb nog för ett vanligt konsumentgrafikkort.
Vilka versioner finns?
- Stable Diffusion 1.5 (2022): bilder i 512×512, tusentals finjusterade modeller och LoRAs från communityn.
- SDXL 1.0 (juli 2023): 1024×1024 nativt, bättre händer, ansikten och komposition, plus en refiner-modell för detaljerna.
- Stable Diffusion 3 Medium (juni 2024): diffusionstransformer, mycket bättre textrendering och promptförståelse.
- Stable Diffusion 3.5 (oktober 2024): den aktuella versionen, i storlekarna Large, Large Turbo och Medium, med bättre promptföljsamhet och mer varierade stilar.
Se den detaljerade jämförelsen i SDXL vs Stable Diffusion 3.
Vad kan man göra med den?
Text till bild är bara början. Samma modeller klarar bild till bild (img2img: förvandla en skiss eller ett foto), inpainting (måla om ett område), outpainting (utvidga en bild), uppskalning med särskilda superupplösningsmodeller och, med ControlNet, generering styrd av en pose, en djupkarta eller kanter. Tillägg som kallas LoRAs, var och en en liten separat fil, lär modellen en stil eller en karaktär.
På den här webbplatsen kan du prova inpainting och uppskalning utan konto, generera bilder med SDXL eller Stable Diffusion 3, och bläddra bland 1 731 konstnärsstilar och 82 dokumenterade prompts för att lära dig vad en prompt gör.
Hur skiljer den sig från DALL-E och Midjourney?
Två saker: vikterna är offentliga och den körs lokalt. Du kan ladda ner modellen, köra den gratis på din egen dator, ändra den och behålla dina bilder privata. Midjourney och OpenAI:s bildmodeller (DALL-E, numera GPT Image) är stängda tjänster: du betalar via prenumeration eller per bild, och modellen lämnar aldrig deras servrar. I gengäld kräver Stable Diffusion mer av dig. Du måste välja en modell, skriva en exakt prompt och en negativ prompt, och förstå vad seedet gör.
Behöver jag en kraftfull dator?
För att köra den själv räcker ett nyare NVIDIA-kort med 6 GB VRAM för SD 1.5 och 8 GB för SDXL. AMD-kort fungerar via ROCm på Linux och Apple Silicon via MPS-backend. Har du inget av det behöver verktygen på den här webbplatsen ingen hårdvara alls: vissa körs på vår GPU, med kö och förlopp som visas live, andra är externa demor inbäddade på sidan. Läs hur du installerar Stable Diffusion lokalt när du är redo.