Vad är Stable Diffusion?

Av Uppdaterad 3 min läsning

Stable Diffusion är en AI-modell med öppen källkod som gör om en textbeskrivning till en bild. Den släpptes av Stability AI i augusti 2022, körs på ett vanligt grafikkort för spel, kan finjusteras av vem som helst och ligger bakom många gratisverktyg, bland annat dem på den här webbplatsen.

Hur fungerar Stable Diffusion?

Stable Diffusion är en latent diffusionsmodell. Under träningen lärde den sig att ta bort brus från hundratals miljoner bilder med tillhörande bildtexter. När du genererar startar den från rent slumpbrus och avbrusar det steg för steg i riktning mot din text: efter 20 till 30 steg har bruset blivit en bild som matchar prompten.

Tre delar samarbetar: en textkodare som omvandlar dina ord till tal, ett U-Net (eller, sedan version 3, en diffusionstransformer) som sköter avbrusningen, och en avkodare som omvandlar den kompakta latenta bilden till pixlar. Avbrusningen sker i den kompakta latenta bilden, och det är därför modellen är snabb nog för ett vanligt konsumentgrafikkort.

Vilka versioner finns?

  • Stable Diffusion 1.5 (2022): bilder i 512×512, tusentals finjusterade modeller och LoRAs från communityn.
  • SDXL 1.0 (juli 2023): 1024×1024 nativt, bättre händer, ansikten och komposition, plus en refiner-modell för detaljerna.
  • Stable Diffusion 3 Medium (juni 2024): diffusionstransformer, mycket bättre textrendering och promptförståelse.
  • Stable Diffusion 3.5 (oktober 2024): den aktuella versionen, i storlekarna Large, Large Turbo och Medium, med bättre promptföljsamhet och mer varierade stilar.

Se den detaljerade jämförelsen i SDXL vs Stable Diffusion 3.

Vad kan man göra med den?

Text till bild är bara början. Samma modeller klarar bild till bild (img2img: förvandla en skiss eller ett foto), inpainting (måla om ett område), outpainting (utvidga en bild), uppskalning med särskilda superupplösningsmodeller och, med ControlNet, generering styrd av en pose, en djupkarta eller kanter. Tillägg som kallas LoRAs, var och en en liten separat fil, lär modellen en stil eller en karaktär.

På den här webbplatsen kan du prova inpainting och uppskalning utan konto, generera bilder med SDXL eller Stable Diffusion 3, och bläddra bland 1 731 konstnärsstilar och 82 dokumenterade prompts för att lära dig vad en prompt gör.

Hur skiljer den sig från DALL-E och Midjourney?

Två saker: vikterna är offentliga och den körs lokalt. Du kan ladda ner modellen, köra den gratis på din egen dator, ändra den och behålla dina bilder privata. Midjourney och OpenAI:s bildmodeller (DALL-E, numera GPT Image) är stängda tjänster: du betalar via prenumeration eller per bild, och modellen lämnar aldrig deras servrar. I gengäld kräver Stable Diffusion mer av dig. Du måste välja en modell, skriva en exakt prompt och en negativ prompt, och förstå vad seedet gör.

Behöver jag en kraftfull dator?

För att köra den själv räcker ett nyare NVIDIA-kort med 6 GB VRAM för SD 1.5 och 8 GB för SDXL. AMD-kort fungerar via ROCm på Linux och Apple Silicon via MPS-backend. Har du inget av det behöver verktygen på den här webbplatsen ingen hårdvara alls: vissa körs på vår GPU, med kö och förlopp som visas live, andra är externa demor inbäddade på sidan. Läs hur du installerar Stable Diffusion lokalt när du är redo.

Andra vanliga frågor

Är Stable Diffusion gratis?

Ja. Modellerna släpps under öppna licenser (CreativeML OpenRAIL-M för 1.5, OpenRAIL++-M för SDXL och, för 3.x, Stability AI Community License, som är gratis under en miljon dollar i årsomsättning). Att köra lokalt kostar bara el; verktygen på den här webbplatsen är gratis och annonsfinansierade.

Vem äger bilderna jag genererar?

Du, vad licensen beträffar: Stability AI gör inga anspråk på det som genereras. Upphovsrättsreglerna för AI-bilder varierar mellan länder och är ännu inte fastlagda; i EU och USA kan rent AI-genererade bilder i regel inte få upphovsrättsskydd.

Kan Stable Diffusion skriva text i bilder?

Version 1.5 och SDXL har svårt med text. Stable Diffusion 3 och 3.5 återger kort text och rubriker betydligt bättre när du sätter orden inom citattecken i prompten.