Hvad er Stable Diffusion?

Af Opdateret 3 min. læsning

Stable Diffusion er en open source AI-model, der laver et billede ud fra en tekstbeskrivelse. Den blev udgivet af Stability AI i august 2022, kører på et almindeligt gaming-grafikkort, kan finjusteres af alle og driver mange gratis værktøjer, blandt andet dem på dette websted.

Hvordan virker Stable Diffusion?

Stable Diffusion er en latent diffusionsmodel. Under træningen lærte den at fjerne støj fra hundredvis af millioner billeder med tilhørende billedtekster. Når den genererer, starter den fra ren tilfældig støj og fjerner den trin for trin i retning af din tekst: efter 20 til 30 steps er støjen blevet til et billede, der matcher prompten.

Tre dele arbejder sammen: en tekst-encoder, der oversætter dine ord til tal, et U-Net (eller fra version 3 en diffusion transformer), der fjerner støjen, og en decoder, der omsætter det komprimerede latente billede til pixels. Støjfjernelsen foregår på det komprimerede latente billede, og det er derfor, modellen er hurtig nok til et almindeligt grafikkort.

Hvilke versioner findes der?

  • Stable Diffusion 1.5 (2022): billeder i 512×512, tusindvis af finjusteringer og LoRAs fra fællesskabet.
  • SDXL 1.0 (juli 2023): 1024×1024 nativt, bedre hænder, ansigter og komposition, en refiner-model til detaljerne.
  • Stable Diffusion 3 Medium (juni 2024): diffusion transformer, langt bedre tekstgengivelse og promptforståelse.
  • Stable Diffusion 3.5 (oktober 2024): den aktuelle udgave i størrelserne Large, Large Turbo og Medium, med bedre promptfølgsomhed og mere varierede stilarter.

Se den detaljerede sammenligning i SDXL vs Stable Diffusion 3.

Hvad kan du bruge den til?

Tekst til billede er kun begyndelsen. De samme modeller klarer img2img (omdan en skitse eller et foto), inpainting (mal ét område om), outpainting (forlæng et billede), opskalering med dedikerede superopløsningsmodeller og, med ControlNet, generering styret af en pose, et dybdekort eller kanter. Små tilføjelsesfiler kaldet LoRAs lærer modellen en stil eller en karakter.

På dette websted kan du prøve inpainting og opskalering uden konto, generere billeder med SDXL eller Stable Diffusion 3 og gennemse 1.731 kunstnerstile og 82 dokumenterede prompts for at lære, hvad en prompt gør.

Hvordan adskiller den sig fra DALL-E og Midjourney?

På to punkter: vægtene er offentlige, og den kører lokalt. Du kan downloade modellen, køre den gratis på din egen computer, ændre den og holde dine billeder private. Midjourney og OpenAIs billedmodeller (DALL-E, nu GPT Image) er lukkede tjenester: du betaler via abonnement eller pr. billede, og modellen forlader aldrig deres servere. Til gengæld kræver Stable Diffusion mere af dig. Du skal vælge en model, skrive en præcis prompt og en negativ prompt og forstå, hvad seedet gør.

Skal jeg have en kraftig computer?

Vil du køre den selv, rækker et nyere NVIDIA-kort med 6 GB VRAM til SD 1.5 og 8 GB til SDXL. AMD-kort virker via ROCm på Linux, og Apple Silicon via MPS-backend. Har du ingen af delene, kræver værktøjerne på dette websted ingen hardware: nogle kører på vores GPU med kø og fremskridt vist live, andre er hostede demoer indlejret i siden. Læs hvordan du installerer Stable Diffusion lokalt, når du er klar.

Spørgsmål, andre også stiller

Er Stable Diffusion gratis?

Ja. Modellerne udgives under åbne licenser (CreativeML OpenRAIL-M for 1.5, OpenRAIL++-M for SDXL og for 3.x Stability AI Community License, som er gratis under en million dollars i årlig omsætning). At køre den lokalt koster kun strøm; værktøjerne på dette websted er gratis og finansieret af reklamer.

Hvem ejer de billeder, jeg genererer?

Det gør du, hvad licensen angår: Stability AI gør ikke krav på resultaterne. Ophavsretten til AI-billeder varierer fra land til land og er stadig under afklaring; i EU og USA kan rent AI-genererede billeder som regel ikke ophavsretsbeskyttes.

Kan Stable Diffusion lave tekst inde i billeder?

Version 1.5 og SDXL har svært ved tekst. Stable Diffusion 3 og 3.5 gengiver korte tekster og overskrifter langt bedre, når du sætter ordene i anførselstegn i prompten.