Stable Diffusion이란 무엇인가요?

작성자 업데이트 3 분 소요

Stable Diffusion(스테이블 디퓨전)은 텍스트 설명을 이미지로 바꿔 주는 오픈소스 인공지능입니다. Stability AI가 2022년 8월에 공개했으며, 일반 게이밍 그래픽카드에서 실행되고 누구나 파인튜닝할 수 있습니다. 이 사이트의 도구를 비롯한 많은 무료 도구가 이 모델로 움직입니다.

Stable Diffusion은 어떻게 작동하나요?

Stable Diffusion은 잠재 확산 모델(latent diffusion model)입니다. 학습 단계에서는 캡션이 붙은 수억 장의 이미지에서 노이즈를 걷어 내는 법을 배웠습니다. 이미지를 생성할 때는 완전한 무작위 노이즈에서 출발해, 입력한 텍스트가 가리키는 방향으로 한 스텝씩 노이즈를 제거합니다. 20~30스텝이 지나면 노이즈는 프롬프트에 맞는 그림이 되어 있습니다.

이 과정에서는 세 가지 구성 요소가 함께 움직입니다. 단어를 숫자로 바꾸는 텍스트 인코더, 노이즈 제거를 맡는 U-Net(버전 3부터는 디퓨전 트랜스포머), 그리고 압축된 잠재 이미지를 픽셀로 되돌리는 디코더입니다. 이렇게 압축된 잠재 공간에서 계산하기 때문에 일반 소비자용 GPU에서도 충분히 빠르게 돌아갑니다.

어떤 버전이 있나요?

  • Stable Diffusion 1.5(2022년): 512×512 이미지. 커뮤니티가 만든 파인튜닝 모델과 LoRA가 수천 개에 이릅니다.
  • SDXL 1.0(2023년 7월): 기본 해상도 1024×1024. 손, 얼굴, 구도가 좋아졌고 디테일을 다듬는 리파이너(refiner) 모델이 함께 나왔습니다.
  • Stable Diffusion 3 Medium(2024년 6월): 디퓨전 트랜스포머 구조. 글자 표현과 프롬프트 이해력이 크게 좋아졌습니다.
  • Stable Diffusion 3.5(2024년 10월): 현재 최신 버전. Large, Large Turbo, Medium 세 가지 크기로 제공되며 프롬프트를 더 충실히 따르고 스타일도 더 다양합니다.

자세한 비교는 SDXL vs Stable Diffusion 3 가이드에서 확인하세요.

무엇을 할 수 있나요?

텍스트 투 이미지 생성은 시작일 뿐입니다. 같은 모델로 이미지 투 이미지(스케치나 사진을 변형), 인페인팅(일부 영역만 다시 그리기), 아웃페인팅(그림 바깥으로 확장)을 할 수 있고, 전용 초해상도 모델로 업스케일링을 하거나 ControlNet으로 포즈, 깊이 맵, 윤곽선을 따라 생성할 수도 있습니다. LoRA라는 애드온을 쓰면 별도의 작은 파일 하나로 특정 스타일이나 캐릭터를 가르칠 수 있습니다.

이 사이트에서는 계정 없이 인페인팅과 업스케일링을 써 볼 수 있고, SDXL이나 Stable Diffusion 3로 이미지를 생성할 수 있습니다. 1,731가지 아티스트 스타일과 설명이 달린 프롬프트 82개를 둘러보면 프롬프트가 어떤 역할을 하는지 익힐 수 있습니다.

DALL-E, Midjourney와 무엇이 다른가요?

두 가지가 다릅니다. 가중치가 공개되어 있고, 로컬에서 실행된다는 점입니다. 모델을 내려받아 내 컴퓨터에서 무료로 돌리고, 원하는 대로 수정하고, 이미지를 외부에 내보내지 않고 보관할 수 있습니다. Midjourney와 OpenAI의 이미지 모델(DALL-E, 지금은 GPT Image)은 폐쇄형 서비스입니다. 구독료나 이미지당 요금을 내야 하고, 모델은 각 회사의 서버 밖으로 나오지 않습니다. 그 대신 Stable Diffusion은 사용자가 챙겨야 할 것이 더 많습니다. 모델을 고르고, 정확한 프롬프트와 네거티브 프롬프트를 작성하고, 시드를 이해해야 합니다.

고사양 컴퓨터가 필요한가요?

직접 실행한다면 SD 1.5는 VRAM 6GB 이상의 최신 NVIDIA 그래픽카드로 충분하고, SDXL은 8GB면 됩니다. AMD 그래픽카드는 Linux에서 ROCm으로, Apple Silicon은 MPS 백엔드로 작동합니다. 이런 장비가 없다면 별도의 하드웨어가 필요 없는 이 사이트의 도구를 쓰면 됩니다. 일부는 저희 GPU에서 실행되며 대기열과 진행 상황이 실시간으로 표시되고, 나머지는 외부에 호스팅된 데모를 페이지에 임베드한 것입니다. 준비가 되면 Stable Diffusion 로컬 설치 방법을 읽어 보세요.

자주 묻는 질문

Stable Diffusion은 무료인가요?

네. 모델은 오픈 라이선스로 공개되어 있습니다(1.5는 CreativeML OpenRAIL-M, SDXL은 OpenRAIL++-M, 3.x는 연 매출 100만 달러 미만이면 무료인 Stability AI Community Licence). 로컬에서 실행하면 전기 요금만 들고, 이 사이트의 도구는 광고로 운영되는 무료 서비스입니다.

생성한 이미지의 권리는 누구에게 있나요?

라이선스상으로는 사용자에게 있습니다. Stability AI는 생성 결과물에 대해 어떤 권리도 주장하지 않습니다. 다만 AI 이미지에 관한 저작권법은 나라마다 다르고 아직 정리되는 중입니다. EU와 미국에서는 순수하게 AI만으로 생성한 이미지가 일반적으로 저작권 보호를 받지 못합니다.

Stable Diffusion으로 이미지 안에 글자를 넣을 수 있나요?

1.5와 SDXL은 글자에 약합니다. Stable Diffusion 3와 3.5는 프롬프트에서 문구를 따옴표로 감싸면 짧은 문구와 제목을 훨씬 잘 그려 냅니다.