Stable Diffusion은 어떻게 작동하나요?
Stable Diffusion은 잠재 확산 모델(latent diffusion model)입니다. 학습 단계에서는 캡션이 붙은 수억 장의 이미지에서 노이즈를 걷어 내는 법을 배웠습니다. 이미지를 생성할 때는 완전한 무작위 노이즈에서 출발해, 입력한 텍스트가 가리키는 방향으로 한 스텝씩 노이즈를 제거합니다. 20~30스텝이 지나면 노이즈는 프롬프트에 맞는 그림이 되어 있습니다.
이 과정에서는 세 가지 구성 요소가 함께 움직입니다. 단어를 숫자로 바꾸는 텍스트 인코더, 노이즈 제거를 맡는 U-Net(버전 3부터는 디퓨전 트랜스포머), 그리고 압축된 잠재 이미지를 픽셀로 되돌리는 디코더입니다. 이렇게 압축된 잠재 공간에서 계산하기 때문에 일반 소비자용 GPU에서도 충분히 빠르게 돌아갑니다.
어떤 버전이 있나요?
- Stable Diffusion 1.5(2022년): 512×512 이미지. 커뮤니티가 만든 파인튜닝 모델과 LoRA가 수천 개에 이릅니다.
- SDXL 1.0(2023년 7월): 기본 해상도 1024×1024. 손, 얼굴, 구도가 좋아졌고 디테일을 다듬는 리파이너(refiner) 모델이 함께 나왔습니다.
- Stable Diffusion 3 Medium(2024년 6월): 디퓨전 트랜스포머 구조. 글자 표현과 프롬프트 이해력이 크게 좋아졌습니다.
- Stable Diffusion 3.5(2024년 10월): 현재 최신 버전. Large, Large Turbo, Medium 세 가지 크기로 제공되며 프롬프트를 더 충실히 따르고 스타일도 더 다양합니다.
자세한 비교는 SDXL vs Stable Diffusion 3 가이드에서 확인하세요.
무엇을 할 수 있나요?
텍스트 투 이미지 생성은 시작일 뿐입니다. 같은 모델로 이미지 투 이미지(스케치나 사진을 변형), 인페인팅(일부 영역만 다시 그리기), 아웃페인팅(그림 바깥으로 확장)을 할 수 있고, 전용 초해상도 모델로 업스케일링을 하거나 ControlNet으로 포즈, 깊이 맵, 윤곽선을 따라 생성할 수도 있습니다. LoRA라는 애드온을 쓰면 별도의 작은 파일 하나로 특정 스타일이나 캐릭터를 가르칠 수 있습니다.
이 사이트에서는 계정 없이 인페인팅과 업스케일링을 써 볼 수 있고, SDXL이나 Stable Diffusion 3로 이미지를 생성할 수 있습니다. 1,731가지 아티스트 스타일과 설명이 달린 프롬프트 82개를 둘러보면 프롬프트가 어떤 역할을 하는지 익힐 수 있습니다.
DALL-E, Midjourney와 무엇이 다른가요?
두 가지가 다릅니다. 가중치가 공개되어 있고, 로컬에서 실행된다는 점입니다. 모델을 내려받아 내 컴퓨터에서 무료로 돌리고, 원하는 대로 수정하고, 이미지를 외부에 내보내지 않고 보관할 수 있습니다. Midjourney와 OpenAI의 이미지 모델(DALL-E, 지금은 GPT Image)은 폐쇄형 서비스입니다. 구독료나 이미지당 요금을 내야 하고, 모델은 각 회사의 서버 밖으로 나오지 않습니다. 그 대신 Stable Diffusion은 사용자가 챙겨야 할 것이 더 많습니다. 모델을 고르고, 정확한 프롬프트와 네거티브 프롬프트를 작성하고, 시드를 이해해야 합니다.
고사양 컴퓨터가 필요한가요?
직접 실행한다면 SD 1.5는 VRAM 6GB 이상의 최신 NVIDIA 그래픽카드로 충분하고, SDXL은 8GB면 됩니다. AMD 그래픽카드는 Linux에서 ROCm으로, Apple Silicon은 MPS 백엔드로 작동합니다. 이런 장비가 없다면 별도의 하드웨어가 필요 없는 이 사이트의 도구를 쓰면 됩니다. 일부는 저희 GPU에서 실행되며 대기열과 진행 상황이 실시간으로 표시되고, 나머지는 외부에 호스팅된 데모를 페이지에 임베드한 것입니다. 준비가 되면 Stable Diffusion 로컬 설치 방법을 읽어 보세요.