비교표
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| 출시 | 2022년 10월 | 2023년 7월 | 2024년 6월 | 2024년 10월 |
| 파라미터 수 | 9억 | 26억(+ 리파이너) | 20억 | 80억 |
| 기본 해상도 | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM(fp16) | 4~6GB | 8GB | 10GB | 19GB(fp8은 11GB) |
| 속도(저희 12GB GPU) | 약 4초 | 약 20초 | — | — |
| 프롬프트 이해력 | 키워드 | 키워드, 구도 향상 | 문장, 여러 피사체 | 가장 우수 |
| 이미지 속 글자 | 불가 | 드물게 가능 | 짧은 문구 가능 | 가능 |
| 아티스트 이름 | 강함 | 강함 | 더 약함 | 더 약함 |
| 커뮤니티 모델 | 매우 많음 | 가장 많음(Pony, Illustrious 포함) | 적음 | 적음 |
| 라이선스 | OpenRAIL-M | OpenRAIL++ | Community Licence(연 매출 100만 달러 미만 무료) | |
| 이 사이트에서 써 보기 | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5: 든든한 주력 모델
작고 빠르며, 커뮤니티가 끝없이 커스터마이징해 온 모델입니다. 실사풍·애니풍 파인튜닝 모델, ControlNet 모델, LoRA, 임베딩까지 없는 것이 없습니다. 약점은 512px라는 기본 해상도와 손 표현, 그리고 프롬프트를 글자 그대로 받아들인다는 점입니다. 6GB 그래픽카드를 쓰거나, AnimateDiff로 애니메이션을 만들거나, ControlNet을 많이 쓰는 작업이라면 여전히 가장 알맞은 선택입니다. 이 사이트의 회원용 txt2img 페이지도 커스텀 SD 1.5 모델로 동작합니다.
SDXL 1.0: 디테일과 스타일
픽셀 수는 네 배가 되었고, 두 번째 텍스트 인코더와 마지막 스텝을 맡는 리파이너가 추가되었습니다. 얼굴, 손, 구도가 크게 좋아졌으며 아티스트 이름의 효과가 강하고 일정하게 나타납니다. 저희 아티스트 1,731명 비교를 SDXL로 생성한 것도 그래서입니다. 8GB가 필요하고 1.5보다 몇 배 느립니다. 저희 GPU에서 이미지 한 장에 1.5는 약 4초, SDXL은 약 20초가 걸립니다. 증류 버전(SDXL Turbo, LCM LoRA)을 쓰면 품질을 조금 내주는 대신 25~30스텝이 아니라 1~8스텝만으로 생성할 수 있습니다.
Stable Diffusion 3와 3.5: 이해력과 글자 표현
키워드 목록 대신 문장을 따라가는 새로운 아키텍처(텍스트 인코더 세 개를 갖춘 디퓨전 트랜스포머)입니다. "a red cube on a blue sphere, to the left of a green cone" 같은 프롬프트가 대체로 제대로 나오고, 따옴표 안의 짧은 문구도 대개 읽을 수 있게 그려집니다. 3 Medium에는 인체 표현 문제가 있었지만 3.5에서 줄었습니다. 3.5 Large는 이 계열에서 성능이 가장 뛰어난 모델이고, 3.5 Medium은 균형 잡힌 모델입니다. 아티스트 이름이나 예전 네거티브 프롬프트 습관은 덜 중요해졌습니다. Stable Diffusion 3 Medium을 여기에서 써 보세요.
어떤 모델을 골라야 할까요?
- 입문, 6GB 그래픽카드, ControlNet, AnimateDiff: SD 1.5.
- 일러스트, 인물, 아티스트 스타일, 8~12GB: SDXL.
- 글자가 들어간 포스터, 복잡한 장면, 12~16GB 이상: SD 3.5 Medium 또는 Large.
- GPU가 없을 때: 계정 없이 쓸 수 있는 이 사이트의 온라인 도구.