SDXL, Stable Diffusion 3 hay SD 1.5: nên dùng mô hình nào?

Tác giả: Cập nhật: 4 phút đọc

Hãy dùng Stable Diffusion 1.5 khi cần tốc độ, ít VRAM và kho mô hình cộng đồng đồ sộ; SDXL 1.0 cho ảnh 1024×1024 chi tiết và phong cách nghệ sĩ; Stable Diffusion 3.5 cho prompt nhiều chủ thể, chữ đọc được và chất lượng tốt nhất nếu GPU của bạn có từ 12 GB trở lên.

Bảng so sánh

SD 1.5SDXL 1.0SD 3 MediumSD 3.5 Large
Phát hànhTháng 10/2022Tháng 7/2023Tháng 6/2024Tháng 10/2024
Số tham số0,9 tỷ2,6 tỷ (+ refiner)2 tỷ8 tỷ
Độ phân giải gốc512×5121024×10241024×10241024×1024
VRAM (fp16)4–6 GB8 GB10 GB19 GB (11 GB với fp8)
Tốc độ (GPU 12 GB của chúng tôi)~4 giây~20 giây——
Khả năng hiểu prompttừ khóatừ khóa, bố cục tốt hơncâu văn, nhiều chủ thểtốt nhất
Chữ trong ảnhkhônghiếm khicó, chữ ngắncó
Tên nghệ sĩmạnhmạnhyếu hơnyếu hơn
Mô hình cộng đồngrất nhiềunhiều nhất, tính cả Pony và Illustriousítít
Giấy phépOpenRAIL-MOpenRAIL++Community Licence (miễn phí nếu doanh thu dưới 1 triệu USD)
Thử trên trang nàySD 1.5SDXLSD 3—

Stable Diffusion 1.5: mô hình “quốc dân”

Nhỏ gọn, nhanh, được tùy biến không biết bao nhiêu mà kể. Bản fine-tune ảnh chân thực và anime, mô hình ControlNet, LoRA và embedding: thứ gì cũng có. Điểm yếu của nó là độ phân giải gốc 512 px, bàn tay, và cách hiểu prompt theo đúng từng chữ. Nó vẫn là lựa chọn đúng cho card 6 GB, cho việc làm animation bằng AnimateDiff và cho những công việc dùng nhiều ControlNet. Công cụ txt2img dành cho thành viên trên trang này chạy một mô hình SD 1.5 tùy biến.

SDXL 1.0: chi tiết và phong cách

Số điểm ảnh gấp bốn lần, thêm bộ mã hóa văn bản thứ hai, và một refiner cho những bước cuối. Khuôn mặt, bàn tay và bố cục cải thiện rất nhiều, còn tên nghệ sĩ có tác dụng mạnh và dễ đoán, đó là lý do bảng so sánh 1.731 nghệ sĩ của chúng tôi được tạo bằng SDXL. Nó cần 8 GB và chậm hơn bản 1.5 vài lần: khoảng 20 giây so với 4 giây mỗi ảnh trên GPU của chúng tôi. Các phiên bản distilled (chưng cất) như SDXL Turbo hay LCM LoRA chỉ cần từ một đến tám bước thay vì 25 đến 30, đổi lại chất lượng giảm đi phần nào.

Stable Diffusion 3 và 3.5: hiểu prompt và viết chữ

Một kiến trúc mới (diffusion transformer với ba bộ mã hóa văn bản) làm theo câu văn thay vì danh sách từ khóa: “a red cube on a blue sphere, to the left of a green cone” thường cho ra đúng như mô tả, và chữ ngắn đặt trong ngoặc kép thường đọc được. Bản 3 Medium gặp vấn đề về giải phẫu mà bản 3.5 đã giảm bớt; 3.5 Large là mô hình mạnh nhất của dòng này, 3.5 Medium là bản cân bằng. Tên nghệ sĩ và các thói quen cũ với negative prompt không còn quan trọng như trước. Hãy thử Stable Diffusion 3 Medium ngay tại đây.

Nên chọn bản nào?

  • Mới học, card 6 GB, ControlNet, AnimateDiff: SD 1.5.
  • Minh họa, chân dung, phong cách nghệ sĩ, 8–12 GB: SDXL.
  • Poster có chữ, cảnh phức tạp, từ 12–16 GB trở lên: SD 3.5 Medium hoặc Large.
  • Không có GPU: các công cụ trực tuyến trên trang này, không cần tài khoản.

Câu hỏi thường gặp

SDXL có tốt hơn SD 1.5 không?

Xét bản gốc chưa tùy biến thì có: độ phân giải cao hơn, giải phẫu và bố cục tốt hơn. SD 1.5 vẫn giữ ưu thế về tốc độ và VRAM, đồng thời vẫn có một kho fine-tune đồ sộ từ cộng đồng.

Có dùng được LoRA của SD 1.5 với SDXL hoặc SD 3 không?

Không. LoRA gắn liền với kiến trúc của mô hình dùng để huấn luyện nó; mỗi dòng mô hình cần LoRA riêng.

Còn Flux thì sao?

Flux.1 của Black Forest Labs (tháng 8 năm 2024) là đối thủ với 12 tỷ tham số, bám prompt và viết chữ xuất sắc; Flux.2 ra mắt tháng 11 năm 2025. Cả hai đều không phải là mô hình Stable Diffusion. ComfyUI chạy được cả hai, còn Forge chạy được Flux.1; checkpoint đầy đủ của Flux.1 nặng 24 GB, các bản lượng tử hóa thì vừa với card 6 đến 12 GB.