Stable Diffusion là gì?

Tác giả: Cập nhật: 4 phút đọc

Stable Diffusion là AI mã nguồn mở biến mô tả bằng văn bản thành hình ảnh. Do Stability AI phát hành tháng 8 năm 2022, mô hình này chạy trên card đồ họa chơi game thông thường, ai cũng fine-tune được, và là nền tảng của nhiều công cụ miễn phí, kể cả trên trang này.

Stable Diffusion hoạt động như thế nào?

Stable Diffusion là một mô hình khuếch tán tiềm ẩn (latent diffusion model). Trong quá trình huấn luyện, nó học cách khử nhiễu trên hàng trăm triệu bức ảnh có kèm chú thích. Khi tạo ảnh, nó xuất phát từ nhiễu ngẫu nhiên hoàn toàn rồi khử nhiễu từng bước theo hướng mà văn bản của bạn chỉ ra: sau 20 đến 30 bước, đám nhiễu đã thành một bức ảnh khớp với prompt.

Có ba thành phần phối hợp với nhau: bộ mã hóa văn bản (text encoder) chuyển câu chữ của bạn thành con số, U-Net (hoặc diffusion transformer kể từ phiên bản 3) đảm nhận việc khử nhiễu, và bộ giải mã (decoder) chuyển ảnh tiềm ẩn (latent) nén gọn thành điểm ảnh. Chính nhờ làm việc trong không gian tiềm ẩn đã nén này mà mô hình đủ nhanh để chạy trên GPU phổ thông.

Có những phiên bản nào?

  • Stable Diffusion 1.5 (2022): ảnh 512×512, hàng nghìn bản fine-tune và LoRA của cộng đồng.
  • SDXL 1.0 (tháng 7 năm 2023): độ phân giải gốc 1024×1024, bàn tay, khuôn mặt và bố cục đẹp hơn, có thêm mô hình refiner để trau chuốt chi tiết.
  • Stable Diffusion 3 Medium (tháng 6 năm 2024): kiến trúc diffusion transformer, viết chữ trong ảnh và hiểu prompt tốt hơn hẳn.
  • Stable Diffusion 3.5 (tháng 10 năm 2024): bản phát hành hiện tại, có ba cỡ Large, Large Turbo và Medium, bám prompt sát hơn, phong cách đa dạng hơn.

Xem phần so sánh chi tiết trong bài SDXL và Stable Diffusion 3.

Stable Diffusion làm được những gì?

Tạo ảnh từ văn bản (text-to-image) mới chỉ là bước khởi đầu. Chính những mô hình ấy còn làm được image-to-image (biến đổi một bản phác thảo hay một bức ảnh), inpainting (vẽ lại một vùng), outpainting (mở rộng bức ảnh), upscale bằng các mô hình siêu phân giải chuyên dụng, và khi có ControlNet thì tạo ảnh theo một tư thế, một bản đồ độ sâu hay đường nét cho trước. Các phần bổ sung gọi là LoRA, mỗi LoRA là một tệp nhỏ riêng biệt, dạy cho mô hình một phong cách hay một nhân vật.

Trên trang này, bạn có thể thử inpainting và upscale ảnh mà không cần tài khoản, tạo ảnh bằng SDXL hoặc Stable Diffusion 3, và xem 1.731 phong cách nghệ sĩ cùng 82 prompt mẫu có chú giải để hiểu một prompt tác động ra sao.

Khác gì so với DALL-E hay Midjourney?

Có hai điểm: trọng số của mô hình được công khai và mô hình chạy ngay trên máy của bạn. Bạn có thể tải mô hình về, chạy miễn phí trên máy tính của mình, chỉnh sửa nó và giữ ảnh cho riêng mình. Midjourney và các mô hình tạo ảnh của OpenAI (DALL-E, nay là GPT Image) là dịch vụ đóng: bạn trả phí thuê bao hoặc trả theo từng ảnh, còn mô hình thì không bao giờ rời khỏi máy chủ của họ. Đổi lại, Stable Diffusion đòi hỏi ở bạn nhiều hơn: chọn mô hình, viết prompt chính xác kèm negative prompt, và hiểu seed là gì.

Có cần máy tính mạnh không?

Để tự chạy, một card NVIDIA đời mới có ít nhất 6 GB VRAM là đủ cho SD 1.5, còn với SDXL thì 8 GB là đủ. Card AMD chạy được qua ROCm trên Linux, còn Apple Silicon thì qua backend MPS. Nếu máy bạn không đáp ứng được, các công cụ trên trang này không đòi hỏi phần cứng nào: một số chạy trên GPU của chúng tôi, có hiển thị trực tiếp hàng chờ và tiến độ, số khác là bản demo chạy trên máy chủ bên ngoài, nhúng vào trang. Khi đã sẵn sàng, hãy đọc cách cài đặt Stable Diffusion trên máy tính.

Dùng thử ngay, miễn phíTạo ảnh với Stable Diffusion XL →

Câu hỏi thường gặp

Stable Diffusion có miễn phí không?

Có. Các mô hình được phát hành theo giấy phép mở (CreativeML OpenRAIL-M cho bản 1.5, OpenRAIL++-M cho SDXL, còn dòng 3.x dùng Stability AI Community Licence, miễn phí nếu doanh thu hằng năm dưới một triệu đô la). Chạy trên máy của bạn chỉ tốn tiền điện; các công cụ trên trang này miễn phí và được duy trì nhờ quảng cáo.

Ảnh tôi tạo ra thuộc về ai?

Xét về mặt giấy phép thì thuộc về bạn: Stability AI không đòi quyền gì đối với ảnh tạo ra. Luật bản quyền đối với ảnh AI mỗi nước một khác và vẫn đang được định hình; ở EU và Mỹ, ảnh hoàn toàn do AI tạo ra nhìn chung không được bảo hộ bản quyền.

Stable Diffusion có viết được chữ trong ảnh không?

Bản 1.5 và SDXL viết chữ rất chật vật. Stable Diffusion 3 và 3.5 viết chữ ngắn và tiêu đề tốt hơn hẳn khi bạn đặt phần chữ đó trong dấu ngoặc kép ở prompt.