Stable Diffusion hoạt động như thế nào?
Stable Diffusion là một mô hình khuếch tán tiềm ẩn (latent diffusion model). Trong quá trình huấn luyện, nó học cách khử nhiễu trên hàng trăm triệu bức ảnh có kèm chú thích. Khi tạo ảnh, nó xuất phát từ nhiễu ngẫu nhiên hoàn toàn rồi khử nhiễu từng bước theo hướng mà văn bản của bạn chỉ ra: sau 20 đến 30 bước, đám nhiễu đã thành một bức ảnh khớp với prompt.
Có ba thành phần phối hợp với nhau: bộ mã hóa văn bản (text encoder) chuyển câu chữ của bạn thành con số, U-Net (hoặc diffusion transformer kể từ phiên bản 3) đảm nhận việc khử nhiễu, và bộ giải mã (decoder) chuyển ảnh tiềm ẩn (latent) nén gọn thành điểm ảnh. Chính nhờ làm việc trong không gian tiềm ẩn đã nén này mà mô hình đủ nhanh để chạy trên GPU phổ thông.
Có những phiên bản nào?
- Stable Diffusion 1.5 (2022): ảnh 512×512, hàng nghìn bản fine-tune và LoRA của cộng đồng.
- SDXL 1.0 (tháng 7 năm 2023): độ phân giải gốc 1024×1024, bàn tay, khuôn mặt và bố cục đẹp hơn, có thêm mô hình refiner để trau chuốt chi tiết.
- Stable Diffusion 3 Medium (tháng 6 năm 2024): kiến trúc diffusion transformer, viết chữ trong ảnh và hiểu prompt tốt hơn hẳn.
- Stable Diffusion 3.5 (tháng 10 năm 2024): bản phát hành hiện tại, có ba cỡ Large, Large Turbo và Medium, bám prompt sát hơn, phong cách đa dạng hơn.
Xem phần so sánh chi tiết trong bài SDXL và Stable Diffusion 3.
Stable Diffusion làm được những gì?
Tạo ảnh từ văn bản (text-to-image) mới chỉ là bước khởi đầu. Chính những mô hình ấy còn làm được image-to-image (biến đổi một bản phác thảo hay một bức ảnh), inpainting (vẽ lại một vùng), outpainting (mở rộng bức ảnh), upscale bằng các mô hình siêu phân giải chuyên dụng, và khi có ControlNet thì tạo ảnh theo một tư thế, một bản đồ độ sâu hay đường nét cho trước. Các phần bổ sung gọi là LoRA, mỗi LoRA là một tệp nhỏ riêng biệt, dạy cho mô hình một phong cách hay một nhân vật.
Trên trang này, bạn có thể thử inpainting và upscale ảnh mà không cần tài khoản, tạo ảnh bằng SDXL hoặc Stable Diffusion 3, và xem 1.731 phong cách nghệ sĩ cùng 82 prompt mẫu có chú giải để hiểu một prompt tác động ra sao.
Khác gì so với DALL-E hay Midjourney?
Có hai điểm: trọng số của mô hình được công khai và mô hình chạy ngay trên máy của bạn. Bạn có thể tải mô hình về, chạy miễn phí trên máy tính của mình, chỉnh sửa nó và giữ ảnh cho riêng mình. Midjourney và các mô hình tạo ảnh của OpenAI (DALL-E, nay là GPT Image) là dịch vụ đóng: bạn trả phí thuê bao hoặc trả theo từng ảnh, còn mô hình thì không bao giờ rời khỏi máy chủ của họ. Đổi lại, Stable Diffusion đòi hỏi ở bạn nhiều hơn: chọn mô hình, viết prompt chính xác kèm negative prompt, và hiểu seed là gì.
Có cần máy tính mạnh không?
Để tự chạy, một card NVIDIA đời mới có ít nhất 6 GB VRAM là đủ cho SD 1.5, còn với SDXL thì 8 GB là đủ. Card AMD chạy được qua ROCm trên Linux, còn Apple Silicon thì qua backend MPS. Nếu máy bạn không đáp ứng được, các công cụ trên trang này không đòi hỏi phần cứng nào: một số chạy trên GPU của chúng tôi, có hiển thị trực tiếp hàng chờ và tiến độ, số khác là bản demo chạy trên máy chủ bên ngoài, nhúng vào trang. Khi đã sẵn sàng, hãy đọc cách cài đặt Stable Diffusion trên máy tính.