Viết prompt Stable Diffusion như thế nào?

Tác giả: Cập nhật: 4 phút đọc

Prompt Stable Diffusion là đoạn văn bản mô tả, định hướng cho bức ảnh: chủ thể rõ ràng trước, rồi đến phong cách, ánh sáng, khung hình và vài từ về chất lượng, ngăn cách bằng dấu phẩy. Ngắn gọn, cụ thể, xếp từ quan trọng nhất đến ít quan trọng nhất: đó là cách để có ảnh đúng ý.

Cấu trúc hiệu quả

  1. Chủ thể: ai hoặc cái gì, đang làm gì, ở đâu. a red fox sitting on a mossy rock in a pine forest
  2. Phong cách hoặc chất liệu: oil painting, 35mm photograph, watercolor, 3D render, hoặc tên một nghệ sĩ: by Ivan Shishkin.
  3. Ánh sáng và không khí: golden hour, soft diffused light, dramatic rim light, foggy.
  4. Khung hình và ống kính: close-up, wide shot, 85mm, shallow depth of field.
  5. Từ khóa chất lượng: highly detailed, sharp focus, masterpiece. Hai hoặc ba từ là đủ.

Từ đứng đầu prompt thường có sức nặng hơn từ đứng cuối. Hãy luôn đặt chủ thể lên trước.

Một ví dụ có chú giải

portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed

Năm từ đầu tiên xác định chủ thể. Tên nghệ sĩ quyết định bảng màu và nét cọ (hãy xem chỉ một cái tên thôi đã thay đổi bức ảnh nhiều đến mức nào trên các trang phong cách nghệ sĩ). Các từ về ánh sáng quyết định không khí, các từ về khung hình quyết định bố cục, còn nhóm cuối cùng để hoàn thiện. Negative prompt: blurry, deformed hands, extra fingers, watermark, text — xem thêm trong bài negative prompt là gì.

Trọng số và nhấn mạnh

Trong Automatic1111, Forge, Fooocus và ComfyUI, dấu ngoặc đơn dùng để đặt trọng số cho một cụm từ: (red scarf:1.3) nghĩa là mô hình chú ý đến cụm từ ấy nhiều hơn 30%, còn (background:0.7) thì ít hơn. Riêng trong Automatic1111, dấu ngoặc vuông làm giảm trọng số. Hãy giữ trong khoảng 0.6 đến 1.4: vượt ra ngoài thì ảnh thường xấu đi. Dùng trọng số để cứu một chi tiết mà mô hình cứ bỏ qua, đừng dùng cho mọi từ.

Những lỗi thường gặp

  • Câu phủ định: “a room without windows” thường lại tạo ra cửa sổ. Thứ gì không muốn có thì đưa vào negative prompt.
  • Quá nhiều ý tưởng: mỗi ảnh một chủ thể. Với SD 1.5 và SDXL, một khối CLIP chứa được 75 token (khoảng 60 từ); Automatic1111 đưa phần vượt quá sang khối thứ hai, còn công cụ nào không chia khối thì cắt bỏ phần đó.
  • Phong cách mâu thuẫn nhau: photorealistic watercolor cho ra kết quả lem nhem.
  • Thay đổi mọi thứ cùng lúc: hãy cố định seed và mỗi lần chỉ đổi một từ để biết từng từ có tác dụng gì.

Khác biệt giữa các mô hình

SD 1.5 và SDXL phản hồi tốt với danh sách từ khóa như ví dụ trên. Stable Diffusion 3 và 3.5 hiểu câu văn tự nhiên tốt hơn, có thể sắp đặt nhiều chủ thể (“a cat on the left, a dog on the right”) và viết được chữ ngắn đặt trong ngoặc kép. Dù bạn dùng mô hình nào, 82 prompt mẫu có chú giải trên trang này đều hiển thị các thông số đằng sau mỗi bức ảnh, còn trình tạo prompt sẽ phát triển vài từ thành một prompt hoàn chỉnh.

Dùng thử ngay, miễn phíXem 82 prompt kèm thông số →

Câu hỏi thường gặp

Prompt Stable Diffusion nên dài bao nhiêu?

Với SD 1.5 và SDXL, từ 15 đến 60 từ là vừa. Dưới 10 từ, mô hình sẽ tự lấp chỗ trống một cách ngẫu nhiên; vượt quá 75 token, Automatic1111 chia văn bản thành nhiều khối, còn công cụ nào không có tính năng này thì cắt bỏ phần thừa.

Tên nghệ sĩ có còn tác dụng không?

Có, với SD 1.5 và SDXL, vốn biết hàng nghìn nghệ sĩ: bảng so sánh của chúng tôi, gồm 1.731 cái tên dùng chung bốn prompt và một bộ seed, cho thấy tác dụng của từng tên. Stable Diffusion 3 thì kém nhạy với tên nghệ sĩ hơn.

Có nên viết prompt bằng tiếng Anh không?

Có. Các bộ mã hóa văn bản được huấn luyện chủ yếu trên chú thích tiếng Anh. Prompt bằng tiếng Việt hay một ngôn ngữ khác cùng lắm chỉ có tác dụng một phần và kém chính xác; hãy dịch sang tiếng Anh trước.