LoRA trong Stable Diffusion là gì?

Tác giả: Cập nhật: 4 phút đọc

LoRA (Low-Rank Adaptation) là một tệp nhỏ, từ vài megabyte đến vài trăm megabyte, bổ sung một phong cách, nhân vật, sản phẩm hay khái niệm vào mô hình Stable Diffusion có sẵn mà không cần huấn luyện lại. Bạn nạp nó cùng mô hình gốc, đặt trọng số, và kết hợp được nhiều LoRA cùng lúc.

LoRA hoạt động như thế nào

Fine-tune cả một mô hình nghĩa là viết lại hàng trăm triệu đến hàng tỷ trọng số và tạo ra một tệp nặng 2 đến 7 GB với SD 1.5 hoặc SDXL. LoRA thì đóng băng mô hình và chỉ huấn luyện những cặp ma trận nhỏ, phần lớn nằm cạnh các lớp attention; tích của mỗi cặp xấp xỉ phần thay đổi. Kết quả gói gọn “cái mới” trong một tệp nhỏ và được áp dụng ngay lúc tạo ảnh, kèm một hệ số nhân. Mười đến ba mươi bức ảnh thường là đủ để huấn luyện một LoRA trên GPU phổ thông, mất từ vài phút đến vài giờ tùy mô hình gốc.

Cách dùng LoRA

  1. Tải một LoRA dành cho đúng mô hình gốc của bạn: LoRA của SD 1.5 không chạy với SDXL và ngược lại; SD 3.5 có LoRA riêng.
  2. Đặt tệp vào thư mục models/Lora của Automatic1111 (hoặc thư mục tương ứng của ComfyUI, Forge, Fooocus).
  3. Trong Automatic1111, Forge và Fooocus, gọi LoRA ngay trong prompt bằng <lora:filename:0.8>; còn trong ComfyUI thì thêm một node Load LoRA. Con số là trọng số; khoảng thường dùng là 0.6 đến 1.0.
  4. Thêm trigger word (từ kích hoạt) do tác giả cung cấp nếu có (tên nhân vật, token phong cách).
  5. Điều chỉnh: mạnh quá thì ảnh nào cũng giống nhau, yếu quá thì chẳng có gì thay đổi.

Kết hợp nhiều LoRA

Có thể chồng nhiều LoRA lên nhau: một phong cách ở 0.7, một nhân vật ở 0.8, một LoRA tăng chi tiết ở 0.4. Càng thêm nhiều LoRA thì càng nên hạ trọng số của từng cái, và hãy cố định seed trong lúc tinh chỉnh, nếu không bạn sẽ không biết mỗi LoRA làm gì. Các LoRA được huấn luyện trên cùng một khái niệm sẽ “đánh nhau”; hãy chọn một cái thôi.

LoRA, embedding, checkpoint: nên chọn loại nào?

LoạiDung lượngPhù hợp nhất choCách dùng
Checkpoint (fine-tune)2–7 GB (SD 1.5, SDXL)cả một phong cách thẩm mỹ (chân thực, anime)thay thế mô hình gốc
LoRAtừ vài MB đến vài trăm MBmột phong cách, nhân vật, vật thể, tư thế<lora:name:weight> trong prompt, hoặc node Load LoRA trong ComfyUI
Textual inversion (embedding)từ vài KB đến 100 KBmột token duy nhất, thường dùng trong negative prompttên token trong prompt

Cách dùng phổ biến là chạy một checkpoint tốt rồi đổi LoRA theo từng ảnh.

Tìm LoRA ở đâu

Civitai và Hugging Face lưu trữ hàng chục nghìn LoRA, kèm ảnh mẫu, trigger word và mô hình gốc mà chúng cần. Hãy kiểm tra giấy phép: một số LoRA cấm dùng cho mục đích thương mại, còn Civitai thì đã gỡ bỏ các LoRA về người thật từ tháng 5 năm 2025. Bảng so sánh phong cách nghệ sĩ của chúng tôi là lựa chọn thay thế tốt cho phần phong cách: một cái tên trong prompt thường cho hiệu quả tương đương một LoRA phong cách, mà không phải tải gì về.

Câu hỏi thường gặp

LoRA có làm chậm quá trình tạo ảnh không?

Hầu như không: Automatic1111 và ComfyUI gộp LoRA vào trọng số của mô hình trước khi lấy mẫu, nên mỗi bước vẫn tốn thời gian như cũ. Chỉ riêng thao tác gộp, lúc bạn nạp hoặc đổi LoRA, là mất một chút thời gian.

Tôi có dùng được LoRA trên trang này không?

LoRA của riêng bạn thì không. Các công cụ chạy mô hình cố định, và trang này đã gắn sẵn vào đó vài LoRA nhỏ: loại tăng chi tiết và loại noise offset. Trong tương lai, các trang txt2img dành cho thành viên có thể sẽ cung cấp một số LoRA nhất định.

Con số trong <lora:name:0.8> có nghĩa là gì?

Đó là cường độ áp dụng các thay đổi của LoRA: 1.0 là mức tác giả đã huấn luyện, 0.5 là một nửa hiệu ứng, còn giá trị trên 1.2 thường làm méo ảnh.