LoRA ใน Stable Diffusion คืออะไร?

โดย อัปเดต 2 นาทีในการอ่าน

LoRA (Low-Rank Adaptation) คือไฟล์เล็ก ๆ ที่เพิ่มสไตล์ ตัวละคร สินค้า หรือแนวคิดให้โมเดล Stable Diffusion โดยไม่ต้องฝึกใหม่ โหลดคู่กับโมเดลหลัก ตั้งน้ำหนัก และใช้หลายตัวพร้อมกันได้

LoRA ทำงานอย่างไร

การ fine-tune ทั้งโมเดลหมายถึงการเขียน weights ใหม่หลายร้อยล้านถึงหลายพันล้านค่า และได้ไฟล์ขนาด 2 ถึง 7 GB สำหรับ SD 1.5 หรือ SDXL ส่วน LoRA จะตรึงโมเดลไว้แล้วฝึกเฉพาะคู่ของเมทริกซ์เล็ก ๆ ส่วนใหญ่อยู่ข้างชั้น attention ผลคูณของแต่ละคู่ใช้ประมาณค่าความเปลี่ยนแปลง ผลลัพธ์คือ "สิ่งที่เพิ่มเข้ามา" ถูกเก็บในไฟล์เล็ก ๆ และนำมาใช้ตอนสร้างภาพพร้อมตัวคูณ ภาพสิบถึงสามสิบภาพมักพอสำหรับฝึก LoRA หนึ่งตัวบน GPU ทั่วไป ใช้เวลาไม่กี่นาทีถึงไม่กี่ชั่วโมงขึ้นกับโมเดลหลัก

วิธีใช้ LoRA

  1. ดาวน์โหลด LoRA ที่ทำมาสำหรับโมเดลหลักของคุณ: LoRA ของ SD 1.5 ใช้กับ SDXL ไม่ได้ และกลับกัน ส่วน SD 3.5 มี LoRA ของตัวเอง
  2. วางไฟล์ในโฟลเดอร์ models/Lora ของ Automatic1111 (หรือโฟลเดอร์เทียบเท่าใน ComfyUI Forge หรือ Fooocus)
  3. ใน Automatic1111 Forge และ Fooocus เรียกใช้ใน prompt ด้วย <lora:filename:0.8> ส่วนใน ComfyUI ให้เพิ่มโหนด Load LoRA แทน ตัวเลขคือน้ำหนัก ช่วงที่ใช้กันคือ 0.6 ถึง 1.0
  4. ใส่ trigger word ที่ผู้สร้างระบุไว้ถ้ามี (ชื่อตัวละคร หรือคำประจำสไตล์)
  5. ปรับจูน: แรงไปทุกภาพจะหน้าตาเหมือนกันหมด เบาไปก็ไม่มีอะไรเปลี่ยน

ใช้ LoRA หลายตัวร่วมกัน

LoRA ซ้อนกันได้หลายตัว: สไตล์ที่ 0.7 ตัวละครที่ 0.8 ตัวเพิ่มรายละเอียดที่ 0.4 ยิ่งเพิ่มหลายตัวยิ่งต้องลดน้ำหนักแต่ละตัวลง และล็อก seed ไว้ระหว่างปรับ ไม่อย่างนั้นจะบอกไม่ได้ว่าตัวไหนทำอะไร LoRA ที่ฝึกจากแนวคิดเดียวกันจะตีกัน เลือกตัวเดียวพอ

LoRA, embedding, checkpoint: เลือกอะไรดี?

ประเภทขนาดเหมาะกับวิธีใช้
Checkpoint (fine-tune)2–7 GB (SD 1.5 SDXL)แนวภาพโดยรวม (สมจริง อนิเมะ)ใช้แทนโมเดลหลัก
LoRAไม่กี่ MB ถึงไม่กี่ร้อย MBสไตล์ ตัวละคร วัตถุ ท่าทาง<lora:name:weight> ใน prompt หรือโหนด Load LoRA ใน ComfyUI
Textual inversion (embedding)ไม่กี่ KB ถึง 100 KBtoken เดียว มักใช้ฝั่ง negativeใส่ชื่อ token ใน prompt

ชุดที่นิยมคือ checkpoint ดี ๆ หนึ่งตัว แล้วสลับ LoRA ตามภาพ

หา LoRA ได้ที่ไหน

Civitai และ Hugging Face มี LoRA หลายหมื่นตัว พร้อมภาพตัวอย่าง trigger word และโมเดลหลักที่ต้องใช้ ตรวจสอบใบอนุญาตด้วย: บางตัวห้ามใช้เชิงพาณิชย์ และ Civitai ได้ลบ LoRA ของบุคคลจริงออกตั้งแต่พฤษภาคม 2025 การเปรียบเทียบสไตล์ศิลปินของเราเป็นทางเลือกที่ดีสำหรับสไตล์: ชื่อศิลปินใน prompt มักให้ผลเหมือน LoRA สไตล์ โดยไม่ต้องดาวน์โหลดอะไรเลย

คำถามที่พบบ่อย

LoRA ทำให้สร้างภาพช้าลงไหม?

แทบไม่ Automatic1111 และ ComfyUI รวม LoRA เข้ากับ weights ของโมเดลก่อน sampling แต่ละ step จึงใช้เวลาเท่าเดิม มีแค่ตอนรวม ซึ่งเกิดเมื่อโหลดหรือเปลี่ยน LoRA ที่ใช้เวลาสักครู่

ใช้ LoRA บนเว็บไซต์นี้ได้ไหม?

ใช้ LoRA ของตัวเองไม่ได้ เครื่องมือรันโมเดลที่กำหนดไว้ตายตัว ซึ่งเว็บไซต์ใส่ LoRA เพิ่มรายละเอียดและ noise-offset ตัวเล็ก ๆ ให้อยู่แล้ว หน้า txt2img สำหรับสมาชิกอาจเปิดให้เลือก LoRA เฉพาะบางตัวในอนาคต

ตัวเลขใน <lora:name:0.8> หมายถึงอะไร?

ความแรงที่ใช้กับการเปลี่ยนแปลงของ LoRA: 1.0 คือตามที่ผู้สร้างฝึกมา 0.5 คือครึ่งหนึ่ง ค่าเกิน 1.2 มักทำให้ภาพบิดเบี้ยว