איך Stable Diffusion עובד?
Stable Diffusion הוא מודל דיפוזיה לטנטי (latent diffusion model). במהלך האימון הוא למד להסיר רעש ממאות מיליוני תמונות שצורפו להן כיתובים. בזמן היצירה הוא מתחיל מרעש אקראי לחלוטין, ושלב אחרי שלב מנקה אותו לכיוון הטקסט שלכם: אחרי 20 עד 30 צעדים הרעש הפך לתמונה שתואמת את הפרומפט.
שלושה חלקים עובדים יחד: מקודד טקסט (text encoder) שהופך את המילים שלכם למספרים, U-Net (או, מגרסה 3, diffusion transformer) שמבצע את הסרת הרעש, ומפענח (decoder) שממיר את התמונה הלטנטית הדחוסה לפיקסלים. הסרת הרעש מתבצעת על אותה תמונה לטנטית דחוסה, וזה מה שהופך את המודל למהיר מספיק ל-GPU ביתי.
אילו גרסאות קיימות?
- Stable Diffusion 1.5 (2022): תמונות 512×512, אלפי fine-tunes ו-LoRAs מהקהילה.
- SDXL 1.0 (יולי 2023): 1024×1024 ברזולוציה טבעית, ידיים, פנים וקומפוזיציה טובות יותר, מודל refiner לפרטים.
- Stable Diffusion 3 Medium (יוני 2024): diffusion transformer, רינדור טקסט והבנת פרומפט טובים בהרבה.
- Stable Diffusion 3.5 (אוקטובר 2024): הגרסה הנוכחית, בגדלים Large, Large Turbo ו-Medium, עם נאמנות טובה יותר לפרומפט ומגוון סגנונות רחב יותר.
ההשוואה המפורטת נמצאת במדריך SDXL מול Stable Diffusion 3.
מה אפשר לעשות איתו?
יצירת תמונה מטקסט היא רק ההתחלה. אותם מודלים מטפלים גם ב-image-to-image (הפיכת סקיצה או צילום לתמונה חדשה), inpainting (ציור מחדש של אזור אחד), outpainting (הרחבת תמונה מעבר לגבולותיה), הגדלת תמונות עם מודלי super-resolution ייעודיים, ובעזרת ControlNet, יצירה שמונחית על ידי תנוחה, מפת עומק או קווי מתאר. תוספים בשם LoRA, כל אחד קובץ קטן ונפרד, מלמדים את המודל סגנון או דמות.
באתר הזה תוכלו לנסות inpainting והגדלת תמונות בלי חשבון, ליצור תמונות עם SDXL או עם Stable Diffusion 3, ולעיין ב-1,731 סגנונות של אמנים וב-82 פרומפטים מתועדים כדי ללמוד מה כל פרומפט עושה.
במה הוא שונה מ-DALL-E או מ-Midjourney?
בשני דברים: המשקולות ציבוריות והוא רץ מקומית. אפשר להוריד את המודל, להריץ אותו בחינם במחשב שלכם, לשנות אותו ולשמור את התמונות פרטיות. Midjourney ומודלי התמונה של OpenAI (DALL-E, וכיום GPT Image) הם שירותים סגורים: משלמים במנוי או לפי תמונה, והמודל לעולם לא יוצא מהשרתים שלהם. בתמורה, Stable Diffusion דורש מכם יותר. צריך לבחור מודל, לכתוב פרומפט מדויק ופרומפט שלילי, ולהבין מה עושה ה-seed.
האם צריך מחשב חזק?
כדי להריץ אותו בעצמכם, כרטיס NVIDIA עדכני עם 6 GB של VRAM מספיק ל-SD 1.5, ו-8 GB ל-SDXL. כרטיסי AMD עובדים דרך ROCm בלינוקס, ו-Apple Silicon דרך ה-MPS backend. אם אין לכם אף אחד מאלה, הכלים באתר הזה לא דורשים חומרה: חלקם רצים על ה-GPU שלנו, עם תור והתקדמות שמוצגים בזמן אמת, ואחרים הם דמואים חיצוניים שמוטמעים בדף. כשתהיו מוכנים, קראו איך מתקינים את Stable Diffusion מקומית.