מה זה Stable Diffusion?

מאת עודכן 3 דקות קריאה

Stable Diffusion הוא מודל בינה מלאכותית בקוד פתוח שהופך תיאור בטקסט לתמונה. המודל שוחרר על ידי Stability AI באוגוסט 2022, רץ על כרטיס מסך רגיל למשחקים, כל אחד יכול לאמן אותו על סגנון משלו, והוא עומד מאחורי כלים חינמיים רבים, כולל הכלים החינמיים באתר הזה.

איך Stable Diffusion עובד?

Stable Diffusion הוא מודל דיפוזיה לטנטי (latent diffusion model). במהלך האימון הוא למד להסיר רעש ממאות מיליוני תמונות שצורפו להן כיתובים. בזמן היצירה הוא מתחיל מרעש אקראי לחלוטין, ושלב אחרי שלב מנקה אותו לכיוון הטקסט שלכם: אחרי 20 עד 30 צעדים הרעש הפך לתמונה שתואמת את הפרומפט.

שלושה חלקים עובדים יחד: מקודד טקסט (text encoder) שהופך את המילים שלכם למספרים, U-Net (או, מגרסה 3, diffusion transformer) שמבצע את הסרת הרעש, ומפענח (decoder) שממיר את התמונה הלטנטית הדחוסה לפיקסלים. הסרת הרעש מתבצעת על אותה תמונה לטנטית דחוסה, וזה מה שהופך את המודל למהיר מספיק ל-GPU ביתי.

אילו גרסאות קיימות?

  • Stable Diffusion 1.5 (2022): תמונות 512×512, אלפי fine-tunes ו-LoRAs מהקהילה.
  • SDXL 1.0 (יולי 2023): 1024×1024 ברזולוציה טבעית, ידיים, פנים וקומפוזיציה טובות יותר, מודל refiner לפרטים.
  • Stable Diffusion 3 Medium (יוני 2024): diffusion transformer, רינדור טקסט והבנת פרומפט טובים בהרבה.
  • Stable Diffusion 3.5 (אוקטובר 2024): הגרסה הנוכחית, בגדלים Large, Large Turbo ו-Medium, עם נאמנות טובה יותר לפרומפט ומגוון סגנונות רחב יותר.

ההשוואה המפורטת נמצאת במדריך SDXL מול Stable Diffusion 3.

מה אפשר לעשות איתו?

יצירת תמונה מטקסט היא רק ההתחלה. אותם מודלים מטפלים גם ב-image-to-image (הפיכת סקיצה או צילום לתמונה חדשה), inpainting (ציור מחדש של אזור אחד), outpainting (הרחבת תמונה מעבר לגבולותיה), הגדלת תמונות עם מודלי super-resolution ייעודיים, ובעזרת ControlNet, יצירה שמונחית על ידי תנוחה, מפת עומק או קווי מתאר. תוספים בשם LoRA, כל אחד קובץ קטן ונפרד, מלמדים את המודל סגנון או דמות.

באתר הזה תוכלו לנסות inpainting והגדלת תמונות בלי חשבון, ליצור תמונות עם SDXL או עם Stable Diffusion 3, ולעיין ב-1,731 סגנונות של אמנים וב-82 פרומפטים מתועדים כדי ללמוד מה כל פרומפט עושה.

במה הוא שונה מ-DALL-E או מ-Midjourney?

בשני דברים: המשקולות ציבוריות והוא רץ מקומית. אפשר להוריד את המודל, להריץ אותו בחינם במחשב שלכם, לשנות אותו ולשמור את התמונות פרטיות. Midjourney ומודלי התמונה של OpenAI (DALL-E, וכיום GPT Image) הם שירותים סגורים: משלמים במנוי או לפי תמונה, והמודל לעולם לא יוצא מהשרתים שלהם. בתמורה, Stable Diffusion דורש מכם יותר. צריך לבחור מודל, לכתוב פרומפט מדויק ופרומפט שלילי, ולהבין מה עושה ה-seed.

האם צריך מחשב חזק?

כדי להריץ אותו בעצמכם, כרטיס NVIDIA עדכני עם 6 GB של VRAM מספיק ל-SD 1.5, ו-8 GB ל-SDXL. כרטיסי AMD עובדים דרך ROCm בלינוקס, ו-Apple Silicon דרך ה-MPS backend. אם אין לכם אף אחד מאלה, הכלים באתר הזה לא דורשים חומרה: חלקם רצים על ה-GPU שלנו, עם תור והתקדמות שמוצגים בזמן אמת, ואחרים הם דמואים חיצוניים שמוטמעים בדף. כשתהיו מוכנים, קראו איך מתקינים את Stable Diffusion מקומית.

שאלות נוספות שאנשים שואלים

האם Stable Diffusion חינמי?

כן. המודלים משוחררים תחת רישיונות פתוחים (CreativeML OpenRAIL-M ל-1.5, OpenRAIL++-M ל-SDXL, ול-3.x רישיון הקהילה של Stability AI, שהוא חינמי מתחת למיליון דולר הכנסות בשנה). הרצה מקומית עולה רק חשמל; הכלים באתר הזה חינמיים וממומנים בפרסומות.

למי שייכות התמונות שאני יוצר?

לכם, ככל שזה נוגע לרישיון: Stability AI לא תובעת זכויות על התוצרים. דיני זכויות היוצרים על תמונות AI משתנים ממדינה למדינה ועדיין מתגבשים; באיחוד האירופי ובארצות הברית, תמונות שנוצרו לחלוטין על ידי AI בדרך כלל אינן זכאיות להגנת זכויות יוצרים.

האם Stable Diffusion יכול ליצור טקסט בתוך תמונות?

גרסאות 1.5 ו-SDXL מתקשות עם טקסט. Stable Diffusion 3 ו-3.5 מרנדרים טקסט קצר וכותרות הרבה יותר טוב כשכותבים את המילים במירכאות בתוך הפרומפט.