איך יוצרים סרטון מטקסט עם Wan 2.2?

מאת עודכן 4 דקות קריאה

Wan 2.2 text-to-video מייצר סרטון ללא קול של כחמש שניות, ב-480p או 720p, ממשפט אחד שמתאר את הסצנה, הפעולה והמצלמה. זהו מודל הווידאו במשקולות פתוחות של Alibaba, ששוחרר ב-2025 תחת רישיון Apache 2.0, והוא רץ בבית ב-ComfyUI או ב-Diffusers, אם יש לכם כרטיס מסך חזק מספיק.

מה זה Wan 2.2 text-to-video

Wan 2.2 הושק עם שלושה מודלים פתוחים. Wan2.2-T2V-A14B הוא מודל ה-text-to-video: diffusion transformer מסוג תערובת מומחים עם 27 מיליארד פרמטרים, 14 מיליארד פעילים בכל צעד, שבו מומחה לרעש גבוה קובע את הפריסה הכללית ומומחה לרעש נמוך מלטש את הפרטים. Wan2.2-I2V-A14B מנפיש תמונה קיימת, ו-Wan2.2-TI2V-5B הוא מודל היברידי קטן יותר שעושה את שניהם ורץ על כרטיס ביתי ב-720p ו-24 פריימים לשנייה.

בהשוואה ל-Wan 2.1, מודלי 2.2 אומנו על 66% יותר תמונות ו-83% יותר סרטונים, עם תוויות מפורטות לתאורה, קומפוזיציה, ניגודיות וגוון צבע. זו הסיבה שפרומפט יכול לציין את האור ואת המסגור במונחים קולנועיים כמו "soft lighting", "warm colors" או "low angle shot", כולם לקוחים מאוצר המילים לפרומפטים של Alibaba עצמה.

איך כותבים פרומפט לווידאו

פרומפט לווידאו מתאר סצנה קצרה, לא תמונת סטילס. מבנה שעובד: נושא, פעולה, מקום, מצלמה, סגנון: "A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic".

  • נושא ופעולה: נושא אחד, פעולה ברורה אחת עם פועל. חמש שניות מספיקות למחווה, להליכה, לנפנוף, לא לסיפור.
  • מקום: המקום ושעת היום קובעים את האור.
  • מצלמה: static, pan, tilt, tracking, push-in, drone shot. ציינו אותה, אחרת המודל בוחר.
  • סגנון: cinematic, documentary, anime, claymation, 35 mm film. מילת סגנון אחת מספיקה.

כתבו את הפעולה במשפטים פשוטים; מילות מפתח יכולות לקבוע את האור ואת המסגור, כמו בפרומפטים לדוגמה של Alibaba עצמה, אבל רשימת תגיות לא מתארת תנועה. השתמשו בפרומפט השלילי לפגמים הקלאסיים (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). יש לו השפעה רק כשה-guidance גבוה מ-1; תהליכי העבודה עם Lightning LoRA של 4 צעדים רצים על 1 ומתעלמים ממנו.

הגדרות וזמן יצירה

ברירות המחדל הרשמיות הן 81 פריימים ב-16 fps, 480p או 720p, 40 צעדים ו-guidance של 3 עד 4; תהליכי העבודה של ComfyUI משתמשים ב-20 צעדים עם guidance של 3.5, או ב-4 צעדים ב-guidance של 1 עם ה-Lightning LoRA. עם ההגדרות הרשמיות, סרטון 480p לוקח בערך חמש דקות וחצי על GPU אחד מסוג H100 של מרכז נתונים, ו-720p בערך פי שלושה לאותו מספר פריימים. ה-seed עובד כמו ביצירת תמונות: קבעו אותו כדי להשוות שני פרומפטים, שנו אותו כדי לקבל טייק נוסף של אותו פרומפט. יחס הגובה-רוחב נבחר לפני היצירה, בדרך כלל 16:9 או 9:16; המודל לא יכול לשנות אותו אחר כך.

מכיוון שכל ניסיון איטי, בדקו את הפרומפט ב-480p ורק אז הריצו שוב ב-720p. ה-seed של טייק ב-480p נותן סרטון אחר ב-720p, כי לרעש יש צורה אחרת. רוב התוצאות הגרועות נובעות מפרומפטים עם יותר מדי פעולות או מהוראות מצלמה סותרות, לא מההגדרות.

מה text-to-video עדיין לא יודע לעשות

חמש שניות, 81 פריימים, הן האורך שהמודל מכוון אליו; יצירות ארוכות יותר נסחפות. טקסט ארוך בתוך הסרטון לא אמין. ידיים ואינטראקציות מהירות ומורכבות בין כמה אנשים עדיין נכשלות לעתים קרובות. הפיזיקה סבירה ולא מדויקת: מים, בד ושיער זזים יפה, אבל כדור יכול לקפוץ לא נכון. אין אודיו. למראה מדויק, image-to-video קל יותר: צרו את הפריים הראשון עם Stable Diffusion, SDXL או Flux, ואז הנפישו אותו עם Wan 2.2.

הרצת Wan 2.2 T2V מקומית

המשקולות נמצאות ב-Hugging Face ורצות ב-ComfyUI, ב-Diffusers ובמאגר הרשמי. עם הסקריפט הרשמי, ש-Alibaba אומרת שהוא דורש כרטיס של 80 GB, מודל ה-T2V של 14B מגיע לשיא של כ-41 GB של VRAM ב-480p ו-60 GB ב-720p. ב-ComfyUI הוא רץ על כרטיס של 24 GB עם checkpoints ב-fp8 ועם offloading, בכמה דקות לסרטון. מודל ה-5B מפיק סרטון 720p של חמש שניות על RTX 4090 בפחות מעשר דקות. ב-ComfyUI הוא נכנס בכרטיס של 8 GB; מתחת לזה, השתמשו ב-GPU בענן או בדמו החינמי באתר הזה, שמתחיל מתמונה שמשמשת כפריים הראשון.

שאלות נוספות שאנשים שואלים

האם Wan 2.2 טוב יותר מ-Wan 2.1?

כן, לפי Alibaba, באיכות התנועה, בנאמנות לפרומפט ובשליטה האסתטית: מודלי תערובת המומחים ותוויות האימון העשירות יותר מכוונים לתנועה חלקה יותר ולשליטה הדוקה יותר בתאורה ובקומפוזיציה. על כרטיסי מסך צנועים, מודל ה-5B של Wan 2.2 תופס את מקומו של Wan 2.1.

האם Wan 2.2 יכול ליצור סרטון מתמונה וטקסט?

כן. מודל ה-I2V משתמש בתמונה כפריים הראשון ובפרומפט שמתאר את התנועה, ומודל ה-TI2V של 5B מקבל טקסט בלבד או טקסט עם תמונה. הדמו של Wan 2.2 באתר הזה עובד מתמונה.

אפשר להשתמש בסרטונים למטרות מסחריות?

המודלים משוחררים תחת רישיון Apache 2.0, שמתיר שימוש מסחרי, ו-Alibaba לא תובעת זכויות על הסרטונים שאתם יוצרים. בדקו את התנאים של השירות המקוון שבו אתם משתמשים.