Як згенерувати відео з тексту у Wan 2.2?

Автор: Оновлено 4 хв читання

Wan 2.2 text-to-video генерує беззвучний ролик тривалістю близько п’яти секунд у 480p або 720p з одного речення, яке описує сцену, дію та камеру. Це відеомодель Alibaba з відкритими вагами, випущена 2025 року за ліцензією Apache 2.0; її можна запустити вдома в ComfyUI або Diffusers.

Що таке Wan 2.2 text-to-video

На старті Wan 2.2 складалася з трьох відкритих моделей. Wan2.2-T2V-A14B — модель для генерації відео з тексту: дифузійний трансформер з архітектурою mixture-of-experts на 27 мільярдів параметрів, із яких на кожному кроці активні 14 мільярдів; експерт для високого рівня шуму задає загальну композицію, а експерт для низького — уточнює деталі. Wan2.2-I2V-A14B анімує готове зображення, а Wan2.2-TI2V-5B — менша гібридна модель, яка вміє і те, і те та працює на споживчій відеокарті у 720p із 24 кадрами за секунду.

Порівняно з Wan 2.1 моделі 2.2 навчали на більшому наборі даних (на 66 % більше зображень і на 83 % більше відео) з докладною розміткою освітлення, композиції, контрасту й колірного тону. Тому в промпті можна описати світло й кадрування кінематографічними термінами на кшталт «soft lighting», «warm colors» чи «low angle shot» — усі вони взяті з власного словника промптів Alibaba.

Як написати промпт для відео

Промпт для відео описує коротку сцену, а не нерухомий кадр. Структура, яка працює, — об’єкт, дія, місце, камера, стиль: «A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic». Кожен елемент відповідає на запитання, відповідь на яке моделі інакше довелося б угадувати.

  • Об’єкт і дія: один об’єкт, одна чітка дія, виражена дієсловом. П’яти секунд вистачить на жест, кілька кроків, помах рукою, але не на цілу історію.
  • Місце: місце й час доби визначають освітлення.
  • Камера: static, pan, tilt, tracking, push-in, drone shot. Назвіть рух камери, інакше модель вибере сама.
  • Стиль: cinematic, documentary, anime, claymation, 35 mm film. Одного слова про стиль достатньо.

Дію описуйте звичайними реченнями; ключовими словами можна задати світло й кадрування, як у прикладах промптів від самої Alibaba, але перелік тегів руху не опише. У негативний промпт записуйте класичні дефекти (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Він діє, лише коли guidance вищий за 1; воркфлоу з 4-кроковою Lightning LoRA працюють зі значенням 1 і його ігнорують.

Налаштування й час генерації

Офіційні типові значення — 81 кадр із частотою 16 fps, 480p або 720p, 40 кроків і guidance scale від 3 до 4; воркфлоу ComfyUI використовують 20 кроків із guidance 3.5 або 4 кроки з guidance 1 і Lightning LoRA. З офіційними налаштуваннями ролик у 480p генерується близько п’яти з половиною хвилин на одному GPU H100 рівня дата-центру, а 720p потребує приблизно втричі більше часу за тієї самої кількості кадрів. Seed працює так само, як у генерації зображень: зафіксуйте його, щоб порівняти два промпти, змініть — щоб отримати інший дубль за тим самим промптом. Співвідношення сторін вибирають до генерації, зазвичай 16:9 або 9:16; змінити його потім модель не може.

Оскільки кожна спроба повільна, перевіряйте промпт у 480p і лише тоді запускайте 720p. Seed дубля з 480p дасть у 720p інший ролик, бо шум має іншу форму. Більшість невдалих результатів спричиняють промпти з надто великою кількістю дій або суперечливими вказівками для камери, а не налаштування.

Чого text-to-video ще не вміє

П’ять секунд, тобто 81 кадр, — це тривалість, на яку модель розрахована; довші генерації «пливуть». На довгі написи у відео покладатися не варто. Руки та швидка, складна взаємодія кількох людей досі часто не вдаються. Фізика радше правдоподібна, ніж точна: вода, тканина й волосся рухаються добре, але м’яч може відскочити неправильно. Звуку немає. Якщо потрібен точно заданий вигляд, простіше скористатися image-to-video: згенеруйте перший кадр у Stable Diffusion, SDXL чи Flux, а потім оживіть його у Wan 2.2.

Як запустити Wan 2.2 T2V локально

Ваги викладено на Hugging Face; вони запускаються в ComfyUI, Diffusers та офіційному репозиторії. З офіційним скриптом, для якого, за словами Alibaba, потрібна карта на 80 ГБ, модель T2V на 14B займає на піку близько 41 ГБ VRAM у 480p і 60 ГБ у 720p. У ComfyUI вона працює на карті з 24 ГБ із чекпойнтами fp8 і вивантаженням моделі з VRAM — тоді ролик генерується кілька хвилин. Модель на 5B створює п’ятисекундний ролик у 720p на RTX 4090 менш ніж за десять хвилин. У ComfyUI вона вміщується на карту з 8 ГБ; якщо VRAM менше, скористайтеся хмарним GPU або безкоштовним демо на цьому сайті, яке працює із зображенням, що стає першим кадром.

Часті запитання

Чи Wan 2.2 краща за Wan 2.1?

Так, за словами Alibaba, — за якістю руху, дотриманням промпту й контролем над естетикою: моделі mixture-of-experts і багатша розмітка навчальних даних мають дати плавніший рух і точніший контроль освітлення й композиції. На слабких відеокартах на зміну Wan 2.1 приходить модель Wan 2.2 на 5B.

Чи може Wan 2.2 зробити відео із зображення й тексту?

Так. Модель I2V бере зображення як перший кадр і текст з описом руху, а модель TI2V на 5B приймає або лише текст, або текст разом із зображенням. Демо Wan 2.2 на цьому сайті працює із зображенням.

Чи можна використовувати відео з комерційною метою?

Моделі випущено за ліцензією Apache 2.0, яка дозволяє комерційне використання, а Alibaba не заявляє жодних прав на згенеровані вами відео. Перевірте умови сервісу, на якому ви генеруєте.