Як Wan 2.2 перетворює зображення на відео?

Автор: Оновлено 4 хв читання

Wan 2.2 image-to-video бере нерухоме зображення й коротке речення з описом руху та повертає ролик тривалістю близько п’яти секунд у 480p або 720p, зберігаючи об’єкт, кольори й кадрування фото. Це модель з відкритими вагами від Alibaba: нею можна безкоштовно користуватися онлайн на цьому сайті або запускати вдома на потужній відеокарті.

Що робить Wan 2.2 image-to-video

Wan 2.2, випущена в липні 2025 року за ліцензією Apache 2.0, — наступниця Wan 2.1 у лінійці відкритих відеомоделей Alibaba. Варіант для перетворення зображення на відео, Wan2.2-I2V-A14B, — це дифузійний трансформер з архітектурою mixture-of-experts («суміш експертів»): один експерт відповідає за ранні, зашумлені кроки, які задають загальну композицію, другий — за пізні кроки, що уточнюють деталі. На кожному кроці активні близько 14 мільярдів параметрів із 27 мільярдів загалом. Менша гібридна модель, Wan2.2-TI2V-5B, приймає і текст, і зображення та працює на одній споживчій відеокарті.

Ви даєте моделі картинку — перший кадр ролика — і промпт, який описує, що має рухатися. Вона генерує 81 кадр із частотою 16 кадрів за секунду, тобто близько п’яти секунд, і будує ролик на основі цієї картинки: обличчя, одяг і освітлення лишаються близькими до оригіналу, поки рухається камера чи сам об’єкт.

Як написати промпт для руху

Зображення вже містить об’єкт, стиль і композицію, тому промпт має описати лише зміну. Напишіть одне-два короткі речення: хто або що рухається, як саме і що робить камера. «The woman turns her head to the right and smiles, soft wind in her hair, slow push-in» працює, а перелік стильових тегів — ні. Якщо камера важлива, називайте її рух прямо: «static camera», «slow pan to the left», «the drone rises».

Рух має бути правдоподібним для п’ятисекундного ролика. Одна дія на промпт — надійний вибір. Дієслова на кшталт walks, waves, blinks, flows, drifts, rotates дають передбачуваний рух. Не просіть того, чого на картинці немає: модель може зрушити автомобіль, але дорогу за ним їй доведеться вигадати, а це менш надійно, ніж те, що вже є на картинці. Негативний промпт діє, лише коли guidance вищий за 1; воркфлоу з 4-кроковою Lightning LoRA працюють зі значенням 1 і його ігнорують. В інших випадках годиться звичний список: blurry, distorted hands, extra limbs, flickering, watermark, text.

Налаштування, які мають значення

  • Роздільна здатність: 480p приблизно втричі швидше за 720p, і для соцмереж цього часто досить; 720p беріть для фінального ролика.
  • Кадри: 81 кадр із частотою 16 fps — стандартний п’ятисекундний ролик. Довші послідовності «пливуть»; краще згенерувати два ролики й змонтувати їх.
  • Кроки: 40 кроків семплінгу в офіційному скрипті, 20 — у базовому воркфлоу ComfyUI. Із 4-кроковою Lightning LoRA вистачає від 4 до 8.
  • Guidance (CFG): типово 3.5 для моделі I2V на 14B і 1 — із 4-кроковою LoRA. З вищими значеннями модель буквальніше дотримується промпту, але з’являється мерехтіння.
  • Seed: як і в Stable Diffusion, те саме зображення, промпт, налаштування й seed відтворюють той самий ролик; змініть лише seed — і отримаєте інший рух для тієї самої картинки.

Перевірте промпт у 480p, перш ніж витрачати час на 720p. Проте seed не переноситься: у 720p шум має іншу форму, тож рух буде іншим.

Які зображення анімуються найкраще

Wan 2.2 працює з будь-яким фото чи згенерованим ШІ зображенням, але з деякими картинками їй значно простіше. Чіткий головний об’єкт на простому тлі дає чистий рух; у переповнених сценах моделі доводиться самій вибирати, що рухати. Ролик переймає співвідношення сторін картинки, тож годяться і вертикальні, і горизонтальні зображення. У ComfyUI задайте ширину й висоту з тим самим співвідношенням, інакше зображення буде обрізано. Різкі, добре освітлені картинки зберігають деталі впродовж усього ролика, якщо вони не менші за розмір результату (832 пікселі за довшою стороною для 480p, 1280 — для 720p); із розмитого чи сильно стисненого джерела вийде розмите відео.

Зображення, згенеровані в Stable Diffusion, SDXL чи Flux, анімуються дуже добре, тому image-to-video — найпростіший спосіб отримати коротке відео з точно заданим виглядом: спершу згенеруйте саме той кадр, який вам потрібен, а потім оживіть його.

Як запустити Wan 2.2 I2V удома

Ваги викладено на Hugging Face; вони запускаються в ComfyUI, у Diffusers і в офіційному репозиторії Wan. З офіційним скриптом, для якого, за словами Alibaba, потрібна карта на 80 ГБ, модель I2V на 14B займає на піку близько 41 ГБ VRAM у 480p і 60 ГБ у 720p. У ComfyUI вона працює на карті з 24 ГБ із квантованими чекпойнтами fp8 і вивантаженням моделі з VRAM — ціною кількох хвилин на ролик. Модель TI2V на 5B генерує п’ятисекундний ролик у 720p на RTX 4090 менш ніж за десять хвилин і з офіційним скриптом потребує близько 24 ГБ VRAM; у ComfyUI вона вміщується на карту з 8 ГБ. Якщо VRAM менше, скористайтеся хмарним GPU або безкоштовним демо на цьому сайті.

Спробуйте просто зараз, безкоштовноОживити зображення у Wan 2.2, безкоштовно →

Часті запитання

Якої тривалості може бути відео у Wan 2.2?

Стандартний результат — 81 кадр із частотою 16 кадрів за секунду, тобто близько п’яти секунд. Деякі інтерфейси дозволяють більше кадрів, але якість і узгодженість падають; для довшого відео згенеруйте кілька роликів, починаючи кожен з останнього кадру попереднього, і змонтуйте їх.

Чи генерує Wan 2.2 звук?

Ні. Wan 2.2 створює відео без звуку; музику або закадровий голос додайте потім у відеоредакторі.

Чи це безкоштовно і чи можна використовувати відео?

Модель випущено за ліцензією Apache 2.0, яка дозволяє комерційне використання, а Alibaba не заявляє жодних прав на згенеровані вами відео; сервіс, на якому ви генеруєте, може додавати власні умови. Демо на цьому сайті безкоштовне, але черга спільна, тому ролик може генеруватися кілька хвилин.