Що таке Wan 2.2 text-to-video
На старті Wan 2.2 складалася з трьох відкритих моделей. Wan2.2-T2V-A14B — модель для генерації відео з тексту: дифузійний трансформер з архітектурою mixture-of-experts на 27 мільярдів параметрів, із яких на кожному кроці активні 14 мільярдів; експерт для високого рівня шуму задає загальну композицію, а експерт для низького — уточнює деталі. Wan2.2-I2V-A14B анімує готове зображення, а Wan2.2-TI2V-5B — менша гібридна модель, яка вміє і те, і те та працює на споживчій відеокарті у 720p із 24 кадрами за секунду.
Порівняно з Wan 2.1 моделі 2.2 навчали на більшому наборі даних (на 66 % більше зображень і на 83 % більше відео) з докладною розміткою освітлення, композиції, контрасту й колірного тону. Тому в промпті можна описати світло й кадрування кінематографічними термінами на кшталт «soft lighting», «warm colors» чи «low angle shot» — усі вони взяті з власного словника промптів Alibaba.
Як написати промпт для відео
Промпт для відео описує коротку сцену, а не нерухомий кадр. Структура, яка працює, — об’єкт, дія, місце, камера, стиль: «A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic». Кожен елемент відповідає на запитання, відповідь на яке моделі інакше довелося б угадувати.
- Об’єкт і дія: один об’єкт, одна чітка дія, виражена дієсловом. П’яти секунд вистачить на жест, кілька кроків, помах рукою, але не на цілу історію.
- Місце: місце й час доби визначають освітлення.
- Камера: static, pan, tilt, tracking, push-in, drone shot. Назвіть рух камери, інакше модель вибере сама.
- Стиль: cinematic, documentary, anime, claymation, 35 mm film. Одного слова про стиль достатньо.
Дію описуйте звичайними реченнями; ключовими словами можна задати світло й кадрування, як у прикладах промптів від самої Alibaba, але перелік тегів руху не опише. У негативний промпт записуйте класичні дефекти (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Він діє, лише коли guidance вищий за 1; воркфлоу з 4-кроковою Lightning LoRA працюють зі значенням 1 і його ігнорують.
Налаштування й час генерації
Офіційні типові значення — 81 кадр із частотою 16 fps, 480p або 720p, 40 кроків і guidance scale від 3 до 4; воркфлоу ComfyUI використовують 20 кроків із guidance 3.5 або 4 кроки з guidance 1 і Lightning LoRA. З офіційними налаштуваннями ролик у 480p генерується близько п’яти з половиною хвилин на одному GPU H100 рівня дата-центру, а 720p потребує приблизно втричі більше часу за тієї самої кількості кадрів. Seed працює так само, як у генерації зображень: зафіксуйте його, щоб порівняти два промпти, змініть — щоб отримати інший дубль за тим самим промптом. Співвідношення сторін вибирають до генерації, зазвичай 16:9 або 9:16; змінити його потім модель не може.
Оскільки кожна спроба повільна, перевіряйте промпт у 480p і лише тоді запускайте 720p. Seed дубля з 480p дасть у 720p інший ролик, бо шум має іншу форму. Більшість невдалих результатів спричиняють промпти з надто великою кількістю дій або суперечливими вказівками для камери, а не налаштування.
Чого text-to-video ще не вміє
П’ять секунд, тобто 81 кадр, — це тривалість, на яку модель розрахована; довші генерації «пливуть». На довгі написи у відео покладатися не варто. Руки та швидка, складна взаємодія кількох людей досі часто не вдаються. Фізика радше правдоподібна, ніж точна: вода, тканина й волосся рухаються добре, але м’яч може відскочити неправильно. Звуку немає. Якщо потрібен точно заданий вигляд, простіше скористатися image-to-video: згенеруйте перший кадр у Stable Diffusion, SDXL чи Flux, а потім оживіть його у Wan 2.2.
Як запустити Wan 2.2 T2V локально
Ваги викладено на Hugging Face; вони запускаються в ComfyUI, Diffusers та офіційному репозиторії. З офіційним скриптом, для якого, за словами Alibaba, потрібна карта на 80 ГБ, модель T2V на 14B займає на піку близько 41 ГБ VRAM у 480p і 60 ГБ у 720p. У ComfyUI вона працює на карті з 24 ГБ із чекпойнтами fp8 і вивантаженням моделі з VRAM — тоді ролик генерується кілька хвилин. Модель на 5B створює п’ятисекундний ролик у 720p на RTX 4090 менш ніж за десять хвилин. У ComfyUI вона вміщується на карту з 8 ГБ; якщо VRAM менше, скористайтеся хмарним GPU або безкоштовним демо на цьому сайті, яке працює із зображенням, що стає першим кадром.