Wan 2.2 텍스트 투 비디오란
Wan 2.2는 출시 당시 세 가지 오픈 모델로 공개되었습니다. Wan2.2-T2V-A14B는 텍스트 투 비디오 모델입니다. 파라미터 270억 개 가운데 스텝마다 140억 개가 활성화되는 MoE(Mixture-of-Experts) 디퓨전 트랜스포머로, 하이 노이즈 전문가 모델이 전체 레이아웃을 잡고 로우 노이즈 전문가 모델이 디테일을 다듬습니다. Wan2.2-I2V-A14B는 기존 이미지를 움직이게 하고, Wan2.2-TI2V-5B는 두 가지를 모두 하는 더 작은 하이브리드 모델로 소비자용 그래픽카드에서 720p, 초당 24프레임으로 실행됩니다.
Wan 2.1과 비교하면 2.2 모델은 이미지는 66%, 영상은 83% 더 많은 데이터로 학습되었고, 그 데이터에는 조명, 구도, 대비, 색조에 대한 상세한 레이블이 붙어 있었습니다. 그래서 프롬프트에서 "soft lighting", "warm colors", "low angle shot" 같은 영화 용어로 빛과 프레이밍을 지정할 수 있습니다. 모두 Alibaba가 직접 제공하는 프롬프트 어휘에서 가져온 표현입니다.
영상 프롬프트 작성법
영상 프롬프트는 정지 화면이 아니라 짧은 장면을 설명합니다. 잘 통하는 구조 가운데 하나는 피사체, 동작, 배경, 카메라, 스타일 순서입니다. "A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic". 각 요소는 적어 주지 않으면 모델이 추측할 수밖에 없는 질문에 답해 줍니다.
- 피사체와 동작: 피사체 하나에, 동사로 표현한 분명한 동작 하나. 5초는 몸짓 하나, 걷기, 손 흔들기에는 충분하지만 이야기를 담기에는 짧습니다.
- 배경: 장소와 시간대가 빛을 결정합니다.
- 카메라: static, pan, tilt, tracking, push-in, drone shot. 직접 지정하지 않으면 모델이 알아서 고릅니다.
- 스타일: cinematic, documentary, anime, claymation, 35 mm film. 스타일 단어는 하나면 충분합니다.
동작은 자연스러운 문장으로 풀어 쓰세요. Alibaba의 예시 프롬프트처럼 빛과 프레이밍은 키워드로 지정할 수 있지만, 태그 목록으로는 움직임을 설명할 수 없습니다. 네거티브 프롬프트에는 전형적인 결함(blurry, flicker, distorted hands, extra fingers, watermark, subtitles)을 넣습니다. 다만 가이던스가 1보다 클 때만 효과가 있으며, 4스텝 Lightning LoRA 워크플로는 가이던스 1로 동작하므로 네거티브 프롬프트를 무시합니다.
설정과 생성 시간
공식 기본값은 16fps로 81프레임, 480p 또는 720p, 40스텝, 가이던스 스케일 3~4입니다. ComfyUI 워크플로는 가이던스 3.5에 20스텝을 쓰거나, Lightning LoRA와 함께 가이던스 1에 4스텝을 씁니다. 공식 설정으로는 데이터센터용 GPU인 H100 한 장에서 480p 클립에 약 5분 30초가 걸리고, 720p는 같은 프레임 수에 약 세 배 더 오래 걸립니다. 시드는 이미지 생성 때와 똑같이 작동합니다. 두 프롬프트를 비교하려면 시드를 고정하고, 같은 프롬프트의 다른 테이크를 얻으려면 시드를 바꾸세요. 화면비는 생성 전에 정하며 보통 16:9 또는 9:16입니다. 생성한 뒤에는 모델이 바꿀 수 없습니다.
시도 한 번 한 번이 느리기 때문에, 프롬프트는 480p로 테스트한 다음에 720p로 다시 생성하세요. 480p 테이크의 시드를 720p에 그대로 써도 노이즈의 형태가 달라 다른 클립이 나옵니다. 결과가 나쁜 원인은 대부분 설정이 아니라, 동작이 너무 많거나 카메라 지시가 서로 모순되는 프롬프트에 있습니다.
텍스트 투 비디오가 아직 못하는 것
모델은 5초, 즉 81프레임 길이에 맞춰져 있습니다. 더 길게 생성하면 내용이 흐트러집니다. 영상 속에 넣는 긴 문구는 제대로 나오지 않을 때가 많습니다. 손 표현이나 여러 사람이 빠르고 복잡하게 얽히는 장면은 여전히 자주 망가집니다. 물리 표현은 정확하다기보다 그럴듯한 수준입니다. 물, 천, 머리카락은 잘 움직이지만 공이 이상하게 튈 수 있습니다. 오디오는 없습니다. 원하는 느낌을 정확히 내려면 이미지 투 비디오가 더 쉽습니다. Stable Diffusion, SDXL, Flux로 첫 프레임을 생성한 다음 Wan 2.2로 움직임을 입히세요.
Wan 2.2 T2V를 로컬에서 실행하기
가중치는 Hugging Face에 공개되어 있으며 ComfyUI, Diffusers, 공식 저장소에서 실행할 수 있습니다. Alibaba가 80GB 그래픽카드가 필요하다고 안내하는 공식 스크립트로 실행하면, 14B T2V 모델의 VRAM 사용량은 480p에서 최대 약 41GB, 720p에서 최대 약 60GB입니다. ComfyUI에서는 fp8 체크포인트와 오프로딩을 쓰면 24GB 그래픽카드에서도 돌아가지만 클립 하나에 몇 분이 걸립니다. 5B 모델은 RTX 4090에서 720p 5초 클립을 10분 이내에 만들어 내며, ComfyUI에서는 8GB 그래픽카드에서도 돌아갑니다. VRAM이 그보다 적다면 클라우드 GPU나 이 사이트의 무료 데모를 이용하세요. 이 데모는 이미지를 첫 프레임으로 삼아 영상을 만드는 방식입니다.