Wan 2.2 이미지 투 비디오가 하는 일
Wan 2.2는 Alibaba의 오픈 영상 모델 계열에서 Wan 2.1의 뒤를 잇는 모델로, 2025년 7월 Apache 2.0 라이선스로 공개되었습니다. 이미지 투 비디오 버전인 Wan2.2-I2V-A14B는 MoE(Mixture-of-Experts) 방식의 디퓨전 트랜스포머를 사용합니다. 한 전문가 모델은 전체 레이아웃을 잡는, 노이즈가 많은 초반 스텝을 맡고, 다른 전문가 모델은 디테일을 다듬는 후반 스텝을 맡습니다. 전체 270억 개 파라미터 가운데 스텝마다 약 140억 개가 활성화됩니다. 더 작은 하이브리드 모델인 Wan2.2-TI2V-5B는 텍스트와 이미지를 모두 입력받으며 소비자용 그래픽카드 한 장으로 실행됩니다.
모델에 클립의 첫 프레임이 될 이미지와, 무엇이 움직여야 하는지를 적은 프롬프트를 넣습니다. 그러면 초당 16프레임으로 81프레임, 약 5초 분량을 생성하며, 넣어 준 이미지를 바탕으로 클립을 만들어 갑니다. 카메라나 피사체가 움직이는 동안에도 얼굴, 옷, 조명이 원본과 가깝게 유지됩니다.
모션 프롬프트 작성법
피사체와 스타일, 구도는 이미 이미지에 담겨 있으므로 프롬프트에는 변화만 설명하면 됩니다. 누가 또는 무엇이 어떻게 움직이는지, 카메라는 어떻게 움직이는지를 짧은 문장 한두 개로 쓰세요. "The woman turns her head to the right and smiles, soft wind in her hair, slow push-in"은 잘 통하지만, 스타일 태그를 나열한 목록은 통하지 않습니다. 카메라가 중요하다면 "static camera", "slow pan to the left", "the drone rises"처럼 분명히 적어 주세요.
움직임은 5초짜리 클립에 담길 만한 수준으로 잡으세요. 프롬프트 하나에 동작 하나가 안전한 선택입니다. walks, waves, blinks, flows, drifts, rotates 같은 동사가 예측 가능한 움직임을 만듭니다. 이미지에 없는 것은 요구하지 마세요. 모델은 자동차를 움직일 수 있지만, 그 뒤의 도로는 새로 만들어 내야 하므로 이미지에 이미 담긴 부분만큼 믿을 만하지는 않습니다. 네거티브 프롬프트는 가이던스가 1보다 클 때만 효과가 있습니다. 4스텝 Lightning LoRA 워크플로는 가이던스 1로 동작하므로 네거티브 프롬프트를 무시합니다. 그 밖의 경우에는 늘 쓰는 목록이 그대로 통합니다. blurry, distorted hands, extra limbs, flickering, watermark, text.
중요한 설정
- 해상도: 480p는 720p보다 약 세 배 빠르고 SNS용으로는 대개 충분합니다. 최종 클립에는 720p를 쓰세요.
- 프레임 수: 16fps로 81프레임이 표준 5초 클립입니다. 더 긴 시퀀스는 내용이 흐트러지므로, 클립 두 개를 생성해 편집으로 잇는 편이 낫습니다.
- 스텝: 샘플링 스텝은 공식 스크립트에서 40, 기본 ComfyUI 워크플로에서 20입니다. 4스텝 Lightning LoRA를 쓸 때는 4~8스텝으로 충분합니다.
- 가이던스(CFG): 14B I2V 모델의 기본값은 3.5이고, 4스텝 LoRA를 쓸 때는 1입니다. 값이 높을수록 프롬프트를 글자 그대로 따르지만 깜빡임이 늘어납니다.
- 시드: Stable Diffusion과 마찬가지로 이미지, 프롬프트, 설정, 시드가 같으면 같은 클립이 재현됩니다. 시드만 바꾸면 같은 이미지에서 다른 움직임을 얻을 수 있습니다.
720p에 시간을 들이기 전에 480p로 프롬프트를 먼저 검증하세요. 다만 시드는 그대로 이어지지 않습니다. 720p에서는 노이즈의 형태가 달라져 움직임도 달라집니다.
어떤 이미지가 잘 움직이나요?
Wan 2.2는 어떤 사진이나 AI 생성 이미지로도 작동하지만, 훨씬 다루기 쉬운 이미지가 있습니다. 단순한 배경에 주 피사체가 뚜렷하면 움직임이 깔끔하고, 복잡한 장면에서는 무엇을 움직일지 모델이 골라야 합니다. 클립은 이미지의 화면비를 그대로 따르므로 세로형과 가로형 모두 쓸 수 있습니다. ComfyUI에서는 너비와 높이를 같은 비율로 지정하세요. 그러지 않으면 이미지가 잘립니다. 선명하고 조명이 좋은 이미지는 크기가 출력 해상도 이상(긴 변 기준 480p는 832픽셀, 720p는 1280픽셀)이면 클립 끝까지 디테일이 유지됩니다. 흐리거나 심하게 압축된 원본에서는 흐린 영상이 나옵니다.
Stable Diffusion, SDXL, Flux로 생성한 이미지는 아주 잘 움직입니다. 그래서 이미지 투 비디오는 원하는 느낌을 정확히 살린 짧은 영상을 얻는 가장 쉬운 방법입니다. 먼저 원하는 프레임을 정확히 생성하고, 그다음에 움직임을 입히면 됩니다.
Wan 2.2 I2V를 내 PC에서 실행하기
가중치는 Hugging Face에 공개되어 있으며 ComfyUI, Diffusers, Wan 공식 저장소에서 실행할 수 있습니다. Alibaba가 80GB 그래픽카드가 필요하다고 안내하는 공식 스크립트로 실행하면, 14B I2V 모델의 VRAM 사용량은 480p에서 최대 약 41GB, 720p에서 최대 약 60GB입니다. ComfyUI에서는 fp8 양자화 체크포인트와 오프로딩을 쓰면 24GB 그래픽카드에서도 돌아가지만 클립 하나에 몇 분이 걸립니다. 5B TI2V 모델은 RTX 4090에서 720p 5초 클립을 10분 이내에 생성하며, 공식 스크립트로는 약 24GB의 VRAM이 필요하지만 ComfyUI에서는 8GB 그래픽카드에서도 돌아갑니다. VRAM이 그보다 적다면 클라우드 GPU나 이 사이트의 무료 데모를 이용하세요.