Wan 2.2’nin görselden videoya modeli ne yapar?
Temmuz 2025’te Apache 2.0 lisansıyla yayımlanan Wan 2.2, Alibaba’nın açık video modelleri serisinde Wan 2.1’in halefidir. Görselden videoya sürümü olan Wan2.2-I2V-A14B, uzman karışımı (mixture-of-experts) yapısında bir diffusion transformer kullanır: uzmanlardan biri genel düzeni kuran ilk, gürültülü adımları, diğeri ise ayrıntıları işleyen son adımları üstlenir. Toplam 27 milyar parametrenin her adımda yaklaşık 14 milyarı etkindir. Daha küçük bir hibrit model olan Wan2.2-TI2V-5B ise hem metin hem görsel kabul eder ve tek bir tüketici sınıfı ekran kartında çalışır.
Modele bir görsel (klibin ilk karesi) ve neyin hareket edeceğini söyleyen bir prompt verirsiniz. Model saniyede 16 kare hızında 81 kare, yani yaklaşık beş saniye üretir ve klibi bu görselin üzerine kurar: kamera ya da konu hareket ederken yüzler, giysiler ve ışık kaynak görsele yakın kalır.
Hareket promptu nasıl yazılır?
Konu, stil ve kompozisyon zaten görselde bulunduğundan promptun yalnızca değişimi anlatması yeterlidir. Bir iki kısa cümle yazın: kim ya da ne hareket ediyor, nasıl hareket ediyor ve kamera ne yapıyor. “The woman turns her head to the right and smiles, soft wind in her hair, slow push-in” işe yarar; stil etiketlerinden oluşan bir liste ise işe yaramaz. Önemli olduğu durumlarda kamerayı açıkça belirtin: “static camera”, “slow pan to the left”, “the drone rises”.
Hareketi beş saniyelik bir klibe sığacak kadar makul tutun. Prompt başına tek bir eylem en güvenli seçimdir. walks, waves, blinks, flows, drifts, rotates gibi fiiller öngörülebilir hareketler üretir. Görselde bulunmayan şeyleri istemekten kaçının: model bir arabayı hareket ettirebilir ama arkasındaki yolu kendisi uydurmak zorundadır; bu da görselde zaten bulunanlar kadar güvenilir olmaz. Negatif prompt yalnızca guidance (CFG) değeri 1’in üzerindeyken etkili olur; 4 adımlı Lightning LoRA iş akışları ise 1 değeriyle çalışır ve negatif promptu yok sayar. Bunun dışında alışılmış liste işinizi görür: blurry, distorted hands, extra limbs, flickering, watermark, text.
Önemli ayarlar
- Çözünürlük: 480p, 720p’den yaklaşık üç kat hızlıdır ve sosyal medya için çoğu zaman yeterlidir; nihai klip için 720p kullanın.
- Kare sayısı: saniyede 16 kareyle 81 kare, standart beş saniyelik kliptir. Daha uzun dizilerde tutarlılık giderek bozulur; iki klip üretip kurguda birleştirmek daha iyidir.
- Adım sayısı: resmi betikte 40, temel ComfyUI iş akışında 20 örnekleme adımı. 4 adımlı Lightning LoRA ile 4 ila 8 adım yeterlidir.
- Guidance (CFG): 14B I2V modelinde varsayılan değer 3.5, 4 adımlı LoRA ile 1’dir. Daha yüksek değerlerde model prompta daha sıkı uyar ama titreme (flicker) artar.
- Seed: Stable Diffusion’da olduğu gibi aynı görsel, prompt, ayarlar ve seed aynı klibi yeniden üretir; aynı görsel için farklı bir hareket elde etmek istiyorsanız yalnızca seed değerini değiştirin.
720p’ye zaman harcamadan önce promptu 480p’de deneyin. Seed bir çözünürlükten diğerine taşınmaz: 720p’de gürültünün şekli farklıdır, dolayısıyla hareket de değişir.
Hangi görseller en iyi canlandırılır?
Wan 2.2 herhangi bir fotoğrafla ya da yapay zekayla üretilmiş herhangi bir görselle çalışır, ancak bazı görsellerle iyi sonuç almak çok daha kolaydır. Sade bir arka plan önündeki net bir ana konu temiz bir hareket verir; kalabalık sahnelerde ise neyi hareket ettireceğine model karar vermek zorunda kalır. Klip görselin en-boy oranını alır; dolayısıyla hem dikey hem yatay görseller kullanılabilir. ComfyUI’da aynı orana sahip bir genişlik ve yükseklik girin, yoksa görsel kırpılır. Keskin ve iyi aydınlatılmış görseller, en az çıktı kadar büyükse (uzun kenar 480p’de 832, 720p’de 1280 piksel) ayrıntıyı klip boyunca korur; bulanık ya da aşırı sıkıştırılmış bir kaynak bulanık bir video üretir.
Stable Diffusion, SDXL ya da Flux ile üretilmiş görseller çok iyi canlandırılır. Bu da görselden videoya yöntemini, aklınızdaki görünüme sahip kısa bir video elde etmenin en kolay yolu hâline getirir: önce tam istediğiniz kareyi üretin, sonra onu canlandırın.
Wan 2.2 I2V’yi evde çalıştırmak
Model ağırlıkları Hugging Face’te bulunur; ComfyUI’da, Diffusers’ta ve resmi Wan deposunda çalışır. Alibaba’nın 80 GB’lık bir kart gerektiğini belirttiği resmi betikle 14B I2V modelinin VRAM kullanımı 480p’de yaklaşık 41 GB’a, 720p’de 60 GB’a kadar çıkar. ComfyUI’da ise fp8 ile nicemlenmiş (quantised) checkpoint dosyaları ve sistem belleğine aktarma (offloading) sayesinde 24 GB’lık bir kartta çalışır; bunun bedeli klip başına birkaç dakikadır. 5B TI2V modeli, RTX 4090’da 720p çözünürlükte beş saniyelik bir klibi on dakikadan kısa sürede üretir ve resmi betikle yaklaşık 24 GB VRAM ister; ComfyUI’da ise 8 GB’lık bir karta sığar. Daha küçük kartlarda bulut üzerinde bir GPU ya da bu sitedeki ücretsiz demoyu kullanın.