Wan 2.2 ile metinden video nasıl üretilir?

Yazan: Güncelleme: 4 dk okuma

Wan 2.2’nin metinden videoya (text-to-video) modeli; sahneyi, eylemi ve kamerayı anlatan tek bir cümleden 480p ya da 720p çözünürlükte, yaklaşık beş saniyelik sessiz bir klip üretir. Alibaba’nın 2025’te Apache 2.0 lisansıyla yayımladığı açık ağırlıklı video modelidir; ComfyUI ya da Diffusers ile evde de çalıştırılabilir.

Wan 2.2’nin metinden videoya modeli nedir?

Wan 2.2 üç açık modelle piyasaya çıktı. Wan2.2-T2V-A14B metinden videoya modelidir: 27 milyar parametreli, her adımda 14 milyarı etkin olan, uzman karışımı (mixture-of-experts) yapısında bir diffusion transformer. Yüksek gürültü uzmanı genel düzeni kurar, düşük gürültü uzmanı ise ayrıntıları işler. Wan2.2-I2V-A14B mevcut bir görseli canlandırır; Wan2.2-TI2V-5B ise her ikisini de yapan, tüketici sınıfı bir kartta 720p çözünürlükte ve saniyede 24 kareyle çalışan daha küçük bir hibrit modeldir.

Wan 2.1’e kıyasla 2.2 modelleri %66 daha fazla görsel ve %83 daha fazla videoyla; ışık, kompozisyon, kontrast ve renk tonu için ayrıntılı etiketlerle eğitilmiştir. Bir promptta ışığı ve kadrajı “soft lighting”, “warm colors” ya da “low angle shot” gibi sinema terimleriyle belirtebilmenizin nedeni budur; bu terimlerin hepsi Alibaba’nın kendi prompt sözlüğünden alınmıştır.

Video promptu nasıl yazılır?

Bir video promptu durağan bir görseli değil, kısa bir sahneyi anlatır. İşe yarayan bir yapı şudur: konu, eylem, mekan, kamera, stil. Örneğin: “A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic”. Her öğe, aksi halde modelin tahmin etmek zorunda kalacağı bir soruyu yanıtlar.

  • Konu ve eylem: tek bir konu, bir fiille anlatılan tek ve net bir eylem. Beş saniye bir jest, bir yürüyüş, bir el sallama için yeter; bir hikaye için yetmez.
  • Mekan: yer ve günün saati ışığı belirler.
  • Kamera: static, pan, tilt, tracking, push-in, drone shot. Hangisini istediğinizi belirtin, yoksa seçimi model yapar.
  • Stil: cinematic, documentary, anime, claymation, 35 mm film. Tek bir stil kelimesi yeterlidir.

Eylemi düz cümlelerle yazın; Alibaba’nın kendi örnek promptlarında olduğu gibi ışığı ve kadrajı anahtar kelimelerle belirleyebilirsiniz, ama bir etiket listesi hareketi anlatmaz. Negatif promptu klasik kusurlar için kullanın (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Negatif prompt yalnızca guidance değeri 1’in üzerindeyken etkili olur; 4 adımlı Lightning LoRA iş akışları ise 1 değeriyle çalışır ve onu yok sayar.

Ayarlar ve üretim süresi

Resmi varsayılan değerler şunlardır: saniyede 16 kareyle 81 kare, 480p ya da 720p, 40 adım ve 3 ile 4 arasında bir guidance ölçeği. ComfyUI iş akışları ise 3.5 guidance değeriyle 20 adım, Lightning LoRA eklendiğinde ise 1 guidance değeriyle 4 adım kullanır. Resmi ayarlarla 480p bir klip, veri merkezi sınıfı tek bir H100 GPU’da yaklaşık beş buçuk dakika sürer; 720p ise aynı kare sayısı için yaklaşık üç kat daha uzun sürer. Seed, görsel üretimindeki gibi çalışır: iki promptu karşılaştırmak için sabitleyin, aynı promptun başka bir yorumunu elde etmek için değiştirin. En-boy oranı üretimden önce seçilir, genellikle 16:9 ya da 9:16; model bunu sonradan değiştiremez.

Her deneme yavaş olduğu için promptu 480p’de sınayın ve ancak ondan sonra 720p’de yeniden çalıştırın. 480p’deki bir denemenin seed değeri 720p’de farklı bir klip verir, çünkü gürültünün şekli değişir. Kötü sonuçların çoğu ayarlardan değil, çok fazla eylem ya da birbiriyle çelişen kamera talimatları içeren promptlardan kaynaklanır.

Metinden video üretiminin henüz yapamadıkları

Modelin ayarlandığı uzunluk beş saniye, yani 81 karedir; daha uzun üretimlerde tutarlılık giderek bozulur. Video içindeki uzun yazılar güvenilir değildir. Ellerde ve birkaç kişi arasındaki hızlı, karmaşık etkileşimlerde model hâlâ sık sık hata yapar. Fizik kesin olmaktan çok inandırıcıdır: su, kumaş ve saç iyi hareket eder ama bir top yanlış sekebilir. Ses yoktur. Belirli bir görünüm istiyorsanız görselden videoya yöntemi daha kolaydır: ilk kareyi Stable Diffusion, SDXL ya da Flux ile üretin, sonra Wan 2.2 ile canlandırın.

Wan 2.2 T2V’yi yerel olarak çalıştırmak

Model ağırlıkları Hugging Face’te bulunur; ComfyUI’da, Diffusers’ta ve resmi depoda çalışır. Alibaba’nın 80 GB’lık bir kart gerektiğini belirttiği resmi betikle 14B T2V modelinin VRAM kullanımı 480p’de yaklaşık 41 GB’a, 720p’de 60 GB’a kadar çıkar. ComfyUI’da ise fp8 checkpoint dosyaları ve offloading ile 24 GB’lık bir kartta çalışır, ancak klip başına birkaç dakika sürer. 5B modeli, RTX 4090’da 720p çözünürlükte beş saniyelik bir klibi on dakikadan kısa sürede üretir. ComfyUI’da 8 GB’lık bir karta sığar; daha küçük kartlarda bulut üzerinde bir GPU ya da bu sitedeki ücretsiz demoyu kullanın. Bu demo, ilk kare olarak kullanılan bir görselden yola çıkar.

Sıkça sorulan sorular

Wan 2.2, Wan 2.1’den daha mı iyi?

Alibaba’ya göre hareket kalitesi, prompta bağlılık ve estetik kontrol açısından evet: uzman karışımı modeller ve daha zengin eğitim etiketleri daha akıcı bir hareketi, ışık ve kompozisyon üzerinde de daha sıkı bir kontrolü hedefler. Küçük GPU’larda Wan 2.1’in yerini 5B’lik Wan 2.2 modeli alır.

Wan 2.2 bir görsel ve bir metinden video üretebilir mi?

Evet. I2V modeli bir görseli ilk kare olarak, hareketi anlatan bir metinle birlikte kullanır; 5B TI2V modeli ise yalnızca metni ya da metinle birlikte bir görseli kabul eder. Bu sitedeki Wan 2.2 demosu bir görselden yola çıkar.

Videoları ticari amaçla kullanabilir miyim?

Modeller, ticari kullanıma izin veren Apache 2.0 lisansıyla yayımlanmıştır; Alibaba da ürettiğiniz videolar üzerinde hiçbir hak talep etmez. Üretim yaptığınız barındırma hizmetinin koşullarını da kontrol edin.