ما هو Wan 2.2 من نص إلى فيديو
يأتي Wan 2.2 في ثلاثة نماذج مفتوحة. Wan2.2-T2V-A14B هو نموذج النص إلى فيديو: محوّل انتشار بمزيج من الخبراء بـ 27 مليار معامل، منها 14 ملياراً نشطة في كل خطوة، حيث يرسم خبير الضجيج العالي الحركة ويصقل خبير الضجيج المنخفض القوام والإضاءة. Wan2.2-I2V-A14B يحرّك صورة موجودة، وWan2.2-TI2V-5B نموذج هجين أصغر يقوم بالأمرين ويعمل على بطاقة استهلاكية بدقة 720p و24 إطاراً في الثانية.
مقارنة بـ Wan 2.1، دُرّبت نماذج 2.2 على فيديو أكثر بكثير، مع تصنيفات للإضاءة والتكوين واللون وحركة الكاميرا. لهذا يمكن للأمر أن يطلب «إضاءة خلفية في الساعة الذهبية» أو «كاميرا محمولة باليد» ويحصل عليها، وهو ما كانت النماذج المفتوحة السابقة تتجاهله غالباً.
كيف تكتب أمر فيديو
يصف أمر الفيديو مشهداً قصيراً لا صورة ثابتة. البنية الموثوقة هي الموضوع، الحركة، المكان، الكاميرا، الأسلوب: «ثعلب أحمر يمشي في ثلج طازج داخل غابة صنوبر، يدير رأسه نحو الكاميرا، لقطة تتبّع من زاوية منخفضة، ضوء صباح ناعم، سينمائي». كل عنصر يجيب عن سؤال كان النموذج سيخمّنه.
- الموضوع والحركة: موضوع واحد وحركة واضحة بفعل. خمس ثوانٍ تكفي لإيماءة أو مشية أو تلويحة، لا لقصة.
- المكان: المكان ووقت اليوم يحددان الضوء.
- الكاميرا: ثابتة، تحريك أفقي، إمالة، تتبّع، اقتراب، لقطة مسيّرة. سمِّها وإلا اختار النموذج.
- الأسلوب: سينمائي، وثائقي، أنمي، صلصال متحرك، فيلم 35 مم. كلمة أسلوب واحدة تكفي.
اكتب بجمل بسيطة؛ قوائم الكلمات المفتاحية التي تنجح في Stable Diffusion تعطي هنا حركة جامدة وغير متماسكة. استخدم الأمر السلبي للعيوب المعروفة: ضبابي، وميض، أيدٍ مشوّهة، أصابع زائدة، علامة مائية، ترجمة.
الإعدادات ووقت التوليد
الإعدادات الافتراضية 81 إطاراً بمعدل 16 في الثانية، 480p أو 720p، من 20 إلى 30 خطوة، وتوجيه قرب 5. بدقة 480p يستغرق المقطع دقيقة إلى دقيقتين على معالج مركز بيانات؛ و720p يستغرق أربعة أضعاف ذلك لعدد الإطارات نفسه. تعمل البذرة كما في توليد الصور: ثبّتها لمقارنة أمرين، وغيّرها للحصول على لقطة أخرى للأمر نفسه. تُختار نسبة الأبعاد قبل التوليد، عادة 16:9 أو 9:16؛ ولا يستطيع النموذج تغييرها بعد ذلك.
ولأن كل محاولة بطيئة، اختبر الأمر بدقة 480p، واحتفظ ببذرة اللقطة التي تعجبك، ثم أعد التشغيل بدقة 720p. معظم النتائج السيئة تأتي من أوامر بحركات كثيرة أو تعليمات كاميرا متناقضة، لا من الإعدادات.
ما لا يستطيعه النص إلى فيديو بعد
خمس ثوانٍ هي الحد العملي لمقطع متسق؛ التوليد الأطول ينحرف ويتغير وجه الموضوع أو ملابسه. النص داخل الفيديو غير موثوق. الأيدي والتفاعلات السريعة المعقدة بين عدة أشخاص ما زالت تفشل كثيراً. الفيزياء معقولة لا دقيقة: الماء والقماش والشعر تتحرك جيداً، لكن الكرة قد ترتد خطأ. لا يوجد صوت. للمظهر الدقيق، الصورة إلى فيديو أسهل: ولّد الإطار الأول بـ Stable Diffusion أو SDXL أو FLUX ثم حرّكه بـ Wan 2.2.
تشغيل Wan 2.2 T2V محلياً
الأوزان على Hugging Face وتعمل في ComfyUI وDiffusers والمستودع الرسمي. يحتاج نموذج T2V بحجم 14B إلى نحو 80 جيجابايت من ذاكرة الفيديو بالدقة الكاملة، أو بطاقة 24 جيجابايت مع نقاط تحقق fp8 والتفريغ، بعدة دقائق لكل مقطع. ينتج نموذج 5B مقطع 720p لخمس ثوانٍ على RTX 4090 في أقل من عشر دقائق. دون 16 جيجابايت استخدم معالجاً سحابياً أو العرض التجريبي المجاني في هذا الموقع، الذي يقبل أيضاً صورة كإطار أول.