Τι είναι το Wan 2.2 text-to-video
Το Wan 2.2 κυκλοφόρησε με τρία ανοιχτά μοντέλα. Το Wan2.2-T2V-A14B είναι το μοντέλο text-to-video: ένας diffusion transformer μείγματος ειδικών με 27 δισεκατομμύρια παραμέτρους, 14 δισεκατομμύρια ενεργές σε κάθε βήμα, όπου ένας ειδικός υψηλού θορύβου ορίζει τη συνολική διάταξη και ένας ειδικός χαμηλού θορύβου βελτιώνει τις λεπτομέρειες. Το Wan2.2-I2V-A14B ζωντανεύει μια υπάρχουσα εικόνα, και το Wan2.2-TI2V-5B είναι ένα μικρότερο υβρίδιο που κάνει και τα δύο και τρέχει σε κάρτα καταναλωτικής κατηγορίας στα 720p και 24 καρέ ανά δευτερόλεπτο.
Σε σύγκριση με το Wan 2.1, τα μοντέλα 2.2 εκπαιδεύτηκαν σε 66% περισσότερες εικόνες και 83% περισσότερα βίντεο, με λεπτομερείς ετικέτες για φωτισμό, σύνθεση, αντίθεση και χρωματικό τόνο. Γι' αυτό ένα prompt μπορεί να κατονομάσει το φως και το κάδρο με κινηματογραφικούς όρους όπως «soft lighting», «warm colors» ή «low angle shot», όλοι παρμένοι από το λεξιλόγιο prompt της ίδιας της Alibaba.
Πώς να γράψετε prompt για βίντεο
Ένα prompt για βίντεο περιγράφει μια σύντομη σκηνή, όχι μια στατική εικόνα. Μια δομή που δουλεύει είναι θέμα, δράση, σκηνικό, κάμερα, στυλ: «A red fox walks through fresh snow in a pine forest, turns its head towards the camera, low angle tracking shot, soft morning light, cinematic».
- Θέμα και δράση: ένα θέμα, μία σαφής ενέργεια με ρήμα. Πέντε δευτερόλεπτα αρκούν για μια χειρονομία, ένα περπάτημα, έναν χαιρετισμό με το χέρι, όχι για μια ιστορία.
- Σκηνικό: ο τόπος και η ώρα της ημέρας ορίζουν το φως.
- Κάμερα: static, pan, tilt, tracking, push-in, drone shot. Κατονομάστε την, αλλιώς διαλέγει το μοντέλο.
- Στυλ: cinematic, documentary, anime, claymation, 35 mm film. Μία λέξη στυλ αρκεί.
Γράψτε τη δράση σε απλές προτάσεις· οι λέξεις-κλειδιά μπορούν να ορίσουν το φως και το κάδρο, όπως στα παραδείγματα prompt της Alibaba, αλλά μια λίστα ετικετών δεν περιγράφει κίνηση. Χρησιμοποιήστε το αρνητικό prompt για τα κλασικά ελαττώματα (blurry, flicker, distorted hands, extra fingers, watermark, subtitles). Έχει αποτέλεσμα μόνο όταν η καθοδήγηση είναι πάνω από 1· οι ροές εργασίας με το Lightning LoRA 4 βημάτων τρέχουν στο 1 και το αγνοούν.
Ρυθμίσεις και χρόνος δημιουργίας
Οι επίσημες προεπιλογές είναι 81 καρέ στα 16 fps, 480p ή 720p, 40 βήματα και κλίμακα καθοδήγησης 3 έως 4· οι ροές εργασίας του ComfyUI χρησιμοποιούν 20 βήματα με καθοδήγηση 3.5, ή 4 βήματα στο 1 με το Lightning LoRA. Με τις επίσημες ρυθμίσεις ένα κλιπ 480p παίρνει περίπου πεντέμισι λεπτά σε μία GPU H100 κέντρου δεδομένων, και τα 720p περίπου τρεις φορές περισσότερο για τον ίδιο αριθμό καρέ. Το seed δουλεύει όπως στη δημιουργία εικόνων: σταθεροποιήστε το για να συγκρίνετε δύο prompt, αλλάξτε το για να πάρετε άλλη λήψη του ίδιου prompt. Ο λόγος πλευρών επιλέγεται πριν από τη δημιουργία, συνήθως 16:9 ή 9:16· το μοντέλο δεν μπορεί να τον αλλάξει μετά.
Επειδή κάθε προσπάθεια είναι αργή, δοκιμάστε το prompt στα 480p και μόνο τότε ξανατρέξτε το στα 720p. Το seed μιας λήψης 480p δίνει διαφορετικό κλιπ στα 720p, αφού ο θόρυβος έχει άλλο σχήμα. Τα περισσότερα κακά αποτελέσματα προέρχονται από prompt με πάρα πολλές ενέργειες ή αντιφατικές οδηγίες κάμερας, όχι από τις ρυθμίσεις.
Τι δεν μπορεί να κάνει ακόμη το text-to-video
Πέντε δευτερόλεπτα, 81 καρέ, είναι η διάρκεια για την οποία έχει ρυθμιστεί το μοντέλο· οι μεγαλύτερες δημιουργίες ξεφεύγουν. Το μακρύ κείμενο μέσα στο βίντεο είναι αναξιόπιστο. Τα χέρια και οι γρήγορες, σύνθετες αλληλεπιδράσεις μεταξύ πολλών ανθρώπων αποτυγχάνουν ακόμη συχνά. Η φυσική είναι εύλογη, όχι ακριβής: το νερό, το ύφασμα και τα μαλλιά κινούνται καλά, αλλά μια μπάλα μπορεί να αναπηδήσει λάθος. Δεν υπάρχει ήχος. Για συγκεκριμένη εμφάνιση, το image-to-video είναι ευκολότερο: δημιουργήστε το πρώτο καρέ με Stable Diffusion, SDXL ή Flux και μετά ζωντανέψτε το με το Wan 2.2.
Εκτέλεση του Wan 2.2 T2V τοπικά
Τα βάρη βρίσκονται στο Hugging Face και τρέχουν στο ComfyUI, στο Diffusers και στο επίσημο αποθετήριο. Με το επίσημο script, που κατά την Alibaba χρειάζεται κάρτα 80 GB, το μοντέλο T2V 14B φτάνει μέχρι περίπου 41 GB VRAM στα 480p και 60 GB στα 720p. Στο ComfyUI τρέχει σε κάρτα 24 GB με checkpoint fp8 και offloading, με αρκετά λεπτά ανά κλιπ. Το μοντέλο 5B παράγει κλιπ 720p πέντε δευτερολέπτων σε μια RTX 4090 σε λιγότερο από δέκα λεπτά. Στο ComfyUI χωρά σε κάρτα 8 GB· κάτω από αυτό, χρησιμοποιήστε μια GPU στο cloud ή το δωρεάν demo αυτού του ιστότοπου, που ξεκινά από μια εικόνα ως πρώτο καρέ.