Τι κάνει το Wan 2.2 image-to-video
Το Wan 2.2, που κυκλοφόρησε τον Ιούλιο του 2025 με άδεια Apache 2.0, είναι ο διάδοχος του Wan 2.1 στη σειρά ανοιχτών μοντέλων βίντεο της Alibaba. Η παραλλαγή image-to-video, Wan2.2-I2V-A14B, χρησιμοποιεί έναν diffusion transformer μείγματος ειδικών (mixture of experts): ένας ειδικός αναλαμβάνει τα πρώτα, θορυβώδη βήματα που ορίζουν τη συνολική διάταξη, ένας άλλος τα τελευταία βήματα που βελτιώνουν τη λεπτομέρεια. Περίπου 14 δισεκατομμύρια παράμετροι είναι ενεργές ανά βήμα από 27 δισεκατομμύρια συνολικά. Ένα μικρότερο υβριδικό μοντέλο, το Wan2.2-TI2V-5B, δέχεται και κείμενο και εικόνα και τρέχει σε μία μόνο κάρτα καταναλωτικής κατηγορίας.
Δίνετε στο μοντέλο μια εικόνα, που γίνεται το πρώτο καρέ του κλιπ, και ένα prompt που λέει τι πρέπει να κινηθεί. Παράγει 81 καρέ στα 16 καρέ ανά δευτερόλεπτο, περίπου πέντε δευτερόλεπτα, και χτίζει το κλιπ πάνω σε αυτή την εικόνα: πρόσωπα, ρούχα και φωτισμός μένουν κοντά στην πηγή ενώ η κάμερα ή το θέμα κινείται.
Πώς να γράψετε το prompt κίνησης
Η εικόνα περιέχει ήδη το θέμα, το στυλ και τη σύνθεση, οπότε το prompt χρειάζεται να περιγράψει μόνο την αλλαγή. Γράψτε μία ή δύο σύντομες προτάσεις: ποιος ή τι κινείται, πώς, και τι κάνει η κάμερα. Το «The woman turns her head to the right and smiles, soft wind in her hair, slow push-in» δουλεύει· μια λίστα ετικετών στυλ όχι. Αναφέρετε ρητά την κάμερα όταν έχει σημασία: «static camera», «slow pan to the left», «the drone rises».
Κρατήστε την κίνηση εύλογη για κλιπ πέντε δευτερολέπτων. Μία ενέργεια ανά prompt είναι η ασφαλής επιλογή. Ρήματα όπως walks, waves, blinks, flows, drifts, rotates δίνουν προβλέψιμη κίνηση. Αποφύγετε να ζητάτε πράγματα που δεν υπάρχουν στην εικόνα: το μοντέλο μπορεί να κινήσει ένα αυτοκίνητο, αλλά πρέπει να επινοήσει τον δρόμο πίσω του, κάτι λιγότερο αξιόπιστο από αυτό που ήδη δείχνει η εικόνα. Το αρνητικό prompt έχει αποτέλεσμα μόνο όταν η καθοδήγηση είναι πάνω από 1· οι ροές εργασίας με το Lightning LoRA 4 βημάτων τρέχουν στο 1 και το αγνοούν. Αλλιώς η συνηθισμένη λίστα δουλεύει: blurry, distorted hands, extra limbs, flickering, watermark, text.
Ρυθμίσεις που μετράνε
- Ανάλυση: τα 480p είναι περίπου τρεις φορές πιο γρήγορα από τα 720p και συχνά αρκούν για τα κοινωνικά δίκτυα· χρησιμοποιήστε 720p για τελικό κλιπ.
- Καρέ: 81 καρέ στα 16 fps είναι το τυπικό κλιπ πέντε δευτερολέπτων. Οι μεγαλύτερες ακολουθίες ξεφεύγουν· καλύτερα να δημιουργήσετε δύο κλιπ και να τα ενώσετε στο μοντάζ.
- Βήματα: 40 βήματα δειγματοληψίας στο επίσημο script, 20 στη βασική ροή εργασίας του ComfyUI. Με το Lightning LoRA 4 βημάτων, 4 έως 8 αρκούν.
- Καθοδήγηση (CFG): 3.5 από προεπιλογή για το μοντέλο I2V 14B και 1 με το LoRA 4 βημάτων. Υψηλότερες τιμές ακολουθούν το prompt πιο κυριολεκτικά αλλά προσθέτουν τρεμόπαιγμα.
- Seed: όπως στο Stable Diffusion, η ίδια εικόνα, prompt, ρυθμίσεις και seed αναπαράγουν το ίδιο κλιπ· αλλάξτε μόνο το seed για να πάρετε άλλη κίνηση για την ίδια εικόνα.
Δοκιμάστε το prompt στα 480p πριν ξοδέψετε χρόνο στα 720p. Το seed δεν μεταφέρεται: στα 720p ο θόρυβος έχει άλλο σχήμα, οπότε η κίνηση αλλάζει.
Ποιες εικόνες ζωντανεύουν καλύτερα
Το Wan 2.2 δουλεύει από οποιαδήποτε φωτογραφία ή εικόνα AI, αλλά κάποιες εικόνες είναι πολύ πιο εύκολες. Ένα σαφές κύριο θέμα σε απλό φόντο δίνει καθαρή κίνηση· οι φορτωμένες σκηνές αναγκάζουν το μοντέλο να διαλέξει τι θα κινήσει. Το κλιπ παίρνει τον λόγο πλευρών της εικόνας, οπότε δουλεύουν και το κατακόρυφο και το οριζόντιο κάδρο. Στο ComfyUI, ορίστε πλάτος και ύψος με τον ίδιο λόγο, αλλιώς η εικόνα περικόπτεται. Οι ευκρινείς, καλά φωτισμένες εικόνες κρατούν τη λεπτομέρεια σε όλο το κλιπ αν είναι τουλάχιστον τόσο μεγάλες όσο η έξοδος (832 pixel στη μεγάλη πλευρά στα 480p, 1280 στα 720p)· μια θολή ή έντονα συμπιεσμένη πηγή παράγει θολό βίντεο.
Οι εικόνες που δημιουργήθηκαν με Stable Diffusion, SDXL ή Flux ζωντανεύουν πολύ καλά, κάτι που κάνει το image-to-video τον ευκολότερο τρόπο για να πάρετε ένα σύντομο βίντεο με συγκεκριμένη εμφάνιση: δημιουργήστε πρώτα το ακριβές καρέ που θέλετε και μετά ζωντανέψτε το.
Εκτέλεση του Wan 2.2 I2V τοπικά
Τα βάρη βρίσκονται στο Hugging Face και τρέχουν στο ComfyUI, στο Diffusers και στο επίσημο αποθετήριο Wan. Με το επίσημο script, που κατά την Alibaba χρειάζεται κάρτα 80 GB, το μοντέλο I2V 14B φτάνει μέχρι περίπου 41 GB VRAM στα 480p και 60 GB στα 720p. Στο ComfyUI τρέχει σε κάρτα 24 GB με τα κβαντισμένα checkpoint fp8 και offloading, με κόστος αρκετά λεπτά ανά κλιπ. Το μοντέλο TI2V 5B δημιουργεί κλιπ 720p πέντε δευτερολέπτων σε μια RTX 4090 σε λιγότερο από δέκα λεπτά και χρειάζεται περίπου 24 GB VRAM με το επίσημο script· στο ComfyUI χωρά σε κάρτα 8 GB. Κάτω από αυτό, χρησιμοποιήστε μια GPU στο cloud ή το δωρεάν demo αυτού του ιστότοπου.