Πώς λειτουργεί το Stable Diffusion;
Το Stable Diffusion είναι ένα μοντέλο λανθάνουσας διάχυσης (latent diffusion). Κατά την εκπαίδευση έμαθε να αφαιρεί θόρυβο από εκατοντάδες εκατομμύρια εικόνες συνοδευόμενες από λεζάντες. Κατά τη δημιουργία ξεκινά από καθαρά τυχαίο θόρυβο και, βήμα προς βήμα, τον αποθορυβοποιεί προς την κατεύθυνση του κειμένου σας: μετά από 20 έως 30 βήματα ο θόρυβος έχει γίνει μια εικόνα που αντιστοιχεί στο prompt.
Τρία μέρη συνεργάζονται: ένας κωδικοποιητής κειμένου που μετατρέπει τις λέξεις σας σε αριθμούς, ένα U-Net (ή, από την έκδοση 3, ένας diffusion transformer) που κάνει την αποθορυβοποίηση, και ένας αποκωδικοποιητής που μετατρέπει τη συμπαγή λανθάνουσα εικόνα σε pixel. Η αποθορυβοποίηση γίνεται πάνω σε αυτή τη συμπαγή λανθάνουσα εικόνα, και αυτό είναι που κάνει το μοντέλο αρκετά γρήγορο για μια GPU καταναλωτικής κατηγορίας.
Ποιες εκδόσεις υπάρχουν;
- Stable Diffusion 1.5 (2022): εικόνες 512×512, χιλιάδες fine-tune και LoRA από την κοινότητα.
- SDXL 1.0 (Ιούλιος 2023): εγγενής ανάλυση 1024×1024, καλύτερα χέρια, πρόσωπα και σύνθεση, ένα μοντέλο refiner για τις λεπτομέρειες.
- Stable Diffusion 3 Medium (Ιούνιος 2024): diffusion transformer, πολύ καλύτερη απόδοση κειμένου και κατανόηση του prompt.
- Stable Diffusion 3.5 (Οκτώβριος 2024): η τρέχουσα έκδοση, σε μεγέθη Large, Large Turbo και Medium, με καλύτερη πιστότητα στο prompt και πιο ποικίλα στυλ.
Δείτε την αναλυτική σύγκριση στο SDXL vs Stable Diffusion 3.
Τι μπορείτε να κάνετε με αυτό;
Η δημιουργία εικόνας από κείμενο είναι μόνο η αρχή. Τα ίδια μοντέλα κάνουν image-to-image (μετασχηματισμό ενός σκίτσου ή μιας φωτογραφίας), inpainting (ξαναζωγράφισμα μιας περιοχής), outpainting (επέκταση μιας εικόνας), μεγέθυνση με ειδικά μοντέλα υπερ-ανάλυσης και, με το ControlNet, δημιουργία καθοδηγούμενη από μια στάση σώματος, έναν χάρτη βάθους ή ακμές. Πρόσθετα που λέγονται LoRA, το καθένα ένα μικρό ξεχωριστό αρχείο, μαθαίνουν στο μοντέλο ένα στυλ ή έναν χαρακτήρα.
Σε αυτόν τον ιστότοπο μπορείτε να δοκιμάσετε inpainting και μεγέθυνση χωρίς λογαριασμό, να δημιουργήσετε εικόνες με SDXL ή Stable Diffusion 3 και να εξερευνήσετε 1.731 στυλ καλλιτεχνών και 82 τεκμηριωμένα prompt για να μάθετε τι κάνει ένα prompt.
Σε τι διαφέρει από το DALL-E ή το Midjourney;
Σε δύο πράγματα: τα βάρη είναι δημόσια και τρέχει τοπικά. Μπορείτε να κατεβάσετε το μοντέλο, να το τρέξετε δωρεάν στον δικό σας υπολογιστή, να το τροποποιήσετε και να κρατήσετε τις εικόνες σας ιδιωτικές. Το Midjourney και τα μοντέλα εικόνας της OpenAI (DALL-E, σήμερα GPT Image) είναι κλειστές υπηρεσίες: πληρώνετε με συνδρομή ή ανά εικόνα και το μοντέλο δεν φεύγει ποτέ από τους διακομιστές τους. Σε αντάλλαγμα, το Stable Diffusion ζητά περισσότερα από εσάς. Πρέπει να επιλέξετε μοντέλο, να γράψετε ένα ακριβές prompt και ένα αρνητικό prompt και να καταλάβετε το seed.
Χρειάζομαι ισχυρό υπολογιστή;
Για να το τρέξετε μόνοι σας, μια πρόσφατη κάρτα NVIDIA με 6 GB VRAM αρκεί για το SD 1.5 και 8 GB για το SDXL. Οι κάρτες AMD δουλεύουν μέσω ROCm στο Linux και το Apple Silicon μέσω του backend MPS. Αν δεν έχετε τίποτα από αυτά, τα εργαλεία αυτού του ιστότοπου δεν χρειάζονται δικό σας εξοπλισμό: κάποια τρέχουν στη δική μας GPU, με την ουρά και την πρόοδο να εμφανίζονται ζωντανά, άλλα είναι φιλοξενούμενα demo ενσωματωμένα στη σελίδα. Διαβάστε πώς να εγκαταστήσετε το Stable Diffusion τοπικά όταν είστε έτοιμοι.