Τι είναι το Stable Diffusion;

Από Ενημερώθηκε 4 λεπτά ανάγνωσης

Το Stable Diffusion είναι ένα μοντέλο τεχνητής νοημοσύνης ανοιχτού κώδικα που μετατρέπει μια περιγραφή κειμένου σε εικόνα. Κυκλοφόρησε από τη Stability AI τον Αύγουστο του 2022, τρέχει σε μια συνηθισμένη κάρτα γραφικών για παιχνίδια, μπορεί να εκπαιδευτεί περαιτέρω από οποιονδήποτε και τροφοδοτεί πολλά δωρεάν εργαλεία, μεταξύ άλλων και αυτά του ιστότοπου.

Πώς λειτουργεί το Stable Diffusion;

Το Stable Diffusion είναι ένα μοντέλο λανθάνουσας διάχυσης (latent diffusion). Κατά την εκπαίδευση έμαθε να αφαιρεί θόρυβο από εκατοντάδες εκατομμύρια εικόνες συνοδευόμενες από λεζάντες. Κατά τη δημιουργία ξεκινά από καθαρά τυχαίο θόρυβο και, βήμα προς βήμα, τον αποθορυβοποιεί προς την κατεύθυνση του κειμένου σας: μετά από 20 έως 30 βήματα ο θόρυβος έχει γίνει μια εικόνα που αντιστοιχεί στο prompt.

Τρία μέρη συνεργάζονται: ένας κωδικοποιητής κειμένου που μετατρέπει τις λέξεις σας σε αριθμούς, ένα U-Net (ή, από την έκδοση 3, ένας diffusion transformer) που κάνει την αποθορυβοποίηση, και ένας αποκωδικοποιητής που μετατρέπει τη συμπαγή λανθάνουσα εικόνα σε pixel. Η αποθορυβοποίηση γίνεται πάνω σε αυτή τη συμπαγή λανθάνουσα εικόνα, και αυτό είναι που κάνει το μοντέλο αρκετά γρήγορο για μια GPU καταναλωτικής κατηγορίας.

Ποιες εκδόσεις υπάρχουν;

  • Stable Diffusion 1.5 (2022): εικόνες 512×512, χιλιάδες fine-tune και LoRA από την κοινότητα.
  • SDXL 1.0 (Ιούλιος 2023): εγγενής ανάλυση 1024×1024, καλύτερα χέρια, πρόσωπα και σύνθεση, ένα μοντέλο refiner για τις λεπτομέρειες.
  • Stable Diffusion 3 Medium (Ιούνιος 2024): diffusion transformer, πολύ καλύτερη απόδοση κειμένου και κατανόηση του prompt.
  • Stable Diffusion 3.5 (Οκτώβριος 2024): η τρέχουσα έκδοση, σε μεγέθη Large, Large Turbo και Medium, με καλύτερη πιστότητα στο prompt και πιο ποικίλα στυλ.

Δείτε την αναλυτική σύγκριση στο SDXL vs Stable Diffusion 3.

Τι μπορείτε να κάνετε με αυτό;

Η δημιουργία εικόνας από κείμενο είναι μόνο η αρχή. Τα ίδια μοντέλα κάνουν image-to-image (μετασχηματισμό ενός σκίτσου ή μιας φωτογραφίας), inpainting (ξαναζωγράφισμα μιας περιοχής), outpainting (επέκταση μιας εικόνας), μεγέθυνση με ειδικά μοντέλα υπερ-ανάλυσης και, με το ControlNet, δημιουργία καθοδηγούμενη από μια στάση σώματος, έναν χάρτη βάθους ή ακμές. Πρόσθετα που λέγονται LoRA, το καθένα ένα μικρό ξεχωριστό αρχείο, μαθαίνουν στο μοντέλο ένα στυλ ή έναν χαρακτήρα.

Σε αυτόν τον ιστότοπο μπορείτε να δοκιμάσετε inpainting και μεγέθυνση χωρίς λογαριασμό, να δημιουργήσετε εικόνες με SDXL ή Stable Diffusion 3 και να εξερευνήσετε 1.731 στυλ καλλιτεχνών και 82 τεκμηριωμένα prompt για να μάθετε τι κάνει ένα prompt.

Σε τι διαφέρει από το DALL-E ή το Midjourney;

Σε δύο πράγματα: τα βάρη είναι δημόσια και τρέχει τοπικά. Μπορείτε να κατεβάσετε το μοντέλο, να το τρέξετε δωρεάν στον δικό σας υπολογιστή, να το τροποποιήσετε και να κρατήσετε τις εικόνες σας ιδιωτικές. Το Midjourney και τα μοντέλα εικόνας της OpenAI (DALL-E, σήμερα GPT Image) είναι κλειστές υπηρεσίες: πληρώνετε με συνδρομή ή ανά εικόνα και το μοντέλο δεν φεύγει ποτέ από τους διακομιστές τους. Σε αντάλλαγμα, το Stable Diffusion ζητά περισσότερα από εσάς. Πρέπει να επιλέξετε μοντέλο, να γράψετε ένα ακριβές prompt και ένα αρνητικό prompt και να καταλάβετε το seed.

Χρειάζομαι ισχυρό υπολογιστή;

Για να το τρέξετε μόνοι σας, μια πρόσφατη κάρτα NVIDIA με 6 GB VRAM αρκεί για το SD 1.5 και 8 GB για το SDXL. Οι κάρτες AMD δουλεύουν μέσω ROCm στο Linux και το Apple Silicon μέσω του backend MPS. Αν δεν έχετε τίποτα από αυτά, τα εργαλεία αυτού του ιστότοπου δεν χρειάζονται δικό σας εξοπλισμό: κάποια τρέχουν στη δική μας GPU, με την ουρά και την πρόοδο να εμφανίζονται ζωντανά, άλλα είναι φιλοξενούμενα demo ενσωματωμένα στη σελίδα. Διαβάστε πώς να εγκαταστήσετε το Stable Diffusion τοπικά όταν είστε έτοιμοι.

Ερωτήσεις που κάνουν συχνά οι χρήστες

Είναι δωρεάν το Stable Diffusion;

Ναι. Τα μοντέλα διατίθενται με ανοιχτές άδειες (CreativeML OpenRAIL-M για το 1.5, OpenRAIL++-M για το SDXL και, για τα 3.x, η Stability AI Community Licence, δωρεάν κάτω από το ένα εκατομμύριο δολάρια ετήσιων εσόδων). Η τοπική εκτέλεση κοστίζει μόνο ρεύμα· τα εργαλεία αυτού του ιστότοπου είναι δωρεάν και υποστηρίζονται από διαφημίσεις.

Σε ποιον ανήκουν οι εικόνες που δημιουργώ;

Σε εσάς, όσον αφορά την άδεια: η Stability AI δεν διεκδικεί δικαιώματα στα αποτελέσματα. Η νομοθεσία για τα πνευματικά δικαιώματα των εικόνων AI διαφέρει ανά χώρα και δεν έχει ξεκαθαρίσει ακόμη· στην ΕΕ και στις ΗΠΑ, οι εικόνες που παράγονται αποκλειστικά από AI γενικά δεν προστατεύονται με πνευματικά δικαιώματα.

Μπορεί το Stable Diffusion να γράψει κείμενο μέσα στις εικόνες;

Οι εκδόσεις 1.5 και SDXL δυσκολεύονται με το κείμενο. Τα Stable Diffusion 3 και 3.5 αποδίδουν πολύ καλύτερα σύντομο κείμενο και τίτλους όταν βάζετε τις λέξεις σε εισαγωγικά μέσα στο prompt.