Συγκριτικός πίνακας
| SD 1.5 | SDXL 1.0 | SD 3 Medium | SD 3.5 Large | |
|---|---|---|---|---|
| Κυκλοφορία | Οκτ 2022 | Ιούλ 2023 | Ιούν 2024 | Οκτ 2024 |
| Παράμετροι | 0,9 δισ. | 2,6 δισ. (+ refiner) | 2 δισ. | 8 δισ. |
| Εγγενές μέγεθος | 512×512 | 1024×1024 | 1024×1024 | 1024×1024 |
| VRAM (fp16) | 4–6 GB | 8 GB | 10 GB | 19 GB (11 GB σε fp8) |
| Ταχύτητα (η GPU μας, 12 GB) | ~4 δευτ. | ~20 δευτ. | — | — |
| Κατανόηση prompt | λέξεις-κλειδιά | λέξεις-κλειδιά, καλύτερη σύνθεση | προτάσεις, πολλά θέματα | η καλύτερη |
| Κείμενο στις εικόνες | όχι | σπάνια | ναι, σύντομο | ναι |
| Ονόματα καλλιτεχνών | ισχυρά | ισχυρά | ασθενέστερα | ασθενέστερα |
| Μοντέλα κοινότητας | πάρα πολλά | τα περισσότερα, με Pony και Illustrious | λίγα | λίγα |
| Άδεια | OpenRAIL-M | OpenRAIL++ | Community licence (δωρεάν κάτω από 1 εκατ. $ έσοδα) | |
| Δοκιμή στον ιστότοπο | SD 1.5 | SDXL | SD 3 | — |
Stable Diffusion 1.5: ο ακούραστος εργάτης
Μικρό, γρήγορο, με αμέτρητες προσαρμογές. Υπάρχουν φωτορεαλιστικά και anime fine-tune, μοντέλα ControlNet, LoRA και embedding για τα πάντα. Οι αδυναμίες του είναι η βασική ανάλυση 512 px, τα χέρια και η κυριολεκτική ανάγνωση των prompt. Παραμένει η σωστή επιλογή για κάρτα 6 GB, για animation με AnimateDiff και για δουλειά βασισμένη σε ControlNet. Η σελίδα txt2img των μελών σε αυτόν τον ιστότοπο τρέχει ένα προσαρμοσμένο μοντέλο SD 1.5.
SDXL 1.0: λεπτομέρεια και στυλ
Το SDXL έχει τετραπλάσια pixel, δεύτερο κωδικοποιητή κειμένου και ένα refiner για τα τελευταία βήματα. Πρόσωπα, χέρια και σύνθεση βελτιώθηκαν πολύ, και τα ονόματα καλλιτεχνών έχουν ισχυρό, προβλέψιμο αποτέλεσμα, γι' αυτό και η σύγκρισή μας με 1.731 καλλιτέχνες δημιουργήθηκε με SDXL. Χρειάζεται 8 GB και είναι αρκετές φορές πιο αργό από το 1.5: περίπου 20 δευτερόλεπτα έναντι 4 ανά εικόνα στη δική μας GPU. Οι αποσταγμένες εκδόσεις (SDXL Turbo, LCM LoRA) χρειάζονται μόνο ένα έως οκτώ βήματα αντί για 25 έως 30, με κάποιο κόστος στην ποιότητα.
Stable Diffusion 3 και 3.5: κατανόηση και κείμενο
Μια νέα αρχιτεκτονική (diffusion transformer με τρεις κωδικοποιητές κειμένου) που ακολουθεί προτάσεις αντί για λίστες λέξεων-κλειδιών: τις περισσότερες φορές το «a red cube on a blue sphere, to the left of a green cone» βγαίνει σωστά και το σύντομο κείμενο σε εισαγωγικά είναι ευανάγνωστο. Το 3 Medium είχε προβλήματα ανατομίας που το 3.5 μείωσε· το 3.5 Large είναι το πιο ικανό της οικογένειας, το 3.5 Medium το ισορροπημένο. Τα ονόματα καλλιτεχνών και οι παλιές συνήθειες του αρνητικού prompt μετράνε λιγότερο. Δοκιμάστε το Stable Diffusion 3 Medium εδώ.
Ποιο να διαλέξετε;
- Εκμάθηση, κάρτα 6 GB, ControlNet, AnimateDiff: SD 1.5.
- Εικονογράφηση, πορτρέτα, στυλ καλλιτεχνών, 8–12 GB: SDXL.
- Αφίσες με κείμενο, σύνθετες σκηνές, 12–16 GB+: SD 3.5 Medium ή Large.
- Χωρίς GPU: τα online εργαλεία αυτού του ιστότοπου, χωρίς λογαριασμό.