Πώς να γράψετε ένα prompt για το Stable Diffusion;

Από Ενημερώθηκε 3 λεπτά ανάγνωσης

Ένα prompt στο Stable Diffusion είναι μια περιγραφή κειμένου που καθοδηγεί την εικόνα: πρώτα ένα σαφές θέμα, μετά το στυλ, ο φωτισμός, το κάδρο και λίγες λέξεις ποιότητας, χωρισμένα με κόμματα. Ένα σύντομο, συγκεκριμένο prompt, με τα πιο σημαντικά στοιχεία πρώτα, είναι αυτό που δίνει προβλέψιμες εικόνες.

Η δομή που δουλεύει

  1. Θέμα: ποιος ή τι, κάνοντας τι, πού. a red fox sitting on a mossy rock in a pine forest
  2. Στυλ ή μέσο: oil painting, 35mm photograph, watercolor, 3D render, ή ένας καλλιτέχνης: by Ivan Shishkin.
  3. Φωτισμός και ατμόσφαιρα: golden hour, soft diffused light, dramatic rim light, foggy.
  4. Κάδρο και φακός: close-up, wide shot, 85mm, shallow depth of field.
  5. Λέξεις ποιότητας: highly detailed, sharp focus, masterpiece. Δύο ή τρεις αρκούν.

Οι λέξεις στην αρχή του prompt τείνουν να βαραίνουν περισσότερο από αυτές στο τέλος. Κρατήστε το θέμα πρώτο.

Ένα σχολιασμένο παράδειγμα

portrait of an old fisherman, weathered face, wool sweater, oil painting by Rembrandt, warm candlelight, dark background, close-up, 85mm, highly detailed

Οι πρώτες πέντε λέξεις ορίζουν το θέμα. Το όνομα του καλλιτέχνη καθορίζει την παλέτα και την πινελιά (δείτε πόσο αλλάζει ένα μόνο όνομα στις σελίδες με τα στυλ καλλιτεχνών). Οι λέξεις για το φως καθορίζουν την ατμόσφαιρα, οι λέξεις για το κάδρο τη σύνθεση, και η τελευταία ομάδα κάνει το φινίρισμα. Αρνητικό prompt: blurry, deformed hands, extra fingers, watermark, text (περισσότερα στο τι είναι το αρνητικό prompt).

Βάρη και έμφαση

Στα Automatic1111, Forge, Fooocus και ComfyUI, οι παρενθέσεις ορίζουν το βάρος ενός όρου: (red scarf:1.3) σημαίνει 30% περισσότερη προσοχή, (background:0.7) λιγότερη. Οι αγκύλες το μειώνουν στο Automatic1111. Μείνετε μεταξύ 0.6 και 1.4: πέρα από αυτά η εικόνα συχνά χαλάει. Χρησιμοποιήστε τα βάρη για να σώσετε μια λεπτομέρεια που το μοντέλο επιμένει να αγνοεί, όχι σε κάθε λέξη.

Συνηθισμένα λάθη

  • Αρνήσεις: το «a room without windows» συχνά παράγει παράθυρα. Βάλτε ό,τι δεν θέλετε στο αρνητικό prompt.
  • Πάρα πολλές ιδέες: ένα θέμα ανά εικόνα. Με SD 1.5 και SDXL, ένα τμήμα CLIP χωρά 75 token (περίπου 60 λέξεις)· το Automatic1111 βάζει ό,τι ακολουθεί σε δεύτερο τμήμα, ενώ τα εργαλεία που δεν τεμαχίζουν το κόβουν.
  • Αντιφατικά στυλ: το photorealistic watercolor δίνει θολό αποτέλεσμα.
  • Αλλαγή όλων ταυτόχρονα: σταθεροποιήστε το seed και αλλάζετε μία λέξη τη φορά για να μάθετε τι κάνει η καθεμία.

Διαφορές μεταξύ μοντέλων

Τα SD 1.5 και SDXL ανταποκρίνονται σε λίστες λέξεων-κλειδιών όπως το παραπάνω παράδειγμα. Τα Stable Diffusion 3 και 3.5 καταλαβαίνουν καλύτερα φυσικές προτάσεις, μπορούν να τοποθετήσουν πολλά θέματα («a cat on the left, a dog on the right») και να αποδώσουν σύντομο κείμενο σε εισαγωγικά. Όποιο και αν είναι το μοντέλο, τα 82 τεκμηριωμένα prompt αυτού του ιστότοπου δείχνουν τις παραμέτρους πίσω από κάθε εικόνα, και η γεννήτρια prompt αναπτύσσει λίγες λέξεις σε ένα πλήρες prompt.

Ερωτήσεις που κάνουν συχνά οι χρήστες

Πόσο μακρύ πρέπει να είναι ένα prompt στο Stable Diffusion;

Για SD 1.5 και SDXL, 15 έως 60 λέξεις είναι ένα καλό εύρος. Κάτω από 10 λέξεις το μοντέλο συμπληρώνει τα κενά στην τύχη· πάνω από 75 token το Automatic1111 χωρίζει το κείμενο σε τμήματα, ενώ τα εργαλεία χωρίς αυτή τη δυνατότητα το κόβουν.

Δουλεύουν ακόμη τα ονόματα καλλιτεχνών;

Ναι, με SD 1.5 και SDXL, που γνωρίζουν χιλιάδες καλλιτέχνες: η σύγκρισή μας με 1.731 ονόματα, αποδοσμένα με τα ίδια τέσσερα prompt και seed, δείχνει το αποτέλεσμα του καθενός. Το Stable Diffusion 3 αντιδρά λιγότερο σε αυτά.

Πρέπει να γράφω τα prompt στα αγγλικά;

Ναι. Οι κωδικοποιητές κειμένου εκπαιδεύτηκαν κυρίως σε αγγλικές λεζάντες. Ένα prompt στα ελληνικά δουλεύει εν μέρει, αλλά χάνει ακρίβεια· μεταφράστε το πρώτα.