Table of Contents
Τα μοντέλα βαθιάς μάθησης είναι ισχυρά εργαλεία αλλά συχνά συναντούν κοινές παγίδες που μπορούν να εμποδίσουν την απόδοσή τους.
Υπεράρμοστο και Απροσάρμοστο
Η υπερβολική προσαρμογή συμβαίνει όταν ένα μοντέλο μαθαίνει θόρυβο στα δεδομένα κατάρτισης, οδηγώντας σε κακή γενίκευση. Η υποκαταλληλότητα συμβαίνει όταν το μοντέλο είναι πολύ απλό για να συλλάβει υποκείμενα πρότυπα. Οι τεχνικές τακοποίησης, όπως η ρύθμιση L2, προσθέτουν έναν όρο ποινής στη λειτουργία απώλειας με βάση τα βάρη του μοντέλου, που μπορεί να εκφραστεί ως:
Χαμηλή = Εμπειρική Απώλεια + λ *
όπου το λ ελέγχει τη δύναμη ρύθμισης. Ο σωστός συντονισμός του λ βοηθά στην ισορροπία της προκατάληψης και της διακύμανσης.
Απομάκρυνση και Εκρηκτική Βαθμίδα
Κατά τη διάρκεια της μετατροπής, οι κλίσεις μπορούν να γίνουν πολύ μικρές (εξάντληση) ή πολύ μεγάλες (εκρηκτική), παρεμποδίζοντας την εκπαίδευση. Χρησιμοποιώντας λειτουργίες ενεργοποίησης όπως η RELU μετριάζει τις διαλείπουσες κλίσεις, επειδή η παράγωγή της είναι σταθερή για θετικές εισροές. Επιπλέον, τεχνικές κανονικοποίησης όπως η Batch Normalization σταθεροποιούν την εκπαίδευση διατηρώντας τη μέση και τη διακύμανση των εισροών στρώματος.
Κακή αρχικοποίηση
Η αρχικοποίηση του Xavier θέτει βάρη με βάση τον αριθμό των νευρώνων εισόδου και εξόδου, με στόχο να κρατήσει τη διαφορά των ενεργοποιήσεων συνεπή σε όλα τα στρώματα. Μαθηματικά, τα βάρη λαμβάνονται από μια κατανομή με διαφορά:
Var(w) = 2 / (nin + n out]
Ανισορροπία δεδομένων
Τεχνικές όπως οι σταθμισμένες λειτουργίες απώλειας αποδίδουν υψηλότερες ποινές σε σφάλματα κατηγορίας μειοψηφίας. Η σταθμισμένη απώλεια διατροπίας είναι:
Χαμηλή = - ⁇ i wi * y]i] * log(p]i]
- Τακτοποίηση
- Κατάλληλη αρχικοποίηση
- Τεχνικές κανονικοποίησης
- Αύξηση δεδομένων
- στάθμιση κατά κατηγορία