Überanpassungen treten auf, wenn ein maschinelles Lernmodell die Trainingsdaten zu gut lernt, einschließlich Rauschen und Ausreißer, was seine Fähigkeit, auf neue Daten zu verallgemeinern, verringert.

Anzeichen von Overfitting

Überanpassungen sind häufig durch einen signifikanten Unterschied zwischen der Trainings- und Validierungsleistung gekennzeichnet, und wenn ein Modell bei Trainingsdaten außergewöhnlich gut, bei unsichtbaren Daten jedoch schlecht abschneidet, ist eine Überanpassung wahrscheinlich.

Techniken zum Erkennen von Overfitting

Die Überwachung der Modellleistung in Validierungsdatensätzen hilft dabei, Überanpassungen zu erkennen.

  • Plotting Trainings- und Validierungsgenauigkeit über Epochen
  • Bewertung von Leistungskennzahlen für separate Prüfdaten
  • Verwendung von Cross-Validierungstechniken

Strategien zur Vermeidung von Overfitting

Präventive Maßnahmen tragen zur Verbesserung der Modellverallgemeinerung bei.

  • Regularisierung: Strafen für die Modellkomplexität, wie L1 oder L2 Regularisierung.
  • Beschneiden: Vereinfachen von Entscheidungsbäumen, indem Zweige entfernt werden, die nicht wesentlich beitragen.
  • Frühes Stoppen: Stoppen des Trainings, wenn die Validierungsleistung nicht mehr verbessert wird.
  • Datenerweiterung: Erhöhung der Trainingsdatenvielfalt, um Overfitting zu reduzieren.
  • Dropout: Zufälliges Deaktivieren von Neuronen während des Trainings in neuronalen Netzwerken.