Das Verständnis von Overfitting und Underfitting ist für die Bewertung von Modellen des maschinellen Lernens von entscheidender Bedeutung. Diese Konzepte helfen zu bestimmen, wie gut ein Modell auf unsichtbare Daten verallgemeinert. Die Berechnung relevanter Metriken liefert Einblicke in die Modellleistung und führt zu Verbesserungen.

Überanpassungsmetriken

Überanpassungen treten auf, wenn ein Modell bei Trainingsdaten gut, bei neuen Daten jedoch schlecht funktioniert.

  • Training vs. Validation Error: Eine große Lücke zeigt Überanpassung an.
  • Komplexitätsmaße: Wie die Anzahl der Parameter in Bezug auf Datenpunkte.
  • Cross-Validation Scores: Deutlich höhere Trainingswerte im Vergleich zu Validierungswerten deuten auf eine Überanpassung hin.

Kennzahlen zur Untersetzung

Die Unteranpassung erfolgt, wenn ein Modell zu einfach ist, um die zugrunde liegenden Datenmuster zu erfassen.

  • High Error on Both Training and Validation Sets: Zeigt an, dass das Modell zu simpel ist.
  • Low Model Complexity: Wie sehr wenige Features oder Parameter.
  • Konsistente schlechte Leistung: Über alle Trainings- und Validierungsdaten hinweg.

Berechnungsmetriken

Übliche Messwerte sind Genauigkeit, Präzision, Rückruf und F1-Score. Um Overfitting oder Underfitting zu bewerten, vergleichen Sie diese Messwerte in Trainings- und Validierungsdatensätzen. Eine signifikante Diskrepanz deutet auf Overfitting hin, während einheitlich niedrige Werte auf Underfitting hinweisen.

Die Verwendung von Cross-Validation hilft bei der Bewertung der Modellstabilität. Die Berechnung der durchschnittlichen Leistung über mehrere Falten hinweg liefert eine zuverlässigere Schätzung der Leistung des Modells bei nicht sichtbaren Daten.