Quantifizierung der Modellleistung im überwachten Lernen: Metriken und Berechnungen
Die Bewertung der Leistung von Modellen für überwachtes Lernen ist für das Verständnis ihrer Wirksamkeit unerlässlich. Verschiedene Metriken werden verwendet, um zu messen, wie gut ein Modell Ergebnisse auf der Grundlage von gekennzeichneten Daten vorhersagt. Diese Metriken helfen beim Vergleich von Modellen und bei der Auswahl des besten für eine bestimmte Aufgabe.
Gemeinsame Leistungsmetriken
Mehrere Metriken werden häufig verwendet, um Modelle für überwachtes Lernen zu bewerten. Die Wahl der Metrik hängt von der Art des Problems ab, wie z. B. Klassifizierung oder Regression. Das Verständnis dieser Metriken ermöglicht eine bessere Interpretation der Modellergebnisse.
Metriken für die Klassifikation
Bei Klassifikationsaufgaben umfassen gängige Metriken Genauigkeit, Präzision, Rückruf und F1-Score. Diese Metriken bewerten verschiedene Aspekte der Fähigkeit des Modells, Klassenetiketten korrekt vorherzusagen.
Genauigkeit
Die Genauigkeit misst den Anteil der korrekten Vorhersagen an den Gesamtprognosen und wird berechnet als:
Genauigkeit = (Wahre Positive + Wahre Negative) / Gesamtprognosen
Präzision und Rückruf
Präzision gibt den Anteil der positiven Vorhersagen an, die korrekt sind, während Rückruf den Anteil der korrekt identifizierten tatsächlichen Positiven misst.
Präzision = True Positives / (True Positives + False Positives)
Recall = True Positives / (True Positives + False Negatives)
Metriken für Regression
Regressionsmodelle werden mit Metriken wie Mean Absolute Error (MAE), Mean Squared Error (MSE) und R-squared bewertet, die die Differenz zwischen vorhergesagten und tatsächlichen kontinuierlichen Werten quantifizieren.
Mittelwert des absoluten Fehlers (MAE)
MAE berechnet die durchschnittliche absolute Differenz zwischen vorhergesagten und tatsächlichen Werten:
MAE = Σ|Vorhergesehen - tatsächlich| / Anzahl der Vorhersagen
R-Quadrat
R-Quadrat gibt den Anteil der Varianz in der durch das Modell erklärten abhängigen Variable an, er reicht von 0 bis 1, wobei höhere Werte eine bessere Passform anzeigen.
Diese Metriken bieten eine quantitative Grundlage für die Bewertung und den Vergleich der Modellleistung bei überwachten Lernaufgaben.