Schrittweise Berechnung des Cross-Validation Errors im Model Tuning
Cross-Validation ist eine Technik, die zur Bewertung der Leistung eines maschinellen Lernmodells verwendet wird. Sie hilft bei der Abstimmung von Modellparametern, indem sie schätzt, wie gut das Modell bei nicht sichtbaren Daten funktioniert. Der Prozess beinhaltet die Aufteilung des Datensatzes in mehrere Teile, das Training des Modells an einigen Teilen und das Testen an anderen. Dieser Artikel erklärt die schrittweise Berechnung des Cross-Validierungsfehlers während des Modelltunings.
Schritt 1: Datenpartitionierung
Der Datensatz wird in k gleiche Teile unterteilt, die so genannten Folds. Die allgemeine Auswahl für k ist 5 oder 10. Jede Folds fungiert einmal als Validierungssatz, während die restlichen Folds den Trainingssatz bilden. Dieser Prozess stellt sicher, dass jeder Datenpunkt sowohl für das Training als auch für die Validierung verwendet wird.
Schritt 2: Modellschulung und -validierung
Für jede Faltung wird das Modell auf die verbleibenden 'k-1'-Falten trainiert, dann auf die aktuelle Faltung validiert. Der Fehler wird auf der Grundlage der Vorhersagen des Modells im Vergleich zu den tatsächlichen Werten in der Validierungsfaltung berechnet. Dieser Schritt wird für alle Falten wiederholt.
Schritt 3: Fehlerberechnung
Die Fehler aus jeder Faltung werden aufgezeichnet. Übliche Fehlermetriken umfassen den mittleren Quadratfehler (MSE) oder den mittleren Absolutfehler (MAE). Der Kreuzvalidierungsfehler ist der Durchschnitt dieser Fehler über alle Falten hinweg und liefert eine Schätzung der Leistung des Modells.
Schritt 4: Endgültige Fehlerschätzung
Der aus dem Kreuzvalidierungsverfahren gewonnene Durchschnittsfehler dient als Schätzung der Leistung des Modells bei neuen, nicht sichtbaren Daten, der die Auswahl optimaler Modellparameter beim Tuning bestimmt.