Gradient Descent: Schritt-für-Schritt-Berechnungen für die Optimierung des maschinellen Lernens
Gradientenabstieg ist ein Optimierungsalgorithmus, der verwendet wird, um eine Funktion durch iteratives Bewegen auf den tiefsten Punkt zu minimieren. Er wird im maschinellen Lernen häufig verwendet, um Modelle durch Anpassung von Parametern zu optimieren, um Fehler zu reduzieren. Dieser Artikel erläutert die Schritt-für-Schritt-Berechnungen, die bei der Anwendung von Gradientenabstieg für maschinelle Lernaufgaben verwendet werden.
Den Gradient Descent Algorithmus verstehen
Die Kernidee der Gradientenabsenkung ist die Aktualisierung von Modellparametern in Richtung des negativen Gradienten der Verlustfunktion, der so lange fortgesetzt wird, bis die Parameter zu einem Minimalpunkt, idealerweise dem globalen Minimum, konvergieren.
Schritt-für-Schritt-Berechnungsprozess
Angenommen, wir haben ein einfaches lineares Regressionsmodell mit einer Verlustfunktion, wie Mean Squared Error (MSE).
- Initialisieren Sie Parameter (z. B. Gewichte und Bias) mit kleinen Zufallswerten.
- Berechnen Sie den prognostizierten Output unter Verwendung aktueller Parameter.
- Berechnen Sie den Verlustfunktionswert auf der Grundlage von Vorhersagen und tatsächlichen Daten.
- Berechnen Sie den Gradienten der Verlustfunktion in Bezug auf jeden Parameter.
- Aktualisieren Sie jeden Parameter, indem Sie das Produkt aus der Lernrate und dem entsprechenden Gradienten subtrahieren.
Dieser Vorgang wiederholt sich für eine festgelegte Anzahl von Iterationen oder bis die Änderung des Verlusts vernachlässigbar wird.
Beispielrechnung
Betrachten Sie einen einzelnen Datenpunkt mit Eingabe x = 2 und Ausgabe y = 4 initialisieren Gewicht w = 0.5 und Bias b = 0 verwenden Sie eine Lernrate von 0.1.
Berechnen Sie die Vorhersage: ŷ = wx + b = 0.5 * 2 + 0 = 1
Berechnungsfehler: Fehler = ŷ - y = 1 - 4 = -3
Gradienten berechnen:
Gefälle mit Gewicht: ∂L/∂w = 2 * Fehler * x = 2 * (-3) * 2 = -12
Gradient mit WRT-Bias: ∂L/∂b = 2 * Fehler = 2 * (-3) = -6
Aktualisierungsparameter:
Neugewicht: w = 0,5 - 0,1 * (-12) = 0,5 + 1,2 = 1,7
Neue Verzerrung: b = 0 - 0,1 * (-6) = 0 + 0,6 = 0,6