Gradient Descent: Schritt-für-Schritt-Berechnungen für die Optimierung des maschinellen Lernens

Gradientenabstieg ist ein Optimierungsalgorithmus, der verwendet wird, um eine Funktion durch iteratives Bewegen auf den tiefsten Punkt zu minimieren. Er wird im maschinellen Lernen häufig verwendet, um Modelle durch Anpassung von Parametern zu optimieren, um Fehler zu reduzieren. Dieser Artikel erläutert die Schritt-für-Schritt-Berechnungen, die bei der Anwendung von Gradientenabstieg für maschinelle Lernaufgaben verwendet werden.

Den Gradient Descent Algorithmus verstehen

Die Kernidee der Gradientenabsenkung ist die Aktualisierung von Modellparametern in Richtung des negativen Gradienten der Verlustfunktion, der so lange fortgesetzt wird, bis die Parameter zu einem Minimalpunkt, idealerweise dem globalen Minimum, konvergieren.

Schritt-für-Schritt-Berechnungsprozess

Angenommen, wir haben ein einfaches lineares Regressionsmodell mit einer Verlustfunktion, wie Mean Squared Error (MSE).

Dieser Vorgang wiederholt sich für eine festgelegte Anzahl von Iterationen oder bis die Änderung des Verlusts vernachlässigbar wird.

Beispielrechnung

Betrachten Sie einen einzelnen Datenpunkt mit Eingabe x = 2 und Ausgabe y = 4 initialisieren Gewicht w = 0.5 und Bias b = 0 verwenden Sie eine Lernrate von 0.1.

Berechnen Sie die Vorhersage: ŷ = wx + b = 0.5 * 2 + 0 = 1

Berechnungsfehler: Fehler = ŷ - y = 1 - 4 = -3

Gradienten berechnen:

Gefälle mit Gewicht: ∂L/∂w = 2 * Fehler * x = 2 * (-3) * 2 = -12

Gradient mit WRT-Bias: ∂L/∂b = 2 * Fehler = 2 * (-3) = -6

Aktualisierungsparameter:

Neugewicht: w = 0,5 - 0,1 * (-12) = 0,5 + 1,2 = 1,7

Neue Verzerrung: b = 0 - 0,1 * (-6) = 0 + 0,6 = 0,6