Die Mathematik hinter T-sne für die Visualisierung von hochdimensionalen Daten verstehen
t-SNE (t-Distributed Stochastic Neighbor Embedding) ist eine beliebte Technik zur Visualisierung hochdimensionaler Daten in zwei oder drei Dimensionen. Es hilft, Muster und Cluster aufzudecken, die in den Originaldaten nicht leicht zu beobachten sind. Das Verständnis der mathematischen Prinzipien hinter t-SNE kann seine Anwendung und Interpretation verbessern.
Kernkonzepte von t-SNE
t-SNE wandelt hochdimensionale Datenpunkte in eine Wahrscheinlichkeitsverteilung um, die ihre Ähnlichkeiten widerspiegelt. Anschließend wird eine niedrigdimensionale Einbettung gesucht, die diese Ähnlichkeiten so genau wie möglich bewahrt. Der Prozess umfasst zwei Hauptschritte: Berechnung paarweiser Ähnlichkeiten und Minimierung einer Divergenz zwischen Verteilungen.
Mathematische Grundlagen
Im hochdimensionalen Raum wird die Ähnlichkeit zwischen zwei Punkten mit Hilfe einer Gauß-Verteilung modelliert. Die Wahrscheinlichkeit, dass Punkt j ein Nachbar von Punkt i ist, ergibt sich aus:
pj|i = frac{exp(-|xi - xj|^2 / 2sigma i^2)}{sum {k neq i} exp(-|xi - xk|^2 / 2sigma i^2)}
Die gemeinsame Wahrscheinlichkeit pij wird symmetrisch wie folgt symmetrischisiert: EPMATHMARKEREP
ij = frac{pj|i + pi|j}{2N}
Im niedrigdimensionalen Raum werden Ähnlichkeiten mit der t-Verteilung eines Schülers mit einem Freiheitsgrad modelliert:
qij = frac{(1 + |yi - yj|^2)^{-1}}{sum {k neq l} (1 + |yk - yl|^2)^{-1}}
Optimierungsprozess
Das Ziel ist es, niedrigdimensionale Punkte zu finden yi, die die Kullback-Leibler-Divergenz zwischen den hoch- und niedrigdimensionalen Verteilungen minimieren:
KL(P || Q) = sum {i neq j} pij log frac{pij}{qij}
Dies wird durch Gradientenabstieg erreicht, indem die Positionen von Punkten im niedrigdimensionalen Raum angepasst werden, um die Divergenz zu reduzieren. Die Gradienten werden basierend auf den Unterschieden zwischen pij und qij berechnet.
Schlussfolgerung
Um die mathematische Basis von t-SNE zu verstehen, muss man verstehen, wie Ähnlichkeiten modelliert werden und wie die Optimierung diese Ähnlichkeiten über Dimensionen hinweg ausrichtet. Diese Grundlage hilft bei der Abstimmung von Parametern und der Interpretation von Visualisierungen.