Förstå matematiken bakom T-sne för visualisering av högdimensionella data

T-SNE (t-Distributed Stochastic Neighbor Embedding) är en populär teknik för att visualisera högdimensionella data i två eller tre dimensioner. Det hjälper till att avslöja mönster och kluster som inte är lätt observerbara i originaldata. Förstå de matematiska principerna bakom t-SNE kan förbättra sin tillämpning och tolkning.

Kärnkoncept av t-SNE

T-SNE omvandlar högdimensionella datapunkter till en sannolikhetsfördelning som speglar deras likheter. Det söker sedan en lågdimensionell inbäddning som bevarar dessa likheter så nära som möjligt. Processen involverar två huvudsteg: beräknar parvis likheter och minimerar en skillnad mellan distributioner.

Matematiska stiftelser

I det högdimensionella utrymmet modelleras likheten mellan två punkter med en gaussisk distribution. Sannolikheten att peka ]]j] är en granne ]] ges av:

]j[[] = frac{exp(-|x[]]]i]]]]] - x]]] 2sigma i^2) sum {k neq i} exp(-|x]]]] - x]]]]]

Detta definierar en sannolikhetsfördelning över grannar för varje punkt. Den gemensamma sannolikheten p ]] ij[] är symmetriserad som:

[]][[]] = frac{p[]]]]j|i]] + p[]]]]]][]]]]]]]][2N}

][]] är det totala antalet poäng. I det lågdimensionella utrymmet modelleras likheter med hjälp av en elevs t-distribution med en grad av frihet:

q[]][ = frac{(1+ |y]]]i]] - y]]]]]] = frac{(1+ | | | ]]]]]] - y]]]]

Optimeringsprocessen

Målet är att hitta lågdimensionella punkter ][][]]]]] som minimerar Kullback-Leibler-divergensen mellan de hög- och lågdimensionella fördelningarna:

KL(P || Q) = sum {i neq j} p[]]] ij]] log frac{p[]]] ij]][]]]]

Detta uppnås genom gradient nedstigning, justera positionerna av punkter i det lågdimensionella utrymmet för att minska divergens. De gradienter beräknas baserat på skillnaderna mellan ]p ] ij]] och ]]]]q]]]]][[[]]]]]]]]]]]]]]]]][[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]

Slutsats

Att förstå den matematiska grunden för t-SNE innebär att förstå hur likheter modelleras och hur optimeringen anpassar dessa likheter över dimensioner. Denna grund hjälper till att lura parametrar och tolka visualiseringar effektivt.