Förstå matematiken bakom T-sne för visualisering av högdimensionella data
T-SNE (t-Distributed Stochastic Neighbor Embedding) är en populär teknik för att visualisera högdimensionella data i två eller tre dimensioner. Det hjälper till att avslöja mönster och kluster som inte är lätt observerbara i originaldata. Förstå de matematiska principerna bakom t-SNE kan förbättra sin tillämpning och tolkning.
Kärnkoncept av t-SNE
T-SNE omvandlar högdimensionella datapunkter till en sannolikhetsfördelning som speglar deras likheter. Det söker sedan en lågdimensionell inbäddning som bevarar dessa likheter så nära som möjligt. Processen involverar två huvudsteg: beräknar parvis likheter och minimerar en skillnad mellan distributioner.
Matematiska stiftelser
I det högdimensionella utrymmet modelleras likheten mellan två punkter med en gaussisk distribution. Sannolikheten att peka ]]j] är en granne ]] ges av:
]j[[] = frac{exp(-|x[]]]i]]]]] - x]]] 2sigma i^2) sum {k neq i} exp(-|x]]]] - x]]]]]
Detta definierar en sannolikhetsfördelning över grannar för varje punkt. Den gemensamma sannolikheten p ]] ij[] är symmetriserad som:
[]][[]] = frac{p[]]]]j|i]] + p[]]]]]][]]]]]]]][2N}
][]] är det totala antalet poäng. I det lågdimensionella utrymmet modelleras likheter med hjälp av en elevs t-distribution med en grad av frihet:
q[]][ = frac{(1+ |y]]]i]] - y]]]]]] = frac{(1+ | | | ]]]]]] - y]]]]
Optimeringsprocessen
Målet är att hitta lågdimensionella punkter ][][]]]]] som minimerar Kullback-Leibler-divergensen mellan de hög- och lågdimensionella fördelningarna:
KL(P || Q) = sum {i neq j} p[]]] ij]] log frac{p[]]] ij]][]]]]
Detta uppnås genom gradient nedstigning, justera positionerna av punkter i det lågdimensionella utrymmet för att minska divergens. De gradienter beräknas baserat på skillnaderna mellan ]p ] ij]] och ]]]]q]]]]][[[]]]]]]]]]]]]]]]]][[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]
Slutsats
Att förstå den matematiska grunden för t-SNE innebär att förstå hur likheter modelleras och hur optimeringen anpassar dessa likheter över dimensioner. Denna grund hjälper till att lura parametrar och tolka visualiseringar effektivt.