Comprendre les mathématiques derrière le T-sne pour visualiser les données haute dimension
T-SNE (T-Distributed Stochastic Neighbor Embedding) est une technique populaire pour visualiser les données haute dimension en deux ou trois dimensions. Elle aide à révéler des modèles et des grappes qui ne sont pas facilement observables dans les données originales. Comprendre les principes mathématiques derrière t-SNE peut améliorer son application et son interprétation.
Concepts fondamentaux de t-SNE
t-SNE convertit les points de données haute dimension en une distribution de probabilité qui reflète leurs similitudes. Il cherche ensuite une intégration basse dimension qui préserve ces similitudes le plus étroitement possible. Le processus implique deux étapes principales : calculer les similitudes par paires et minimiser une divergence entre les distributions.
Fondations mathématiques
Dans l'espace haute dimension, la similitude entre deux points est modélisée à l'aide d'une distribution gaussienne. La probabilité que le point j soit un voisin du point i est donnée par:
j=] = frac{exp(---]i - xj^2 / 2sigma i^2)} {sum {k neq i} exp(--------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
Ceci définit une distribution de probabilité sur les voisins pour chaque point. La probabilité articulaire pij est symétrique comme suit:
ij = frac{pj=i + pi=j}{2N}
où N est le nombre total de points. Dans l'espace à faible dimension, les similitudes sont modélisées à l'aide de la distribution t d'un étudiant avec un degré de liberté unique:
qij = frac{(1 +=y]i - yj^2)^{-1}}{sum {k neq l} (1 +=y]k[ - yl^2)^{-1}}
Processus d'optimisation
Le but est de trouver des points à faible dimension yi qui minimisent la divergence entre les distributions à haute et à basse dimension:
KL(P)Q) = sum {i neq j} pij log frac{pij}{qij}
On obtient ainsi une descente en gradient, en ajustant les positions des points dans l'espace à basse dimension pour réduire la divergence. Les gradients sont calculés sur la base des différences entre pij et qij.
Conclusion
Comprendre la base mathématique du t-SNE implique de comprendre comment les similitudes sont modélisées et comment l'optimisation aligne ces similitudes entre les dimensions.