Comprender las matemáticas detrás de T-sne para visualizar datos de alta dimensión

t-SNE (t-Distributed Stochastic Neighbor Embedding) es una técnica popular para visualizar datos de alta dimensión en dos o tres dimensiones. Ayuda a revelar patrones y cúmulos que no son fácilmente observables en los datos originales. Entendiendo los principios matemáticos detrás de t-SNE puede mejorar su aplicación e interpretación.

Conceptos básicos de t-SNE

t-SNE convierte los puntos de datos de alta dimensión en una distribución de probabilidad que refleje sus similitudes. Busca una incrustación de baja dimensión que preserve estas similitudes lo más cerca posible. El proceso implica dos pasos principales: computar similitudes de par y minimizar una divergencia entre distribuciones.

Fundaciones Matemáticas

En el espacio de alta dimensión, la similitud entre dos puntos se modela mediante una distribución gausiana. La probabilidad de que el punto j] es un vecino de punto i] es dada por:

j sometidai] = frac{exp(- habitxi] - xj] perpetua^2 / 2sigma i^2)}{sum {k neq i} exp(-prehensix[LT:6]i[FLT]i[I]

Esto define una distribución de probabilidad sobre los vecinos para cada punto. La probabilidad conjunta p]ij es simetrizada como:

pij] = frac{pj turbo] + pi turbaj}{2N}

donde N] es el número total de puntos. En el espacio de baja dimensión, se modelan similitudes utilizando la t-distribución de un estudiante con un grado de libertad:

ij = frac{(1 + prehensiyi - yj [Permitir]^2)^{sum {k neq l} (1 + TENY ]k[LT] [LT] [LT] [LT] [LT] [LT]

Proceso de optimización

El objetivo es encontrar puntos de baja dimensión yi que minimizan la divergencia Kullback-Leibler entre las distribuciones de alta y baja dimensión:

KL(P TENED Q) = sum {i neq j} p]ij] log frac{pij}{q]ij}}

Esto se logra mediante la bajada de gradientes, ajustando las posiciones de los puntos en el espacio de baja dimensión para reducir la divergencia. Los gradientes se calculan sobre la base de las diferencias entre p]ij y q]ij][FLT][4][

Conclusión

Comprender la base matemática de t-SNE implica comprender cómo se modelan las similitudes y cómo la optimización alinea estas similitudes a través de las dimensiones. Esta fundación ayuda a ajustar los parámetros e interpretar las visualizaciones de manera efectiva.