Table of Contents
t-SNE(t-Distributed Stochastic Neigbor Embedding)是一种在两三个维度上可视化高维数据的一种流行技术,它有助于揭示在原始数据中不易观察到的规律和集群. 了解t-SNE背后的数学原理可以改进其应用和解释.
t-SNE的核心概念
t-SNE将高维数据点转换成反映其相似性的概率分布,然后寻求一种能尽可能地保持这些相似性的低维嵌入. 这一过程涉及两个主要步骤:计算对等相似性和尽量减少分布之间的差异.
数学基础
在高维空间中,使用高斯分布来建模两个点之间的相似性。该点j是点i[的邻点,其概率由:
pj ⁇ i =frac{exp(------xi ]]-x]j ]}}}}}}} } \} \} \}} - }}}}}}}}}}}}}}} \} \} \} / 2 sigma i}} \ [FLT: }]]] } [FLT: ]}}}}}}}}}}}}
此定义每个点的概率分布在邻位上。 连接概率 p[ [FLT: 0]] ij [[FLT: 1] 被对称为:
pij =frac{p j ⁇ i + p i ⁇ j ⁇ 2N}]] ⁇ .
以 N 为总点数。在低维空间中,相似之处是使用学生的t分配方式,并具有一个自由度的:
q ij =frac{(1+++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++++
优化进程
目标是找到低维点yi,以尽量减少高维和低维分布之间的Kullback-leibler差:
KL(P Q) = sum ⁇ i neq j} p ] ij log frac{p ij q ] ij ]]]]]]]]]].
其方法是通过梯度下降,调整低维空间中点的位置以减少差异。梯度是根据p ij 和q ij 之间的差值计算出来的。
结论
理解 t-SNE 的数学基础需要了解相似性是如何建模的,以及优化如何在维度上协调这些相似性。 这个基础有助于调整参数和有效解释可视化。