t-SNE(t-Distributed Stochastic Neighbor Embedding)は、高次元データを2次元または3次元で視覚化するための一般的な技術です。元のデータでは、簡単に観察できないパターンとクラスターを明らかにするのに役立ちます。t-SNEの背後にある数学的原則を理解することで、そのアプリケーションと解釈を改善することができます。

t-SNEのコアコンセプト

t-SNEは、同等性を反映した高次元のデータポイントを確率分布に変換します。その後、これらの類似性をできるだけ密接に保つ低次元の埋め込みを求めます。このプロセスは、計算の対等性を含み、分布間の分散を最小限に抑える2つの主なステップを含みます。

数学基礎

高度次元空間では、ガウス分布を用いて2点間の類似性をモデル化しています。]]jを指す確率は、ポイントの隣接]i]が付与されます。

...............................................................................................................................................................................................................................................................

それぞれの点で隣人に対して確率分布を定義します。ジョイント確率p]]ijは次のように対称されます。

p]ij] = frac{p]j|i] + p[]i|j[}{2N}

Nは、ポイントの合計数です。 低い次元空間では、類似点は、学生のt-配布を使用して1つの自由度でモデル化されます。

q[]ij]] = frac{(1 + ]]]i]]] - ]j[]| ^[^{1}}}} {{{{{{{{{{{{{{{{{{{{{{{{{{{}]] - - [FLT:] - [FLT:] - [FLT:] [FLT:] [FLT:] - [FLT:[FLT:] [FLT:] - [[FLT:] [FLT:[FLT:] [[FLT:] [[FLT:]] - [[FLT:]] - [[FLT:] [[FLT:]]] - [[FLT:] - [[FLT:[FLT:] :[FLT:]]] [[[[[FLT:] :[F] :[F]]]]]]

最適化プロセス

目標は、高次元分布と低次元分布の間のKullback-Leiblerの分散を最小限に抑える[]]y[]]]iの低次元点を見つけることです。

ログ frac{p]]] ログ frac{p}{q]]}

勾配下降下で、低次元空間の点の位置を調整して、分散を削減します。勾配は]p]ij[[]]と]]q[ij]]]の差に基づいて計算されます。

コンテンツ

t-SNEの数学的基礎を理解することは、類似性がどのようにモデル化され、最適化が寸法全体でこれらの類似性を合わせるのかを把握することを含みます。この基盤は、パラメータを調整し、視覚化を効果的に解釈するのに役立ちます。