データの処理は、監視されていない学習タスクのための生データの準備に重要なステップです。 適切に処理されたデータは、クラスタリングや寸法削減などのアルゴリズムのパフォーマンスを大幅に向上させることができます。 この記事では、重要な技術と重要な洞察を意味のある洞察に変えるための検討について説明します。

生データを理解する

生データは、多くの場合、分析を妨げることができない不整合性、欠落値、および騒音が含まれています。これは、さまざまなフォーマットと品質を持つ各ログ、センサー、データベースなどのさまざまなソースから来ている可能性があります。これらの問題を認識することは、効果的な事前処理への最初のステップです。

データクリーニング技術

データのクリーニングには、不足している値の処理、重複の削除、エラーの修正が含まれます。 テクニックには、

  • []入力:[]]]] 意味、中央値、またはモードで欠落値を満たす。
  • フィルタリング:]] アウトリエやノイズを除去する。
  • ]正規化:[]]] データを標準範囲にスケーリングします。
  • [:]]のエンコード。 数値形式に分類変数を変換します。

機能工学

原物のデータをより深く理解するようなパターンが不可欠である機能に変える。テクニックには、新しい機能の作成、関連するものの選択、寸法の縮小が含まれます。これらの手順は、アルゴリズムがデータの最も有益な側面に焦点を当てるのに役立ちます。

寸法の縮小

監視されていないアルゴリズムでは、高次元データが難しい場合があります。 プリンシパルコンポーネント解析(PCA)やt-Distributed Stochastic Neighbor Embedding(t-SNE)などの技術は、重要な構造を観察しながら、機能の数を減らすことができます。 この単純化分析と可視化。