La preelaborazione dei dati è un passo cruciale nella preparazione dei dati grezzi per le attività di apprendimento non supervisionate. I dati trattati correttamente possono migliorare significativamente le prestazioni di algoritmi come la riduzione di clustering e dimensionalità.

Comprensione dei dati crudi

I dati grezzi contengono spesso incongruenze, valori mancanti e rumore che possono ostacolare l'analisi, e possono provenire da varie fonti come log, sensori o database, ciascuno con diversi formati e qualità.

Tecniche di pulizia dei dati

I dati di pulizia comporta la gestione dei valori mancanti, la rimozione dei duplicati e la correzione degli errori.

  • Imputazione:[] Riempire i valori mancanti con la mediana, o la modalità.
  • Filtro:[]] Rimozione di antenne o rumore.
  • Normalizzazione:[ Dati di scala a un intervallo standard.
  • Codifica:[] Convertire variabili categoriche in formati numerici.

Ingegneria della caratteristica

La trasformazione dei dati grezzi in caratteristiche che meglio rappresentano i modelli sottostanti è essenziale. Le tecniche includono la creazione di nuove funzionalità, la selezione di quelli rilevanti e la riduzione della dimensionalità.

Riduzione della dimensione

I dati ad alta dimensione possono essere impegnativi per gli algoritmi non supervisionati. Tecniche come l'analisi dei componenti principali (PCA) e t-Distributed Stochastic Close Embedding (t-SNE) riducono il numero di caratteristiche, preservando le strutture importanti.