数据预处理是准备原始数据执行无监督学习任务的关键步骤,经过妥善处理的数据可以大大改善集群和维度减小等算法的性能,本条讨论将原始数据转化为有意义的见解的关键技术和考虑因素.

了解原始数据

原始数据往往含有不一致、缺失值和噪音,从而阻碍分析。 这些数据可能来自各种来源,如日志、传感器或数据库,每个来源的格式和质量不同。 承认这些问题是有效预处理的第一步。

数据清理技术

清理数据涉及处理缺失值、删除重复数据以及纠正错误。

  • 截图:] 以平均值、中值或模式填充缺失值。
  • 过滤:]去除输出器或噪音.
  • 规范化:[] 将数据放大到标准范围.
  • 编码:将绝对变量转换成数字格式.

地物工程

将原始数据转换成更好地代表基本规律的特征至关重要。技术包括创建新特征、选择相关特征和降低维度。这些步骤有助于算法侧重于数据信息最丰富的方面。

减少影响

对无监督算法来说,高维度数据可能具有挑战性。主要组件分析(PCA)和t-分布式Stochastic Nebricor Embedding(t-SNE)等技术在保留重要结构的同时减少了特性的数量。这简化了分析和可视化。