Table of Contents
数据预处理是准备原始数据执行无监督学习任务的关键步骤,经过妥善处理的数据可以大大改善集群和维度减小等算法的性能,本条讨论将原始数据转化为有意义的见解的关键技术和考虑因素.
了解原始数据
原始数据往往含有不一致、缺失值和噪音,从而阻碍分析。 这些数据可能来自各种来源,如日志、传感器或数据库,每个来源的格式和质量不同。 承认这些问题是有效预处理的第一步。
数据清理技术
清理数据涉及处理缺失值、删除重复数据以及纠正错误。
- 截图:] 以平均值、中值或模式填充缺失值。
- 过滤:]去除输出器或噪音.
- 规范化:[] 将数据放大到标准范围.
- 编码:将绝对变量转换成数字格式.
地物工程
将原始数据转换成更好地代表基本规律的特征至关重要。技术包括创建新特征、选择相关特征和降低维度。这些步骤有助于算法侧重于数据信息最丰富的方面。
减少影响
对无监督算法来说,高维度数据可能具有挑战性。主要组件分析(PCA)和t-分布式Stochastic Nebricor Embedding(t-SNE)等技术在保留重要结构的同时减少了特性的数量。这简化了分析和可视化。