特质选择是无监督学习中提高模型性能和降低复杂性的重要一步,与有监督学习不同,它不依赖标注的数据,使得过程更具挑战性. 本条探索了在无监督环境中用于特质选择的常见技术和策略.

未监督的特性选择技术

使用几种方法来识别相关特征,但没有标注数据,这些技术侧重于测量特征的内在性质及其在数据集内的关系.

差异阈值

这种方法消除了样本之间差异较小的特征,假设差异不大的特征信息较少.

基于分组的选定

特征根据其对集群结果的贡献来评价,改善集群分离的特征被保留下来.

有效选择特征的战略

实施特征选择需要战略规划,以确保取得有意义的成果。 结合多种技术往往产生更好的成果。

减少影响

主要组件分析(PCA)等方法在保留大部分数据差异的同时减少特性数量,协助特性选择.

迭代选择

以集群性能为基础,主动删除或添加特性,有助于确定数据集最相关的特性.

  • 评价特征重要性
  • 使用多种技术
  • 使用集群衡量标准验证
  • 减少维度