Similitud cuantificadora: cálculos y métricas para el análisis de datos no supervisados
La medición de la similitud entre los puntos de datos es esencial en el análisis de datos no supervisados. Ayuda a identificar patrones, agrupaciones y relaciones dentro de conjuntos de datos sin etiquetas predefinidas. Se utilizan varios cálculos y métricas para cuantificar cómo son similares o diferentes puntos de datos.
Metrices de similitud común
Se utilizan varias métricas para medir la similitud, cada una adecuada para diferentes tipos de datos y objetivos de análisis. La más común incluye la distancia euclidiana, la similitud cosina y el índice de Jaccard.
Distancia euroclidiana
La distancia euclidiana calcula la distancia recta entre dos puntos en el espacio. Se utiliza ampliamente para los datos numéricos y se calcula como la raíz cuadrada de la suma de diferencias cuadradas en todas las características.
Similitud cosina
La similitud cosina mide el cosino del ángulo entre dos vectores. Es especialmente útil para datos de alta dimensión, como el análisis de texto o documentos, donde la magnitud de los vectores es menos importante que su orientación.
Índice de Jaccard
El índice Jaccard evalúa la similitud entre dos conjuntos dividiendo el tamaño de su intersección por el tamaño de su unión. Se utiliza comúnmente para datos binarios o categóricos.
- Distancia euclidiana
- Semejanza cosina
- Índice de Jaccard
- Distancia a Manhattan
- Coeficiente de correlación de Pearson