Table of Contents

À une époque où les volumes de données continuent de croître de façon exponentielle, la capacité de mesurer avec précision comment les mêmes points de données ou différents sont devenus de plus en plus critiques pour les organisations qui cherchent à tirer parti de l'apprentissage automatique pour obtenir un avantage concurrentiel. Combinés à des données du monde réel, ces mesures transforment des constructions théoriques en outils puissants qui conduisent des applications pratiques dans toutes les industries, de la segmentation des clients et de la détection des anomalies aux systèmes de recommandation et à la reconnaissance d'images.

Comprendre la similitude des mesures de profondeur

Les mesures de similitude quantifient le degré de ressemblance entre deux points de données, objets ou observations dans un ensemble de données.Ces mesures sont étroitement liées à l'apprentissage à distance de la métrique, qui implique d'apprendre une fonction de distance sur des objets qui obéissent à des axiomes mathématiques spécifiques, y compris la non-négativité, l'identité des indiscriminables, la symétrie et la subadditivité.

Les approches d'apprentissage non supervisées comme le regroupement reposent sur des mesures de similitude pour regrouper des objets proches ou similaires, tandis que les approches supervisées comme l'algorithme voisin K-nearest utilisent des étiquettes d'objets voisins pour décider de l'étiquette d'un nouvel objet. Le choix de la métrique de similitude façonne fondamentalement comment les algorithmes perçoivent et interprètent les relations de données, ce qui en fait une des décisions les plus critiques dans le pipeline d'apprentissage automatique.

La Fondation mathématique de mesure de la similitude

Les mesures de similitude sont utilisées pour mesurer les similitudes entre vecteurs, et le choix d'une mesure de distance appropriée aide à améliorer la classification et les performances de regroupement significativement. Les propriétés mathématiques de ces mesures déterminent leur comportement dans différents contextes et leur adéquation pour différents types de données et applications.

Lorsque vous travaillez avec des mesures de similarité, il est essentiel de comprendre que différentes mesures saisissent différents aspects des relations de données. Certaines mesures se concentrent sur les différences de grandeur, d'autres sur l'alignement directionnel, et d'autres encore sur le chevauchement fondé sur des ensembles de données.

Les mêmes critères et leurs applications

Le paysage des mesures de similitude est diversifié, chaque mesure offrant des avantages uniques pour des types de données spécifiques et des cas d'utilisation. Comprendre les caractéristiques, les forces et les limites des mesures communes est essentiel pour un apprentissage efficace et non supervisé.

Distance euclidienne

La distance euclidienne mesure la longueur d'un segment qui relie deux points dans l'espace euclidien en n-dimensionnel et est la métrique la plus utilisée, très utile lorsque les données sont continues. Cette métrique calcule la distance linéaire entre deux points, ce qui la rend intuitive et géométriquement interprétable.

La distance euclidienne doit être utilisée lorsque vous vous souciez de la différence de grandeur, car elle est excellente lorsque vos vecteurs ont des grandeurs différentes et que vous vous souciez principalement de la distance entre vos points de données dans l'espace. Cela rend la distance euclidienne particulièrement adaptée aux applications impliquant des données spatiales, des mesures physiques ou tout scénario où l'ampleur absolue des différences compte.

Dans la pratique, la distance euclidienne fonctionne bien pour les données de dimensions faibles à modérées, mais peut souffrir de la "mauvaise de dimensionnalité" dans les espaces de haute dimension, où tous les points tendent à se distinguer les uns des autres.

Similarité avec les cosinus

La similitude de la cosine doit être utilisée lorsque vous vous souciez de la différence d'orientation, ce qui la rend parfaite pour les applications NLP et les scénarios où la direction vectorielle compte plus que l'amplitude.

La similitude des cosinus est couramment utilisée dans les tâches d'analyse de texte et de regroupement de documents, qui permettent de mesurer la similitude entre documents quelle que soit leur taille, car elle se concentre sur l'orientation des vecteurs plutôt que sur leur ampleur.

Les vecteurs de documents peuvent être comparés en utilisant la similitude cosine ou d'autres mesures de distance analogiques, avec des approches alternatives telles que l'analyse sémantique explicite, l'analyse sémantique saillante, la similitude distributionnelle et les analogues hyperespaces au langage. La polyvalence de la similitude cosine en fait un choix standard pour les systèmes de recommandation, la recherche d'information et les tâches d'analyse sémantique.

Indice et distance de Jaccard

Le coefficient de distance Jaccard mesure la similitude entre deux ensembles d'échantillons et est défini comme la cardinalité de l'intersection des ensembles définis divisé par la cardinalité de leur union, applicable uniquement aux ensembles d'échantillons finis, avec la distance Jaccard mesurant la dissimilarité en soustrayant le coefficient de similitude Jaccard de 1. Cette métrique basée sur un ensemble est particulièrement utile pour les données binaires ou catégoriques.

La similitude Jaccard est bien adaptée aux scénarios impliquant des ensembles, des données binaires ou des situations où la présence ou l'absence d'éléments est importante. Les applications courantes comprennent la comparaison de documents basée sur la présence de mots, l'analyse du comportement des utilisateurs dans les systèmes de recommandation et l'analyse génomique de séquences.

Jaccard Similarity métrique est utilisé pour déterminer la similitude entre deux documents textuels en mesurant leur proximité en fonction de leur contexte, définie comme une intersection de deux documents divisés par l'union de ces documents, se référant au nombre de mots communs sur un nombre total de mots. Cela rend particulièrement efficace la comparaison de documents ou de ensembles où l'accent est mis sur des éléments partagés plutôt que sur leurs fréquences ou leur magnitude.

Produit intérieur

Le produit intérieur doit être utilisé lorsque vous vous souciez de l'ampleur et de l'orientation, car il s'agit d'une option polyvalente qui fonctionne bien pour les ensembles de données normalisés et non normalisés.

L'IP est plus utile si vous devez comparer des données non normalisées ou si vous vous souciez de l'ampleur et de l'angle. Cette double considération rend le produit intérieur particulièrement utile dans les scénarios où l'échelle et la direction des vecteurs portent des informations significatives, comme dans certains systèmes de recommandation ou des applications de correspondance de fonctionnalités.

Statistiques spécialisées pour les types de données spécifiques

Au-delà des mesures couramment utilisées, des mesures de similitude spécialisées ont été élaborées pour répondre à des types de données spécifiques et aux exigences d'application. Les mesures spécialisées comme Hamming ou Jaccard devraient être utilisées pour des données binaires ou des applications spécifiques lorsque ces mesures sont plus appropriées.

Des mesures telles que la distance d'accueil de Fréchet comparent la distribution d'un ensemble d'images à un autre, tandis que d'autres mesures telles que la dispréparation maximale moyenne du noyau et la distance de Wasserstein ont été utilisées pour mesurer la similitude entre deux ensembles de données, et des mesures telles que le stress de Sammon et le stress de Kruskal sont utilisées pour évaluer la bonté d'ajustement dans les sous-espaces à faible dimension.

Le rôle des données du monde réel dans les calculs de similitude

L'intégration de données authentiques dans des calculs métriques de similitude nécessite un traitement préalable et une considération soigneux des caractéristiques des données pour s'assurer que les similitudes calculées reflètent des relations significatives plutôt que des artefacts de problèmes de qualité des données.

Prétraitement des données pour les calculs de similarité

Le prétraitement efficace est essentiel pour garantir que les mesures de similitude produisent des résultats significatifs lorsqu'elles sont appliquées aux données du monde réel. Le pipeline de prétraitement comporte généralement plusieurs étapes critiques qui transforment les données brutes en un format approprié pour l'analyse de similitude.

Normalisation et mise à niveau

La normalisation est le processus des vecteurs de graduation, de sorte qu'ils ont une échelle cohérente, généralement une longueur unitaire, qui peut être cruciale lorsque l'on utilise la similitude cosine, combinant des vecteurs de différentes sources avec différentes échelles, ou voulant faire des comparaisons équitables entre les différentes dimensions vectorielles, la normalisation L2 étant l'approche la plus courante où chaque vecteur est divisé par sa norme L2. Cette étape de prétraitement garantit que les caractéristiques avec des échelles plus grandes ne dominent pas le calcul de la similitude.

Les échelles de normalisation Min-max sont des caractéristiques d'une plage fixe, généralement [0,1], ce qui le rend approprié lorsque vous avez besoin de valeurs limites. La normalisation Z-score (normalisation) transforme les caractéristiques pour avoir une moyenne zéro et une variance unitaire, ce qui est particulièrement utile lorsque les caractéristiques suivent différentes distributions. Le choix de la méthode de normalisation dépend des caractéristiques des données et des exigences spécifiques de la mesure de similitude utilisée.

Manipulation des valeurs manquantes

Les ensembles de données du monde réel contiennent souvent des valeurs manquantes, qui peuvent avoir une incidence significative sur les calculs de similarité si elles ne sont pas correctement traitées. Les stratégies communes pour traiter les données manquantes comprennent l'imputation (remplacer les valeurs manquantes par des estimations statistiques telles que la moyenne, la médiane ou le mode), la suppression (enlevant les enregistrements ou les fonctions avec des valeurs manquantes), ou l'utilisation d'algorithmes qui peuvent traiter les données manquantes de façon intrinsèque.

Le choix de la stratégie de valeurs manquantes devrait tenir compte du mécanisme de la non-conformité (que les données soient complètement manquantes au hasard, manquantes au hasard ou manquantes au hasard), de la proportion de valeurs manquantes et de l'impact potentiel sur les calculs de similitude.

Sélection des fonctionnalités et réduction de dimensionnalité

La sélection des caractéristiques est la tâche de choisir les caractéristiques les plus informatives et les plus importantes qui représentent les données de la meilleure façon, fait pour réduire la dimensionnalité tout en améliorant ou en maintenant les performances de la machine d'apprentissage en aval ou de la tâche d'extraction de données, et peut être fait dans des paramètres supervisés ou non supervisés.

Les techniques de réduction de dimensionnalité telles que l'analyse des composantes principales (PCA), le t-SNE ou l'UMAP peuvent transformer les données à haute dimension en représentations à plus faible dimension tout en préservant des relations structurelles importantes, ce qui non seulement améliore l'efficacité des calculs, mais peut aussi améliorer l'efficacité des mesures de similitude en réduisant le bruit et en se concentrant sur les aspects les plus informatifs des données.

Défis avec les données du monde réel

Les données réelles présentent de nombreux défis qui peuvent influer sur l'exactitude et la fiabilité des calculs de similitude. La compréhension de ces défis et l'élaboration de stratégies pour les relever sont essentielles pour construire des modèles d'apprentissage robustes et non supervisés.

Bruit et aberrations

Les données du monde réel contiennent souvent du bruit provenant d'erreurs de mesure, d'erreurs de saisie de données ou de variabilité inhérente aux phénomènes mesurés. Les valeurs extrêmes – des points de données qui diffèrent sensiblement des autres observations – peuvent influencer de façon disproportionnée les calculs de similarité, en particulier pour les mesures comme la distance euclidienne qui sont sensibles aux valeurs extrêmes.

Des techniques de prétraitement robustes, comme la détection et l'élimination des défauts, des méthodes de graduation robustes ou l'utilisation de mesures de similitude moins sensibles aux défauts, peuvent aider à atténuer ces problèmes.

Dimensionnalité élevée

L'échelle d'apprentissage métrique et de similarité quadratiquement avec la dimension de l'espace d'entrée et l'échelle aux dimensions supérieures peuvent être obtenues en appliquant une structure de dispersion sur le modèle de matrice. La malédiction de dimensionnalité affecte de nombreuses métriques de similarité, car les distances deviennent moins significatives dans les espaces haute dimension où tous les points ont tendance à être approximativement équidistants.

Les stratégies pour traiter la dimensionnalité élevée comprennent la réduction de dimensionnalité, la sélection des caractéristiques, l'utilisation de mesures spécifiquement conçues pour les données à haute dimension, ou l'utilisation de techniques de hachage sensibles à la localisation qui peuvent trouver efficacement des éléments similaires dans des espaces à haute dimension sans calculer toutes les similitudes par paires.

Hétérogénéité des données

Les ensembles de données du monde réel contiennent souvent des types de données mixtes (numériques, catégoriques, textuels et binaires) qui nécessitent chacun des mesures différentes de similitude.

Les approches utilisées pour traiter des données hétérogènes comprennent l'utilisation de mesures de distance spécialisées conçues pour des types de données mixtes (comme la distance de Gower), le calcul de similarités distinctes pour différents types de caractéristiques et leur combinaison avec des poids appropriés, ou la transformation de toutes les caractéristiques en un espace de représentation commun où une seule mesure peut être appliquée.

Techniques avancées dans l'apprentissage de la similitude

L'apprentissage moderne par machine a introduit des approches sophistiquées pour l'apprentissage et l'optimisation des mesures de similitude directement à partir des données, allant au-delà des fonctions de distance artisanales à des mesures de similitude fondées sur les données qui peuvent s'adapter à des domaines et des tâches spécifiques.

Apprentissage de la même façon sans supervision

Bien que les techniques supervisées et semi supervisées aient fait des progrès pertinents sur les tâches d'apprentissage de la similitude, les scénarios où les données marquées sont inexistantes nécessitent des stratégies différentes, l'apprentissage non supervisé étant une solution prometteuse qui permet d'envisager l'information contextuelle et la structure de l'ensemble des données pour calculer de nouvelles mesures de similitude.

Les systèmes de réseaux neuronaux artificiels peuvent catégoriser de façon autonome les espaces métriques en apprenant à représenter les espaces pour satisfaire l'indépendance algébrique entre les réseaux neuronaux, en projetant l'information sensorielle sur plusieurs espaces métriques à haute dimension afin d'évaluer de façon indépendante les différences et les similitudes entre les caractéristiques.

Similarité fondée sur l'apprentissage profond

Les techniques d'apprentissage approfondi permettent de représenter des documents ou des textes comme vecteurs en utilisant doc2vec, avec de multiples approches existantes pour apprendre les représentations vectorielles de mots, y compris les méthodes de décomposition de matrice comme les saut-grammes ou les sacs de mots continus. Ces représentations apprises peuvent ensuite être comparées en utilisant des mesures de similitude traditionnelles, mais avec l'avantage que la représentation elle-même a été optimisée pour capturer les relations sémantiques.

Les approches d'apprentissage profond comprennent le CNN, le RNN, le transformateur, les mécanismes d'attention et le BERT, avec de nombreuses méthodes d'évaluation de la similitude récemment utilisant des représentations sémantiques de mots produites par des techniques d'apprentissage profond, car les modèles DL apprennent automatiquement les caractéristiques dans les couches précoces, réduisant la consommation de temps dans le processus d'extraction.

Approches d'apprentissage métrique

De nombreuses formulations pour l'apprentissage métrique ont été proposées, avec des approches bien connues, notamment l'apprentissage de comparaisons relatives basées sur la perte de triplets, la marge la plus proche du voisin et l'apprentissage métrique théorique de l'information.

L'apprentissage de la similitude basé sur le classement suppose une forme de supervision plus faible que la régression parce qu'au lieu de fournir une mesure exacte de la similitude, il suffit de fournir l'ordre relatif de similitude, ce qui facilite l'application dans les applications réelles à grande échelle. Cette flexibilité rend les approches basées sur le classement particulièrement pratiques pour les scénarios du monde réel où l'obtention de scores de similitude précis est difficile mais les comparaisons relatives sont plus facilement disponibles.

Applications de la même méthode dans l'apprentissage non supervisé

L'apprentissage de la similitude est utilisé pour la recherche d'information pour apprendre à classer, à vérifier ou à identifier le visage, et dans les systèmes de recommandation. Les applications pratiques des mesures de similitude couvrent de nombreux domaines et cas d'utilisation, chacun mettant à profit la capacité de quantifier les relations entre les points de données de manière significative.

Clustering et découverte de modèles

Les algorithmes de regroupement reposent fondamentalement sur des paramètres de similitude pour les points de données liés au groupe. Différentes approches de regroupement – comme les moyennes k, les regroupements hiérarchiques, DBSCAN et les regroupements spectraux – utilisent des paramètres de similitude de différentes façons, mais toutes dépendent de mesures de similitude précises pour produire des regroupements significatifs.

Dans la segmentation des clients, les mesures de similitude permettent aux entreprises d'identifier des groupes de clients ayant des comportements, des préférences ou des caractéristiques similaires, ce qui permet de cibler des stratégies de marketing, des recommandations personnalisées et un meilleur service à la clientèle.

Dans la recherche scientifique, le regroupement fondé sur des paramètres de similitude aide à identifier les patrons des données génomiques, à grouper des composés chimiques similaires ou à catégoriser les objets astronomiques. La capacité de découvrir des groupements naturels sans étiquettes prédéfinies rend le regroupement fondé sur la similitude inestimable pour l'analyse exploratoire des données et la génération d'hypothèses.

Détection d'anomalies

En mesurant la similitude de chaque point de données avec ses voisins ou avec les modèles typiques des données, les algorithmes de détection d'anomalies peuvent signaler des observations inhabituelles qui peuvent indiquer une fraude, une défaillance de l'équipement, une intrusion de réseau ou d'autres événements importants.

Dans les services financiers, la détection d'anomalies fondées sur la similitude aide à identifier les transactions frauduleuses en comparant chaque transaction aux modèles de comportement normal. Dans la fabrication, il peut détecter les dysfonctionnements d'équipement en identifiant les lectures de capteurs qui s'écartent des modèles opérationnels typiques.

L'efficacité de la détection des anomalies dépend de façon critique du choix de mesures de similarité qui reflètent les aspects pertinents de la normalité et de l'anomalie pour l'application spécifique.

Systèmes de recommandation

Les systèmes de recommandation utilisent des paramètres de similitude pour identifier des éléments semblables à ceux qu'un utilisateur a aimés ou des utilisateurs semblables à un utilisateur donné.

Dans le commerce électronique, les recommandations de produits basées sur la similitude aident les clients à découvrir les éléments pertinents, augmentant l'engagement et les ventes. Dans les services de streaming, les mesures de similitude permettent des recommandations de contenu personnalisées basées sur l'historique de visionnement et les préférences.

Le choix de la mesure de similitude dans les systèmes de recommandation a une incidence sur la qualité et la diversité des recommandations. La similitude des cosinus est couramment utilisée pour son efficacité avec des données peu nombreuses et son accent sur les modèles plutôt que sur les grandeurs, mais d'autres mesures peuvent être plus appropriées en fonction de la tâche de recommandation et des caractéristiques des données.

Récupération d'information et recherche

La méthode classique de la linguistique computationnelle consiste à mesurer la similitude fondée sur le chevauchement de contenu entre documents en représentant les documents comme vecteurs clairsemés de la poche des mots et en définissant la mesure du chevauchement comme angle entre les vecteurs en utilisant la similitude cosine.

Les moteurs de recherche utilisent des mesures de similitude pour classer les documents en fonction de leur pertinence pour une requête. La similarité permet de trouver des articles connexes, de détecter des duplicata et d'organiser de vastes collections de documents.

Les systèmes modernes de recherche d'information combinent souvent plusieurs paramètres de similitude et utilisent des ancrages appris pour saisir la similitude sémantique au-delà de la simple correspondance par mots-clés. Cela permet des capacités de recherche plus sophistiquées qui peuvent comprendre l'intention de l'utilisateur et trouver du contenu pertinent même lorsque des correspondances par mots-clés exacts sont absentes.

Analyse d'images et de vidéos

La similitude est mesurée entre deux images en utilisant des caractéristiques soit par des mesures sémantiques de distance, soit par des techniques d'apprentissage automatique, avec des mesures de distance appliquant la distance euclidienne ou la similitude cosine entre les vecteurs de caractéristiques, tandis que les modèles ML sont formés pour apprendre des caractéristiques extraites pour la prédiction de similitude.

Dans les systèmes de recherche d'images, les paramètres de similitude permettent de trouver des images visuellement similaires dans de grandes bases de données. Dans l'imagerie médicale, ils aident à identifier des cas similaires ou à détecter des anomalies en comparant avec des modèles normaux.

Il est difficile de définir une mesure de distance pour saisir avec précision la similitude intuitive entre les images, car les méthodes analytiques existantes ont du mal à dégager des similitudes d'un contexte sémantique plus large, y compris des relations insaisissables telles que des expériences émotionnelles ou sensorielles partagées, des objets liés sémantiquement et des similitudes entre les objets individuels.

Avantages de l'utilisation de données du monde réel avec des mesures similaires

L'incorporation de données du monde réel dans des calculs métriques de similitude et des modèles d'apprentissage non supervisés offre de nombreux avantages qui améliorent la performance, la fiabilité et l'applicabilité pratique des modèles.

Précision et généralisation améliorées du modèle

Les données du monde réel exposent les modèles à la complexité et à la variabilité de l'environnement opérationnel réel. Cette exposition aide les modèles à apprendre des mesures de similarité robustes qui généralisent bien les nouvelles données invisibles plutôt que de les adapter de façon exagérée à des ensembles de données idéalisés ou synthétiques.

Lorsque des mesures de similitude sont ajustées et validées sur des données du monde réel, elles permettent de mieux saisir les nuances et les cas de bord qui se produisent dans la pratique, ce qui permet de regrouper plus précisément les données, de détecter les anomalies de façon plus fiable et de formuler des recommandations plus pertinentes lorsque les modèles sont déployés dans des environnements de production.

La diversité des données réelles – y compris les variations de la qualité des données, les changements de distribution et les schémas inattendus – oblige les modèles à développer des mesures de similarité plus robustes qui fonctionnent dans un plus grand nombre de conditions.

Meilleure manipulation du bruit et des aberrations

Les données du monde réel contiennent inévitablement du bruit provenant d'erreurs de mesure, de problèmes de collecte de données et de variabilité naturelle. La formation et la validation de mesures de similarité sur ces données aident à développer des approches qui résistent à ces imperfections plutôt qu'à être déraillées par elles.

Les données aberrantes dans le monde réel peuvent représenter des erreurs à ignorer ou des anomalies importantes à détecter. Travailler avec des données authentiques aide les praticiens à développer le jugement et les techniques nécessaires pour distinguer ces cas et gérer les aberrations de manière appropriée dans les calculs de similitude.

Les mesures de similarité robustes qui fonctionnent bien sur des données réelles bruyantes sont plus susceptibles de réussir dans des environnements de production où la qualité des données ne peut pas toujours être garantie. Cette fiabilité est cruciale pour la construction de systèmes d'apprentissage automatique fiables dont les parties prenantes peuvent dépendre pour des décisions importantes.

Reconnaissance améliorée des modèles

Les données du monde réel contiennent les modèles, les relations et les structures qui existent dans le domaine d'intérêt. Les mesures de similitude formées sur ces données peuvent découvrir et exploiter ces modèles authentiques plutôt que des artefacts de ensembles de données synthétiques ou simplifiés.

Les modèles qui permettent de saisir avec succès ces modèles peuvent fournir des renseignements plus approfondis et des prévisions plus précieuses que celles qui sont formées sur des données simplifiées.

La capacité de reconnaître des modèles significatifs dans les données réelles permet aux modèles d'apprentissage non supervisés de découvrir des idées qui pourraient ne pas être apparentes par l'analyse manuelle. Cette capacité de découverte est l'un des aspects les plus précieux de l'apprentissage non supervisé fondé sur la similitude.

Perspectives plus pertinentes et plus réalisables

Les données issues du monde réel sont directement applicables aux problèmes opérationnels et aux contextes décisionnels réels. Les mesures de similitude qui fonctionnent bien sur les données authentiques produisent des regroupements, des recommandations et des détections d'anomalies qui correspondent aux besoins et aux contraintes du monde réel.

Les parties prenantes sont plus susceptibles de faire confiance aux données du monde réel et d'agir sur celles-ci, car elles peuvent vérifier les résultats par rapport à leurs connaissances et à leur expérience dans le domaine.

Les données du monde réel reflètent les distributions, les relations et les cas de pointe réels qui se produisent dans la pratique, garantissant que les modèles basés sur la similitude traitent les problèmes appropriés de la bonne manière. Cet alignement entre le comportement du modèle et les besoins du monde réel est crucial pour fournir la valeur commerciale.

Meilleures pratiques pour la mise en oeuvre de mesures de similitude

Pour mettre en place avec succès des mesures de similarité pour l'apprentissage non supervisé avec des données du monde réel, il faut suivre les pratiques exemplaires établies qui garantissent des résultats solides, fiables et efficaces.

Sélection du bon métrique pour vos données

Si vous ne savez pas quelle est la métrique de similarité utilisée dans le modèle d'intégration ou si des vecteurs ont été créés sans une métrique spécifique dans le processus de génération, expérimentez avec diverses métriques de similarité pour voir ce qui produit les meilleurs résultats pour votre cas d'utilisation spécifique. Le choix de la métrique de similarité doit être guidé par les caractéristiques de vos données et les objectifs de votre analyse.

Pour les données numériques continues, la distance euclidienne ou la similarité cosine sont souvent appropriées. Pour les données binaires ou catégoriques, la similarité Jaccard ou la distance Hamming peuvent être plus appropriées. Pour les données textuelles, la similarité cosine sur TF-IDF ou les vecteurs d'intégration est couramment utilisée. Pour les types de données mixtes, des mesures spécialisées comme la distance de Gower ou les approches composites peuvent être nécessaires.

Si les caractéristiques ont des échelles très différentes, la normalisation devient essentielle, en particulier pour les mesures basées sur la distance comme la distance euclidienne. Si vous vous souciez principalement des motifs plutôt que des magnitudes, la similitude de la cosine peut être plus appropriée que la distance euclidienne.

Dans les espaces haute dimension, certaines mesures deviennent moins discriminantes en raison de la malédiction de la dimensionnalité. La réduction de dimensionnalité ou des mesures de similitude haute dimension spécialisées peuvent être nécessaires pour un calcul efficace de la similitude.

Validation de la même méthode

La validation est essentielle pour garantir que les mesures de similitude choisies produisent des résultats significatifs. Pour l'apprentissage non supervisé, la validation est plus difficile que dans les cadres supervisés, mais plusieurs approches peuvent aider à évaluer la qualité métrique.

Si des éléments similaires selon la métrique semblent également semblables au jugement humain, cela suggère que la métrique capture des relations significatives. Inversement, si les groupes métriques dissemblaient manifestement des éléments, cela indique un problème avec le choix métrique ou le prétraitement des données.

La validation quantitative peut utiliser des mesures de regroupement internes comme le score de silhouette ou l'indice Davies-Bouldin pour évaluer la qualité des regroupements fondés sur la similitude. Bien que ces mesures aient des limites, elles peuvent aider à comparer différentes mesures de similitude et approches de prétraitement.

Si des étiquettes de vérité au sol sont disponibles pour un sous-ensemble de données, elles peuvent être utilisées pour valider que les éléments métriques similaires sont regroupés et séparent des éléments différents. Cette approche de validation semi-supervisée peut fournir des preuves solides de la qualité métrique.

Considérations relatives à l'efficacité informatique

Les similitudes de calcul par paires pour les grands ensembles de données peuvent être coûteuses par calcul, avec une complexité croissante quadratiquement avec le nombre de points de données.

Les méthodes approximatives de voisinage les plus proches, comme le hachage sensible à la localité ou les approches basées sur les arbres, peuvent réduire considérablement les coûts de calcul en évitant des comparaisons exhaustives par paires.Ces méthodes échangent une certaine précision pour des améliorations significatives de la vitesse, fournissant souvent de bonnes approximations à une fraction du coût de calcul.

Les structures et algorithmes de données sparses peuvent exploiter la sparosité dans la matrice de données ou de similarité pour réduire l'utilisation de la mémoire et le temps de calcul.

Des approches informatiques parallèles et distribuées peuvent faire des calculs de similarité à de très grands ensembles de données en distribuant le calcul sur plusieurs processeurs ou machines.

Raffinement itératif et expérimentation

Trouver la similitude optimale métrique et le pipeline de prétraitement nécessite souvent l'expérimentation et le raffinement itératif. Commencez par des mesures simples et bien comprises et des étapes de prétraitement, puis explorez progressivement des approches plus sophistiquées au besoin.

Documentez soigneusement vos expériences, enregistrant les mesures, les étapes de prétraitement et les paramètres qui ont été essayés et les résultats qu'ils ont produits. Cette documentation permet d'éviter de répéter des approches infructueuses et de développer des connaissances institutionnelles sur ce qui fonctionne pour vos données spécifiques et cas d'utilisation.

Soyez prêt à combiner plusieurs mesures de similitude ou à utiliser des approches d'ensemble si aucune mesure ne saisit tous les aspects pertinents de la similitude pour vos données. Différentes mesures peuvent être appropriées pour différents sous-ensembles de caractéristiques ou différents aspects de la relation de similitude.

Tendances et orientations futures

Le domaine des mesures de similitude et de l'apprentissage non supervisé continue d'évoluer rapidement, les nouvelles techniques et applications se faisant jour régulièrement.

Similitude apprise Métriques

Les travaux récents présentent de nouveaux modèles d'enregistrement d'images déformables qui apprennent de façon non supervisée une mesure de similitude spécifique aux données, proposant d'utiliser une mesure de similitude accessible mise en place comme modèle basé sur l'énergie. Cette tendance à l'apprentissage des mesures de similitude directement à partir de données plutôt que d'utiliser des fonctions de distance artisanales représente un changement significatif dans le domaine.

Les architectures d'apprentissage approfondi, en particulier les réseaux siamois et les réseaux triplets, permettent d'utiliser des fonctions de similarité d'apprentissage optimisées pour des tâches et des types de données spécifiques.

L'intégration de l'apprentissage métrique à l'apprentissage de la représentation permet aux modèles d'apprendre simultanément à représenter les données et à mesurer la similitude dans cet espace de représentation.

Apprentissage de la similitude multimodale

Comme les données proviennent de plus en plus de multiples modalités – textes, images, données audio, capteurs –, les mesures de similitude peuvent fonctionner selon les modalités ou intégrer des informations provenant de sources multiples. L'apprentissage de la similitude multimodale permet des applications comme la récupération modal, où une requête de texte peut trouver des images pertinentes ou vice versa.

Les techniques de similarité multimodale comprennent l'apprentissage d'espaces d'intégration partagés où différentes modalités peuvent être directement comparées, l'apprentissage de cartes transmodales qui se traduisent entre les modalités, ou l'utilisation de mécanismes d'attention pour pondérer la contribution de différentes modalités à la similarité globale.

Similarité explicable Métrique

Comme les systèmes d'apprentissage automatique sont déployés dans des applications à fort débit, la demande d'explications est de plus en plus forte, ce qui explique pourquoi le modèle considère deux éléments semblables ou différents, ce qui a conduit à la recherche de mesures de similitude qui fournissent des explications interprétables aux côtés des scores de similitude.

Les approches permettant d'expliquer la similitude comprennent les méthodes d'attribution des caractéristiques qui permettent d'identifier les caractéristiques qui contribuent le plus à la similitude, les méthodes fondées sur des prototypes qui expliquent la similitude en termes d'exemples représentatifs ou les mécanismes d'attention qui mettent en évidence les parties des données qui conduisent à des jugements de similitude.

Similarité domaine-spécifique Métrique

Comme les ancrages vectoriels continuent d'évoluer avec des modèles plus sophistiqués, nous pouvons nous attendre à ce que de nouvelles mesures de similitude apparaissent pour mieux saisir les nuances de domaines spécifiques. Plutôt que de nous fier uniquement à des mesures à usage général, nous reconnaissons de plus en plus que les mesures de similitude spécifiques à un domaine peuvent fournir de meilleurs résultats pour des applications spécialisées.

Dans le domaine des soins de santé, des mesures de similitude intégrant les connaissances médicales et la pertinence clinique sont en cours d'élaboration. Dans le domaine des finances, des mesures qui tiennent compte de la dynamique temporelle et des conditions du marché apparaissent.

Guide pratique de mise en œuvre

Pour mettre en œuvre avec succès des mesures de similarité pour l'apprentissage non supervisé, il faut prêter une attention particulière aux détails pratiques et à une approche systématique du développement et du déploiement.

Flux de travail pour la préparation des données

Commencez par bien comprendre vos données par l'analyse des données exploratoires. Examinez les distributions, identifiez les valeurs manquantes, détectez les valeurs aberrantes et comprenez les relations entre les caractéristiques.

Élaborer un pipeline de prétraitement qui traite les valeurs manquantes, normalise ou écaille les caractéristiques, selon le cas, et effectue toute ingénierie ou sélection de fonctionnalités nécessaires. Faire ce pipeline reproductible et contrôlé par version afin que le même prétraitement puisse être appliqué de façon uniforme aux nouvelles données.

Partagez vos données en ensembles de développement et de validation, même dans des paramètres non supervisés. Utilisez l'ensemble de développement pour explorer différentes mesures et approches de prétraitement, et réservez l'ensemble de validation pour l'évaluation finale afin d'éviter de trop correspondre à vos données de développement.

Sélection et réglage des paramètres

Commencez par des mesures simples et bien comprises adaptées à votre type de données. Implémentez plusieurs mesures candidates et comparez leur comportement sur vos données. Utilisez à la fois des mesures quantitatives et une inspection qualitative pour évaluer quelles mesures produisent des similitudes significatives.

De nombreuses métriques de similarités ont des paramètres qui peuvent être ajustés, par exemple le paramètre de puissance dans la distance Minkowski ou les paramètres du noyau dans les similarités basées sur le noyau.

Considérez les approches d'ensemble qui combinent plusieurs mesures, particulièrement si différentes mesures saisissent différents aspects de similitude qui sont tous pertinents pour votre application. Apprenez les poids appropriés pour combiner des mesures basées sur la performance de validation.

Évaluation et suivi

Établir des critères d'évaluation clairs pour vos mesures de similitude en fonction de la tâche en aval. Si des similitudes sont utilisées pour le regroupement, évaluer la qualité du regroupement. Si on utilise pour la recommandation, évaluer la pertinence des recommandations.

Surveiller la performance métrique de la similitude au fil du temps à l'arrivée de nouvelles données.Les distributions de données peuvent changer, nécessiter un recyclage ou un recalibrage des mesures apprises ou un ajustement des paramètres de prétraitement.

Recueillir les commentaires des utilisateurs ou des experts du domaine sur la qualité des résultats fondés sur la similitude, ce qui permet de cerner les problèmes que les mesures quantitatives pourraient manquer et de guider les améliorations à apporter à l'approche de mesure de la similitude.

Principaux avantages de l'apprentissage non supervisé fondé sur la similitude

La combinaison de mesures de similarité bien choisies et de données du monde réel offre de nombreux avantages qui font de l'apprentissage sans surveillance un outil puissant pour extraire la valeur des ensembles de données non étiquetés.

  • Amélioration de la précision du modèle:[ Les données du monde réel exposent les modèles à des modèles et à des variations authentiques, ce qui conduit à des mesures de similitude qui généralisent mieux les nouvelles données et produisent des résultats plus précis dans les environnements de production.
  • Mieux manipuler le bruit et les aberrations: La formation sur les données du monde réel avec ses imperfections inhérentes développe des mesures de similarité robustes qui fonctionnent de façon fiable même lorsque la qualité des données est moins que parfaite.
  • Reconnaissance de modèle améliorée:[ Les données authentiques contiennent les structures et les relations réelles présentes dans le domaine, permettant de découvrir des modèles significatifs qui pourraient être manqués avec des ensembles de données synthétiques ou simplifiés.
  • Plus de renseignements pertinents : Les mesures de similitude adaptées aux données du monde réel produisent des résultats qui correspondent aux besoins opérationnels réels et aux exigences du domaine, ce qui permet aux intervenants de se fier et d'utiliser des renseignements concrets.
  • Scalabilité aux ensembles de données volumineux:[ Les implémentations métriques modernes et les méthodes approximatives permettent une échelle vers des ensembles de données très volumineux, rendant l'apprentissage non supervisé pratique pour les applications de mégadonnées.
  • Flexibilité dans tous les domaines: La grande variété de mesures de similarité disponibles et la capacité d'apprendre des mesures personnalisées signifie que les approches fondées sur la similarité peuvent être adaptées à pratiquement n'importe quel domaine ou type de données.
  • Aucun étiquetage requis: L'apprentissage non supervisé avec des mesures de similarité peut extraire de la valeur des données non étiquetées, qui est souvent beaucoup plus abondante et moins chère à obtenir que les données étiquetées.
  • Découverte des modèles inconnus: Sans étiquettes prédéfinies qui limitent l'analyse, l'apprentissage non supervisé fondé sur la similitude peut découvrir des modèles et des relations inattendus qui pourraient ne pas être apparents par des approches supervisées.

Conclusion

Les mesures de similitude constituent le fondement mathématique de l'apprentissage non supervisé, fournissant la capacité essentielle de quantifier les relations entre les points de données sans exiger d'exemples marqués. Combinées à des données du monde réel, ces mesures deviennent des outils puissants pour découvrir les modèles, identifier les anomalies, faire des recommandations et extraire des informations des grandes quantités de données non marquées disponibles dans les applications modernes.

Le succès avec l'apprentissage non supervisé basé sur la similitude exige une attention particulière à la sélection métrique, au prétraitement des données, à la validation et à l'efficacité de calcul. Le choix de la métrique de similitude doit être guidé par les caractéristiques des données, les exigences du domaine et les objectifs spécifiques de l'analyse.

Au fur et à mesure que le domaine évolue, nous constatons des développements passionnants dans les mesures de similarité apprise, les approches multimodales et les mesures spécifiques à domaine.Ces progrès promettent de rendre l'apprentissage non supervisé fondé sur la similarité encore plus puissant et applicable à une gamme croissante de problèmes.

Pour explorer plus en détail les mesures de similitude et leurs applications, envisagez de consulter des ressources telles que la documentation scikit-learn métriques, qui fournit une couverture complète des mesures de distance et de similitude, ou les tutoriels [TensorFlow pour les approches d'apprentissage de la similitude fondées sur l'apprentissage profond. Le arXiv reserve offre l'accès à des documents de recherche de pointe sur l'apprentissage de la métrique et les techniques d'apprentissage non supervisées, tandis que Kaggle[ fournit des ensembles de données et des cahiers pour l'expérimentation pratique de mesures de similitude dans des scénarios réels.