Techniques de tri dans le traitement des données : Un Primer

Le tri est une opération fondamentale dans le traitement des données, utilisée pour organiser les enregistrements dans un ordre spécifique basé sur un ou plusieurs attributs. Les algorithmes de tri communs comprennent le tri rapide, le tri fusion, le tri à bulles et le tri à bulles, chacun avec des complexités de temps et d'espace différentes. Bien que le tri soit indispensable pour une récupération, un rapport et une analyse efficaces des données, son impact sur la vie privée et l'anonymat des données est rarement examiné de façon critique.

De nombreux professionnels de la gestion des données supposent que le tri est une opération neutre, mais dans le contexte de la vie privée, il peut agir comme un objectif qui grossit les modèles, les valeurs aberrantes et les liens qui resteraient cachés autrement. Par exemple, le tri d'un ensemble de données médicales par date de diagnostic peut exposer le moment des maladies rares, potentiellement identifier les patients.

Comment les techniques de tri influencent les risques liés à la protection de la vie privée

Les risques de confidentialité introduits par le tri peuvent être regroupés en trois grandes catégories : fuite de patrons, facilitation de la réidentification et exposition aberrante. Chaque type de risque est exacerbé par le choix de l'algorithme de tri et de l'attribut choisi pour commander.

Fuite de motif

Par exemple, le tri d'un ensemble de données de santé publique par âge du patient peut exposer des groupes d'âge qui correspondent à des conditions médicales spécifiques, ce qui facilite le lien entre un individu et une condition, même si des identifiants directs sont supprimés. Cette fuite peut être particulièrement dangereuse dans les ensembles de données qui sont destinés à être anonymes mais sont libérés avec le tri appliqué.

Attaques de réidentification

Le tri peut considérablement réduire le coût de ces attaques. Un exemple bien connu est la réidentification des dossiers médicaux du gouverneur du Massachusetts William Weld, dans les années 1990, où les chercheurs ont recoupé les données de sortie de l'hôpital de l'État (par ordre de date et par code postal) avec les listes électorales accessibles au public. Le tri par date et par code postal a créé une combinaison unique qui permettait de relier les données.

Expositions extérieures

Les valeurs aberrantes sont des points de données qui s'écartent sensiblement du reste. Le tri par un attribut sensible (p. ex. revenu, scores de test, nombre de visites) place les valeurs aberrantes en haut ou en bas de la liste. Ces enregistrements contiennent souvent des informations très identifiables précisément parce qu'elles sont inhabituelles. Par exemple, dans un ensemble de données salariales d'une petite entreprise, le plus haut gagnant peut être le PDG, et le plus bas gagnant un employé à temps partiel.

Tri et anonymat Objectifs : conflit ou complément?

L'anonymisation vise à éliminer ou à masquer le lien entre les sujets de données et leurs enregistrements.Les techniques standard comprennent generalisation (d'élargissement des valeurs d'attribut, p.ex., remplacement de l'âge exact par une fourchette d'âge), suppression[ (en supprimant certaines valeurs entièrement), et ajout de bruit (en perturbant légèrement les valeurs).

Lors du tri des sous-mines Anonymisation

Si un ensemble de données est anonymisé en utilisant la généralisation ou k-anonyme[] (en assurant que chaque enregistrement est indistinctible d'au moins k[-1 autres), le tri par un quasi-identificateur peut briser cette protection. Par exemple, supposons qu'un ensemble de données a été généralisé de sorte que chaque groupe d'enregistrements partage la même fourchette d'âge et le même code postal.

Quand trier peut aider l'anonymat

Par exemple, tri randomisé ou permutant l'ordre des enregistrements avant d'appliquer des mécanismes de confidentialité différentiels peut réduire le risque de divulgations séquentielles. Dans échange de données[ (replacement des valeurs entre les enregistrements), le tri peut aider à sélectionner des candidats appropriés pour échanger tout en préservant les propriétés statistiques. Un autre cas est l'anonymisation des plus proches , où le tri par une métrique de distance aide à regrouper des enregistrements similaires, qui est ensuite utilisé pour générer des groupes généralisés. La clé est que le tri doit être contrôlé et documenté dans le cadre du pipeline d'anonymisation, et non pas une post-pensée.

Meilleures pratiques pour le tri de préservation de la vie privée

Pour minimiser les risques liés à la vie privée tout en conservant les avantages du tri, les organisations devraient adopter les principes suivants : chaque recommandation est fondée sur les lignes directrices existantes en matière de recherche sur la vie privée et de réglementation, telles que celles du NIST[ et du European Data Protection Board.

  1. Évaluer la nécessité de trier avant publication. Si l'ensemble de données est publié, déterminer si l'ordre trié lui-même fuit l'information. Souvent, les données peuvent être publiées dans un ordre aléatoire ou avec un identifiant unique qui ne révèle aucun attribut. Si le tri est nécessaire à une fin analytique précise, documenter la justification et mettre en place des contrôles techniques pour limiter l'exposition.
  2. Utiliser le tri aléatoire combiné avec d'autres techniques d'anonymisation. Avant d'appliquer la généralisation ou l'anonymité k, mélanger les enregistrements de façon aléatoire.Après l'anonymisation, randomiser encore l'ordre de briser les liens résiduels. Ce processus en deux étapes est recommandé par le NIST Guide to Protection the Confidentiality of Personally Identifiable Information (PDF).
  3. Éviter le tri par quasi-identification lors de la diffusion de données. Les quasi-identifications comme le code postal, la date de naissance, le sexe et la date de diagnostic sont les attributs les plus couramment utilisés dans les attaques de réidentification. Si le tri doit être basé sur ces attributs, appliquer une forte suppression ou généralisation d'abord, puis trier après l'anonymisation.
  4. La confidentialité différentielle avec un mécanisme de bruit de tri-concepteur La confidentialité différentielle (DP) offre des garanties mathématiques contre les fuites d'informations, mais les mécanismes standard du DP supposent que l'ordre des données est indépendant de la requête. Si le tri est appliqué, le mécanisme du DP devrait être étalonné pour tenir compte de la corrélation potentielle introduite par la commande.
  5. Testez régulièrement le risque de réidentification en utilisant des mesures de tri-aiguillageUtilisez des mesures comme le [[journaliste][[pour évaluer la probabilité qu'un attaquant réidentifie des enregistrements.Ces mesures doivent être calculées non seulement sur les valeurs de données mais aussi sur l'ordre des enregistrements.Un ensemble de données qui est k-anonyme dans l'espace de valeur peut encore être vulnérable si l'ordre de tri crée des séquences uniques.
  6. Les règles de tri des documents dans les politiques de gouvernance des données. Tout tri effectué sur des données personnelles — que ce soit pendant la collecte, le traitement ou la publication — doit être enregistré et justifié. Inclure l'attribut utilisé, l'algorithme utilisé (p. ex., tri rapide, tri à godets) et le but (p. ex., -) pour permettre l'analyse des tendances temporelles.

Études de cas : le mauvais traitement — et la bonne

Cas 1 : Fuite des données sur la santé par tri de date

In 2021, a European health research institute published a de-identified dataset of patient visits for a flu study. The dataset was sorted by date of visit and included age and gender. Although direct identifiers were removed, an independent privacy audit found that the sorted order enabled an attacker with knowledge of a few patients’ approximate visit datesL'institut a ensuite révisé sa procédure pour randomiser l'ordre des enregistrements et appliquer l'anonymat k (k=5) sur les critères d'âge et de date. Cet exemple souligne que même un simple type ascendant peut être un vecteur d'attaque efficace.

Cas 2 : Données financières et démasquage des cadres

Une société de services financiers a publié un échantillon de 10 000 documents de transactions anonymisées dans le cadre d'un concours d'analyse de données. Les documents ont été triés par ordre décroissant de leur montant. Plusieurs documents près du haut avaient des montants supérieurs à 1 million de dollars, et ces comptes présentaient également des combinaisons inhabituelles de types de transactions. Des chercheurs externes ont utilisé les dépôts publics de SEC et des articles de nouvelles pour identifier deux des comptes de grande valeur, les reliant à des agents ministériels précis.

Cas 3 : Utilisation réussie du tri dans les données d'enquêtes privées différenciées

Un organisme national de statistique a utilisé le tri pour améliorer la précision des données de recensement différentiellement privées. Il a trié les dossiers des ménages par une identification synthétique basée sur un cluster géographique, puis a appliqué un mécanisme de bruit DP qui a exploité l'ordre trié pour réduire l'erreur relative des requêtes.Comme la clé de tri était une géohash non sensible (plus généralisée), le tri n'a pas dérouté les attributs individuels. L'organisme a publié un rapport technique détaillant comment le tri peut faire partie d'un pipeline de préservation de la vie privée lorsque la clé de tri n'est pas sensible et que l'ordre est randomisé après l'ajout de bruit.

Tri des algorithmes et de leurs propriétés de confidentialité

Tous les algorithmes de tri ne sont pas égaux du point de vue de la confidentialité. L'algorithme , le modèle d'accès à la mémoire et la complexité du temps, peuvent divulguer des informations sur les données pendant l'exécution. Ceci est particulièrement pertinent dans le calcul multiparties sécurisé (MPC) et les requêtes de base de données chiffrées[ où le tri doit être effectué sans révéler les données.

  • Les types basés sur la comparaison (p. ex., Quicksort, Mergesort):[ Ces algorithmes reposent sur la comparaison de valeurs.Dans un environnement d'exécution non fiable (p. ex., nuage), la série de comparaisons peut échapper à l'ordre relatif des éléments, qui à son tour fuit des informations sensibles si le domaine est petit. Les algorithmes de tri objectif (p. ex., Batcher=s impair-even Mergesort) tentent de masquer le modèle d'accès en effectuant un nombre fixe d'opérations, peu importe l'entrée, mais ils sont plus lents.
  • Traitements non comparatifs (p. ex. tri de comptage, tri radix):[ Ces algorithmes utilisent des clés entières et des données de seau dans des bacs. L'attribution de seau peut révéler la catégorie numérique d'un enregistrement (p. ex. groupe d'âge). Si les limites du seau sont connues du public, un observateur qui regarde le processus de tri peut déduire dans quels registres tombent dans quel seau. Pour atténuer cette situation, les organisations peuvent utiliser différentement une seautisation privée où les limites sont randomisées ou le bruit est ajouté au seau.
  • Tri stable contre unstable: Les triables conservent l'ordre original des enregistrements avec des clés égales. Si l'ordre original contient des informations temporelles ou séquentielles (p. ex., heure d'arrivée), un tri stable peut permettre à un attaquant de reconstruire une partie de l'ordre original, qui peut être sensible.

Lors du choix d'un algorithme de tri pour les opérations sensibles à la vie privée, considérez le modèle de menace. Dans le traitement interne des données avec contrôle d'accès complet, le tri peut être sûr. Cependant, pour toute donnée qui sera publiée ou partagée avec des parties non confiantes, utilisez un algorithme instable, randomisez la clé de tri si possible, et considérez choupler l'ensemble de données après tri.

Conclusion

Les techniques de tri sont loin d'être neutres en ce qui concerne la confidentialité et l'anonymat des données. L'ordre dans lequel les documents apparaissent peut révéler des modèles, faciliter les attaques de réidentification et exposer des valeurs aberrantes. Pourtant, le tri n'est pas intrinsèquement en contradiction avec la vie privée; lorsqu'il est utilisé délibérément et combiné avec des méthodes d'anonymisation appropriées, il peut même améliorer certaines protections de la vie privée. Les organisations doivent reconnaître que la vie privée est une propriété de la totalité des données libérées, et pas seulement des valeurs elles-mêmes.

Pour plus de renseignements sur les risques de divulgation et de tri des données, consultez le NIST Guide to Protection the Confidentiality of PII et le wiki OWASP sur les attaques de réidentification[, qui fournissent des cadres pratiques pour évaluer ces menaces.