Tecniche di selezione in Data Handling: A Primer

La selezione è un'operazione fondamentale nel trattamento dei dati, utilizzata per organizzare i record in un ordine specifico basato su uno o più attributi. Gli algoritmi di selezione comuni includono una rapida selezione, unione, una bollasort, e un'assortimento, ciascuno con diverse complessità di tempo e di spazio.

Molti professionisti del dato assumono la selezione è un'operazione neutrale, ma nel contesto della privacy, può agire come una lente che ingrandisce modelli, outlier e linkage che altrimenti resteranno nascosti. Ad esempio, ordinare un set di dati medici per data di diagnosi può esporre il tempismo delle malattie rare, potenzialmente identificare i pazienti. Allo stesso modo, ordinare i record finanziari per quantità di transazione può raggruppare transazioni ad alto valore, permettendo un aggressore di differire la ricchezza o le relazioni di affari.

Come ordinare tecniche influenzano rischi per la privacy

I rischi di privacy introdotti dalla selezione possono essere raggruppati in tre categorie principali: perdita di pattern, facilitazione di riidentificazione e esposizione esterna.

Leakage del modello

Quando i dati vengono ordinati da un quasi-identificatore come l'età, il codice postale o la data di diagnosi, l'ordine risultante può rivelare modelli comportamentali o demografici. Ad esempio, la selezione di un set di dati per la salute pubblica per età del paziente può esporre cluster di età che corrispondono a specifiche condizioni mediche, rendendo più facile collegare un individuo a una condizione anche se vengono rimossi identificativi diretti.

Attacco di identificazione

Gli attacchi di identificazione usano informazioni ausiliarie (ad esempio, registri elettori, profili dei social media) per corrispondere a record de-identificati agli individui. La selezione può ridurre significativamente il costo di tali attacchi. Un esempio noto è la ri-identificazione del Governatore del Massachusetts William Weld's cartelle cliniche dimostrano negli anni '90, dove i ricercatori hanno interrottato i dati di scarico ospedalieri dello stato (scelto da data e CAP)

Esposizione esterna

Gli appositi strumenti di ricerca sono punti di dati che deviano in modo significativo dal resto. Ordinando un attributo sensibile (ad esempio, reddito, punteggi di test, numero di visite) mette a piè di fuori dalla cima o dal fondo della lista. Questi record spesso contengono informazioni altamente identificabili proprio perché sono insolite. Ad esempio, in un set di dati salariali di una piccola azienda, il più alto guadagno potrebbe essere il CEO, e il guadagno più basso uno stipendio parziale rivela un dipendente a tempo.

Ordinazione e anonimazione Obiettivi: Conflitto o Completamento?

L'anonimizzazione mira a eliminare o oscurare il legame tra gli interessati e i loro record. Le tecniche standard includono generalizzazione] (valori di attributo di frazionamento, ad esempio, sostituendo l'età esatta con l'intervallo di età), suppressione] (rimozione di determinati valori completamente), e

Quando si ordinano le mine anonimizzazione

Se un dataset è anonimizzato usando la generalizzazione o ]k-anonimato] (che assicura ogni record è indistinguibile da almeno k-1 altri), la selezione da parte di un quasi-identificatore può rompere tale protezione.

Quando ordinare può aiutare l'anonimizzazione

Per esempio, ] la selezione strategica può migliorare alcune tecniche di anonimizzazione.] la selezione casuale] o la permutazione dell'ordine dei record prima di applicare meccanismi di privacy differenziali può ridurre il rischio di divulgazione sequenziale.

Migliori Pratiche per la Privacy-Preserving Sorting

Per ridurre al minimo i rischi di privacy, mantenendo i vantaggi della selezione, le organizzazioni dovrebbero adottare i seguenti principi: ogni raccomandazione è fondata nelle linee guida di ricerca e regolamentazioni sulla privacy esistenti, come quelle di []NIST[]] e European Data Protection Board]].

  1. Valutare la necessità di ordinare prima della pubblicazione. Se l'insieme dei dati verrà rilasciato pubblicamente, considerare se l'ordine ordinato perde informazioni. Spesso, i dati possono essere rilasciati in ordine randomizzato o con un identificatore unico che non rivela alcun attributo. Se la selezione è necessaria per uno scopo analitico specifico, documentare la giustificazione e implementare controlli tecnici per limitare l'esposizione.
  2. Utilizzare la selezione randomizzata combinata con altre tecniche di anonimizzazione. Prima di applicare la generalizzazione o l'anonimato, zittire i record in modo casuale. Dopo l'anonimizzazione, randomizzare nuovamente l'ordine di rompere eventuali link residui. Questo processo a due fasi è raccomandato dal NIST Guida alla protezione della riservatezza delle informazioni personali.
  3. Avoid smistamento da quasi-identificatori quando rilasciano dati. Quasi-identifiers come codice zip, data di nascita, sesso e data di diagnosi sono gli attributi più comuni utilizzati negli attacchi di ri-identificazione. Se la selezione deve essere basata su tali attributi, applicare forte soppressione o generalizzazione prima, poi ordinare dopo l'anonimizzazione.
  4. La privacy differenziale è un meccanismo di rumore di smistamento-consapevole. La privacy differenziale (DP) fornisce garanzie matematiche contro la perdita di informazioni, ma i meccanismi standard DP assumono che l'ordine dei dati è indipendente dalla query. Se si applica la selezione, il meccanismo DP dovrebbe essere calibrato per tenere conto della correlazione potenziale introdotta dall'ordine.
  5. I dati relativi all’identificazione di un tipo di ordinamento possono essere utilizzati in modo diverso da quello di un utente [[FLT:] ], ] i dati relativi all’esecuzione], e i dati relativi all’attacco del cliente]
  6. Le regole di selezione del documento nelle politiche di governance dei dati Qualsiasi ordinamento eseguito sui dati personali — sia durante la raccolta, il trattamento o la pubblicazione — dovrebbe essere registrato e giustificato. Includi l'attributo(i) utilizzato, l'algoritmo impiegato (ad esempio, la selezione rapida, la secchiosità), e lo scopo (ad esempio, "per abilitare l'analisi della tendenza temporale”).

Studi di casi: Ordinazione di Gone Wrong — e Giusto

Caso 1: Leakage dati sanitari tramite la data di selezione

In 2021, a European health research institute published a de-identified dataset of patient visits for a flu study. The dataset was sorted by date of visit and included age and gender. Although direct identifiers were removed, an independent privacy audit found that the sorted order enabled an attacker with knowledge of a few patients’ approximate visit datesL'istituto ha poi rivisto la sua procedura per randomizzare l'ordine di registrazione e applicare k-anonimato (k=5) su criteri di età e di data, sottolineando che anche un semplice tipo di attacco può essere un vettore efficace.

Caso 2: Dati finanziari e la smascheramento dei dirigenti

Una società di servizi finanziari ha rilasciato un campione di 10.000 record di transazioni anonime a una concorrenza di analisi dei dati. I record sono stati ordinati per importo di transazione in ordine decrescente. Diversi record vicino alla cima avevano importi superiori a 1 milione, e questi conti avevano anche combinazioni insolite di tipi di transazioni.

Caso 3: Utilizzo di una selezione in dati di indagine differenzialmente privati

Un'agenzia di statistiche nazionale utilizzata per migliorare l'accuratezza dei dati del censimento differenziale privato. Hanno ordinato i record domestici da un ID sintetico basato su cluster geografico, quindi applicato un meccanismo di rumore DP che sfruttava l'ordine ordinato per ridurre l'errore relativo di query.

Ordinare gli algoritmi e le loro proprietà sulla privacy

Non tutti gli algoritmi di smistamento sono uguali a un punto di vista della privacy. Il modello di accesso alla memoria dell'algoritmo e la complessità del tempo possono divulgare informazioni sui dati durante l'esecuzione. Ciò è particolarmente rilevante in ] la computazione multi-partitica (MPC) e ]] le query codificate del database] dove la selezione deve essere eseguita senza rivelare i dati.

  • [LT:0]Scelta basata su componenti (ad esempio, rapida, mergesort):] Questi algoritmi si basano sul confronto dei valori. In un ambiente di esecuzione non attendibile (ad esempio, cloud), la serie di confronti può trapelare l’ordine relativo degli elementi, che a sua volta perde informazioni sensibili se il dominio è piccolo.
  • [LT:0]] Non-comparison sorts (ad esempio, conteggio di sorta, radix sort): Questi algoritmi utilizzano chiavi integer e dati di secchio in contenitori. L'assegnazione del secchio può rivelare la categoria numerica di un record (ad esempio, gruppo di età). Se i confini del secchio sono pubblicamente noti, un osservatore che osserva il processo di selezione può inferire quali record cadono in cui si possono attenuare.
  • Stable vs.ordinamento instabile:[] I tipi stabili conservano l'ordine originale dei record con le stesse chiavi. Se l'ordine originale contiene informazioni temporali o sequenziali (ad esempio, il tempo di arrivo), una sorta stabile può consentire ad un aggressore di ricostruire parte dell'ordine originale, che può essere sensibile.

Nel trattamento dei dati interni con controlli di accesso completo, la selezione può essere sicura. Tuttavia, per qualsiasi dato che verrà pubblicato o condiviso con parti non attendibili, utilizzare un algoritmo instabile, randomizzare la chiave di selezione se possibile e considerare il riempimento dell'intero set di dati dopo la selezione[]].

Conclusioni

Le tecniche di selezione sono lontane dalla neutralità quando si tratta di privacy e anonimizzazione dei dati. L'ordine in cui i record appaiono possono rivelare i modelli, facilitare gli attacchi di riidentificazione e esporre i più esterni. Tuttavia, la selezione non è intrinsecamente a dispari con la privacy; quando utilizzato deliberatamente e combinato con i metodi di anonimizzazione appropriati, può anche migliorare alcune protezioni sulla privacy.

Per ulteriori informazioni sul rilascio e la selezione dei dati da parte della privacy, consultare la [NIST Guide to Protecting the Confidentiality of PII[] e la ]OWASP wiki on re-identification attack[]], che forniscono dei framework pratici per la valutazione di queste minacce.