Table of Contents
טכניקות מיון ב-Data Handling: A Primer
מיון הוא פעולה בסיסית בעיבוד נתונים, המשמש לסדר רשומות בסדר מסוים המבוסס על אחד או יותר תכונות. אלגוריתמים ממיין משותף כוללים מהירות, ממזג, בועות, ו heapsort, כל אחד עם זמן ומורכבות חלל שונה. בעוד מיון הוא חיוני עבור יעילות שחזור נתונים, דיווח וניתוח, ההשפעה שלו על נתונים פרטיות ואנונימיות הוא לעתים רחוקות לבחון מערכת מידע רגישה או זיהוי זה יכול להציג מחדש.
אנשי מקצוע רבים של נתונים מניחים כי מיון הוא פעולה נייטרלית, אבל בהקשר של פרטיות, זה יכול לפעול כעדשה כי תבניות מעצימות, מחוץ לערים, וקישורים שאחרת יישארו חבויים.לדוגמה, מיון נתונים רפואיים באמצעות תאריך אבחון עשוי לחשוף את התזמון של מחלות נדירות, זיהוי חולים באופן פוטנציאלי, מיון רשומות פיננסיות לפי כמות העסקה יכול להיות עסקאות בעלות ערך גבוה, ומאפשר התקפה על עושר או מערכת יחסים כגון אופטימיזציה עסקית, לא רק.
כיצד שיטות מיון משפיעות על סיכוני הפרטיות
הסיכונים הפרטיות המוצגים על ידי מיון יכולים להיות מחולקים לשלוש קטגוריות עיקריות: דליפת דפוס, תיקון מחדש, וחשיפה יוצאת דופן יותר.כל סוג סיכון הוא החריפה על ידי בחירת אלגוריתם מיון והתכונה שנבחרה לסידור.
דפוס Leakage
כאשר הנתונים ממיין על ידי מאמת-זהה כגון גיל, קוד zip או תאריך אבחון, ההזמנה המתקבלת יכולה לחשוף דפוסים התנהגותיים או דמוגרפיים.לדוגמה, מיון נתונים לבריאות הציבור שגיל המטופל עלול לחשוף את אשכולות הגיל התואמים לתנאי הרפואה הספציפיים, מה שהופך אותו קל יותר לקשר אדם למצב אפילו אם מזהים ישירים ניתן להסיר.
התקפות הזדהות מחדש
התקפות זיהוי מחדש משתמשות במידע עזרי (למשל, רשומות מצביעים, פרופילים ברשתות החברתיות) כדי להתאים את הרשומות המוזהות בחזרה ליחידים.מיין יכול להוריד באופן משמעותי את העלות של התקפות כאלה.דוגמה ידועה היא זיהוי מחדש של רשומות רפואיות של מושל מסצ'וסטס ויליאם וולד ב-1990, שם החוקרים חוצים את הפרשות הרפואיות של המדינה וקוד פתוח במיוחד על ידי קודים מוצלחים יותר.
חשיפה יוצאת דופן
אאוטיירים הם נקודות נתונים המתפתלות באופן משמעותי משאר השאר.הרישום על ידי תכונה רגישה (למשל, הכנסה, ציוני מבחן, מספר ביקורים) מעמידים את החריגים בחלק העליון או התחתון של הרשימה. רשומות אלה לעתים קרובות מכילים מידע מזהה מאוד בדיוק כי הם יוצאי דופן.לדוגמה, בנקודת זמן של שכר של חברה קטנה, המרוויח הגבוה ביותר עשוי להיות המנכ"ל, והנמוך ביותר יכול לקבל חלק מזהה באופן מיידי את זהויות של העובד.
מיון ואנונימיות מטרות: קונפליקט או הגשמה?
אנונימיות שואפת לחסל או לטשטש את הקשר בין נושאי נתונים לבין רשומותיהם, טכניקות סטנדרטיות כוללות את ה-FLT:0 הכללה FLT:1 (מעל ערכים, למשל, החלפת הגיל המדויק עם טווח הגיל), (FLT:2suppressionFLT 3: (הסרת ערכים מסוימים), ו-FLT:4noise תוספת:5 ערכים אלה יכולים להשתמש בטכניקות מעטות או מעטות).
כאשר אנו ממיין מתחת לתחתונים אנונימיזציה
(ב) אם תחילתו של שאלון (הידועה על ידי הכללה או FLT:0) ,anonymityureFLT:1 (הבטח כל שיא אינו ניתן לניתוק מ-FLT:2kFLT 3-1 אחרים), המגדיר את הנתונים או ה-FLT5 לפני ש-Squasi-ident-identidt יכול לשבור את ההגנה הזו.
כאשר מיון יכול לעזור אנונימיזציה
(בהשוואה, מיון אסטרטגי יכול לשפר טכניקות אנונימיות מסוימות.לדוגמה, (FLT:0randomized מיוןFLT:1 או לחלחל לסדר של רשומות לפני יישום מנגנוני פרטיות שונים יכול להפחית את הסיכון לחשיפה לחשיפה לרישום, אם כי 2data להחליף את ה-FLT 3 (הצבת ערכים בין רשומות), מיון יכול לעזור לבחור את הסיכון להחלפת קבצים מתאימים לאחר מכן, אם כי אם כי אם כי אם כי הוא משמש סוג של ניטראליזציה של 5.
Best Practices for Privacy-Preworthing
כדי למזער את הסיכונים הפרטיות תוך שמירה על היתרונות של מיון, ארגונים צריכים לאמץ את העקרונות הבאים: כל המלצה מבוססת על מחקר פרטיות קיים והנחיות רגולטוריות כגון אלה מ-FLT:0NISTIRFLT:1 ו-FLT:2 European Data Protection BoardureFLT 3: 3.
- (FLT:0) להעריך את הצורך במיין לפני פרסום.FLT 1:1 אם הנתונים ישתחררו בפומבי, לשקול אם ההזמנה המנוונת עצמה מדליפת מידע לעתים קרובות, הנתונים יכולים להיות משוחררים בסדר אקראי או עם מזהה ייחודי שאינו חושף תכונה כלשהי.אם מיון נדרש למטרה אנליטית מסוימת, לתעד את ההצדקה וליישם בקרה טכנית לצמצום החשיפה.
- (ב) [ה]] [ה]] [ה]] [ה]] [ה] [ה]]]] לפני יישום כלליזציה או האנונימיות, הטביע את הרשומות באופן אקראי לאחר אנונימיות, שוב תגדירו מחדש את הסדר להפר כל קישורים חיים.
- (FLT:0) ללא מיון על ידי מאמתים חד-הכרתיים כאשר הם משחררים נתונים.Freave 1:00 Quasi-identifiers כגון zip Code, תאריך לידה, מין, ואבחון הם התכונות הנפוצות ביותר המשמשות בהתקפות זיהוי מחדש.If מיון חייב להיות מבוסס על תכונות כאלה, ליישם דיכוי חזק או כלליזציה ראשונה, ולאחר מכן גם לאחר אנונימיות, מודע לכך שגילו עשוי לחשוף את סדר הדלי (גיל המאפיין צעיר יותר).
- (FLT:0) ניהול פרטיות שונה עם מנגנון רעש מלוטש מסוגנן.FLT:1 פרטיות שונה (DP) מספק ערבויות מתמטיות נגד דליפת מידע, אך מנגנוני DP סטנדרטיים מניחים כי סדר הנתונים הוא עצמאי של השאילתה.אם מיון הוא מיושם, מנגנון ה-DP צריך להיות מותאם לחשבון עבור ההתאמה הפוטנציאלית שהוצגה על ידי הזמנת חוקרים הציעו LTF:2 או אלגוריתמים לאלגוריתמים מתקדמים של מידע, אך יש צורך באלגוריתמים, אך יש צורך באלגוריתמים, אך ורק על מנת להבטיח את הרגישות גבוהה יותר, אך ורק על מנת להבטיח את המידע, אך ורק על מנת להבטיח את האלגוריתמים, אך ורק על ידי אלגוריתמים, אך ורק על מנת להבטיח את האלגוריתמים מתקדמים, אך ורק על מנת להבטיח את האלגוריתמים, אך ורק על מנת להבטיח את מידת הרגישות, במידת הצורך, במידת הצורך, על מנת להבטיח את האלגוריתמים, על מנת להבטיח את האלגוריתמים, על מנת להבטיח את האלגוריתמים, במידת הצורך, במידת הצורך, במידת הצורך, על מנת להבטיח את האלגוריתמים, אך ורק על מנת להבטיח את האלגוריתמים, על מנת להבטיח את האלגוריתמים, על מנת להבטיח את האלגוריתמים, על מנת להבטיח את האלגוריתמים
- (ב) [17] , עיין בקביעת הסיכון לזיהוי מחדש של פרמטרים מסוגנן (FLT: 1) שימוש במערכים כמו ה-FLT:2marketer's RiskFLT 3: , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (FLT:0) ביצוע כללים במדיניות ניהול נתונים.
מחקרים: מיון השתבש - ונכון
מקרה 1: בריאות נתונים Leakage באמצעות תאריך מיון
In 2021, a European health research institute published a de-identified dataset of patient visits for a flu study. The dataset was sorted by date of visit and included age and gender. Although direct identifiers were removed, an independent privacy audit found that the sorted order enabled an attacker with knowledge of a few patients’ approximate visit datesכדי להתאים את הרשומות עם ביטחון גבוה.המכון עדכן את נוהלו כדי לבצע את סדר הרשומה וליישם את האנונימיות (k=5) בשני הגיל והקריטריונים של התאריך.דוגמה זו מדגישה שאפילו סוג פשוט של עלייה יכול להיות וקטור התקפה יעיל.
מקרה 2: נתונים פיננסיים ו unmasking של מנהלים
חברת שירותים פיננסיים פרסמה מדגם של 10,000 רשומות עסקה אנונימיות לתחרות ניתוח נתונים.הרשומות היו מסומנות על ידי סכום העסקה בסדר יורד.מספר רשומות ליד העליון היו מעל מיליון דולר, וחשבונות אלה היו גם שילובים יוצאי דופן של סוגי עסקאות.חוקרים חיצוניים השתמשו במסמכים ציבוריים של ה-SEC ובמאמרים חדשות כדי לזהות שניים מהחשבונות בעלי הערך הגבוה, המקשרים אותם לקצינים ספציפיים.
מקרה 3: שימוש מוצלח במיין בנתונים אישיים שונים
סוכנות סטטיסטיקות לאומית השתמשה במיין כדי לשפר את הדיוק של נתונים פרטיים במפקדים שונים.הם סינו רשומות משק בית על ידי מזהה סינתטי מבוסס על אשכול גיאוגרפי, ולאחר מכן ליישם מנגנון רעש DP אשר ניצל את ההוראה המסוגנת כדי להפחית את השגיאה היחסית של שאילתות. כי המפתח הממיין הוא גיאואש לא רגיש (ה אחרת, מיון לא פידל תכונות בודדות.
« « « « « ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
לא כל אלגוריתמים מדומים לפרספקטיבה פרטיות.תבנית הגישה של האלגוריתם ומורכבות הזמן יכולה להדליף מידע על הנתונים במהלך ביצועם.זה רלוונטי במיוחד ב-FLT:0 בטוח חישוב רב-מפלגתי (MPC)FLT:1 ו-FLT:2en שאילתות מקודמות מסד נתונים LT:3 שבו יש לבצע ללא חשיפת הנתונים.
- (ב) [15] [17] , אלגוריתמים אלה מבוססים על השוואת ערכים (למשל, מהירות, מיזוגים): אלגוריתמים אלה מסתמכים על השוואת ערכים, בסביבה בלתי-ממונה (למשל, ענן), סדרת ההשוואה יכולה להדליף את סדרם היחסי של אלמנטים, אשר בתורו של מידע רגיש אם התחום הוא קטן.
- (ב) [15] [15] [15] [15] [15] [17] , [17] , ויקרא ויקרא יט): אלגוריתמים אלה משתמשים במפתחות אינטגרטיביים ונתוני דלי לתוך בינאריות (למשל, דלי יכול לחשוף את הקטגוריה המספרית של שיא (למשל, קבוצת גיל) אם גבולות הדלי ידועים באופן פומבי, צופה בתהליך מיון יכול להסיק מהם רשומות דליות, כלומר, כלומר, אם ניתן להשתמש במדד זה יכול להיות דלי או LT2 ארגונים פרטיים.
- (FLT:0Stable vs. unconnative מיון:Figal 1: , Stable סוגים לשמר את הסדר המקורי של רשומות עם מפתחות שווים.If ההזמנה המקורית מכילה מידע זמני או זניח (למשל, זמן ההגעה), סוג יציב יכול לאפשר תוקף לשחזר חלק של ההזמנה המקורית, אשר עשוי להיות רגיש.
בעת בחירת אלגוריתם מיון של פעולות רגישות לפרטיות, לשקול את מודל האיום.בעיבוד נתונים פנימיים עם בקרת גישה מלאה, מיון עשוי להיות בטוח.עם זאת, עבור כל מידע שיפורסם או משותף עם צדדים שאינם בוטחים, השתמש באלגוריתם לא יציב, אקראי את המפתח אם ניתן, לשקול FLT:0shuffling את הנתונים שלמים לאחר מיון של 1LT:1.
מסקנה
טכניקות מיון הן רחוק נייטרליות כשמדובר בפרטיות נתונים ואנונימיות.הסדר שבו רשומות מופיעות יכול לחשוף דפוסים, להקל על התקפות זיהוי מחדש, וחשיפת חריגים.אך מיון אינו מטבעו בסתירה לפרטיות; כאשר משתמשים בו במכוון ובשילוב עם שינוי מידע הולם, הוא יכול אפילו לשפר את ההגנה על הפרטיות מסוימת.
לקריאה נוספת על שחרור נתונים וקביעת סיכונים, להתייעץ עם מדריך ה-FLT:0NIST להגנת הסודיות של PIIFLT:1 ו-FLT:2OWASP wiki על התקפות זיהוי מחדש של FLT 3, המספקות מסגרות מעשיות להערכת האיומים הללו.