מה הם עצי החלטות ומדוע הם Excel בגילויי הונאה

עצי החלטות הם אלגוריתם למידה מכונה בפיקוח כי החלטות מודלים והשלכות אפשריות שלהם בגרף דמוי עץ.כל עלה פנימית בודק תכונה מסוימת (למשל, סכום העסקה > 500 דולר), כל ענף מייצג את התוצאה של המבחן, וכל עלה מחזיק תווית ייצוגית - לגיטימית או הונאה.הטבע מבוסס הכלל שלהם מקבל אותם מפרשים מטבעם, יתרון קריטי מוסדר שבו יש להסביר את ההחלטות, בניגוד ל-"חלבונים" או "תיקים" כמו" של קבוצות פיקוח חיצוניות, כמו "או" של קבוצות פיקוח חיצוניות.

במערכות זיהוי הונאה, עצי ההחלטות מטפלים בנתונים המספריים והקטגוריים, דורשים עיבוד נתונים מינימלי, וניתן באופן טבעי מודל של מערכות יחסים לא לינאריות.לדוגמה, עסקה עלולה להיות מחוספסת כחשידה אם היא מתרחשת ב-3 AMFLT:0andBuildFLT:1 הסכום עולה על 1,000FLT:2andFLT 3, כתובת המשלוח שונה מכתובת עץ קטן כגון:

פרטים נוספים בנושא מקרה 1: מגזר הבנקאות

בנק גלובלי tier-1 קידם מערכת עץ החלטה להילחם הונאה כרטיס אשראי.המודל הוכשר על תחילת נתונים של 10 מיליון עסקאות היסטוריות, באמצעות תכונות כגון סכום עסקה, קוד קטגוריה סוחר, זמן מאז העסקה האחרונה, מרחק בין מיקום בית ועסקאות, וטביעת אצבע המכשיר.העץ השיג שיעור זיהוי מטעה של 92 אחוזים תוך שמירה על חיובי מתחת ל-3 אחוזים.

הבנק גם ייושם מנגנון זיהוי סחף.בגלל שתבניות הונאה מתפתחות (למשל, שינוי מכרטיס-הווה להתקפות לא-הווה), עץ ההחלטות הוכשר כל שבועיים בחלון מתגלגל של 30 הימים האחרונים של הנתונים.הגיל הזה מנע את המודל מלהפוך ל-Stale.המערכת התאחדה עם מנוע ניקוד בזמן אמת, אשר החזיר הסתברות בתוך 20 שניות, פגישה של הבנק לבקשות עצלות.

שיעור מהיישום הבנקאי

  • (FLT:0) נושאים מגוונים של מגוון חומרים.FLT:1, תכונות ממוקדות עסקאות לבד אינן מספיקות.שילוב ביומטריות התנהגותיות (למשל, הקלדת מהירות, תנועות עכבר) ונתונים פרופיל לקוחות (למשל, גודל כרטיס ממוצע, שעות קניות טיפוסיות) עלייה בשיעורי זיהוי ב- 15%.
  • (FLT:0) טיפול בחוסר איזון הוא לא ניתן להשגה.שערים של ההרחבה ( 1:1 מקרי הונאה מיוצגים רק 0.2% של עסקאות.הבנק השתמש בלמידה רגישה בעלות (כפי שחתימה עלות השגויה גבוהה יותר לשלילים כוזבים) ו-SMOTE מפריזמה לאזן את מערך האימונים, אשר השתפר ללא להקריב דיוק.
  • (FLT:0) הסבירות הרווחת אמון בעלי המניות.FreaLT:1) הוצגו נתיבי ההחלטות של העץ בלוח מחוונים חזותיים, מה שהופך אותו קל עבור קציני סיכון לאשר פריסת מודל וללקוחות להבין עסקאות מופחתות במהלך סכסוכים.

מחקר מקרה מורחב 2: E-commerce Platform

פלטפורמת מסחר אלקטרוני בגודל בינוני המתמחה בסחורות דיגיטליות העומדות בפני הפסדים גוברים מנטילת חשבון (ATO) והונאה של צד ראשון (הונאה ידידותית) החברה יישמה מודל עץ החלטה המאכיל עם תכונות כולל גיל חשבון, מספר עסקאות שנויות במחלוקת בעבר, מוניטין של תחום הדואר האלקטרוני, מכלול ה- IPlocation, והיחס של העסקה לממוצע ההיסטורי של המשתמש.

הפלטפורמה גם השתמשה בעצי ההחלטות כבסיס כדי להשוות נגד מודל ⁇ -boosting (XGBoost) בעוד XGBoost השיג מעט גבוה יותר AUC, עץ ההחלטות היה מעדיף את השקיפות שלו, במיוחד כאשר הסבירו החלטות לגבות למעבדים בתשלום.מערכת הייצור הסופית השתמש בגישה היברידית: מסנן מבוסס חוק (למשל, חסימת עסקאות מ- IP גרועים) ואחריו ההחלטה למקרים של גבול.

המונחים: E-commerce Deployment

  • (FLT:0) שילוב עם שיטות הרכב.FLT:1 עץ החלטה יחיד שימש לפירוש בשכבה הראשונה, אבל יער אקראי טיפל בהחלטות מורכבות גבוהה בשלב השני.המערכת המשולבת הפחיתה את החיובים השקריים ב-22 אחוזים בהשוואה לשימוש במודל בלבד.
  • (FLT:0) הנדסה הנדסית מניע ביצועים.FLT:1 יצירת תכונות מצטברות (למשל, גלגול 24 שעות ספירת עסקאות, סכום ממוצע לכל מכשיר) באופן משמעותי מפורש באמצעות שדות גלם.הצוות גם מוצפן משתנים קטגוריאליים כמו מדינת המשלוח באמצעות טבילה, אשר שיפרה את פיצולי העץ.
  • (FLT:0) ניטור מתמיד של סחף.FLT:1, זכר המודל נבדק שבועי.כאשר גל חדש של התקפות "קארד" הופיע (עסקאות קטנות התפשטו על פני סוחרים רבים), הביצועים של העץ צנחו.מחיל עם תכונות חדשות (למשל, מהירות עסקה לסוחר) שיקפו יעילות בתוך 48 שעות.

מקרה מחקר: תביעות ביטוח

נכס גדול וביטוחי אחריות אקראיים הגישו עצי החלטה כדי לזהות תביעות הונאה וביטוח ביתי.תכונות כללו סכום תביעה, זמן בין אירוע להגשת תביעה, היסטוריה של תביעה מוקדמת, ציון האשראי של בעלי המדיניות, ואם האירוע דווח בסוף השבוע. עץ ההחלטות זיהה כי תביעות שהוגשו בתוך 48 שעות של תאונה, יחד עם תביעה מוקדמת של אותו סוג של נזק, היו 80% יותר סבירות להיות מתועבה של 21% עבור בדיקה ידנית של 30 מיליון דולר.

תובנות מעשיות מביטוח

  • (FLT:0) המומחיות Domain מעשירה את בחירת המאפיין.FreaLT:1 אנליסטים של ההונאה של המורדים זיהו "קוד zip רפואי תואם למיקום טיפול" כתכונה רבת עוצמה שבודדה רק לוכדת תוכניות תאונות רבות.
  • (FLT:0) ,הריצה מונעת מהתאמה להונאה היסטורית.FLT:1 העץ נפרץ לעומק של 8 רמות למניעת דפוסי למידה שהיו ספציפיים מדי ל טבעות הונאה קודמות.
  • (FLT:0) אינטגרציה עם זרימת עבודה: FIRLT:1) תפוקה עץ ההחלטה לא הייתה "בלוק / allow" מוחלט, אלא ציון הונאה מ 0 עד 100. תביעות עם ציון מעל 70 הונחו באופן אוטומטי לחוקרים בכירים, בעוד ציוני בין 50-70 גרם אימות אוטומטי בהיר יותר.

שיטות טובות ליישום עצי החלטות בגילויי הונאה

ציור מהמחקרים והניסיון בתעשייה לעיל, הנהלים הבאים ימקסימו את ההצלחה כאשר הם פורסים עצי החלטות לאיתור הונאה.

איכות נתונים והכנת

(המידע על גילויי הונאה הם מלוכלכים לשמצה: ערכים חסרים, קודים לא עקביים, ופרטים חיצוניים. עצי החלטות הם חזקים אל מחוץ לערים, אך סובלים מהנתונים החסרים ללא הגבלה עם אמצעי תקשורת או מצב, או ליצור קטגוריה נפרדת "לא ידועה" עבור משתנים קדמיים קדמיים.וודא כי הנתונים ההיסטוריים משקף את הנוף הנוכחי - ללא הכשרה נתונים (למשל, סימולציות) של שיטות זיהוי מוקדם יותר של הונאה (FID) הוא יעיל של נתונים לפני כן, כלומר: 1.com) הוא יעיל של נתונים לפני כן, כלומר: 1.

המונחים: Class Imמאזן

הונאה היא נדירה - לעתים קרובות פחות מ 1 אחוזים של עסקאות.ללא תיקון, עץ החלטות יכול פשוט לחזות "לגיטימי" עבור כל המקרים, להשיג דיוק 99 אחוזים אבל אפס זיהוי הונאה. השתמש למידה רגישה על ידי התאמת פרמטר משקל הכיתה (למשל, פיסול למידה של ROCLT:0), טכניקות oversampling כמו SMOTE, או דגימות תחת הרוב, להעריך באופן חמור של דיוק של נתונים של AUC.

בחירה והנדסת

עצי ההחלטות בוחרים באופן אוטומטי את התכונות המודיעיניות ביותר במהלך יצירה מפוצלת, אך מתן תכונות לא רלוונטיות רבות מדי יכול להוביל להתאמה יתר.התחל עם קבוצה מונחה על ידי מערכת מבוססת תחומית של 20-30 תכונות (כמות transaction, תדירות, גיאוגרפיה, מידע למכשיר, דפוסים התנהגותיים) ואז להשתמש בציונים חשובים מעץ ראשוני כדי להוריד תכונות נמוכות של אבחון.

מודל Pruning and Regularization

עץ מבוגר לחלוטין יכול להפריז ברעש ולהשיג דיוק אימון מושלם, אך נכשל בנתונים חדשים. השתמש בטכניקות של קידוד:

  • (ב) §0 (Pre-pruning: FLT:1hil Limit Limitמקסימום עומק (למשל, 10-15 רמות), דגימות מינימום עלה (למשל, 50), או ירידה מינימלית.
  • (ב) ⁇ :0) לאחר סיום: "ה'ה' (ב') ,"ה' (ב') ,"ה', "ה'"ה'" (ב') ,"ה') ,"ה', "ה'ה'והיה'" (ב') ויקרא י"ב') ,"ה'"ב"ה'"ה'"ה'"ה'"ב'"ה'"ה'"ה'"ה'"ב"ב"ה'"ה'"ה'"ה'"ה'"ה'"ה'"ה'"ב'"ה'"ה'"ב'"ב"ב'"ה'"ב'"ב'"ב"ב"ב'"ב'"ב'"ב'"ב'"ב'"ה'"ה'"ה'"ה'"ב'"ה'"ב'"ב'"ה'"ה'"ב'"ה'"ה'"ה'"ה'"ב'"ה'"ב'"ב'"ב'"ב'"ה'"ב

בפועל, עץ מחוספס עם 20-50 משאיר לעתים קרובות איזון הפרשיות ודיוק לגילוי הונאה.

עדכון מודל קבוע ובדיקה

Fraudsters כל הזמן להתאים. לוח זמנים מהדהד על בסיס שבועי או דו-שבועי באמצעות הנתונים האחרונים. Monitor מפתח מדדים מדי יום - Recall, שיעור חיובי כוזב, וערך העסקה הממוצע מתפתל.קבע התראות אוטומטיות כאשר נזכר טיפות יותר מ 5 אחוזים או שיעור חיובי כוזב עולה על סף עסקי.יישום שליטה בדגמים כך שתוכל לחזור אם retraining ביצועים מחדש של רמות מעקב (למשל, לדוגמה, ירידה).

שילוב עם טכניקות אחרות

עצי ההחלטות עובדים לעתים רחוקות בבידוד.

  • (FLT:0) ,Rle מבוסס לפני סינון: ⁇ FLT:1 השתמש בחוקים ⁇ סטים (למשל, חסום עסקאות ממדינות נונות) לפני שהבקיע עם העץ.
  • (FLT:0) שיטות של אורג"ב: FLT:1 Forests Random או ⁇ -boosted עצים (XGBoost, LightGBM) בדרך כלל מחלחל עץ אחד בלבד כאשר מודל הפרשיות הוא רב-חשיבות; אחרת, פריסת הרכב והשימוש ערכי SHAP להסבר.
  • (FLT:0)Layeredגילוי: FLT:1 לעבור עסקאות ממושכות למודל משני (למשל, רשת עצבית או תוקפנות לוגיסטית) לקבלת החלטה סופית.

(ב) [15] מניעת הונאה של FLT:0;0) ,5 , 000, מיפוי הונאה הונאה הונאה הונאה לרמות את הסדינים של ההרחבה 1 (FLT:1 ), מציע הדרכה מעשית על שילוב גישות מבוססות חוק ו-ML.

סליחות וסבירות

בתחומי שיפוט כמו האיחוד האירופי (GDPR) ובתקנות פיננסיות (למשל, חוק דיווח אשראי הוגן), החלטות אוטומטיות חייבות להיות ניתנות לתיאור. עצי ההחלטות הן התאמה טבעית כי ניתן להדפיס את הנתיב של כל עסקה כמערך של אם כן כללים.ספק בעלי עניין עם רשימת העליון-3 סיבות (למשל, "מבוטלים כי סכום של 500 דולר וחשבון חדש <30 ימים ומשלוח להובלת מטען קדימה), כאשר ניתן להימנע מבחירה מורכבת).

אתגרים ומגבלות

עצי ההחלטות אינם כדור כסף.הם נוטים להיות לא יציבים - שינוי קטן בנתונים אימון יכול לייצר עץ שונה לחלוטין.שחלות זה יכול להיות מופחת על ידי השקיה (יער מולד) או באמצעות הגדלת, אבל בעלות של הפרשנות.בנוסף, עצי ההחלטות מתקשים ללכוד אינטראקציות נדירות בין תכונות אלה, אלא אם כן דפוסים אלה הם מופעלים במפורש.

הגבלה נוספת היא הנטייה לשכפל דפוסים מוטהים בנתונים של הכשרה – למשל, לדגל עסקאות באזורים גיאוגרפיים מסוימים כהונאה אם אזורים אלה היו מיוצגים יתר במקרים הונאה בעבר. טכניקות הונאה, כגון משקל או הדבקה, יש ליישם באופן שיטתי במהלך אימון מודל כדי להבטיח הוגנות.

כיוונים עתידיים

הדור הבא של מערכות זיהוי הונאה משלב יותר ויותר מודלים המבוססים על עץ החלטות עם רשתות עצביות ללכוד טבעות הונאה (למשל, קשרים בין מכשירים, IPs וחשבונות) להסביר יכולת עדיין מוקד מחקר מפתח; מאמצים כגון "עצי החלטות בלתי פתורים" ו"עצים החלטה רכה" שואפים לשמור על יכולת הפירוש תוך השגת דיוק קרוב יותר ללמידה עמוקה, למידה אוטומטית (AutoML) פלטפורמות עכשיו מכוון באופן אוטומטי החלטות היפרדות, ואפקטים של שיטות חשיבה, ללא קשר לשיטות אבטחה, חשיבה ידנית.

מסקנה

עצי ההחלטות נשארים כלי יסוד בזיהוי הונאה בשל הפרשנות שלהם, קלות הפריסה, ויכולת מודל גבולות החלטה מורכבים עם כללים ברורים. יישום בעולם האמיתי בבנקאות, מסחר אלקטרוני, ביטוח להוכיח כי כאשר בשילוב עם נהלי נתונים חזקים, הנדסה תכונה זהירה, וגילוי קבוע, עצי החלטה יכולים לספק שיעורי זיהוי גבוהים תוך שמירה על חיובי כוזב.