הסגמנטציה היא אבן הפינה של ניתוח נתונים, המאפשר לארגונים לחשוף דפוסים, חוויות אישיות והחלטות נהיגה. גישות מסורתיות מסתמכות לעתים קרובות רק על שיטות מבוקרות כמו עצי החלטות או שיטות לא מבוססות כמו קיבוץ.אבל לכל אחד יש כתמים עיוורים, עצי החלטות צריכים מטרה מוגדרת מראש, ויכולים להחמיץ מבנים נסתרים בנתונים. Clustering מגלה קבוצות טבעיות אבל אין אפשרות להסביר כללים עבור נקודות משותפות עם עצירות אלה, הן קבוצות עבודה מרשימות, הן על ידי קבוצות פעילות גופנית, הן על פני קבוצות עבודה שונות, הן על פני קבוצות פעילות גופנית, והן על פני קבוצות של מערכות יחסים של מערכות אבטחה, הן על פני קבוצות של פעולות מבוזרות, הן, הן, הן, הן, אשר יכולות שונות, והן על פני קבוצות של מערכות אבטחה מרשימות, הן על פני קבוצות של מערכות אבטחה, והן מרשימות, הן מרשימות, הן על ידי אלגוריתמיות, הן מרשימות, והן על פני קבוצות שיווק חזקות של מערכות אבטחה מרשימות, הן, הן על פני קבוצות טבעיות, אשר יכולות לספק אלגוריתמיות, אשר יכולות שונות, הן על פני מערכות מידע מרשימות, הן, הן, הן, הן, הן, הן על פני מערכות אבטחה מרשימות, אשר יכולות לספק אלגוריתמיות, הן על פני קבוצות טבעיות, הן מרשימות, אשר

הבנת עץ

עצי ההחלטות הם מודלים למידה בפיקוח שחיזוי משתנה מטרה על ידי פיצול חוזר של הנתונים על ערכים תכונה.כל פיצול יוצר צומת ששואלים שאלה כן / לא שאלה - לדוגמה, "גיל > 30?" - ואת הנתיב משורש לעלים מסתיים בחיזוי.האלגוריתם בוחר פיצולים הממקסמים את רווח המידע (או להפחית את הנחיתות) בכל שלב.

עצי ההחלטות פופולריים מאוד כי הם מפרשים.העץ המתקבל ניתן לדמיין כמערך של אם-אז כללים שמומחים בתחום יכולים להבין ולאמת.הם זקוקים לעיבוד נתונים מינימלי (לא סקאלה הנדרשת) ויכולים להתמודד עם תכונות מספריות וקטגוריות.עם זאת, יש להם מגבלות על פני השטח, במיוחד אם הם גדלים ללא חלוף עמוק, הם גם מעדיפים דפוסים גלובליים, לעתים קרובות חסרים, מבנים מקומיים.

להבין את ה-Clustering Algorithms

אלגוריתמים קלוסטרינג אינם מבוססים: הם מחלקים נתונים לקבוצות המבוססות על דמיון ללא כל תוצאה מתוייגת.כל נקודה שייכת למקבץ כזה נקודות באותו אשכול דומות יותר זה לזה מאשר נקודות במקבץ אחר.ההגדרה של "סימיות" תלויה באלגוריתם. K-Means משתמשת במרחק וצורות sphericals.DBAN משתמשת בדחיסות של עץ.

קלוסטרינג מצטיין בגילוי מבנים טבעיים חבויים בנתונים.זה יכול לחשוף קטעים כי אנליסט אנושי מעולם לא היה יכול להיחשב.אבל זה אינו מציע כללים מפורשים מדוע נקודה הוצבה למקבץ.המקבץ רגישים גם ל ראשונית, סקאלה, ויפרפרפרפרפרפרפרפרמטרים.רוב, דבר שלא מספק מודל שיכול לסווג נתונים חדשים ללא הפעלת כל כולו - אלא אם כן, כדי למלא את האלגוריתם החדש (Dan-Dans) כדי למלא את האלגוריתם (Dan-Dan-Dans) או את האלגוריתם).

למה לשלב? – הסינרגיה

שילוב עצי ההחלטות עם שילוב כתובות החולשות של כל שיטה.זרימת העבודה המשולבת עובדת בשני שלבים:

  1. שלב ה-FLT:0 (Clustering Phase:FLT:1 החל אלגוריתם בלתי מבוקר כדי לגלות את הקבוצות הטבעיות בנתונים.שלב זה אינו דורש כל תוויות ומגלה קטעים שעשויים להתאים לסוגים של לקוחות, תת-סוגים של מחלות או קבוצות התנהגותיות.
  2. (FLT:0) שלב מאויש: FLT:1 השתמש במשימת אשכול כמשתנה מטרה חדש.רכבת עץ החלטה לחזות איזה נקודת נתונים שייכת על סמך ערכיו.העץ המתקבל ניתן להשתמש כדי לסווג נתונים חדשים לאותו פלח שנחשף, ללא שכפול מחדש.

סינרגיה זו מעניקה לך את הטוב ביותר של שני העולמות: העץ מספק מודל מפרש, מבוסס חוק שניתן לפרוס בייצור.הקבצים עצמם נגזרים מהמידע ולא על ידי תווית.העץ גם עוזר לך להבין אילו תכונות חשובות ביותר במבדיל את הסבים, המציע תובנות לגבי מה מגדיר כל קטע.

שלב-בי-Step Methodology

שלב 1: הכנת נתונים וחקירה

התחל עם מחקר נתונים מעמיק. השתמש בנתונים סטטיסטיים סיכום, הולוגרמות, וזוג מזימות כדי להבין התפלגות, קורלציות וערכים חסרים.נקה את הנתונים: לטפל בערכים החסרים (פשוטים או ירידה), להסיר לשכפלות, ולטיפול ב-Outliersly. תכונת תכונה חשובה עבור אלגוריתמים מקובצים מבוססי מרחק כמו K-Means; סטנדרטיזציה תכונות מספריות כך שכל התכונות התורמות לעץ-ה, אך לא נחוץ מדי, אך הן למולקולות קריטיות, אך הן למולקולות, אך הן למולקולות, אך הן למולקולות, אך הן יכולות לשלב אותן תכונות סטנדרטיות, אך הן למולקולות ספציפיות, אך הן למולקולות ספציפיות, אך הן למולקולות ספציפיות, אך הן למולקולות, אך הן למולקולות, אך הן למולקולות ספציפיות, אך הן למולקולות ספציפיות יותר מדי, אך הן למולקולות ספציפיות יותר מדי, אך הן למולקולות ספציפיות, אך הן למולקולות ספציפיות, אך הן למולקולות קריטיות עבור תכונות סטנדרטיות, אך הן למולקולות ספציפיות, אך הן יכולות למולקולות ספציפיות, אך הן למולקולות מדויקות עבור תכונות סטנדרטיות, אך הן יכולות למולקולות ספציפיות, אך הן למולקולות ספציפיות, אך הן למולקולות קבועות של אלגוריתמיות למולקולות מדויקות עבור תכונות מדידה

שלב 2: החל את אלגוריתאם

בחר אלגוריתם המבוסס על גודל הנתונים שלך ואת המבנה. עבור אשכולות נקיים, גלוברומיים, K-Means עובד ביעילות על מסדי נתונים גדולים. עבור צורות לא סדירות או שונות של ד"ר או OPTICS הם טובים יותר. Determine מספר של אשכולות (עבור K-Means) באמצעות שיטת המרפק, ציון צללית, או ידע.

שלב 3: תייגו נתונים עם Cluster Assignments

צור עמודה חדשה בנתוניך: "cluster id" זה הופך למשתנה היעד לעץ ההחלטות. Merge תוויות הקוביות בחזרה לתוך ערכת התכונה המקורית (תכונות לא מזוקקות הן בסדר עבור העץ; אתה יכול להשתמש או בקנה מידה או לא בקנה מידה). העץ ילמד את המיפוי מתכונות מקוריות למקבץ.

שלב 4: לאמן עץ החלטה כדי לחזות תוויות קלוסטר

לחלק את הנתונים שלך לאימון ובדיקות (למשל, 80/20) לאמן עץ קצה עץ החלטה (למשל, ספקטרום של פיסול-לימוד:0) באמצעות התכונות המקוריות כמו צופים ואת תוויות הקוביות כמו המטרה. Set a Fit hyperparameters: הגבלת עומק עץ כדי להימנע מהתאמה (למשל, מקסימום) = דגימות מינימום = אינדקס (pcupit) כלומר, לדוגמה, דיוק משקף את ה-pcuptex pate.

שלב 5: בין-pret ו-Visualize The Tree

בחנו את כללי ההחלטה של המחקר.דפס או הרכיבו את העץ כדי לראות את הפיצולים ואת עלות עלים תואמים לקטע (קלוסטר) העץ אומר לכם שתכונות חשובות ביותר למבדיל בין אשכולות. לדוגמה, כלל כמו "אם הגיל והגיל; 40 והכנסה; 60k)" נותן תיאור אנושי של הפרשיות זו הוא יתרון מפתח בלבד: לא יכול גם להציג את הכללים המכוון.

שלב 6: עיין העץ עבור נתונים חדשים

לאחר אימון, עץ ההחלטות יכול לסווג כל נקודת נתונים חדשה, בלתי נראית לאחת מהמקבצים המקוריים ללא איסוף מחדש.זה קריטי עבור יישומים בזמן אמת כגון המלצות או ניקוד הונאה מותאמים אישית.מודל העץ יכול להיות סידורי ומשולב לתוך צינור ייצור. הערכת ביצועים לאורך זמן: אם העברת הנתונים, ייתכן שיהיה עליך להפעיל מחדש את המחזור מחדש ואת תקופת העץ.

שיקולים מעשיים

בחירתו של האלגורים הנכונים

הצלחת הגישה המשולבת תלויה במידה רבה באיכות של הסקטורים. K-Means מניח convex, אשכולות איזוטרופיים ועובדת בצורה הטובה ביותר עם תכונות רציונאליות, לשקול K-Modes או גישה מבוססת דיסימיות.DBSCAN הוא חזק כדי לגלות אלגוריתמים חיצוניים, אך דורש פרמטרים לא-פעמיים זהירים.

קביעת מספר האופטימי של קלסטר

עם K-Means, שיטת המרפק מבססת את האינטרטי (של מרחקים מרובעים) מול k. נקודת "האלבו" מציעה k טוב, אבל זה לא תמיד ברור.ציון הצללית הממוצעים כמה נקודות דומות למקבץ שלהם בהשוואה למקבץ אחר; ציון גבוה יותר מצביע על הפרדה טובה יותר.

איזון בין-תחומיות ובינלאומיות

עץ החלטות שמשכפל בדיוק את המקבץ עשוי להיות עמוק ומורכב מאוד.לפרשיות, לעץ: להגביל את העומק ל- 4-6 רמות, או להשתמש בעומס עלות-המסחרי מקובל כל עוד העץ המנוצל עדיין משיג דיוק מקובל על סט הבדיקה.אם דיוק טיפות יותר מדי, שקול אם הקובעים באמת ניתנים להפרדה על ידי כללים פשוטים; אם לא ניתן לייצר אלגוריתם חפיפות או מכווץ.

עקבו אחרי Large Datasets

גם אימון עץ וגם מקבץ יכול להיות יקר חישובי על מיליוני שורות.עבור K-Means, להשתמש Mini-Batch K-Means עבור מהירות. DBSCAN איטי יותר עם נתונים גדולים; לשקול OPTICS או HDBSCAN. עבור עצי החלטות, יישום של scikit-learnt-learning הוא סביר קנה מידה, אבל עבור נתונים מסיביים, לשקול שימוש בשיטה כמו יערות אקראיים (למרות שזה יכול להיות ייצוג מלא של ספירת) עם ספירת ספירת ספירת ספירת ספירת ספירת עץ).

יישומים אמיתיים

שירות לקוחות בשיווק

שווקים רוצים לאסוף לקוחות לקטעים המבוססים על התנהגות, דמוגרפיה והיסטוריית רכישה.לא מקיפים את נתוני העסקה יכולים לחשוף פלחים כמו "לקוחות נאמנים בעלי ערך גבוה", "מחפשים נתונים", ו"משתמשים חדשים" עץ החלטה המאומנים על תוויות יכול לשמש כדי לסווג כל לקוח לתוך פלח באופן אוטומטי, המאפשר קמפיינים מותאמים אישית.לדוגמה, כלל כגון "אם רכישות ו- 5GT; תקן שיווק ממוצע (A) מאפשר קביעת 50 דולר) מאפשר קביעת חשבונות שיווק באופן אוטומטי.

גילוי דעת ב Cybersecurity

נתוני תעבורת רשת יכולים לחשוף דפוסי תנועה רגילים ומבודדים אשכולות יוצאי דופן (אזורים נמוכים או נקודות חריגות) לאחר שציינו את הקובעים, עץ ההחלטות יכול ללמוד להבחין בין נורמלי לבין תנועה בלתי-רגילה.ניתן לתרגם את כללי העץ לחוקי אש או IDS. לדוגמה, עלה עשוי לומר "אם פרוטוקול = TCP ו-pack & אורכו; 1500 על ידי נמלים ו- 22 אנליסט זה היה גורם לאנליסט אבטחה."

טיפול רפואי

בבריאות, חולים יכולים להיות מקובצים על סמך סימפטומים, תוצאות מעבדה ונתונים גנטיים לזהות תת-סוגים של המחלה. עץ החלטה המאומנים על הקצאות אשכולות יכול לחזות תת-סוג של מטופל חדש מתכונות שנמדדו בצריכה.הפיצול של העץ מספק למטפלים עם קריטריונים: "אם סוכר בדם וגילום; 126 ו- BMI; 30 (Type 2) זה לא רק גורם לחולים שקופה, אלא גם תמיכה ברזולוציה קלינית, אלא גם כן, אלא גם טיפוליתרפיסטפית, אלא גם כן, אלא גם טיפול פסיכולוגי.

היתרונות של הגישה המשולבת

  • (FLT:0) דיוק פלחציה מפורט: 1 (FreaLT:1) צעד המקבץ לוכד דפוסים טבעיים, לעתים קרובות לא לינאריים שעץ החלטה יחיד עלול להחמיץ.העץ מאמת ומסדיר את הדפוסים האלה, ומבטיח כי החלקים הם הדדיים וברורים.
  • (FLT:0 יחסיות ושקיפות: FLT1 עצי החלטה מספקים במפורש אם - אז כללים המסבירים מדוע נקודת נתונים שייכת לסעיף.זה בלתי חוקי לדרישות רגולטוריות (למשל, להסביר החלטות סיכון אשראי) ולבניית אמון עם בעלי עניין.
  • (FLT:0)Deployancy: 1FLT) עץ ההחלטות יכול לסווג נקודות נתונים חדשות באופן מיידי וללא איסוף מחדש.
  • (FLT:0) תובנות של פרופ' פְּטְטְטְטְטְטְטְטְטְטְטְטְטְטַב: 1:1 חשיבותו של העץ ונקודות מפוצלות מגלה אילו תכונות הן האחראיות ביותר להפרדה בין אשכולות.
  • (FLT:0) calScalability:0) , ניתן להשוות את זרימת העבודה ומדורגת. Mini-Batch K-Means ו- עץ הדרכה בקנה מידה טוב למאגרי נתונים גדולים, בתנאי הקצאות אשכולות נקובות על מדגם נציג אם יש צורך.
  • (FLT:0) רובוטות לנסח את הרעיון: FIRLT:1 כאשר השינויים בהפצת נתונים בבסיס, ניתן לחדור במהירות את העץ על תוויות אשכולות חדשות (אם ניתן לשחזר מחדש) או לתקן את הזמן.

מסקנה

[שלב] עצי החלטות עם אלגוריתמים מקובצים היא אסטרטגיה מעשית ורבת עוצמה לפיצול שדוחפת את הפער בין חקר בלתי מבוקר וחיזוי מבוקר, היא מממנת את המבנה הטבעי שהתגלה על ידי קיבוץ ומבנה נייר קיים, אשר ניתן לפרוס את הטבע של עצי ההחלטות: המתודולוגיה היא פשוטה: נתונים מסורקים וספקת נתונים חדשים לחיזוי תוויות, ולאחר מכן להשתמש בעץ לצורך טיפול הולם בנתונים, הכנה, או בחירה הדדית, או אחרת, בין אם אתה מספק גישה חלופית: