Table of Contents
הנדסה תכונה היא אחד השלבים הקריטיים והמשפיעים ביותר בבניית מודלים יעילים ללמידה מכונה.זה כרוך באמנות ובמדע של הפיכת נתונים גולמיים לתכונות משמעותיות שמשפרות באופן משמעותי את ביצועי המודל, הדיוק, ואת יכולות ההכללה.זה תהליך של מיצוי מידע משמעותי מהנתונים הגולמיים והופכת אותו לתכונות הממקסימות את הכוח החיזוי של המודל שלך.
מדריך מקיף זה חוקר את המושגים הבסיסיים, טכניקות מעשיות, ושיטות הטובות ביותר עבור הנדסה תכונה.We נבחן את התיאוריה הבסיסית, לספק דוגמאות בעולם האמיתי, לדון כיצד ליישם שיטות אלה ביעילות על פני תרחישים למידה מכונה שונים.עד סוף מאמר זה, יהיה לך הבנה מעמיקה של איך להפוך את הנתונים הגלום שלך לתכונות עוצמתיות המאפשרות מודלים שלך ללמוד ביעילות רבה יותר ולעשות תחזיות טובות יותר.
ידע על הנדסת תכונות: הקרן של Machine Learning Success
הנדסה תכונה היא תהליך של בחירה, מניפולציה וטרנספורמציה של נתונים גולמיים לתכונות שניתן להשתמש בהם בלמידה מבוקרת.תהליך זה משמש גשר בין נתונים גולמיים, לא ממובנים וקלטים מוכנים מודלים כי אלגוריתמי למידת מכונה יכולים לעבד ביעילות. אלגוריתמי למידת מכונה אינם מבינים טקסט, תמונות, או משתנים קטגוריאליים - הם זקוקים לתכונות שהפכו לייצוגים מספריים.
למה דווקא הנדסה
מטרת הנדסה ובחירה תכונה היא לשפר את הביצועים של אלגוריתמי למידת מכונה. וכתוצאה מכך, דיוק מודל על נתונים בלתי נראים משתפר.איכות ורלוונטיות של תכונות ישירות לקבוע כמה טוב מודל למידת מכונה יכול ללמוד דפוסים ולבצע תחזיות מדויקות.אפילו האלגוריתמים המתוחכמות ביותר יאבקו לספק תוצאות טובות אם מסופקים עם תכונות מונדסות בצורה גרועה.
הנדסה תכונה מכריחה אותך לחפור עמוק יותר לתוך הנתונים שלך, חשיפת דפוסים ומגמות שאולי התעלמו מהם. ההבנה עמוקה יותר של הנתונים שלך לא רק משפרת את ביצועי המודל, אלא גם מספקת תובנות חשובות לבעיה הבסיסית שאתה מנסה לפתור. מדעני נתונים לעתים קרובות מבלים חלק משמעותי מהזמן שלהם על הנדסה תכונה כי יש השפעה כה עמוקה על תוצאות המודל.
באופן כללי, אנו יכולים לחלק את ההנדסה תכונה לשני מרכיבים: 1) יצירת תכונות חדשות ו- 2) עיבוד התכונות האלה כדי להפוך אותם לעבוד בצורה אופטימלית עם אלגוריתם הלמידה תחת שיקול דעת. שני הרכיבים הם הכרחיים ודורשים שיקול זהיר של המאפיינים הנתונים, ידע התחום, ואת הדרישות הספציפיות של אלגוריתמי למידת המכונה שאתה מתכנן להשתמש.
היתרונות העיקריים של הנדסה
הוא מורכב מחמישה תהליכים: יצירה תכונה, שינויים, מיצוי תכונה, ניתוח נתונים ומחקר.כל אחד מהתהליכים האלה ממלא תפקיד חיוני בהכנת הנתונים שלך ללמידה מכונה:
- (FLT:0) יצירת מופת: FLT:1 לפתח תכונות חדשות מהנתונים הקיימים באמצעות ידע דומיין ויצירתיות
- (ב) ⁇ (ב"ה) ⁇ :0) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) ,0) ,העברה של כפלת מימדים, תוך שמירה על מידע חשוב
- מחקר נתונים:0 (Exploratory Data Analysis: FLT:1הבנת הפצת נתונים, מערכות יחסים ובעיות פוטנציאליות
- (ב) ⁇ :0) ⁇ : ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
טכניקות הנדסה
הבנה ויישום של טכניקות הנדסיות תכונה נכונה היא חיונית לבניית מודלים חזקים של למידת מכונה. בואו לחקור את השיטות החשובות ביותר בפירוט, לבחון מתי וכיצד להשתמש בכל טכניקה ביעילות.
מיפוי: נורמליזציה וסטנדרטיזציה
קנה מידה הוא צעד עיבוד קריטי בלמידה של מכונה כי מנרמל את טווח התכונות, להבטיח שהם תורמים באותה מידה לתהליך הלמידה של המודל.ללא קנה מידה הולם, תכונות עם טווחים מספריים גדולים יותר יכולים לשלוט בתהליך הלמידה, למנוע את המודל לזהות דפוסים חשובים בתכונות בקנה מידה קטן יותר.
מאז מגוון הערכים של נתונים גולמיים משתנה באופן נרחב, באלגוריתמים של למידת מכונה, פונקציות אובייקטיביות לא יעבדו כראוי ללא נורמליזציה.חשבו על כך שמודל נתונים המכיל את שניהם הגיל ( החל מ 0-100) והכנסה (החל מ 0-1 000) ללא דרוג, התכונה ההכנסה לשלוט חישובים מרחק ואופטימיזציה של ירידה ⁇ פשוט בשל גודלו הגדול, לא בגלל שזה חשוב יותר עבור תחזיות.
סטנדרט (Z-Score Normalization)
סטנדרטים של סטנדרטים על ידי מצע המשמעות והחלוקת של הסטייה הסטנדרטית.זה הופך את הנתונים כך שיש תכונות אפס משמעות וחלופה יחידה, אשר מסייע מודלים רבים של למידת מכונה לבצע טוב יותר.הערכים הסטנדרטיים וכתוצאה מכך, הנקראים לעתים קרובות Z-scorescores, מייצגים כמה סטיית תקן הרחק מן המשמעות של כל ערך מקורי.
שיטה זו משמשת באופן נרחב לנורמליזציה באלגוריתמים רבים של למידת מכונה (למשל, תמיכה במכונות וקטור, רגרסיה לוגיסטית ורשתות עצביות מלאכותיות). סטנדרטיזציה יעילה במיוחד כאשר הנתונים שלך מחולקים כרגיל וכאשר אתה משתמש באלגוריתמים שמצביעים על תכונות במרכז אפס.
(ב) ,0) כאשר משתמשים בסטנדרט:
- Algorithms להשתמש מדדים מרחק - KN, K-Means, ו- SVM מחשבים מרחקים, כך תכונות צריכות קשקשים דומים כדי להימנע משליטה על ידי תכונות גדולות יותר.
- אופטימיזציה של הירידה הנידור - רשתות ניליות ותוקפנות ליניארית / תיאולוגית מתאחדת מהר יותר כאשר תכונות סטנדרטיות.
- רגרסיה קבועה: LASSO ו- Ridge regression מניחים כי תכונות הן באותו קנה מידה עם 0.
- ניתוח ראשוני: PCA מבוסס על השחלות, כך סטנדרטיזציה מבטיחה תרומה שווה מכל התכונות.
מינוס Min-MAX
ידוע גם בשם מינוף מדרגה או מינוס של Min-max, החלפה היא השיטה הפשוטה ביותר וכוללת בחיזוק טווח התכונות כדי לדרג את הטווח ב [0, 1] או [-1, 1] טכניקה זו משמרת את צורת ההפצה המקורית של הנתונים שלך תוך הבטחת כל הערכים ליפול בטווח מסוים מחויב.
נורמליזציה היא רגישה למדי לזרמים.אם יש לך ערך גבוה מאוד או נמוך מאוד, זה יכול לכווץ את רוב שאר הנתונים נקודות לחלק קטן מאוד של טווח [0, 1], עלול לאבד קצת מידע על ההבדלים היחסיים שלהם.זה שיקול חשוב כאשר בוחרים בין נורמליזציה וסטנדרטיזציה.
(ב) כאשר משתמשים בנורמליזציה:
- רשתות ניליות עם פונקציות הפעלה ספציפיות - Sigmoid ו- tanh הפעלה עובד הכי טוב עם קלט בטווח כבול כמו 0, 1.
- עיבוד תמונה - ערכי Pixel כבולים באופן טבעי (0-255) ונרמל ל- 0, 1) הוא תרגול סטנדרטי.
- כאשר אתה מכיר את גבולות המניין / המקס - אם הנתונים שלך יש גבולות טבעיים (כמו אחוז, דירוגים או ציונים), הנורמליזציה משמרת את הגבולות האלה.
רובוסט סקר מידע על נתונים חיצוניים-כבדים
Robust מדרגing, הידוע גם כסטנדרטיזציה באמצעות טווח Median ו-Interquartile (IQR), נועד להיות חזק יותר אל מחוץ לערים. כאשר הנתונים שלך מכילים מספר עצום של חומרים שאתה לא רוצה להסיר, דרוג חזק מספק אלטרנטיבה יציבה יותר לטכניקות סטנדרטיזציה.
עבור נתונים עם אאוטריירים, רובוסטקלר היא אפשרות טובה יותר.זה משתמש בטווח החציוני וה הבין-כוכבי (IQR) במקום סטייה ממוצעת וסטנדרטית, מה שהופך אותו פחות רגיש לערכים קיצוניים. גישה זו מבטיחה כי לא פחות מאשרתנים לא להשפיע באופן לא פרופורציונלי על הפרמטרים הדרגתיים, וכתוצאה מכך התפלגות תכונות מאוזנות יותר.
המונחים: categorical Variables
מודלים של למידת מכונות לעתים קרובות נאבקים עם משתנים קטגוריאליים כי הם מסתמכים על קלטות מספריות. המרת נתונים קטגוריים לייצוגים מספריים חיוני עבור רוב אלגוריתמי למידת המכונה.עם זאת, שיטת הקידוד שתבחר יכול להשפיע באופן משמעותי על ביצועי המודל ופירושיות.
One Hot Encoding
One-Hot Encoding: צור עמודה בינארית לכל קטגוריה. Best for non-ordinal Data (למשל, "אדום", "כחול", "ירוק") טכניקה זו הופכת תכונה קטגורית אחת עם n קטגוריות לתכונות ננוריות, שבו כל תכונה חדשה מייצגת את נוכחות או היעדר קטגוריה מסוימת.
החלת קידוד חם אחד על תכונה קטגורית תיצור תכונה בינארית חדשה אחת עבור כל קטגוריה במשתנה קטגוריאלי זה.לדוגמה, תכונה "Color" עם ערכים (אדום, כחול, ירוק) יהיה להפוך לשלוש תכונות בינאריות: צבע אדום, צבע כחול, וצבע גרין, שבו לכל שורה יש ערך של 1 באחד העמודות אלה.
מאז מספר התכונות החדשות עולה ככל שמספר הקטגוריות עולה, טכניקה זו מתאימה לתכונות עם מספר נמוך של קטגוריות, במיוחד אם יש לנו מצגת קטנה יותר.אחד הכללים הסטנדרטיים של האגודל מציע יישום טכניקה זו אם יש לנו לפחות 10 רשומות לקטגוריה.
תוויות: Encoding
התווית: Assigns a integer לכל קטגוריה. אידיאלי עבור נתונים אורדיניים (למשל, "Low", "Medium", "גבוה"), כי יש דירוג או הזמנה לערכים שחשוב לדגם לגשת אליו. שיטה זו היא שימושית במיוחד כאשר המשתנים הקטגוריאליים שלך יש סדר טבעי או היררכיה זה צריך להיות שמור בייצוג המספרי.
עם זאת, להיות זהירים בעת יישום התווית נתונים שאינם מקובלים.מספרים עשויים להוביל את המודל כדי לסיים דירוג שבו אף אחד לא קיים, כך אינדיקטורים בינאריים נמנעים מכך.לדוגמה, ערים אנתרופולוגיות כמו 1, 2, 3) עשויים להציע באופן שגוי כי העיר 3 היא "גדולה יותר" מעיר 1, כאשר במציאות אין מערכת יחסים כזו.
עקבו אחרי Missing Data
נתונים חסרים על תכונות מפתח יכולים לעכב את דיוק הדוגמנות והחיזוי של דיוק, בהתייחסות נכונה לערכים החסרים היא חיונית לבניית מודלים חזקים.האסטרטגיה שתבחר צריכה להיות תלויה בטבע הנתונים שלך, כמות המידע החסר והדפוסים בחסרונות.
על ידי שימוש בטכניקות של מזהמים, כגון הערכת ערכים חסרים המבוססים על נתונים הזמינים כמו אזור הנכס, מודל ה-ML יכול להפוך תחזיות מושכלות יותר, הבטחת תוצאה חזקה ואמינה יותר.
- (ב) [15] ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) ,0) ,ההתמדה: 1 , כאשר אנו משתמשים בערכים התכופים ביותר לתכונות קטגוריות
- (ב) ,0) ,3 (בחזרה): "החלל 1" (בשיתוף) בערכים קודמים או הבאים בזמני זמן
- (ב) אלגוריתמים:0) אלגוריתמים המבוססים על מכונות (Model-based Imputation: FIRLT:1) באמצעות אלגוריתמי למידת מכונה כדי לחזות ערכים חסרים
- (ב) ,0) כתב העת "מחדש" (בתרגום חופשי: ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
יצירת תכונות אינטראקציה
יצירת תכונות אינטראקציה כוללת זיהוי יחסים בין תכונות קיימות לבין מניעת תכונות חדשות.תכונות אלה יכולות ללכוד דפוסים מורכבים כי תכונות בודדות עלולות להחמיץ, לעתים קרובות מוביל לשיפורים משמעותיים בביצועי המודל.
לדוגמה, בחיזוי מחיר הבית, חישוב גיל הבית על ידי תת-השנה הוא נבנה מן השנה הנוכחית מדגיש מגמות, כגון מחיר הבית יורד ככל שעובר זמן.
- תכונות קשורות מרובותplying (למשל, אורך × רוחב = אזור)
- יצירת יחסי (למשל, יחס חוב להכנסה)
- תכונות פולינומיות (למשל, x2, x3)
- שילובים ספציפיים של Domain-specific המבוססים על ידע מומחה
הפקה: Dimensionality Reduction
היא מתייחסת לגישות לטיפול בערכים חסרים ומדיקה לטכניקות החילוץ של תכונות כגון PCA, ICA, LDA, LLE ו- t-SNE. טכניקות אלה מסייעות להפחית את מספר התכונות תוך שמירה על המידע החשוב ביותר, אשר יכול לשפר את ביצועי המודל, להפחית את זמן האימון, ולעזור למנוע התאמה.
(FLT:0)Principal Component Analysis (PCAOVA)FLT) 1 הוא אחד טכניקות הפחתת המימדליות הנפוצות ביותר.זה הופך את התכונות המקוריות שלך למערך חדש של תכונות לא קשורות הנקראות רכיבים ראשיים, אשר צוינו על ידי כמות השחלות שהם מסבירים בנתונים.זה מאפשר לך לשמור על ההיבטים המודיעיים ביותר של הנתונים שלך תוך צמצום הממדים.
(FLT:0) שיטות החילוץ האחרות (FLT:1) כוללות ניתוח עצמאי (ICA) להפרדה אותות מעורבים, ניתוח קואר דיפלנטי (LDA) להפחתה של מימדיות בפיקוח, ו- t-SNE עבור הדמיה של נתונים על-ידי דחיסה גבוהה.כל טכניקה יש מקרים ספציפיים לשימוש והנחה כי צריך להנחות את הבחירה שלך.
שיטות בחירה: בחירת התכונות הנכונות
על ידי זיהוי המשתנים החיוניים והסרת משתנים אדומים ולא רלוונטיים, בחירת תכונה משפרת את תהליך הלמידה של המכונה ומגדילה את הכוח הנבאי של אלגוריתמי למידת מכונה. בחירת תכונה נבדלת ממיצוי תכונה - בעוד החילוץ יוצר תכונות חדשות, בחירת התכונות הרלוונטיות ביותר הקיימות.
שיטות סינון
שיטות מסנן להעריך תכונות עצמאיות מכל אלגוריתם למידת מכונה, באמצעות אמצעים סטטיסטיים כדי לזהות ולדרג תכונות. שיטות אלה יעילות חישובית וניתן ליישם אותן כצעד עיבוד לפני אימון מודל.
- (ב) ,0) אינטגרלציה יעילה: 1FLT:1 , measuring יחסים ליניאריים בין תכונות לבין המטרה
- (ב) מבחנים:0) ,Hy-square: FLT:1 , הערכת עצמאות בין תכונות קטגוריות ומטרות
- (ב) ⁇ :0) ,5 ,5 ,5 ,5 , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) ,0) ,Variance סף: 1FLT: 1 Removing תכונות עם שוניות נמוכות
שיטות של Wrapper
שיטות Wrapper להעריך תת-תחומים תכונה על ידי אימון ובדיקה מודל למידה מכונה ספציפי.בנוסף, זה דן שיטות בחירה תכונה שונות, כולל מסנן, עטיפה ושיטות משובצות. בעוד יקר יותר חישובי מאשר שיטות סינון, שיטות עטיפה יכול למצוא שילובים תכונה שעובדת הכי טוב עבור האלגוריתם הספציפי שלך.
שיטות עטוף נפוצות כוללות:
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) ,0) חזרה חיסול: החל מכל התכונות והסרת הסגולות
- (FLT:0) ביטול תכונה תכונתית: FLT:1 , Recursive Remove תכונות ובניית מודלים לזהות את החשובים ביותר
שיטות Embedded
שיטות Embedded לבצע בחירה תכונה כחלק מתהליך הכשרת המודל.שיטות אלה הן ספציפיות אלגוריתמית ולעתים קרובות לספק איזון טוב בין יעילות חישובית ואיכות בחירה.
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) ⁇ (ב"ה) ,"ה'" (ב"ד) ,"ה') ,"ה', "ה', כ"ד," (ב)"ה', "ה'" (ב"ב)
- חשיבותה של LT:0 [ה], על בסיס ה[[1924]]: [[1924]]]]]]
- (ב) [15] ,9) , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
טכניקות הנדסה מתקדמות
מעבר לטכניקות הבסיסיות, כמה שיטות מתקדמות יכולות לשפר את צינור ההנדסה תכונה שלך ולפתוח כוח חיזוי נוסף מהמידע שלך.
הנדסה מבוססת זמן
הפרק מכסה גם תכונות הקשורות לזמן, משתנים lag, תכונות חלון מתגלגל, ותכונות חלון מורחבות.כאשר עובדים עם נתוני הגרלות זמן או נתונים המכילים מידע זמני, יצירת תכונות המבוססות על זמן יכול לשפר באופן משמעותי את ביצועי המודל.
(ב) ,0) , ⁇ ⁇ ⁇ (ב) , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- שנה, חודש, יום, שעה, דקה, שנייה
- יום שבוע, יום השנה, שבוע של שנה
- הרובע, העונה
- סוף שבוע הוא חג
- זמן מאז אירוע ספציפי
(FLT:0) תכונות חיקויFLT:1 לכידת ערכים היסטוריים במרווחי זמן ספציפיים, המאפשרים מודלים ללמוד מתבניות קודמות.לדוגמה, בחיזוי מכירות, ייתכן שתיצור תכונות למכירה לפני יום אחד, לפני 7 ימים ולפני 30 ימים.
(FLT:0) סטטיסטיקות החלון של סטטיסטיקות סטטיסטיקות של חלון LT:1 compregations על פני חלון זמן מזחלות, כגון ממוצעים נעים, סטיית סטנדרטית מתגלגלת, או ערכים מקסימליים.
Logarithmic and Powerטרנספורמציות
עבור נתונים skeed חיובי, החלת שינויים לוגיסטיים יכול לעזור לנרמל את ההפצה לפני הסקאלה.השינויים האלה שימושיים במיוחד כאשר הם מתמודדים עם תכונות שיש להם התפלגות אקספוננציאלית או טווחי ערך רחב.
שינויים Logarithmic דחוסים ערכים גדולים תוך הרחבת ערכים קטנים, מה שהופך אותם אידיאליים לתכונות כמו הכנסה, אוכלוסייה או תעבורה באתר. Box-Cox שינויים הם כלי שימושי נוסף, כפי שהם מוצאים באופן אוטומטי את פרמטר השינוי הטוב ביותר עבור נורמליזציה.
אינטגרציה ודיססטרטגיזציה
Discretization כולל המרת תכונות רציפות ל-Bs או המרווחים הקטגוריים.טכניקה זו יכולה לעזור ללכוד מערכות יחסים לא לינאריות, להפחית את ההשפעה של אאוטיירים, ולהפוך את התכונות לאסטרטגיות של פירוק משותף יותר כוללות:
- (ב) ויקרא י"ד: ויקרא י"ד): "התחלקו את טווח המידות לרווחים של גודל שווה"
- (ב) ויקרא י"ד: ויקרא י"ד): "הב" (במדבר כ"ד)
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) ,0) עץ מבוסס עץ: ההרחבה 1 (בשיתוף עצי החלטות) כדי למצוא נקודות חלוקה אופטימליות
היעד Encoding
Target ⁇ , הידוע גם כ ⁇ , מחליף ערכים קטגוריים עם המשמעות של משתנה המטרה עבור כל קטגוריה.טכניקה זו יכולה להיות חזקה במיוחד עבור תכונות קביעותיות גבוהה שבו טבילה אחת תייצר תכונות רבות מדי.עם זאת, זה דורש יישום זהיר כדי למנוע דליפת נתונים והתאמה יתר, בדרך כלל באמצעות טכניקות כגון גלגול או הוספת רעש.
הנדסה הטובה ביותר
יישום הנדסה תכונה ביעילות דורש לאחר שיטות עבודה מבוססות הטוב ביותר המסייע להבטיח שהמודלים שלך חזקים, כללי, וחופשיים ממלכודות נפוצות.
התחל עם ניתוח נתונים Exploratory
EDA הוא צעד ראשוני בהנדסה תכונה, המאפשר למדענים נתונים לנתח נתונים חזותיים וסטטיסטיים ולקבל תובנות במערכות יחסים, דפוסים ונושאים פוטנציאליים המנחים החלטות הנדסיות תכונה לאחר מכן.לפני יישום כל שינוי, להבין ביסודיות את הנתונים שלך באמצעות ויזואליזציה וניתוח סטטיסטי.
השתמש בספריות פייתון כמו פנדה ומטאפזוליב כדי לבצע ניתוח נתונים מקיף, כגון חקר מידע סטטיסטי, ויזואליזציה, ותיקונים למציאת דפוסים ומערכות יחסים פוטנציאליות בתוך הנתונים. ההבנה הבסיסית הזו תודיע על החלטות הנדסיות תכונה שלך לעזור לך לזהות אילו טכניקות מתאימות ביותר עבור הנתונים הספציפיים שלך.
ידע דומיינים
הנדסה תכונה משתמשת ידע התחום של הנתונים כדי ליצור תכונות שהופכות אלגוריתמי למידת מכונה לעבוד.הבנה שלך של התחום הבעייתי הוא יקר ערך ליצירת תכונות משמעותיות שלוכדות יחסים ודפוסים חשובים.
בצומת זה, עלינו לעצור ולשאול את עצמנו: "אם הייתי עושה את התחזיות באופן ידני בהתבסס על הידע התחום שלי, אילו תכונות היו עוזרות לי לעשות עבודה טובה?", שאלה זו יכולה לחשוף הזדמנויות ליצירת תכונות הנדסיות עוצמתיות שאולי לא היו ברורות מהמידע לבדו.
למנוע נתונים
זה תרגול טוב להתאים את המאזניים על נתוני האימון ולאחר מכן להשתמש בו כדי לשנות את נתוני הבדיקה.זה ימנע כל דליפת נתונים במהלך תהליך בדיקת המודל.דפנית נתונים מתרחשת כאשר מידע מבחוץ מהנתונים של האימון משפיע על המודל, המוביל להערכות ביצועים אופטימיות יתר שאינן מתאימות לנתונים חדשים.
דליפת נתונים: התאמת המאזניים על כל הנתונים (כולל סט הבדיקה) מציגה מידע מהנתונים במבחן לתהליך האימונים, המוביל לאומדנים ביצועים אופטימיים יתר על המידה: תמיד להתאים את הסקאלר רק על נתוני האימון, ולאחר מכן להשתמש בו כדי להפוך את נתוני האימון והמבחן.עקרון הזה חל על כל השלבים המוקדמים, לא רק על קנה המידה.
מקורות נפוצים של דליפת נתונים כוללים:
- שימוש במידע מהמבחן שנקבע במהלך עיבוד
- כולל תכונות שלא יהיו זמינות בזמן החיזוי
- שימוש במידע של מטרה ליצירת תכונות
- דליפות זמנית בנתונים (באמצעות מידע עתידי לנבא את העבר)
ראה דרישות Algorithm-Specific
מודלים שונים של למידת מכונה דורשים שלבים שונים של הנדסה תכונה.לדוגמה, מודלים כגון ליניארי או רב רגרסציה, SVM, ו KNN לעתים קרובות ליהנות מסטנדרטיזציה תכונה, אבל טכניקה זו אינה מסייעת מודלים המבוססים על עץ. אז, להחליט על המודל שלך לפני הזמן יכול לעזור לך לבנות צינור הנדסי יעיל עבור המקרה שלך.
הבנה אילו אלגוריתמים רגישים לתכונת שיטות קשקשים, אנתרופולוגיה, ושינויים אחרים עוזרים לך לתעדף את מאמצי ההנדסה המאפיין שלך.זה גם שווה לציין כי כמה אלגוריתמים, במיוחד שיטות המבוססות על עץ כמו עצי החלטות וזרמים אקראיים, הם חסרי רגישות להיקף התכונות ואינם דורשים דרוג, למרות שבדרך כלל לא מזיק.
זה נכון ומתמשך ברציפות
עם זאת, בסוף היום, הבחירה של שימוש בנורמליזציה או סטנדרטיזציה תהיה תלויה בבעיה שלך ואת אלגוריתם למידת המכונה שאתה משתמש.אין כלל קשה ומהיר לספר לך מתי לנרמל או לתקנו את הנתונים שלך. אתה תמיד יכול להתחיל על ידי התאמת המודל שלך כדי לגלום, לנרמל, וסטנדרט נתונים והשוואה את הביצועים עבור התוצאות הטובות ביותר.
הנדסה תכונה היא תהליך של הנדסת תכונות. ליצור תכונות, להעריך את ההשפעה שלהם על ביצועי המודל, ולחדד את הגישה שלך בהתבסס על התוצאות. השתמש בהגדרה על מנת להבטיח את התכונות המונדסות שלך להכללת נתונים לא נראים. Track מציגות ציוני חשיבות כדי להבין אילו תכונות לתרום ביותר לתחזיות המודל שלך.
מסמך המאפיין שלך הנדסה פילין
שמור תיעוד ברור של כל הטרנספורמציות, תוכניות קידוד, ולוגיקה יצירה תכונה. תיעוד זה חיוני עבור:
- חידוש תוצאות
- מודלים להורדת ייצור
- שיתוף פעולה עם חברי צוות
- בעיות
- שמירה על מודלים לאורך זמן
לאחר שבחרת שיטת דרוג ולטפל בתופעות נתונים, עקביות בייצור היא מפתח.חסוך את כל הפרמטרים הנורמליזציה - כגון אמצעים, סטייה סטנדרטית, או ערכי מינו-מקס - משלב האימונים. השתמש באותם פרמטרים בעת שינוי נתונים חדשים.
להימנע מOver-Engineering
בעוד הנדסה תכונה יכול לשפר באופן משמעותי את ביצועי המודל, יצירת תכונות רבות מדי יכול להוביל לעלויות חישוביות מוגברת, והקטנת הפרשנות המודל. להתמקד ביצירת תכונות משמעותיות שלוכדות דפוסים אמיתיים ולא רעש. השתמש בטכניקות בחירה תכונה כדי לזהות ולשמור רק את התכונות היקרות ביותר.
דוגמאות מעשיות ומימוש
בואו נבחן דוגמאות מעשיות של הנדסה תכונה על פני תחומים שונים כדי להמחיש כיצד טכניקות אלה מוחלות בתרחישים בעולם האמיתי.
דוגמה: תחזית מחירים נדל"ן
לדוגמה, לשקול תרחיש שבו אתה צופה מחירי הנדל"ן באזור מסוים.בתחום זה, הנדסה יעילה תכונה עשוי לכלול:
- (ב) יצירת תכונות:0) יצירת תכונות: מחיר 1:1 לרגל רבוע, גיל הנכס (שנה הנוכחית - שנה בנויה), מרחק למתקנים
- (FLT:0) תכונות של אינטראקציה: מספר חדרי שינה × חדרי אמבטיה, גודל גדול × איכות השכונה
- (FLT:0) תכונות טמפל: עונה 1:1 של מכירה, ימים בשוק, אינדיקטורים למגמה שוק
- (ב) ,0) תכונות מותקנות: FLT:1 ממוצע מחיר בשכונה, הכנסה החציונית ב-zip code
- (ב) ⁇ :0) ⁇ ⁇ : 1-hot ⁇ עבור סוג הנכס, קידוד יעד עבור תכונות בעלות גבוהה של קוד zip
דוגמה: התנהגות לקוח מסחר אלקטרוני
שקול חברה מסחר אלקטרוני לקבוע כמה מלאי זה צריך עבור חופשה הקרובה.חברה יש את הנתונים הבאים: מכירות יומיות, רמות מלאי, ומספר ההזמנות במהלך עונת החגים בשנים האחרונות.שימוש בניתוח נתונים מחקר, החברה יכולה להבין את היחסים בין העלייה בהזמנות ורמות מלאי, עוזר להשיג תובנות בהתנהגות הלקוחות, דפוסי המכירות, דינמיקות ומלאי.
הנדסת תכונה עבור תרחיש זה כולל:
- (FLT:0) תדירות, הון (RFM) תכונות: 10 ימים מאז הרכישה האחרונה, מספר רכישות, סך ההוצאות
- תכונות:0 (Behavioral: 1) זמן ממוצע בין רכישות, קצב נטישה של עגלות, העדפות קטגוריות מוצרים
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (הופנה מהדף LT:0) סטטיסטיקות של רולינג: 1FLT:1 7 ימים ממוצע של מכירות, 30 יום טרנד אינדיקטורים
דוגמה: הערכת הסיכון אשראי
ביישומים פיננסיים כמו ניקוד אשראי, הנדסה תכונה משחק תפקיד קריטי בביצוע מודל:
- יחס החוב להגדלת החוב, שיעור ניצול אשראי, יחס תשלום הכנסה
- (ב) ,0) דפוסים היסטוריים: מספר 1 של תשלומים מאוחרים, אורך ההיסטוריה של אשראי, גיל חשבון
- (ב) ,0) תכונות מותקנות: FLT:1ul סך כל האשראי על פני כל החשבונות, איזון חשבון ממוצע
- (ב) ⁇ :0) שינויים תיאורטיים: מעמד התעסוקה של 1FIRLT 1 (הופנה מהדף מטרות ההלוואה, אזור גיאוגרפי
- (ב) ⁇ :0Risk: Fig: ⁇ 1:1 , מספר שאילתות אשראי האחרונות, דגלי פשיטת רגל, אינדיקטורים של ענישה
כלים וספריות להנדסת תכונות
כמה כלים חזקים וספריות יכולים לייעל את זרימת העבודה ההנדסתת תכונה שלך ולעזור לך ליישם את התרגילים הטובים ביותר ביעילות.
Python Libraries
אנו נשווה את יישום ההנדסה של ספריות קוד פתוח, Scikit-learn, Category Encoders ו-Power-engine.כל ספריה מציעה יכולות ייחודיות:
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) ◄ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (FLT:0)Feature-engine:FLT:1 הספרייה המתמחה בהנדסה כוללת עם אפשרויות שינוי נרחב
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
הנדסה אוטומטית
כלי הנדסת תכונות אוטומטיים כמו תכונות פלוס, ספריות AutoML (למשל, Auto-sklearn, H2O.ai), וטבלת AutoML של גוגל יכולים ליצור באופן אוטומטי ולשנות תכונות, לחסוך זמן ומאמץ.כלים אלה יכולים לייצר מאות או אלפי תכונות באופן אוטומטי, אם כי יש להשתמש בהם באופן עסיסי.
עם זאת, ידע התחום עדיין חיוני לפרשנות ולבחירת התכונות הטובות ביותר.כלים אוטומטיים עובדים הכי טוב בשילוב עם מומחיות אנושית והבנה דומיין. הם יכולים לעזור לזהות דפוסים שאולי החמיצו, אבל הם לא יכולים להחליף את התובנות שמגיעות מתוך הבנה של התחום הספציפי שלך.
מלכודות נפוצות וכיצד להימנע מהם
הבנת שגיאות נפוצות בהנדסה תכונה מסייעת לך להימנע שגיאות יקרות ולבנות מודלים חזקים יותר.
Overfitting באמצעות הנדסה
יצירת תכונות או תכונות רבות מדי עבור נתוני האימון שלך יכול להוביל להתאמה יתר.המודל לומד דפוסים שאינם מעצימים לנתונים חדשים.
- השתמש ב- cross-validation כדי להעריך יעילות תכונה
- שימוש בטכניקות סטנדרטיזציה
- ביצוע בחירה כוללת כדי להסיר תכונות אדומות
- עקבו אחרי הפער בין אימון וביצוע אימות
התעלמות מאינטראקציות
בעוד תכונות בודדות לא יכולות להיות חיזוי, השילובים שלהם יכולים להיות אינפורמטיביים מאוד.אל תתעלמו מהפוטנציאל של תכונות אינטראקציה, אבל גם להיות מודעים לצמיחה האקספוננציאלית בחלל תכונה כאשר הם יוצרים את כל האינטראקציות האפשריות.
עיבוד מוקדם
החלת שלבים מתקדמים שונים לאימון ולנתוני הבדיקה מובילה לתוצאות לא עקביות.זכור להתאים את המאזניים (מחשבה מינוס/מקס או הכוונה/ה) רק על נתוני האימונים שלך ולאחר מכן להשתמש באותו קנה מידה מתאים כדי להפוך את ההכשרה שלך ובדיקת נתונים כדי למנוע דליפת נתונים (לימוד מידע מהמבחן במהלך ההכנה).
הפחתה של תכונות Interpretability
הנדסה תכונה יכול לשפר או להפחית את הפרשיות, בהתאם לטכניקות המשמשות.לדוגמה: יצירת תכונות משמעותיות (למשל, "עידן הבית" במקום "גיל בית") משפר את הפרשיות.מאזן את המרדף אחר ביצועי המודל עם הצורך בתכונות מפרשיות, במיוחד בתחומים שבהם המודל מסביר יכולת חשובה.
הנדסה בייצור
חלוקת צינורות הנדסיים לסביבות ייצור דורש שיקולים נוספים מעבר לפיתוח המודל.
שמירה על יציבות
ודא כי אותם שינויים החלים במהלך אימון מוחלים במהלך ההפרעה.זה דורש:
- שמירת כל הפרמטרים של טרנספורמציה (means, סטיית סטנדרטיות, מיפוי ⁇ )
- גרסה לשלוט בקוד ההנדסה
- בדיקת הצינור ביסודיות לפני הפריסה
- התפלגות תכונות בייצור
קטגוריה חדשה
כאשר אתה מפעיל מודלים המשמשים סלקציה קטגורית, אתה תפגוש קטגוריות בנתונים ייצור שלא היו נוכחים במהלך אימון.
- יצירת קטגוריה "לא ידועה" במהלך אימון
- שימוש בשיטות ספאריות אשר מטפלות בקטגוריות בלתי נראות
- יישום אסטרטגיות של נפילה לקטגוריות נדירות
- מעקב אחר תדירות קטגוריות לא ידועות
אופטימיזציה
הנדסה תכונה יכול להיות יקר חישובי, במיוחד עבור תחזיות בזמן אמת.ייעל את הצינור שלך על ידי:
- לעתים קרובות קידוד תכונות
- תכונות מראש כאשר ניתן
- שימוש במבנים ואלגוריתמים יעילים
- במקביל לטרנספורמציות עצמאיות
- שתף את הקוד שלך כדי לזהות צווארי בקבוק
פיקוח ותחזוקה
שמור על עין על התפלגות תכונה בייצור. Deviations מן ההתפלגות הצפויה יכול להצביע על סחף מודל.קביעת התראות עבור סטיות כאלה יכול לעזור לתפוס בעיות מוקדם. ניטור רגיל עוזר להבטיח את הצנרת להנדסה תכונה שלך ממשיך לעבוד ביעילות כמו דפוסי נתונים מתפתח לאורך זמן.
החלת המודל שלך באופן קבוע עם נתונים טריים כדי להסביר שינויים טבעיים בהפצת נתונים.זה כולל עדכון הפרמטרים להנדסה תכונה שלך אימות כי הטרנספורמציות שלך נשאר מתאים עבור הנוף הנוכחי של הנתונים.
עתיד הנדסה
ככל שלמידה של מכונה ממשיכה להתפתח, כך גם גישות להנדסת תכונות.מודלים למידה עמוקה יכולים ללמוד באופן אוטומטי ייצוגים תכונה, צמצום הצורך בהנדסה תכונה ידנית בתחומים מסוימים כמו ראיית מחשב ועיבוד שפה טבעית.
מגמות מתפתחות כוללות:
- חיפוש אדריכלות:0 (Neural Architecture: FLT:103) באופן אוטומטי לגלות צינורות אופטימליים
- (ב) ,0) למידה עבור תכונות: FLT:1 מינוף מודלים לפני אימון מראש כדי לחלץ תכונות
- (FLT:0) הנדסת תכונה: FLT:1 כלים מתוחכמים יותר המשלבים אוטומציה עם ידע דומיין
- (FLT:0) הנדסת תכונה מוסברת: שיטות 1FLT יוצרות תכונות מפרשיות תוך שמירה על ביצועים
- (FLT:0) הנדסת תכונות בזמן אמת: FLT:1Build features processing for online learning system
מסקנה
לא משנה מה מאפיין עקרונות הנדסיים וטכניקות מהמאמר הזה אתה בוחר להשתמש, המסר החשוב כאן הוא להבין שלמידה של מכונה אינה רק על לשאול את האלגוריתם כדי להבין את הדפוסים.זה לגבי האפשרות שהאלגוריתם יעשה את עבודתו ביעילות על ידי מתן סוג הנתונים שהוא צריך.
הנדסה תכונה היא גם אמנות ומדע הדורש יצירתיות, מומחיות דומיין, ומיומנות טכנית. ML הנדסת תכונה היא המפתח לשיפור הכוח הנבאטיבי של מודלים למידת מכונה על ידי מימון נתונים גולמי לתוך תובנות ניתנות פעולה. על ידי שליטה בטכניקות הנדסיות תכונה, מדעני נתונים יכולים לפתוח את הפוטנציאל האמיתי של נתונים, נהיגה חדשנות ופתרון בעיות בעולם האמיתי על פני תעשיות שונות.
הטכניקות המכוסות במדריך זה - מקנה בסיסית ואנתרופולוגיה ועד שיטות טרנספורמציה מתקדמות ובחירת - לספק ערכת כלים מקיפה לשיפור דגמי הלמידה שלך.זכור כי הנדסה תכונה היא תהליך היררטיבי שמרוויח מניסויים, אימות וזיקוק מתמשך.
התחל עם ניתוח נתונים של מחקר כדי להבין את הנתונים שלך, למנף ידע דומיין כדי ליצור תכונות משמעותיות, ליישם שינויים מתאימים המבוססים על דרישות האלגוריתם שלך, ותמיד לאמת את העבודה שלך באמצעות בדיקות קפדניות. על ידי ביצוע שיטות אלה הטוב ביותר ולהימנע ממכשולים נפוצים, אתה תהיה מצויד היטב תכונות מהנדס כי לשפר באופן משמעותי את הביצועים של המודל שלך ואת יכולות ההכללה.
למידע נוסף, לחקור משאבים כמו FLT:0 (התיעוד המכוון של למידה) של סקריקט-לומד (FLT:2Kaggle's תכונה הנדסי קורסים הנדסת קורסים 3, וספרים מיוחדים בנושא.תרגול טכניקות אלה על נתונים אמיתיים, להשתתף בתחרויות למידה מכונה, ולחדד את כישורי ההנדסה שלך באופן קבוע כדי להישאר בחזית של נתונים ולמידה.