קנה מידה הוא צעד חיוני להכנת נתונים עבור אלגוריתמי למידת מכונה.זה כרוך התאמת טווח ערכים תכונה כדי לשפר את ביצועי המודל ואת מהירות ההתכנסות.

יסודות מתמטיים של פיסול

שיטות דרוג תכונות מבוססות על שינויים מתמטיים שמשנים את ההפצה של נתונים.טכניקות נפוצות כוללות נורמליזציה וסטנדרטיזציה.נורמליזציה מחדש תכונות למגוון מסוים, בדרך כלל (0, 1) באמצעות הנוסחה:

(ב) ⁇ (=0) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

סטנדרטיזציה הופכת את הנתונים ל-0 ו סטייה סטנדרטית של 1, באמצעות:

(ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

טכניקות מעשיות לחיקוי

הטמעת תכונה כוללת בחירה בשיטה הנכונה המבוססת על הנתונים והאלגוריתם.לדוגמה, אלגוריתמים כמו שכנני k-nearest ורשתות עצביות נהנים מנורמליזציה, בעוד שתוקפנות ליניארית ותוקפנות לוגיסטית לעתים קרובות משתמשים בסטנדרטיזציה.

טכניקות נפוצות כוללות:

  • Min-MAX Scaling
  • Z-Score Standardization
  • רובוסט סקאליזציה
  • MaxAbs Scaling

חשוב להתאים את הפרמטרים הדרגתיים על נתוני האימון וליישם את אותו טרנספורמציה לנתונים של הבדיקה כדי למנוע דליפת נתונים.