Table of Contents

هندسة المعالم هي من أهم الخطوات وأكثرها تأثيراً في بناء نماذج فعالة للتعلم الآلي، وهي تشمل فن وعلم تحويل البيانات الخام إلى سمات ذات مغزى، مما يحسن كثيراً أداء النماذج، والدقة، وقدرات التعميم، وهي عملية استخراج معلومات ذات معنى من البيانات الخام وتحويلها إلى سمات تزيد من القدرة التنبؤية لنموذجك، وسواء كنت تعمل على مشاكل التصنيف، أو على أداء مهام التراجع، أو نظم التوصية المعقدة،

هذا الدليل الشامل يستكشف المفاهيم الأساسية، والتقنيات العملية، وأفضل الممارسات في مجال هندسة السمات، وسندرس النظرية الأساسية، ونقدم أمثلة للعالم الحقيقي، ونناقش كيفية تطبيق هذه الأساليب بفعالية في مختلف سيناريوهات التعلم الآلات، وبحلول نهاية هذه المادة، سيكون لديك فهم شامل للكيفية التي يمكن بها تحويل بياناتك الخام إلى سمات قوية تمكن نماذجك من التعلم بمزيد من الفعالية ومن التنبؤات الأفضل.

Understanding Feature Engineering: The Foundation of Machine Learning Success

هندسة المعالم هي عملية اختيار وتلاعب وتحويل البيانات الخام إلى سمات يمكن استخدامها في التعلم تحت الإشراف، وهذه العملية بمثابة جسر بين البيانات الخام وغير المنظمة والمدخلات التي يمكن أن تجهزها خوارزميات التعلم الآلات معالجة فعالة، ولا تفهم خوارزميات التعلم الآلات في جوهرها النص أو الصور أو المتغيرات البحتة التي تحتاجها إلى تحويلات رقمية.

لماذا الأمور الهندسية

والغرض من هندسة المعالم واختيارها هو تحسين أداء الخوارزميات التي تتعلم الآلات، وبالتالي، فإن الدقة النموذجية في البيانات غير المنظورة تتحسن، وتحدد نوعية وصلاحية المعالم بصورة مباشرة كيف يمكن لنموذج التعلم الآلي أن يتعلم الأنماط ويجعل التنبؤات دقيقة، بل إن أكثر الخوارزميات تطورا ستكافح لتحقيق نتائج جيدة إذا ما قدمت لها خصائص مهيدة.

هندسة الخصية تدفعك إلى البحث أعمق في بياناتك، كشف الأنماط والاتجاهات التي ربما تجاهلتها، هذا الفهم الأعمق لبياناتك لا يحسن الأداء النموذجي فحسب، بل يوفر أيضاً أفكاراً قيمة للمشكلة التي تحاول حلها، وغالباً ما يقضّى علماء البيانات جزءاً كبيراً من وقتهم في مجال الهندسة المميزة لأنه له تأثير كبير على النتائج النموذجية.

ويمكننا عموما تقسيم هندسة المعالم إلى عنصرين: 1) إيجاد سمات جديدة و 2) معالجة هذه السمات لجعلها تعمل على الوجه الأمثل مع خوارزمية التعلم الآلات قيد النظر، وكلتا العنصرين أساسيتان وتتطلبان دراسة دقيقة لخصائص البيانات، والمعرفة بالمجالات، والاحتياجات المحددة لوحدات التعلم الآلة التي تخطط لاستخدامها.

المكونات الأساسية لهندسة المعالم

وهي تتألف من خمس عمليات: إنشاء السمات، والتحولات، واستخراج السمات، وتحليل البيانات الاستطلاعية، ووضع المعايير المرجعية، وتؤدي كل عملية من هذه العمليات دورا حيويا في إعداد بياناتكم للتعلم الآلاتي:

  • Feature Creation:] Developing new features from existing data using domain knowledge and creativity
  • Feature Transformation:] Modifying existing features to better represent the underlying patterns
  • Feature Extraction:] Reducing dimensionality while maintaining important information
  • Exploratory Data Analysis:] Understanding data distributions, relationships, and potential issues
  • Benchmarking:] Evaluating feature effectiveness through model performance metrics

التقنيات الهندسية الأساسية

فهم وتطبيق التقنيات الهندسية المناسبة ذات الأهمية الحاسمة لبناء نماذج قوية للتعلم الآلي، دعونا نستكشف أهم الطرق بالتفصيل، وندرس متى وكيف نستخدم كل تقنية بفعالية.

تصعيد المعالم: التطبيع والتوحيد

إن رفع مستوى المعالم هو خطوة حاسمة في مرحلة ما قبل التجهيز في مجال التعلم الآلاتي تطبيع مجموعة الملامح، بما يضمن أنها تساهم على قدم المساواة في عملية التعلم في النموذج، وبدون التوسع المناسب، يمكن للملامح ذات النطاقات الرقمية الأكبر أن تهيمن على عملية التعلم، مما يحول دون الاعتراف بأنماط هامة في السمات الأصغر حجما.

وبما أن نطاق قيم البيانات الخام يختلف اختلافاً واسعاً، ففي بعض خوارزميات التعلم الآلات، فإن المهام الموضوعية لن تعمل بشكل سليم دون التطبيع، والنظر في مجموعة بيانات تحتوي على كل من العمر (العمر من صفر إلى 100) والدخل (المعدل من 000 1). وبدون التوسع، فإن سمة الدخل ستهيمن على حسابات المسافات وتدرج النسب على النحو الأمثل لمجرد أن تكون أكبر حجماً، وليس لأنها أكثر أهمية بالنسبة للتنبؤات.

توحيد المعايير (التطبيع الأساسي للزئبق)

(ب) تُحوّل البيانات إلى أن الملامح لا تُحدّد ولا تُحدّد الفرق، مما يساعد على أداء العديد من نماذج التعلم الآلي أداء أفضل، وتمثل القيم الموحدة الناتجة، التي تُدعى " Z-Scores " ، كم انحرافات معيارية عن المعنى المقصود لكل قيمة أصلية.

هذه الطريقة تستخدم على نطاق واسع لتطبيعها في العديد من خوارزميات التعلم الآلات (مثل آلات الدعم، والتراجع اللوجستي، والشبكات العصبية الاصطناعية)

When to use standardization:]

  • وتستخدم المقاييس المسافات - KNN و K-Means و SVM حاسب المسافات، ولذلك تحتاج السمات إلى مستويات مماثلة لتجنب الهيمنة من جانب السمات الأكبر حجما.
  • Gradient descent optimization - Neural networks and linear/logistic regression converge faster when features are standardized.
  • التراجع المنظم: يفترض أن الملامح هي على نفس النطاق مع العدم المتوسط.
  • تحليل المكونات الرئيسية: يستند التقييم القطري المشترك إلى الفروق، وبالتالي يكفل التوحيد مساواة المساهمة من جميع السمات.

التطبيع المصغر

كما أن إعادة الترشيد، المعروفة أيضاً باسم " الحد الأدنى من الضرائب " أو التطبيع من مكافئات دقيقة، هي أبسط طريقة، وهي تتمثل في إعادة توسيع نطاق الملامح لتسديد النطاق في [0] أو [1]، و[1].() وتحافظ هذه التقنية على شكل التوزيع الأصلي لبياناتكم مع ضمان أن تندرج جميع القيم ضمن نطاق محدد.

فالتطبيعية حساسة جداً للمنبعات، وإذا كان لديك قيمة واحدة عالية جداً أو منخفضة جداً، فإنها يمكن أن تسحق معظم نقاط البيانات الأخرى إلى جزء صغير جداً من النطاق [0]، ويمكن أن تفقد بعض المعلومات عن اختلافاتها النسبية، وهذا اعتبار هام عند اختيار التطبيع والتوحيد.

When to use normalization:]

  • فالشبكات العصبية التي لها وظائف تنشيطية محددة - وهي تعمل على أفضل وجه مع مدخلات في نطاق متصل مثل ]٠، ١[.
  • تجهيز الصور - القيم الثابتة ملزمة بطبيعة الحال )٠-٢٥٢( وتطبيعها إلى ]٠، ١[ ممارسة عادية.
  • عندما تعرف الحدود الدنيا - إذا كانت بياناتك لها حدود طبيعية (مثل النسب المئوية، أو التقديرات، أو الدرجات)، فإن التطبيع يحافظ على تلك الحدود.

قياس الروبوت إلى بيانات عالية المستوى

التوسع الآلي، المعروف أيضاً باسم التوحيد باستخدام النطاق الوسيط والمفصل، مصمم ليكون قوياً للمتفوقين، عندما تحتوي بياناتك على مخارج كبيرة لا تريد إزالتها، فإن التوسع القوي يوفر بديلاً أكثر استقراراً لتقنيات التطبيع القياسية.

وبالنسبة لمجموعات البيانات التي بها مخارج، فإن شركة روبوستسكيلر هي خيار أفضل، فهي تستخدم النطاق الوسيط والمفصل بدلا من الانحرافات الدنيوية والمعيارية، مما يجعلها أقل حساسية للقيم القصوى، وهذا النهج يضمن ألا يؤثر المتفوقون تأثيرا غير متناسب على بارامترات التقسيم، مما يؤدي إلى توزيعات أكثر توازنا للمواضيع.

المتغيرات الشكلية

وكثيرا ما تكافح نماذج التعلم من الآلات بمتغيرات واضحة لأنها تعتمد على مدخلات رقمية، ومن الضروري تحويل البيانات القاطعة إلى بيانات رقمية لمعظم خوارزميات التعلم الآلاتي، غير أن طريقة التزيين التي تختارونها يمكن أن تؤثر تأثيرا كبيرا على الأداء النموذجي وإمكانية التفسير.

1 - هوت Encoding

(أ) إنشاء عمود ثنائي لكل فئة أفضل البيانات غير العادية (مثل (ريد) (بلو) (غرين) هذه التقنية تحول سمة واحدة شاملة مع فئات غير عادية، إلى سمات ثنائية، حيث تمثل كل سمة جديدة وجود فئة معينة أو غيابها.

وتطبيق زينة ساخنة واحدة على سمة قاطعة سيخلق سمة ثنائية جديدة لكل فئة في هذا المتغير القاطع، مثلاً، سمة "العقيد" ذات قيم [الريد، الأزرق، الأخضر] ستتحول إلى ثلاثة سمات ثنائية: العقيد (ريد)، العقيد (بلو)، العقيد (بلو)، والكولور (بلو) (الكولور) (غريين) حيث لكل صف قيمة واحدة في واحدة بالضبط من هذه الأعمدة.

وبما أن عدد الملامح الجديدة يزداد مع ازدياد عدد الفئات، فإن هذه التقنية مناسبة لملامح ذات عدد منخفض من الفئات، لا سيما إذا كان لدينا مجموعة بيانات أصغر، ومن القواعد الموحدة للإبهام أن تطبق هذه التقنية إذا كان لدينا ما لا يقل عن عشرة سجلات لكل فئة.

Label Encoding

يسمي مدخلاً لكل فئة، ويعطي صورة عن البيانات العادية (مثلاً، "اللو"، "ميديوم"، "هاي" لأن هناك ترتيباً أو ترتيباً للقيم التي من المهم أن يتاح للنموذج الوصول إليها، وهذه الطريقة مفيدة بشكل خاص عندما يكون لمتغيرك القاطع ترتيب طبيعي أو تسلسل هرمي ينبغي الحفاظ عليه في العدد.

لكن كوني حذرة عند تطبيق بطاقة تعريفية على بيانات غير عادية الأرقام قد تقود النموذج لإختتام ترتيب حيث لا يوجد أي منها، لذا فإن المؤشرات الثنائية تتجنب ذلك، على سبيل المثال، تزين المدن بأنها [1، 2] قد تشير بشكل خاطئ إلى أن المدينة 3 هي مدينة "أكثر من مدينة 1" عندما لا توجد علاقة في الواقع.

معالجة البيانات المفقودة

إن عدم توفر البيانات عن السمات الرئيسية يمكن أن يعوق التدريب النموذجي والدقة في التنبؤات، فالتصدي السليم للقيم المفقودة أمر حاسم لبناء نماذج قوية، وينبغي أن تعتمد الاستراتيجية التي تختارها على طبيعة بياناتكم، ومقدار المعلومات المفقودة، والأنماط التي تسود في حالة الاختفاء.

ومن خلال استخدام تقنيات الإحلال، مثل تقدير القيم المفقودة استنادا إلى البيانات المتاحة مثل مجال الملكية، يمكن لنموذج القانون النموذجي أن يُحدث توقعات أكثر استنارة، بما يكفل تحقيق نتائج أكثر قوة وموثوقية.

  • Mean/Median Imputation:] Replacing missing values with the mean or median of the feature
  • Mode Imputation:] Using the most frequent value for categorical features
  • Forward/Backward Fill:] Using previous or next values in time-series data
  • Model-Based Imputation:] Using machine learning algorithms to predict missing values
  • Indicator Variables:] Creating binary features to flag which values were missing

إنشاء سلاسل تفاعلية

وينطوي إيجاد سمات للتفاعل على تحديد العلاقات بين السمات القائمة واستخلاص سمات جديدة، ويمكن لهذه السمات أن تلتقط أنماطا معقدة قد تفتقدها السمات الفردية، مما يؤدي في كثير من الأحيان إلى تحسينات كبيرة في الأداء النموذجي.

على سبيل المثال، في التنبؤ بأسعار المنزل، حساب عمر المنزل بطرح السنة التي بنيت فيها من العام الحالي يبرز الاتجاهات، مثل انخفاض أسعار المنازل مع مرور الوقت، ومن الأمثلة الأخرى على السمات التفاعلية:

  • (مثلاً، طول البارود (X) = المنطقة
  • نسب الخلق (مثل نسبة الدين إلى الدخل)
  • السمات السياسية (مثلا، X2, x3)
  • تركيبات خاصة بأهمية تستند إلى معارف الخبراء

الحد من الحمل والبعد

ويتناول النهج المتبعة في معالجة القيم والدلائل المفقودة في تقنيات استخراج السمات مثل التقييم القطري المشترك، والتقييم الدولي، والسوقيات، واللازل، والشبكة الدولية للإحصاء، وتقنيات الإثراء، وتساعد هذه التقنيات على الحد من عدد الملامح مع الحفاظ على أهم المعلومات التي يمكن أن تحسن الأداء النموذجي، وتخفض وقت التدريب، وتساعد على منع الإفراط في الملاءمة.

Principal component Analysis (PCA)] is one of the most widely used dimensionality reduction techniques. It transforms your original features into a new set of uncorrelated features called principal components, ordered by the amount of variation they explain in the data. This allows you to retain the most informative aspects of your data while reducing dimensionality.

Other extraction methods] include Independent component Analysis (ICA) for separating mixed signals, Linear Discriminant Analysis (LDA) for supervised dimensionality reduction, and t-SNE for visualization of high-dimensional data. Each technique has specific use cases and assumptions that should guide your selection.

أساليب الاختيار: اختيار المعالم المناسبة

ومن خلال تحديد المتغيرات الأساسية وإزالة المتغيرات الزائدة وغير ذات الصلة، يؤدي اختيار المعالم إلى تحسين عملية التعلم الآلاتي وزيادة القدرة التنبؤية لوحدات التعلم الآلي.

أساليب التصوير

وتقيم أساليب التصوير سمات مستقلة عن أي خوارزمية للتعلم الآلي، باستخدام تدابير إحصائية لقياس وفرز الرتب، وهذه الأساليب فعالة من الناحية الحسابية ويمكن تطبيقها كخطوة للتجهيز المسبق قبل التدريب النموذجي.

  • معامل الفساد: ] Measuring linear relationships between features and the target
  • Chi-square tests:] Evaluating independence between categorical features and targets
  • Information gain:] Measuring how much information a feature provides about the target
  • Variance threshold:] Removing features with low variation

طرق الغضب

كما أن أساليب الغضب تقيِّم مجموعات المواد الفرعية عن طريق التدريب واختبار نموذج معين للتعلم الآلي، بالإضافة إلى ذلك، تناقش مختلف أساليب اختيار السمات، بما في ذلك الرش واللفائف والأساليب المدمجة، وفي حين أن أساليب التصفيف باهظة التكلفة من أساليب التصفية، فإنها يمكن أن تجد مزيجاً من الملامح التي تعمل على أفضل وجه في خوارزميتك المحددة.

وتشمل أساليب الاختتام المشتركة ما يلي:

  • Forward selection:] Starting with no features and iteratively add the most useful ones
  • القضاء على الازدواج: ] البدء بجميع الملامح وإزالة أقل الميزات فائدة
  • Recursive feature elimination:] Recursively removing features and building models to identify the most important ones

الطرائق المدمجة

وتُجري الأساليب المدمجة عملية اختيار الملامح كجزء من عملية التدريب النموذجية، وهذه الأساليب هي أساليب خاصة بالجرائم، وغالبا ما توفر توازنا جيدا بين الكفاءة الحاسوبية ونوعية الاختيار.

  • LASSO (L1 regularization): Shrinks coefficients of less important features to zero
  • تراجع في التراجع (L2 تسوية: ]
  • Tree-based feature importance:] Using importance scores from decision trees and random forests
  • Elass Net:] Combining L1 and L2 regularization

التقنيات الهندسية المتقدمة

بالإضافة إلى التقنيات الأساسية، عدة طرق متقدمة يمكن أن تزيد من تعزيز خط الأنابيب الهندسية الخاص بك وإطلاق طاقة تنبؤية إضافية من بياناتك.

الهندسة المأخوذة من الرسوم الزمنية

ويشمل الفصل أيضاً السمات المتصلة بالزمن، ومتغيرات اللغ، وملامح النوافذ المتجددة، ووسمات النوافذ الموسَّعة، وعند العمل مع بيانات أو مجموعات بيانات مفصَّلة عن مجموعات زمنية تحتوي على معلومات مؤقتة، يمكن أن يؤدي إنشاء سمات قائمة على الزمن إلى تحسين الأداء النموذجي بشكل كبير.

Temporal decomposition] involves extracting components from datetime features:

  • السنة، الشهر، اليوم، الساعة، الدقيقة، الثانية
  • يوم الأسبوع، يوم السنة، أسبوع السنة
  • فصل، موسم
  • عطلة نهاية الأسبوع، عطلة
  • الوقت منذ حدث محدد

Lag features] capture historical values at specific time intervals, allowing models to learn from past patterns. For example, in sales forecasting, you might create features for sales from 1 day ago, 7 days ago, and 30 days ago.

Rolling window statistics] compute aggregations over sliding time windows, such as moving averages, rolling standard deviations, or rolling maximum values. These features help capture trends and volatile in time-series data.

التحولات في السوق والطاقة

ومن أجل الحصول على بيانات مُخزّرة بشكل إيجابي، يمكن أن يساعد تطبيق التحولات اللوغاريتمية على تطبيع التوزيع قبل التوسع، وهذه التحولات مفيدة بصفة خاصة عند التعامل مع السمات التي لها توزيعات سريعة أو نطاقات واسعة من القيم.

وتضغط التحولات اللوغاريولوجية على القيم الكبيرة مع توسيع القيم الصغيرة، مما يجعلها مثالية لملامح مثل الدخل أو السكان أو حركة المرور على الموقع الشبكي.() وتشكل التحولات في الإطارات - الكوك أداة مفيدة أخرى، حيث أنها تجد تلقائيا أفضل البارامترات التحويلية لتطبيعها.

التوحيد والتدنيس

ويشمل التفريق تحويل السمات المستمرة إلى ملامح أو فترات قطعية، ويمكن لهذه التقنية أن تساعد على استخلاص العلاقات غير الخطية، والحد من تأثير المتفوقين، وجعل الملامح أكثر تفسيرا.

  • Equal-width binning:] Dividing the range into intervals of equal size
  • Equal-frequency binning:] Creating bins with approximately equal numbers of observations
  • Custom binning:] Using domain knowledge to define meaningful intervals
  • [الربط القائم على الأشجار: ] باستخدام أشجار القرار لإيجاد نقاط انقسام أمثل

الهدف

ويحل التوسيع المستهدف، المعروف أيضا باسم " التزيين " ، محل القيم المقطعية بشعار المتغير المستهدف لكل فئة، ويمكن أن تكون هذه التقنية ذات قوة خاصة بالنسبة للملامح القاطعة العالية المكارد، حيث يؤدي التشفير المفاجئ إلى وجود العديد من السمات، غير أنها تتطلب التنفيذ الدقيق لتجنب تسرب البيانات وتجاوزها، وذلك عادة من خلال تقنيات مثل التحلل عبر القمار أو إضافة ضوضاء.

أفضل الممارسات الهندسية

ويتطلب تنفيذ هندسة السمات بفعالية اتباع أفضل الممارسات الراسخة التي تساعد على ضمان أن تكون نماذجك قوية وعامة ومتحررة من المجازر المشتركة.

بدء تحليل البيانات الاستكشافية

وتمثل المؤسسة خطوة أولية في مجال هندسة السمات، مما يتيح لعلماء البيانات تحليل البيانات البصرية والإحصائية والحصول على معلومات عن العلاقات والأنماط والقضايا المحتملة التي تسترشد بها القرارات الهندسية اللاحقة، وقبل تطبيق أي تحولات، فهم بياناتكم فهماً دقيقاً من خلال التصوير والتحليل الإحصائي.

استخدام مكتبات (بيتون) مثل (بانداس) و(ماتبافل) لإجراء تحليل شامل للبيانات الاستكشافية، مثل استكشاف المعلومات الإحصائية، والتصورات، والترابطات من أجل إيجاد أنماط والعلاقات المحتملة في البيانات، وسيسترشد هذا الفهم التأسيسي بقراراتكم الهندسية الرئيسية ويساعدكم على تحديد التقنيات الأنسب لمجموعتكم المحددة للبيانات.

Leverage Domain Knowledge

تستخدم الهندسة المميزة المعرفة بالبيانات لخلق سمات تجعل من خامات التعلم الآلاتي تعمل، فهمكم لمجال المشكلة لا يقدر بثمن لخلق سمات ذات مغزى تستوعب العلاقات والأنماط الهامة.

في هذا الزابور، يجب أن نتوقف ونسأل أنفسنا، "إذا كنت سأصنع التنبؤات يدوياً على معرفة بلدي، ما هي السمات التي ستساعدني على القيام بعمل جيد؟"

منع حدوث أضرار في البيانات

ومن الممارسات الجيدة تكييف مقياس البيانات التدريبية، ثم استخدامه لتحويل بيانات الاختبارات، مما سيتفادى أي تسرب للبيانات أثناء عملية الاختبار النموذجي، ويحدث تسرب البيانات عندما تؤثر المعلومات من خارج مجموعة بيانات التدريب على النموذج، مما يؤدي إلى تقديرات مفرطة في التفاؤل للأداء لا تعمم البيانات الجديدة.

تسريب البيانات: يُدخل تكييف الجدول على مجموعة البيانات بأكملها (بما في ذلك مجموعة الاختبارات) معلومات من بيانات الاختبار إلى عملية التدريب، مما يؤدي إلى تقديرات أداء متفائلة للغاية: أفضل الممارسات: لا تلائم دائماً المقياس إلا على بيانات التدريب، ثم تستخدمه لتحويل البيانات المتعلقة بالتدريب والاختبار على السواء، وينطبق هذا المبدأ على جميع خطوات التجهيز الأولي، وليس مجرد التوسع.

وتشمل المصادر المشتركة لتسرب البيانات ما يلي:

  • استخدام المعلومات المستمدة من مجموعة الاختبار أثناء التجهيز الأولي
  • بما في ذلك الملامح التي لن تكون متاحة في وقت التنبؤ
  • استخدام المعلومات المستهدفة لخلق سمات
  • التسرب المؤقت في بيانات السلسلة الزمنية (استعمال المعلومات المستقبلية للتنبؤ بالماضي)

النظر في شروط حقل الغرامات

نماذج مختلفة للتعلم الآلي تتطلب خطوات مختلفة من هندسة السمات، على سبيل المثال، نماذج مثل الخيط أو التراجع المتعدد، وجهاز التتبع الآلي، وشبكة الأشعة السينية غالبا ما تستفيد من توحيد السمات، لكن هذه التقنية لا تساعد النماذج القائمة على الأشجار، لذا، فإن اتخاذ نموذجك قبل الوقت يمكن أن يساعدك على بناء خط أنابيب هندسية فعال في مجال استخدامك.

فهم أي الخوارزميات حساسة لتصنيفها، وطرق التكفير، وغير ذلك من التحولات يساعدك على إعطاء الأولوية لجهودك الهندسية البارزة، ومن الجدير بالذكر أيضا أن بعض الخوارزميات، ولا سيما الأساليب القائمة على الأشجار مثل أشجار القرار والغابات العشوائية، لا تُراعي في جوهرها حجم الملامح ولا تتطلب رفعها بدقة، وإن كان تطبيقها عادة لا يضر بالأداء.

التكرار والتقدير المستمرين

ولكن في نهاية اليوم، سيتوقف اختيار استخدام التطبيع أو التوحيد على مشكلتك وعلى خوارزمية التعلم الآلات التي تستخدمها، وليس هناك قاعدة صعبة وسريعة لتقول لكم متى تطبيع بياناتكم أو توحدها، ويمكنكم دائما أن تبدأوا بتجهيز نموذجكم على بيانات خام وتطية وموحدة ومقارنة الأداء بأفضل النتائج.

هندسة المعالم هي عملية متكررة، وخلق سمات وتقييم تأثيرها على الأداء النموذجي، وتنقيح نهجك على أساس النتائج، واستخدام المجازفة الشاملة لضمان تعميم ملامحك الهندسية جيدا على البيانات غير المنظورة، وسجلات أهمية المسار لفهم السمات التي تسهم في معظم توقعات نموذجك.

وثيقة خط الأنبوب الهندسي الخاص بك

الحفاظ على وثائق واضحة لجميع التحولات، وخطط الترميز، ومنطق خلق الملامح، وهذه الوثائق أساسية لما يلي:

  • النتائج المستنسخة
  • نشر نماذج الإنتاج
  • التعاون مع أعضاء الفريق
  • المسائل المتعلقة بالحطام
  • الحفاظ على النماذج مع مرور الوقت

بمجرد أن تختار طريقة للتحديث و تعالج شذوذ البيانات، فإن الاتساق في الإنتاج هو مفتاح، إنقاذ كل معايير التطبيع، مثل الوسائل، الانحرافات القياسية، أو القيم الأقل ضرراً، من مرحلة التدريب، استخدام هذه البارامترات نفسها عند تحويل البيانات الجديدة.

تجنب التدريب على المهندسين

وفي حين أن هندسة السمات يمكن أن تحسن أداء النموذج بشكل كبير، فإن إيجاد عدد كبير جدا من السمات يمكن أن يؤدي إلى الإفراط في التأقلم، وزيادة التكاليف الحاسوبية، وتقليل إمكانية التفسير النموذجي، والتركيز على إيجاد سمات ذات مغزى تلتقط أنماطا حقيقية بدلا من الضجيج، واستخدام تقنيات اختيار السمات لتحديد الملامح الأكثر قيمة واستبقاء فقط.

أمثلة عملية وتنفيذ

لنفحص أمثلة عملية على هندسة السمات عبر مجالات مختلفة للتوضيح كيف تطبق هذه التقنيات في سيناريوهات العالم الحقيقي

المثال 1: الافتراض الحقيقي لأسعار العقارات

على سبيل المثال، النظر في سيناريو حيث تتوقّع أسعار الممتلكات في منطقة معينة، وفي هذا المجال، قد تشمل الهندسة المميزة الفعالة ما يلي:

  • Creating derived features:] Price per square foot, age of property (current year - year built), distance to amenities
  • Interaction features:] Number of rooms × bathrooms, lot size × quality
  • Temporal features:] Season of sale, days on market, market trend indicators
  • Aggregated features:] average price in neighborhood, median income in zip code
  • Categorical encoding:] One-hot encoding for property type, target encoding for high-cardinality features like zip code

النموذج 2: شركة E-Commerce Customer Behavior

(ب) النظر في شركة تجارية إلكترونية تحدد كمية المخزون الذي ينبغي أن تكون بحوزتها في عطلة مقبلة، ولدى الشركة البيانات التالية: المبيعات اليومية، ومستويات المخزون، وعدد الطلبات خلال موسم العطلة خلال السنوات القليلة الماضية، وباستخدام تحليل البيانات الاستطلاعية، يمكن للشركة أن تفهم العلاقات بين الزيادة في الطلبات ومستويات المخزون، وتساعدها على اكتساب البصيرة في سلوك العملاء، وأنماط البيع، وديناميات الجرد.

وتشمل هندسة السمات ذات الصلة لهذا السيناريو ما يلي:

  • Recency, Frequency, Monetary (RFM) features:] Days since last purchase, number of purchases, total spent
  • Behavioral features:] متوسط الوقت بين المشتريات، ومعدل التخلي عن العربات، وأفضليات فئة المنتجات
  • Seasonal patterns:] Holiday indicators, day effects, time of day patterns
  • Rolling statistics:] 7 أيام متحركة متوسط المبيعات، مؤشرات الاتجاهات 30 يوماً

المثال 3: تقييم مخاطر الائتمان

وفي التطبيقات المالية مثل التكرير الائتماني، تؤدي هندسة السمات دورا حاسما في الأداء النموذجي:

  • النسب المالية: ] نسبة الديون إلى الدخل، ومعدل استخدام الائتمان، ونسبة الدفع إلى الدخل
  • الأنماط الافتراضية: ] عدد المدفوعات المتأخرة، ومدة تاريخ الائتمان، وسن الحساب
  • الملامح الإجمالية: ] مجموع الحد الائتماني في جميع الحسابات، متوسط رصيد الحساب
  • التحولات الشكلية: ] حالة العمالة، الغرض من القروض، المنطقة الجغرافية
  • مؤشرات مرجعية: ] عدد الاستفسارات الائتمانية الأخيرة، وأعلام الإفلاس، ومؤشرات الانحراف

الأدوات والمكتبات الخاصة بالهندسة المخصّصة

ويمكن للعديد من الأدوات والمكتبات القوية أن تبسط تدفق العمل الهندسي الخاص بك وتساعدك على تنفيذ أفضل الممارسات بكفاءة.

مكتبات بيتسون

وسنقارن بين عمليات التنفيذ الهندسي التي تقوم بها مكتبات باندز، وعلم الكتائب، وفئة المنسّقين، ومهندسة المعالم، وكل مكتبة توفر قدرات فريدة:

  • Pandas:] Data manipulation, basic transformations, and aggregations
  • Scikit-learn:] أدوات شاملة للتجهيز السابق تشمل أجهزة القياس والالتحاق والتحويلات
  • Feature-engine:] Specialized library for feature engineering with extensive transformation options
  • Category Encoders:] Advanced categorical encoding techniques
  • Featuretools:] Automated feature engineering for relational datasets

Automated Feature Engineering

أدوات الهندسة الآلية مثل (فيتول) مكتبات (أوتوماتيك) (مثلاً، (التعلم الآلي، H2O.ai) و (جوجل) يمكن أن تخلق وتتحول تلقائياً سمات، وتوفر الوقت والجهد، وهذه الأدوات يمكن أن تولد مئات أو آلاف الملامح تلقائياً، وإن كان ينبغي استخدامها بحكمة.

ومع ذلك، لا تزال المعرفة بالمجالات ذات أهمية حاسمة في تفسير واختيار أفضل الملامح، فالأدوات الآلية تعمل على أفضل وجه عندما تقترن بالخبرة البشرية وفهم المجالات، ويمكنها أن تساعد على تحديد الأنماط التي قد تكون قد فاتتك، ولكنها لا يمكن أن تحل محل الأفكار التي تأتي من فهم مجال مشكلتك المحددة.

الشلالات المشتركة وكيفية تجنبها

فهم الأخطاء المشتركة في الهندسة المميزة يساعدك على تجنب الأخطاء الباهظة التكلفة وبناء نماذج أقوى.

Overfitting through Feature Engineering

إيجاد العديد من الملامح أو الملامح التي تكون محددة جداً لبيانات التدريب الخاص بك يمكن أن تؤدي إلى الإفراط في الملاءمة، ويتعلم النموذج الأنماط التي لا تُعمم على البيانات الجديدة، لتجنب ذلك:

  • استخدام نظام تبادل المعلومات لتقييم فعالية السمات
  • تقنيات تسوية التطبيق
  • اختيار سمات مناسبة لإزالة الملامح الزائدة عن الحاجة
  • رصد الفجوة بين التدريب وأداء التحقق

إبطال التفاعلات بين الأعضاء

بينما الملامح الفردية قد لا تكون متوقعة، فإن تركيباتها يمكن أن تكون مفيدة للغاية، لا تغفل عن إمكانيات الملامح التفاعلية،

التجهيز الأولي غير المتسق

ويؤدي تطبيق مختلف خطوات التجهيز الأولي على بيانات التدريب والاختبار إلى نتائج غير متسقة، تذكر أن تضبط جهاز القياس (تصنيف الدخان/الضريبة أو متوسط/الدرجة) فقط على بيانات التدريب الخاصة بك، ثم تستخدم نفس المقياس المجهز لتحويل بيانات التدريب والاختبار معا لتفادي تسرب البيانات (تتعلم المعلومات من مجموعة الاختبار أثناء التجهيز الأولي).

إبطال القدرة على التنبؤ بالألوان

فهندسة المعالم يمكن أن تحسن أو تقلل من إمكانية الترجمة الشفوية، تبعاً للتقنيات المستخدمة، مثلاً: إيجاد سمات ذات مغزى (مثل العصر الهوس) بدلاً من "الهيربويلت" يؤدي إلى تحسين قابلية الترجمة الشفوية، وتوازن السعي إلى تحقيق أداء نموذجي مع الحاجة إلى سمات يمكن تفسيرها، لا سيما في المجالات التي يكون فيها الشرح النموذجي مهماً.

Feature Engineering in Production

ويتطلب نشر خطوط الأنابيب الهندسية الخاصة في بيئات الإنتاج اعتبارات إضافية تتجاوز وضع النماذج.

الحفاظ على الاتساق

ضمان تطبيق نفس التحولات التي تطبق أثناء التدريب أثناء النظر، وهذا يتطلب ما يلي:

  • توفير جميع معايير التحول (المقاييس، والانحرافات القياسية، ورسم الخرائط)
  • التحكم في رمز الهندسة الخاص بك
  • اختبار خط الأنابيب بدقة قبل النشر
  • رصد توزيع السمات في الإنتاج

معالجة مجموعات جديدة

عندما تنشر نماذج تستخدم الزينة القاطعة ستواجه فئات في بيانات الإنتاج التي لم تكن موجودة أثناء التدريب

  • إنشاء فئة غير معروفة أثناء التدريب
  • استخدام أساليب الترميز التي تعالج الفئات غير المنظورة بشكل مجيد
  • تنفيذ استراتيجيات التراجع في الفئات النادرة
  • رصد تواتر الفئات غير المعروفة

الأداء على الوجه الأمثل

هندسة الخصيصات يمكن أن تكون باهظة الثمن، خصوصاً للتنبؤات في الوقت الحقيقي، أفضّل خط أنابيبك من خلال:

  • الملامح الحاسوبية في كثير من الأحيان
  • الملامح الحاسبية عند الإمكان
  • استخدام هياكل البيانات والمقاييس الفعالة
  • المواظبة على التحولات المستقلة
  • تُحدّدُ رمزَكَ للتعرف على الاختناقاتِ

الرصد والصيانة

(ب) أن تراقب توزيعات السمات في الإنتاج، ويمكن أن تشير حالات الانحراف عن التوزيع المتوقع إلى حدوث انجراف نموذجي، ويمكن أن يساعد وضع تنبيهات لهذه الانحرافات على الإمساك بزمام الأمور، ويساعد الرصد المنتظم على ضمان استمرار خط الأنابيب الهندسية الخاص بك في العمل بفعالية مع تطور أنماط البيانات بمرور الوقت.

إعادة تدريب نموذجك بانتظام مع بيانات جديدة لتسديد التحولات الطبيعية في توزيع البيانات، ويشمل ذلك تحديث بارامترات الهندسة الخاصة بك والتحقق من أن تحولاتك لا تزال مناسبة للمشهد الحالي للبيانات.

مستقبل الهندسة المخصّصة

ومع استمرار تطور التعلم الآلي، فإن نماذج التعلم العميق يمكن أن تتعلم تلقائياً تمثيلات خاصة، مما يقلل من الحاجة إلى هندسة يدوية في بعض المجالات مثل رؤية الحاسوب وتجهيز اللغات الطبيعية، غير أنه بالنسبة للبيانات المنظمة والعديد من تطبيقات العالم الحقيقي، فإن هندسة السمات المدروسة لا تزال حاسمة.

وتشمل الاتجاهات الناشئة ما يلي:

  • Neural structure search:] Automatically discovering optpic feature transformation pipelines
  • Transfer learning for features:] Leveraging pre-trained models to extract features
  • Automated feature engineering:] More sophisticated tools that combine functioning with domain knowledge
  • مهندس خاص يمكن تفسيره: ] Methods that create interpretable features while maintaining performance
  • مهندس خاص في الوقت الحقيقي: ] Streaming feature computation for online learning systems

خاتمة

مهما كانت المبادئ والتقنيات الهندسية التي تختار استخدامها، فإن الرسالة الهامة هنا هي أن نفهم أن التعلم الآلات ليس فقط حول طلب الخوارزمية لمعرفة الأنماط، بل هو حولنا تمكين الخوارزمية من القيام بعملها بفعالية عن طريق توفير نوع البيانات التي تحتاجها.

إن هندسة المعالم هي فن وعلم يتطلب الإبداع والخبرة الفنية والمهارات التقنية، وهندسة المعالم هي محورية لتعزيز القدرة التنبؤية لنماذج التعلم الآلات من خلال تنقيح البيانات الخام إلى أفكار عملية، ومن خلال استخدام تقنيات هندسة السمات، يمكن لعلماء البيانات أن يكشفوا الإمكانات الحقيقية للبيانات، ودفع الابتكار وحل مشاكل العالم الحقيقي في مختلف الصناعات.

فالتقنيات التي يشملها هذا الدليل - من التوسع الأساسي والتكافل إلى أساليب التحول والاختيار المتقدمة - توفر مجموعة أدوات شاملة لتحسين نماذج التعلم الآلاتي الخاصة بك، وتذكر أن هندسة السمات عملية متكررة تستفيد من التجارب، والتثبت، والتحسين المستمر.

ابدأ بتحليل البيانات الاستطلاعية لفهم بياناتك، وتعبئة المعارف المحلية لخلق سمات ذات معنى، وتطبيق التحولات المناسبة على أساس متطلبات الخوارزمية الخاصة بك، وإثبات صحة عملك من خلال اختبار صارم، من خلال اتباع أفضل الممارسات وتجنب المجازفات المشتركة، ستكون مجهزة تجهيزا جيدا للمعالم الهندسية التي تعزز بشكل كبير من قدرات الأداء والتعميم الخاصة بنموذجك.

من أجل المزيد من التعلم، استكشاف الموارد مثل Scikit-learn's pre processing documentation ] Kaggle's feature engineering courses ]، والكتب المتخصصة عن الموضوع، وممارسة هذه التقنيات على مجموعات البيانات الحقيقية، والمشاركة في مسابقات التعلم الآلاتي، ومواصلة صقل مهاراتك الهندسية الرئيسية للبقاء في المقدمة.