Table of Contents

إن أساليب التكييف هي أساليب أساسية في التعلم العميق والتعلم الآلي تساعد على منع الإفراط في الاستفادة وتحسين تعميم النماذج، وعندما يكون تدريب الشبكات العصبية، فإن أحد أكثر التحديات شيوعاً هو إيجاد نماذج لا تؤدي بشكل جيد بيانات التدريب فحسب، وإنما أيضاً بيانات غير مرئية، ويستكشف هذا الدليل الشامل أكثر تقنيات تسوية الوضع فعالية - 1 و L2 و التسرب من غير النظامي مع أساليب هامة أخرى ينبغي أن يفهمها كل عالم بيانات وممارس للتعلم الآلات.

ويحدث التفويض عندما يتعلم نموذج ما بيانات التدريب بشكل جيد جدا، بما في ذلك ضوضاءه وأطرافه الخارجية، مما يؤدي إلى ضعف الأداء في البيانات الجديدة غير المنظورة، وتعالج أساليب تنظيم هذه المشكلة بإضافة قيود أو تعديلات على عملية التعلم، وتشجع النموذج على تعلم أنماط أكثر عمومية بدلا من تأطير أمثلة تدريبية محددة.

فهم الملاءمة المفرطة والحاجة إلى تنظيم

قبل أن ندخل في أساليب محددة لتسوية الوضع، من الضروري فهم سبب ضرورة تنظيم النظام في المقام الأول، عندما نتدرب على نماذج التعلم العميق، نسعى إلى التقليل إلى أدنى حد من وظيفة الخسارة التي تُقيس مدى تطابق توقعات نموذجنا مع القيم المستهدفة الفعلية، لكن إذا كنا نقدر على وظيفة الخسارة هذه بشكل عدواني جداً على بيانات التدريب وحدها، فإن النموذج قد يبدأ في حفظ أنماط محددة لا تعمم البيانات الجديدة.

ويظهر التفويض عادة كثغرة كبيرة بين التدريب وأدائه المصادقة، ويحقق النموذج نتائج ممتازة بشأن بيانات التدريب ولكنه يؤدي بشكل ضعيف على مجموعات التثبت أو الاختبارات، وهذا يحدث لأن النموذج قد تعلم أن يلتقط الضوضاء والتقلبات العشوائية في بيانات التدريب بدلا من الأنماط الأساسية التي تساعده على التنبؤ بدقة بالأمثلة الجديدة.

وتُستخدم أساليب التكييف بإضافة قيود إلى عملية التعلم التي تثبط النموذج من أن يصبح معقداً جداً أو مكيّفاً بشكل محدد جداً مع بيانات التدريب، ويمكن أن تتخذ هذه القيود أشكالاً كثيرة، من معاقبة الأوزان الكبيرة على التسرب العشوائي للأعصاب أثناء التدريب، والمفتاح هو إيجاد التوازن الصحيح بين تكييف البيانات التدريبية جيداً والحفاظ على القدرة على التعميم في الحالات الجديدة.

لام -1 تسوية: تعزيز الشفافية واختيار الأعضاء التناسلية

(ل) نظام (ل-1) المعروف أيضاً بـ (لاسو) هو تقنية قوية تضيف مصطلحاً جزائياً إلى وظيفة الخسارة يساوي القيمة المطلقة لأثقال النموذج، وهذه الطريقة لها خصائص فريدة تجعلها ذات قيمة خاصة لأنواع معينة من مشاكل التعلم الآلات، خاصة عندما تعالج البيانات العالية الأبعاد أو عندما يكون اختيار السمات مهماً.

How L1 regularization Works

وتُعدل التركيبة الرياضية للتسوية من L1 وظيفة الخسارة القياسية بإضافة مصطلح يتناسب مع مجموع القيم المطلقة لجميع الأوزان في النموذج، وتصبح وظيفة الخسارة المعدلة: الخسارة = الخسارة الأصلية + × × / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / / /

إن مظلة نظامية (إيكو) هي مقياس تقريبي يجب أن تلتحم به ل مشكلتك المحددة، حيث أن قيمة أكبر من ذلك تطبق نظاماً أكثر قوة، مما يدفع وزناً أكبر نحو الصفر، بينما تتيح قيمة صغيرة من حيث القيمة للنموذج مزيداً من الحرية لمواءمة بيانات التدريب، ويستلزم إيجاد القيمة المثلى للآلات إجراء التجارب باستخدام الترميز أو مجموعة من المصادقة.

وما يجعل عملية تسوية الطول ١ مهمة بصفة خاصة هو اتجاهها إلى إيجاد حلول متفرقة - أي حلول حيث يكون عدد كبير من الأوزان صفرا تماما، وهذا يحدث لأن وظيفة القيمة المطلقة لها زاوية حادة عند الصفر، وأثناء الاستخدام الأمثل، يرجح أن تُدفع الأوزان إلى الصفر بدلا من مجرد تخفيضها إلى قيم صغيرة، مما يجعل عملية الفرز ١ آلية فعالة للاختيار الآلي للمعالم.

استحقاقات وتطبيقات نظام L1

إنّ ملكية التّعقيم المتّصلة من نظام (ل1) تُقدّم عدة مزايا عملية، أولاً، تُجري عملية اختيار سمات آلية عن طريق إزالة الملامح غير ذات الصلة من النموذج بشكل فعّال، عندما يصبح الوزن صفراً، فإنّ السمّة المقابلة لم تعد تسهم في توقعات النموذج، التي يمكن أن تساعد على تحديد السمات التي هي ذات أهمية حقيقية للمهمة قيد البحث.

وهذه القدرة على اختيار الملامح ذات قيمة خاصة عندما تعمل مع مجموعات البيانات العالية الأبعاد التي يكون فيها عدد الملامح كبيرا بالمقارنة بعدد الأمثلة التدريبية، وفي هذه السيناريوهات، قد تكون العديد من السمات غير ذات صلة أو زائدة، ويمكن أن تساعد عملية تسوية المسائل المتعلقة بالرتبة المحلية على تحديدها والقضاء عليها، مما يؤدي إلى نماذج أبسط وأكثر تفسيرا.

كما أن نماذج العزل الناتجة عن نظام L1 لها مزايا حسابية، فالنموذجات التي لا يوجد فيها وزن كبير تتطلب قدرا أقل من الذاكرة لتخزينها ويمكن تقييمها على نحو أسرع، حيث يمكن اختراق الحسابات التي تنطوي على وزن صفري، مما يجعل النماذج غير المنتظمة من النوع L1- جذابة بشكل خاص لنشرها في بيئات مزودة بالموارد مثل الأجهزة المحمولة أو النظم المدمجة.

L1 عادة ما يستخدم نظام الضبط في نماذج خطية، وتراجع لوجستي، وشبكات عصبية، وفي أطر التعلم العميق مثل TensorFlow و Py Torch، فإن تنفيذ نظام L1 أمر مستقيم، ويتطلب عادة تحديد مواصفات واحدة عند تحديد طبقات أو متفاؤلات.

الاعتبارات العملية المتعلقة بتسوية المسائل المتصلة بالرتبة المحلية

عند تنفيذ نظام L1، يجب أن توضع في الاعتبار عدة اعتبارات عملية، أولا، يصبح توسيع نطاق المعالم هاما بشكل خاص لأن نظام L1 يعاقب على جميع الأوزان بالقيمة المطلقة، وإذا كانت الملامح على مختلف المستويات، فإن النظام سيكون له أثر غير متناسب على الأوزان التي تتناسب مع السمات ذات النطاقات الأصغر، ولذلك فإنه يوصى عموما بتوحيد أو تطبيع المعالم قبل تطبيق نظام L1.

اختيار البارامتر الخاص بتسوية الوضع الطبيعي هو أمر حاسم ومعتمد على المشاكل، والبدء بمجموعة من القيم، عادة على نطاق لوغاريتمي (مثل 0.001 و 0.001 و 0.1 و 1.0)، واستخدام التفريغ المتبادل لتحديد القيمة التي توفر أفضل تبادل بين أداء التدريب والتعميم، ويستخدم بعض الممارسين البحث عن الشبكات أو البحث العشوائي من أجل استكشاف قيم مختلفة من حيث المقاييس.

من الجدير بالذكر أيضاً أن نظام L1 يمكن أن يجعل من الصعب إلى أقصى حد لأن وظيفة القيمة المطلقة لا يمكن التمييز فيها عند الصفر، لكن الخوارزميات الحديثة ذات الاستخدام الأمثل تعالج هذه المسألة باستخدام التدرجات الفرعية أو الأساليب التقريبية، لذا فإن هذا عادة لا يشكل قلقاً عند استخدام أطر التعلم العميقة.

L2 نظام: نماذج الوتر المرتشى والنماذج النباتية

أما نظام L2، المعروف أيضاً باسم نظام ريدج أو فك الوزن، فهو أحد أكثر تقنيات تسوية النظام استخداماً في التعلم الآلاتي والتعلم العميق، وخلافاً لنظام L1، فإن تسوية L2 تضيف عقوبة تناسب مع مربع الأوزان إلى وظيفة الخسارة، مما يؤدي إلى مختلف الممتلكات والتطبيقات.

الرياضيات خلف نظام L2

ويحد نظام L2 من وظيفة الخسارة بإضافة مصطلح يتناسب مع مجموع الأوزان المربعة: الخسارة = الخسارة الأصلية + × × w2، حيث يعاد ترتيب معيار تسوية الوضع الطبيعي ويمثِّل الأوزان النموذجية، وهذه العقوبة المربعات لها خصائص مختلفة اختلافاً جوهرياً مقارنة بعقوبة القيمة المطلقة المستخدمة في تسوية L1.

فالعقوبة المربعة تعني أن الأوزان الأكبر تُعاقب أكثر من الوزن الأصغر بكثير، فعلى سبيل المثال، يسهم وزن 2.0 في العقوبة، بينما لا يسهم وزن 0.5 إلا 0.25.

على عكس نظام L1، فإن نظام L2 لا يدفع عادة الأوزان إلى الصفر، بل يتقلص جميع الأوزان إلى الصفر بشكل تناسبي، مع ارتفاع الأوزان بشكل أكثر عدوانية، وهذا يعني أن نظام L2 لا ينتج عادة نماذج متفرقة، وجميع السمات عادة ما تحتفظ ببعض التأثير على توقعات النموذج.

لماذا لا 2 أعمال تسوية

ويمكن فهم فعالية نظام L2 من منظورات متعددة، ومن وجهة نظر بايزيينية، فإن تسوية L2 تعادل وضع غاوسي قبل الأوزان، معرباً عن اعتقاده بأن الأوزان ينبغي أن تكون صغيرة ومركَّزة نحو الصفر، وهذا الاعتقاد المسبق يساعد على منع النموذج من إيلاء أهمية قصوى لأي سمة أو صلة معينة.

ومن منظور قياسي جغرافي، فإن تسوية L2 تحد من الأوزان التي يمكن أن تقع داخل مجال في مجال الوزن، وتسعى الخوارزمية، في إطار الاستخدام الأمثل، إلى التقليل إلى أدنى حد من وظيفة الخسارة مع الحفاظ على الأوزان في إطار هذا القيد المتقطع، ويحدّد حجم النطاق من خلال نظام البارامترات، مع وجود قيم أكبر من حيث القيمة المناظرة للمجالات الأصغر، وتقوية النظام.

كما أن تنظيم القاعدة الثانية له تأثير سلس على النموذج، إذ إنه بثنيه عن وجود وزن كبير، يحول دون أن يكون النموذج أكثر حساسية إزاء التغيرات الصغيرة في سمات المدخلات، مما يؤدي إلى تنبؤات أكثر استقراراً وإلى تعميم أفضل، لأن النموذج أقل احتمالاً أن يُلقى من جراء الضوضاء أو الاضطرابات الصغيرة في بيانات المدخلات.

التطبيقات وأفضل الممارسات

إن نظام L2 شائع للغاية في التعلم العميق، وكثيرا ما يطبق بالتقصير في العديد من هياكل الشبكات العصبية، وهو فعال بشكل خاص بالنسبة للشبكات العصبية لأن هذه النماذج لها العديد من المعايير، وهي عرضة للتفوق، لا سيما عندما تكون بيانات التدريب محدودة، ويستخدم تفسير التحلل المرجحي للارتطام باللونين L2 عادة في استخدام الخوارزميات المثلى مثل SGD وآدم.

في الممارسة العملية، عادة ما يفضل نظام L2 على L1 عندما تريد الاحتفاظ بجميع الملامح في النموذج ولكن تمنع أي سمة واحدة من الهيمنة، وهذا أمر شائع في السيناريوهات التي تعتقد أن جميع الملامح تحتوي على معلومات مفيدة ولا تحتاج إلى اختيار واضح للملامح.

وعند تنفيذ نظام L2، تنطبق اعتبارات مماثلة لمعدل التركيز عند المستوى الأول فيما يتعلق بزيادة السمات وضبط مقياس الأشعة فوق البنفسجية، وينبغي أن يُضبط معيار تسوية المقاييس باستخدام بيانات المصادقة، وينبغي أن تكون السمات مثالية على نطاقات مماثلة، ويبدأ العديد من الممارسين في التعلم العميق بقيم صغيرة (مثل 0.0001 أو 0.001) وأن يتكيفوا على أساس التدريب الملاحظ وأداة للتحقق.

أحد تفاصيل التنفيذ المهمة هو أن نظام L2 عادة لا يطبق على شروط التحيز، فقط على الأوزان، هذا لأن شروط التحيز لا تسهم في تعقيد النموذج بنفس الطريقة التي تفعل بها الأوزان،

شبكة المطاط: تركيبة L1 و L2

وفي حين أن لكل من نظام L1 و L2 قوة، يمكن أن يدمجا أيضا في تقنية تسمى نظام نظام اللغتين، ويضيف هذا النهج شروط الغرامة L1 و L2 إلى وظيفة الخسارة، مما يتيح لك الاستفادة من كل من الخواص المميزة وتقنية الترجيح.

The Elastic Net loss function takes the form: Loss = Original Loss + ⁇ × × total × + ki2 × × × × × × ×2, where TE1 and II control the strength of L1 and L2 regularization respectively. alternatively, it can be parameterized using a single regularization strength parameter and a mixing ratio that determines the balance between L1 and L2 penalties.

إن شبكة البيسبول مفيدة بصفة خاصة عندما تكون لديك مجموعات من السمات المتصلة بالعلاقة بين الفينة والحرف الأول، إذ تميل عملية التنظير إلى اختيار أحد السمات بصورة تعسفية من مجموعة من السمات المتصلة بالعلاقة بين الجنسين، بينما تميل عملية تسوية الحرف L2 إلى إعطاء وزن مماثل للملامح المرتبطة بالعلاقة، وتوفر الشبكة البلاستيكية أرضية المتوسطة، وتوفر بعض السمات، بينما تعالج أيضاً السمات المتشابكة.

التسرب: نظام مخزن للشبكات العصبية

التسرب هو أسلوب قوي ومستخدم على نطاق واسع لتنظيم الشبكات العصبية، وقد أصبح التسرب، الذي قدمه جيفري هينتون وزملاؤه، أحد أكثر الأساليب فعالية لمنع الإفراط في الاستفادة من نماذج التعلم العميق، خلافاً لنظام L1 و L2، الذي يعدل وظيفة الخسارة، أعمال التسرب عن طريق تعديل هيكل الشبكة عشوائياً أثناء التدريب.

كيف يعمل التسرب

الفكرة الأساسية وراء التسرب بسيطة بشكل ملحوظ ومع ذلك فعالة للغاية، خلال كل عملية تدريب، يتم التخلص من الترك عشوائياً "الهباء" أو تعطيل مجموعة فرعية من الأعصاب في الشبكة، وهذا يعني أن هذه الأعصاب تُزال مؤقتاً من الشبكة، إلى جانب كل وصلاتها القادمة والمتقادمة، وإمكانية إسقاط كل خلية عصبية تخضع لمقياس تقريبي، يُحدد عادة بنسبة 50 في المائة لكل طبقة مخبأة.

عندما يسقط الأعصاب لا يشارك في المرور الأمامي أو المرور التراجعي لذلك المثال التدريبي الخاص هذا يرغم الشبكة على تعلم التمثيلات الزائدة لأنه لا يمكنها الاعتماد على وجود أي أعصاب محدد دائماً

وأثناء الاختبار أو الاستدلال، يُطفى التسرب عادة، وجميع الأعصاب نشطة، ولكن، لحصر كون أكثر من الأعصاب ناشطة أثناء الاختبار، مقارنة بالتدريب، فإن النواتج عادة ما تُضخ من احتمال التسرب، ومعظم أطر التعلم العميق الحديثة تعالج هذا التصعيد تلقائيا، إما عن طريق التوسع في التدريب (التسرب المتعمد) أو أثناء الاختبار.

لماذا منع الانقطاع عن العمل

فالانقطاع عن الدراسة يمنع من الإفراط في الاستفادة من عدة آليات، أولاً، يمنع الأعصاب من التعاطي مع بعضها البعض، وفي شبكة عصبية عادية، يمكن للزنانين الأعصاب أن يطوروا ترابطاً معقداً حيث يعتمد بعض الأعصاب اعتماداً شديداً على وجود أعصاب أخرى معينة، ويمكن أن يؤدي هذا التكييف المشترك إلى زيادة في الملاءمة لأن الشبكة تتعلم أنماطاً محددة جداً تعتمد على هذه العلاقات الدقيقة.

ثانيا، يمكن النظر إلى التسرب على أنه تدريب مجموعة من مختلف الشبكات العصبية، ويستخدم كل تمرير تدريبي مجموعة فرعية عشوائية مختلفة من الأعصاب، ويخلق فعليا هيكلا مختلفا للشبكة، ويشهد النموذج، أثناء التدريب، آلاف أو ملايين من التشكيلات المختلفة للشبكات، وفي وقت الاختبار، يمكن النظر إلى استخدام جميع الأعصاب على أنه متوسط تقريبا للتنبؤات بجميع هذه الشبكات المختلفة، وهو شكل من أشكال التدرج أو التعليم الجماعي.

ثالثا، يضيف التسرب ضوضاء إلى عملية التعلم، التي لها تأثير منتظم، ويمنع هذا الضوضاء الشبكة من حفظ أمثلة تدريبية محددة ويشجعها على تعلم أنماط أكثر عمومية قوية من أجل الاضطرابات، ويعني الطابع المزعج للتركات أن الشبكة ترى نسخا مختلفة قليلا عن بعضها خلال كل عملية تدريب، مما يساعد على منع الإفراط في استخدام هيكل الشبكة المحددة.

تنفيذ التسرب في الممارسة العملية

وتنفيذ التسرب في أطر التعلم العميق الحديثة أمر مباشر، ففي Py Torch]، يمكنك إضافة طبقة من التسرب إلى شبكتكم، تحدد احتمال التسرب كمعيار، ويعالج الإطار تلقائياً الاختلافات بين أساليب التدريب والاختبار، ويطبق التسرب أثناء التدريب ويعطله أثناء التقييم.

احتمال التسرب هو مقياس ضغط الدم الذي يجب أن يُحسب لمشكلة خاصة بك، وتتراوح القيم المشتركة بين 0.2 و 0.5، مع وجود 0.5 عجز شعبي عن الطبقات الخفية، وعادة ما تستخدم طبقات المدخلات معدلات التسرب المنخفضة، مثل 0.1 أو 0.2، لأن تسرب الكثير من الملامح يمكن أن يزيل الكثير من المعلومات، وطبقات الناتج لا تستخدم التسرب على الإطلاق.

طبقات مختلفة في شبكتك يمكن أن تستخدم معدلات التسرب المختلفة من المسافات، من الشائع استخدام معدلات التسرب المرتفعة في طبقات أكبر أو في طبقات أكثر عرضة للتفوق، بعض الممارسين يستخدمون معدلات التسرب في الطبقات اللاحقة للشبكة، حيث أن هذه الطبقات تميل إلى تعلم المزيد من الملامح الخاصة بالعمل التي يرجح أن تكون أكثر جاذبية.

التغيرات في معدلات التسرب

ومنذ إدخاله، تم تطوير عدة تغييرات في التسرب لمعالجة سيناريوهات محددة أو تحسين الأسلوب الأصلي، فالانخفاض هو بديل يخفض الاتصالات (الوزن) بدلا من الأعصاب، بدلا من أن يُحدث نشاطات عصبية إلى الصفر، ويضع التركونوكان عشوائيا الأوزان الفردية إلى الصفر أثناء التدريب، مما يوفر شكلا أفضل من أشكال التنظيم، ولكنه مكلف بدرجة أكبر.

ويستهدف التسرب من الأماكن المخصصة للشبكات العصبية التي تتجمع في إطارها، بدلا من إسقاط الأعصاب الفردية، يسقط التسرب من الأماكن المكانية خرائط كاملة، وهذا أكثر ملاءمة لطبقات التصالح لأن المزلاجات المتاخمة في خرائط السمات ترتبط عادة ارتباطا وثيقا، ولن يوفر إسقاطات البيكسات الفردية أكبر قدر من الفوائد على تسوية الوضع.

ويطبق التسرب من المتغيرات نفس قناع التسرب عبر جميع مراحله في الشبكات العصبية المتكررة، بدلا من استخدام قناع مختلف في كل خطوة زمنية، وقد تبين أن هذا العمل أفضل بالنسبة للشبكة الوطنية لشبكة RNN لأنه يمنع الشبكة من التعلم للتعويض عن الضوضاء التي تصيب الانقطاع عن الدراسة على مر الزمن.

ويعد التسرب من الغلاف المتكرر مؤخراً متغيراً يتعلم معدل التسرب الأمثل تلقائياً أثناء التدريب، بدلاً من أن يشترط أن يكون مقاساً ثابتاً للكميات، مما قد يوفّر الوقت اللازم للتنبيب من ارتفاع مقياس التناظر، ويفضي إلى أداء أفضل باستخدام معدلات التسرب المختلفة في مراحل مختلفة من التدريب.

متى تستخدمين التركة

التسرب فعال بشكل خاص بالنسبة لطبقات متصلة بالكامل في الشبكات العصبية حيث غالباً ما يكون الإفراط في الملاءمة شاغلاً كبيراً بسبب العدد الكبير من البارامترات، وهو شائع الاستخدام في الطبقات الخفية من شبكات التغذية، وفي الاتصالات المتكررة للشبكة، وبعد الطبقة التصالحية في الشبكة (CNNs) (رغم أن التسرب العرضيفي كثيراً ما يُفضل على الطبقات التلويثية).

إن التسرب ذو قيمة خاصة عندما تكون لديك بيانات تدريبية محدودة مقارنة بتعقد نموذجك، وفي هذه السيناريوهات، فإن الإفراط في الاستفادة من هذا النموذج يشكل خطرا كبيرا، ويمكن أن يؤدي التسرب إلى تحسين أداء تعميمه بشكل كبير، ولكن عندما تكون لديك مجموعات بيانات كبيرة جدا، قد تكون الاستفادة من نظام التسرب أقل وضوحا، بل قد يبطئ التدريب دون إدخال تحسينات كبيرة.

من الجدير بالذكر أن التسرب يمكن أن يبطئ التدريب لأن الشبكة تحتاج إلى المزيد من التمرينات للتجمع عندما يتم إسقاط الأعصاب بشكل عشوائي

مقارنة L1 و L2 و التسرب

ويتطلب فهم متى يستخدم كل أسلوب من أساليب تسوية الأوضاع مقارنة خصائصه، ومواطن قوته، وحالات الاستخدام المثالي، في حين أن هذه الأساليب الثلاثة تهدف إلى منع الإفراط في الاستفادة وتحسين التعميم، فإنها تعمل بطرق مختلفة أساساً وتتناسب مع سيناريوهات مختلفة.

الآلية والأثر

(ب) العمل على تنظيم الصفيحتين 1 و2 بتعديل وظيفة الخسارة، وإضافة شروط جزائية تثبط بعض التكوينات الوزنية، وتؤثر هذه الأحكام على عملية الترجيح الأمثل مباشرة، وتؤثر على كيفية تحديث الأوزان أثناء التدريب، وعلى النقيض من ذلك، تعمل التسربات بتعديل هيكل الشبكة بشكل مفصّل أثناء التدريب، مما يخلق أثراً جماعياً دون تغيير وظيفة الخسارة ذاتها.

(ل) إنتاج نظام (ل-1) نماذج متفرقة ذات وزن صفري، واختيار الملامح بشكل فعال، وتنتج نظام L2 نماذج ذات وزن صغير موزع، حيث تسهم جميع السمات ولكن لا تهيمن عليها، وتنتج التسرب نماذج تتعلم فيها الأعصاب سمات قوية ومستقلة لا تعتمد على وجود أعصاب أخرى محددة.

الاعتبارات الحاسوبية

من منظور حسابي، إن نظام L2 هو عادة الأكثر كفاءة لأنه ببساطة يضيف مصطلحاً إلى حساب التدرج الذي يتناسب مع الأوزان، إن تسوية L1 أكثر تعقيداً بسبب عدم الاختلاف عند الصفر، ولكن الأطر الحديثة تعالج هذا بكفاءة، ويمكن أن يبطئ من التدريب لأنه يتطلب المزيد من التكرارات لتلافيقها بسبب الزيادة الكبيرة في التكلفة.

في وقت الاختبار، النماذج المُقرّرة من طراز L1- والتي لا يوجد وزن لها يمكن أن تكون أسرع لتقييمها لأن الحواسيب التي تنطوي على وزن صفري يمكن اختراقها، النماذج المُنظّمة من طراز L2- ليس لها مزايا خاصة في مجال الإلحاق، فالانقطاع عن الدراسة لا يتطلب حساباً إضافياً في وقت الإفتراض (بجانب التوسع، وهو أمر لا يُذكر) لأنه لا يُطبق إلا أثناء التدريب.

توصيات الحالات

استخدام نظام L1 عندما تريد اختيار السمات التلقائية أو عندما تعتقد أن العديد من السمات غير ذات صلة، إنه ذو قيمة خاصة بالنسبة للمشاكل الرفيعة الأبعاد حيث يكون التفسير مهماً، وتريد تحديد السمات التي تهم حقاً.

استخدام نظام L2 عندما تريد الاحتفاظ بجميع الملامح ولكن منع أي من الهيمنة، أو عندما تريد نماذج سلسة ومستقرة، هو الخيار الافتراضي للعديد من تطبيقات الشبكة العصبية ويعمل جيدا عبر طائفة واسعة من المشاكل.

استخدام التسرب عند تدريب الشبكات العصبية العميقة خاصة عندما تكون لديك بيانات محدودة عن التعقيدات النموذجية، فهو فعال بشكل خاص بالنسبة لطبقات متصلة بالكامل وأصبح عنصرا قياسيا في العديد من هياكل الشبكات العصبية، التسرب ذو قيمة خاصة عندما تحتاج إلى نظام قوي، وعندما لا يكون وقت التدريب عائقا حاسما.

مجموعة تقنيات تسوية المنازعات المتعددة

في الممارسة العملية، من الشائع والمفيد في كثير من الأحيان الجمع بين أساليب التنظير المتعددة، على سبيل المثال، يستخدم العديد من نماذج التعلم العميق الناجحة كلاً من نظام إل 2 والتسرب معاً، وتقنيتين تعملان من خلال آليات مختلفة ويمكن أن تكملا بعضها البعض، مع تنظيم L2 الذي يقيد حجم الوزن بينما يحول التسرب دون التماثل في التغذّي للأعصاب.

عندما تجمع تقنيات تسوية الوضع، قد تحتاج إلى تخفيض قوة كل تقنية من الأساليب الفردية مقارنة بما ستستخدمه إذا ما طبقته بمفردها، فإن التأثير المشترك للتسوية يمكن أن يكون قوياً جداً، لذا من المهم أن تضبط أجهزة التناظر الفائقة بدقة لتجنب نقص الملاءمة، حيث يكون النموذج مقيداً جداً لتعلم الأنماط في البيانات بفعالية.

تقنيات إضافية لتسوية الأوضاع

وفي حين أن L1 و L2 و التسرب من المدارس هي من أكثر الأساليب شيوعاً في نظام التعليم، فإن العديد من التقنيات الأخرى تستخدم على نطاق واسع في التعلم العميق الحديث، إذ إن فهم هذه الأساليب الإضافية يوفر مجموعة أدوات أكثر اكتمالاً لمنع الإفراط في استخدام النماذج وتحسين تعميمها.

التوقف المبكر

التوقف المبكر هو أحد أبسط تقنيات التنظير الأكثر فعالية، الفكرة هي رصد أداء النموذج على مجموعة من المصادقة أثناء التدريب وإيقاف التدريب عند توقف أداء التثبت من الأداء عن التحسن، حتى لو كان الأداء التدريبي لا يزال يتحسن، وهذا يحول دون استمرار النموذج في الاستفادة المثلى من البيانات التدريبية على حساب التعميم.

يتطلب تنفيذ الوقف المبكر تقسيم بياناتك إلى مجموعات التدريب والتثبت من صحتها، وأثناء التدريب، تقوم بتقييم النموذج على مجموعة التحقق على فترات منتظمة (مثل كل خندق) وتتابع فقدان المصادقة أو الدقة، وإذا لم يحسن أداء المصادقة على عدد محدد من الخناق (يسمى البارامتر الصبر)، يتم وقف التدريب وإعادة تحديد الأوزان النموذجية من أفضل أداء للتحقق.

إن التوقف المبكر جذاب جداً لأنه لا يتطلب اختيار مقياس إضافي للضغط مثل قوة نظام التشغيل، ويمكن أن يقلل من وقت التدريب بالتوقف قبل الحد الأقصى لعدد الأكواب، ولكن يتطلب وجود مجموعة مستقلة للتثبت من صحة المعلومات، مما يقلل من كمية البيانات المتاحة للتدريب، ومن المهم أيضاً اختيار قيمة صبرية مناسبة صغيرة جداً، وقد تتوقف مبكراً جداً، وكبيراً جداً، وقد تبالغ في ردة قبل التوقف.

تجميع البيانات

إن زيادة البيانات هي أسلوب تنظيمي يعمل عن طريق التوسع الصناعي في مجموعة بيانات التدريب من خلال التحولات التي تحافظ على الوسم، وهذا أمر شائع بوجه خاص في الرؤية الحاسوبية، حيث يمكن زيادة الصور من خلال التناوب، والقوابل، والمحاصيل، وتسويات الألوان، وغير ذلك من التحولات، ومن خلال التدريب على هذه الأمثلة الإضافية، يتعلم النموذج أن يكون متقلباً في هذه التحولات ويعمم بشكل أفضل البيانات الجديدة.

ومفتاح زيادة البيانات الفعالة هو اختيار تحويلات واقعية والحفاظ على المعنى الرسمي للبيانات، أما بالنسبة لصور الأجسام، فإن القلبات الأفقية والتناوبات الصغيرة تكون عادة آمنة، ولكن القلب الرأسي قد لا يكون منطقيا بالنسبة لبعض الأشياء، وبالنسبة للبيانات النصية، فإن الزيادة قد تشمل استبدال الأسماء المرادفة، أو الترجمة الخلفية، أو الإدراج العشوائي للكلمات وحذفها.

إن زيادة البيانات قوية بشكل خاص لأنها تعالج الإفراط في الاستفادة من بيانات التدريب الأساسية التي لا تكفي لأسبابها، وذلك عن طريق إيجاد أمثلة تدريبية أكثر، حتى وإن كانت مركبة، فإن للنموذج فرص أكبر لتعلم الأنماط العامة، وتوفر أطر التعلم العميق الحديثة قدرات مدمجة في مجال زيادة البيانات يمكن إدماجها بسهولة في خطوط التدريب.

التطبيع

كما أن تطبيع البطاقات، مع تصميمها أساساً للتعجيل بالتدريب وتحقيق الاستقرار الأمثل، له أثر منتظم، وهو يعمل بتطبيع المدخلات لكل طبقة بحيث لا يكون لها فرق في متوسط الوحدة، ويحسب على كل دفعة صغيرة، ويتبع هذا التطبيع نطاق متعلم وبارامترات تحول تسمح للشبكة بأن تلغي التطبيع إذا لزم الأمر.

ويأتي أثر تطبيع الباتش من واقع أن إحصاءات التطبيع (المتوسط والفروق) تُحسب على البطاقات الصغيرة، مما يُحدث ضوضاء في عملية التدريب، ويُطَّبع كل مثال بطريقة مختلفة تبعاً لأمثلة أخرى في خطتها الصغيرة، مما يضيف شكلاً من أشكال التشويش شبيهاً بالتسرب، وهذا الضوضاء له تأثير منتظم يمكن أن يقلل الحاجة إلى أساليب أخرى لتنظيم العمليات.

وقد وجد العديد من الممارسين أن الشبكات التي تطبيع دفعات يمكن أن تستخدم أقل انقطاعاً أو حتى عدم الانقطاع على الإطلاق، غير أن التطبيع والتسرب يمكن أن يتفاعلا أحياناً بطرق معقدة، ويحتاج استخدامهما معاً إلى تدقيق دقيق، وقد أصبح التطبيع في الصيد عنصراً قياسياً في معظم الشبكات العصبية الحديثة العهد، وكثيراً ما يُطبق بعد طبقات للثورة أو ترتبط ارتباطاً كاملاً.

Label Smoothing

إن سلاسة العلامات هي أسلوب تنظيمي لمشاكل التصنيف التي تحول دون أن يصبح النموذج مفرطا في الثقة في توقعاته، بدلا من استخدام أهداف صعبة (0 أو 1 للتصنيف الثنائي، وأجهزة الدفع الواحدة للتصنيف المتعدد الطبقات)، تستخدم العلامات السلسة أهدافا مرنة تسند احتمالا صغيرا إلى فصول غير صحيحة.

فعلى سبيل المثال، بدلا من استخدام هدف قدره [0 1] في مشكلة من ثلاث درجات، يمكن أن يستخدم سلسة البطاقات [005 و 0.9 و 0.05]، وهذا يشجع النموذج على أن يكون أقل يقينا في توقعاته، مما يمكن أن يحسن التعميم، والسبب في ذلك هو أن الثقة الشديدة في بيانات التدريب يمكن أن تؤدي إلى زيادة في الملاءمة، وتوسيط السمات يحول دون ذلك بمعاقبة التنبؤات المفرطة.

وقد تبين أن سلاسة العلامات تحسن الأداء في مختلف المهام، لا سيما في رؤية الحاسوب مع مجموعات البيانات الكبيرة مثل شبكة المعلومات، وهي تقنية بسيطة للتنفيذ، تتطلب عادة تعديلاً صغيراً على وظيفة الخسارة، وهي لا تستحدث سوى عامل إضافي واحد من مقياس التداخل الفائق، وهو عامل سلس يحدد مدى احتمالية الكتلة لإعادة توزيعها على الفئات غير الصحيحة.

القيود على الوزن والتطبيع

وتستلزم القيود المرهقة تقييدا مباشرا لحجم الأوزان بدلا من إضافة عقوبة إلى وظيفة الخسارة، فعلى سبيل المثال، تحد القيود المفروضة على الحد الأقصى للثانية من معيار ال2 لجهاز الوصل لكل عصبي من حيث أن يكون أقل من عتبة محددة، وإذا تجاوزت هذه القاعدة هذه العتبة بعد تحديث التدرج، فإن الأوزان تُخفض لتلبي القيد.

إن التطبيع الدقيق والتطبيع الطيفي هما التقنيات ذات الصلة التي تطبيع الأوزان بطرق محددة لتحسين استقرار التدريب والتعميم، وقد نجحت هذه الأساليب بشكل خاص في شبكات التفرد الوراثية وغيرها من السيناريوهات التدريبية الصعبة التي قد لا تكون فيها أساليب التوحيد القياسي كافية.

دليل التنفيذ العملي

ويتطلب تطبيق أساليب التسوية بنجاح فهما ليس فقط النظرية بل أيضا الجوانب العملية للتنفيذ، والتغطية بالمقياس الفائق، والتشويه، ويوفر هذا الفرع إرشادات عملية لتنفيذ نظام تنظيم المشاريع في العالم الحقيقي.

بدءًا من خط الأساس

قبل تطبيق نظام التكييف، من المهم وضع خط أساس من خلال تدريب نموذج بدون تسوية هذا الخط الأساسي يساعدك على فهم ما إذا كان نموذجك مغالى فيه بالفعل وكم من النظام مطلوب، وتدريب نموذجك على مجموعة التدريب وتقييمه على كل من مجموعات التدريب والتثبت من صحة المعلومات، والفجوة الكبيرة بين التدريب وأداء التثبت تدل على الإفراط في التأقلم وتقترح أن التسوية ستكون مفيدة.

وإذا كان نموذجك ضعيفاً (يؤدي بشكل غير سليم إلى حد كبير على كل من التدريب ومجموعات التصديق)، فإن إضافة نظامية لن تزيد من سوء الأمور إلا في هذه الحالة، ينبغي أن تركز أولاً على زيادة القدرة النموذجية، أو تحسين السمات، أو تعديل معدل التعلم قبل النظر في تسوية الأوضاع.

مقياساً للهبوط الأولي

عند بدء عملية التكييف، واستخدام القيم الأولية المحافظة والتعديل على أساس النتائج، بالنسبة للوقود L2، بدء العمل بقيم صغيرة مثل 0.0001 أو 0.001، وبالنسبة للتسوية L1، قد تبدأ بقيم مماثلة، ولكن تكون مستعدا للتكيف بشكل أكبر استنادا إلى مقدار الشدة الذي تريده، وبالنسبة للتركات، تبدأ بـ 0.5 في الطبقات الخفية و 0.2 في طبقات المدخلات إذا استخدمت.

من الأفضل عموماً أن تبدأ بضعف النظام و زيادةه إذا لزم الأمر بدلاً من أن تبدأ بقوة و نقص في الملاءمة

استراتيجيات التطويع

ويعد التقاط المقياس الفوقي المنتظم أمرا أساسيا لإخراج أكثر تقنيات التصحيح، ويشمل البحث عن الظلم محاولة جميع تركيبات المقاييس الفائقة الدقة من القوائم المحددة سلفا، وهي شاملة ولكنها يمكن أن تكون باهظة التكلفة حسابيا، وتتكون عينات البحث عن مقياس الأشعة فوق البنفسجية من توزيعات محددة، ويمكن أن تكون أكثر كفاءة من البحث عن الشبكات، خاصة عندما تكون بعض المقاييس الفائقة الأهمية أكثر من غيرها.

ويمكن أن تكون النهج الأكثر تطوراً مثل التفشي في بايزيان أكثر كفاءة باستخدام النتائج السابقة لتوجيه البحث عن قياسات أعلى درجة للكميات.

وعندما تواكب أساليب التنظير المتعددة في آن واحد، تكون على علم بأنها تتفاعل مع بعضها البعض، فإن القوة المثلى لتسوية الطول من المستوى الثاني عند استخدام التسرب قد تختلف عن القوة المثلى عندما لا تستخدم التسرب، وتنظر في ضبط مقاييس الارتفاع في المراحل، وتجد أولا قيما جيدة لإحدى التقنيات، ثم تضيف وتربط بعضها البعض.

الرصد والتداول

يتطلب الاستخدام الفعال للتنظيم رصدا دقيقا لديناميات التدريب، وقد يكون التدريب على فترات طويلة، وفقدان المصادقة، من أجل تصور كيف تتغير الفجوة بين هذه التغيرات مع تقدم التدريب، وإذا كانت الفجوة كبيرة ومتنامية، تحتاج إلى مزيد من التنظيم، وإذا كان المنحنىان مرتفعا ولا ينقصان كثيرا، فقد يكون لديك الكثير من التنظيم أو قضايا أخرى مثل معدل التعلم الذي هو منخفض جدا.

عند استخدام نظام L1، رصد مدى شدة نموذجك - أي نسبة من الأوزان هي صفر أو قريبة جداً من الصفر - وهذا يمكن أن يساعدك على فهم ما إذا كان L1 له الأثر المنشود وما إذا كنت بحاجة إلى تعديل قوة التسوية، وعند استخدام التسرب، ضمان تطبيقه فعلاً أثناء التدريب والإعاقة أثناء التقييم، حيث إن نسيان تغيير النماذج هو خطأ شائع.

كما أنه إذا استغرق التدريب وقتا أطول بكثير مما كان متوقعا، فقد يكون ذلك بسبب التصحيح القوي (لا سيما التسرب) الذي يتطلب مزيدا من الخناق للترابط، وفي هذه الحالات قد تحتاج إلى زيادة عدد الخناق التدريبية أو تعديل قوة التنظيم من أجل إيجاد توازن أفضل بين وقت التدريب والأداء النموذجي.

الشلالات المشتركة وكيفية تجنبها

خطأ شائع هو تطبيق نظامية على جميع المعايير بشكل عشوائي، عادة لا ينبغي تعديل شروط البازلاء، لأنها لا تسهم في تعقيد النموذج بنفس الطريقة التي تُستخدم بها الأوزان، ومعظم أطر التعلم العميق تسمح لك بتحديد المعايير التي ينبغي أن تُنظَّم، وبالتالي الاستفادة من هذه المرونة.

وثمة مشقق آخر يتمثل في استخدام نفس القوة في نظام النظام على جميع المستويات، وقد تستفيد مختلف الطبقات من مختلف كميات التطبيع، وقد تحتاج العاجز التي لديها معايير أو طبقات أكثر عرضة للتفوق (مثل الطبقات المرابطة بالكامل) إلى تسوية أقوى من غيرها، وقد تحتاج التجارب إلى مواطن القوة لتسوية الأوضاع على نحو أفضل.

إن نسيان الملامح قبل تطبيق نظام L1 أو L2 خطأ شائع آخر، وبما أن هذه التقنيات تعاقب على حجم الوزن، فإن السمات على مختلف المستويات ستتأثر بشكل مختلف بالتسوية، وتوحيد أو تطبيع سماتكم بحيث تكون لها مستويات مماثلة قبل التدريب على نظام L1 أو L2.

أخيراً، لا تنسى أنّ التّنظير مجرّد أداة واحدة في مجموعة أدواتك، إن كان نموذجك مفرطاً في التأقلم، فربّما عليك أيضاً أن تنظر في جمع المزيد من البيانات التدريبية، باستخدام زيادة البيانات، وتبسيط هيكلك النموذجي، أو تحسين سماتك، فالتّنظيم يعمل على أفضل وجه كجزء من نهج شامل لبناء نماذج تعلم آلية قوية.

المواضيع المتقدمة والتطورات الأخيرة

ولا يزال مجال التنظيم يتطوّر، حيث يقوم الباحثون بتطوير تقنيات جديدة، ويكتسبون فهما نظريا أعمق للأساليب القائمة، ويمكن أن يساعدكم البقاء على علم بهذه التطورات على تطبيق نظامي أكثر فعالية والاستفادة من التقنيات التي تتطور.

تسوية التكيف

وقد استكشفت البحوث الأخيرة أساليب تسوية التكيف التي تكيف تلقائياً القوة في مجال تنظيم التدريب، بدلاً من استخدام معيار ثابت لتسوية الوضع في جميع مراحل التدريب، فإن هذه الأساليب تزيد أو تنخفض من نظام النظام القائم على الحالة الراهنة للنموذج وديناميات التدريب، مما قد يؤدي إلى تحسين الأداء عن طريق تطبيق نظام أكثر قوة في مرحلة مبكرة من التدريب عندما يكون النموذج أكثر عرضة للتجاوز في الأداء، ويضعف نظامه بعد ذلك عندما يحتاج النموذج إلى مزيد من المرونة لتحسين توقعاته.

تسوية مسألة التعلم في مجال النقل

فالتعليم التحويلي، الذي يُعد فيه نموذجاً مُدرباً مسبقاً على مهمة أخرى، يتطلب إيلاء اعتبار خاص للتنظيم، حيث أن الأوزان التي سبقت التدريب تحدد بالفعل خصائص مفيدة، وتطبيق نظام أكثر من اللازم أثناء التدقيق يمكن أن يدمر هذه المعلومات، وتشمل الممارسات المشتركة استخدام نظام أكثر ضعفاً أثناء التدقيق، وتطبيق مواطن القوة النظامية المختلفة على الطبقات الأولية السابقة للتدريب والجديد، أو استخدام تقنيات مثل المراحل غير المعفاة تدريجياً.

تسوية مختلف الهياكل

وقد تستفيد مختلف هياكل الشبكات العصبية من مختلف نُهج تسوية الوضع، وكثيرا ما تعمل الشبكات العصبية التي تبث روحا جيدة مع التسرب من الأماكن المكانية وزيادة البيانات، في حين أن الشبكات العصبية المتكررة قد تستفيد أكثر من التسرب والتصنيف المتباينين، وكثيرا ما تستخدم نماذج التحول، التي أصبحت مهيمنة في تجهيز اللغات الطبيعية، مزيجا من التسرب، وتناقص الوزن، وتطبيع طبقات النظام.

ويظهر أن آليات الاهتمام بالمحولين تمثل تحديات وفرصا فريدة في مجال تنظيم المشاريع، وقد تبين أن الانقطاع عن الدراسة، الذي يخفض بشكل عشوائي الأوزان التي يكتنفها الاهتمام، فعال في منع الإفراط في الاستفادة من نماذج المحولات، كما استطلع بعض الباحثين تنظيم أنماط الاهتمام لتشجيع بعض الممتلكات المستصوبة، مثل الالتفات إلى المراكب القريبة في مهام النماذج المتعاقبة.

الفهم النظري

وقد وفر العمل النظري الأخير نظرة أعمق على سبب عمل النظام وكيفية ارتباط مختلف التقنيات ببعضها البعض، فعلى سبيل المثال، أظهر الباحثون صلات بين التسرب والاختبار البيزي، مما يوحي بأن التسرب يمكن اعتباره إشارة شبه متبادلة إلى البارامترات النموذجية، وقد أدى هذا الفهم النظري إلى تحسينات عملية، مثل استخدام التسرب في وقت الاختبار لتقدير عدم اليقين النموذجي.

Other theoretical work has explored the implicit regularization provided by the optimization algorithm itself. Stochastic gradient descent, even without explicit regularization terms, has been shown to have an implicit bias toward solutions that generalize well. Understanding these implicit regularization effects can help practitioners make better decisions about when and how much explicit regularization to apply.

دراسات الحالة والتطبيقات العالمية الحقيقية

فدراسة كيفية تطبيق أساليب التسوية في نظم العالم الحقيقي الناجحة توفر رؤية قيمة لأفضل الممارسات والاستراتيجيات الفعالة، وكثيرا ما تتطلب مجالات وتطبيقات مختلفة اتباع نهج مختلفة لتسوية الأوضاع استنادا إلى خصائصها وقيودها المحددة.

تطبيقات الرؤية الحاسوبية

وفي رؤية الحاسوب، لا سيما فيما يتعلق بمهام تصنيف الصور، يُستخدم عادة مزيج من أساليب التنظير، وتستخدم نماذج أحدث من قبيل شبكة المعلومات والشبكة الفعالة نظام L2 (تفكيك الوزن) كخط أساس، مقترنة بزيادة البيانات على نطاق واسع، بما في ذلك المحاصيل العشوائية، والقوابل، وتلويث اللون، والتقنيات الأكثر تقدما مثل قطع الأشجار ومسحوق التحلل، وكثيرا ما تستخدم التسرب بشكل متقطع في طبقات أكثر ارتباطا بالجملة.

وتواجه نماذج الكشف عن الأجسام وتجزئة الرمانية تحديات إضافية لأن لديها هياكل أكثر تعقيداً مع وجود العديد من رؤساء النواتج، وكثيراً ما تستخدم هذه النماذج استراتيجيات مختلفة لتسوية العناصر المختلفة، وذلك من أجل تنظيم رؤساء التصنيفات، ووضعف نظام تنظيم رؤساء التكوين المحلي، وتكاد تطبيع المصيد في تركيبات الحواسيب الحديثة، وتوفر فوائد كبيرة من نظام التصنيف.

تجهيز اللغات الطبيعية

وتعتمد نماذج تجهيز اللغات الطبيعية، ولا سيما نماذج اللغات الكبيرة القائمة على هيكل المحولات، اعتمادا كبيرا على التنظيمات لمنع الإفراط في التأقلم على الرغم من وجود بلايين من البارامترات، وتستخدم هذه النماذج عادة مزيجا من التحلل في الوزن، والتسرب المطبق على الأوزان التي يُستخدم فيها الاهتمام، وعلى طبقات التغذية، وتطبيع طبقات المياه، وكثيرا ما تكون معدلات التسرب مرتفعة جدا، وأحيانا تتراوح بين 0.1 و 0.3 في المائة، مما يعكس القدرة الكبيرة لهذه النماذج.

وتأخذ زيادة البيانات في مجال التعليم غير القانوني أشكالا مختلفة عن الرؤية الحاسوبية، بما في ذلك تقنيات مثل الترجمة التحريرية، واستبدال الأسماء المستعارة، والإدراج العشوائي للكلمات أو حذفها، كما أن التقنيات الحديثة مثل التعلم المتناقض قد أظهرت أيضا وعدا بتحسين تعميم نماذج برامج التعليم غير النظامي، وقد أصبح التدريب السابق على الضمادات الكبيرة، الذي يليه تعديل النظام المناسب، النموذج السائد لمعظم مهام برامج التعليم الوطنية.

نظم التوصية

وكثيرا ما تتناول نظم التوصية بيانات متفرقة وعالية الأبعاد، حيث يكون تنظيم المضبوطات أمرا حاسما لمنع الإفراط في الملاءمة، وتستخدم نماذج معامل المطاط، التي هي شائعة في التصفيف التعاوني، عادة نظام L2 لمنع المستعملين المتعلمين وضم المواد من أن يصبح كبيرا جدا، وهذا أمر مهم بصفة خاصة لأن قلة من شدة البيانات تعني أن هناك الكثير من المعايير التي يجري تحديثها بشكل متكافئ، مما يجعلها أكثر عرضة.

وتجمع نظم التوصية القائمة على التعلم العميق بين أساليب التوحيد التقليدية والنُهج الخاصة بكل مجال، فعلى سبيل المثال، يُطبق التسرب عادة على طبقات الترسب وعلى طبقات متصلة تماما، في حين يطبق نظام L2 على جميع المعايير، كما تستخدم بعض النظم العينات السلبية وغيرها من التقنيات التي تنطوي على آثار تسويتها بجعل مشكلة التعلم أكثر تحديا.

موجز وأفضل الممارسات

ويعد تنظيم النظام عنصرا أساسيا في التعلم الحديث للآلات والتعلم العميق، ويوفر الأدوات اللازمة لبناء نماذج تعمم بشكل جيد على البيانات غير المنظورة، ويكتسي فهم مختلف تقنيات التنظيم، ومتى تطبق هذه الأساليب أهمية حاسمة في وضع نماذج قوية وعلي مستوى الأداء.

مداخل رئيسية

L1، التصحيح هو مثالي عندما تحتاج إلى اختيار خاص أو تريد نماذج متفرقة، وهو يدفع الأوزان إلى الصفر تماما، ويزيل بشكل فعال الملامح غير ذات الصلة من النموذج.

(ه) إن نظام تسوية المنازعات L2 هو أكثر تقنيات التنظير المستخدمة عموماً ويعمل على نطاق واسع من المشاكل، ويشجع على وجود أوزان صغيرة موزعة وينتج نماذج سلسة أقل حساسية للضوضاء، ويستخدم L2 كخيار غير مباشر للشبكات العصبية، وينظر في الجمع بينها وبين تقنيات أخرى لتوطيد الأمور عند الحاجة.

(أ) أن يكون الـ (ديروبوت) ) فعالاً بشكل خاص بالنسبة للشبكات العصبية العميقة، ويعمل عن طريق تعطيل الأعصاب بشكل عشوائي أثناء التدريب، ويمنع التكرار المشترك ويمكن اعتباره تدريب مجموعة من النماذج، واستخدام التسرب في طبقات مترابطة تماماً، وتعديل معدل التسرب استناداً إلى حجم طبقة الشبكة ومكانتها، وتذكر أن التسرب يمكن أن يبطئ التدريب، ولكنه يوفر عادة تحسينات هامة.

التوصيات العملية

بدء بنموذج خط الأساس بدون تسوية لفهم ما إذا كان المغالاة في الملاءمة مشكلة في الواقع، وإذا كانت هناك فجوة كبيرة بين التدريب وأداء المصادقة، تبدأ بإضافة تقنيات تسوية واحدة في كل مرة، بدءاً بأبسط النهج.

لا تخافي من الجمع بين تقنيات التكييف المتعددة لكن كوني مدركة أنهما يتفاعلان مع بعضهما البعض عندما تستخدمين تقنيات متعددة ربما تحتاجي إلى تخفيض قوة كل تقنية منفردة

إيلاء الاهتمام للخصائص المحددة لمشكلتك عند اختيار أساليب التسوية، وقد تستفيد المشاكل الرفيعة المستوى التي تنطوي على العديد من السمات غير ذات الصلة من تسوية L1، في حين أن المشاكل التي تنطوي على بيانات محدودة قد تستفيد أكثر من التسرب وزيادة البيانات، والنظر في القيود الحسابية لسرعة تطبيقك - إذا كانت السرعة غير مناسبة، فإن تسوية L1 قد تكون أفضل لأنها تنتج نماذج متفرقة أسرع لتقييمها.

وأخيرا، تذكر أن التوحيد هو جزء فقط من بناء نماذج فعالة للتعلم الآلي، وأن السمات الجيدة، والهيكل النموذجي المناسب، وبيانات التدريب الكافية، والتنصت على قياسات الارتفاع السليمة، هي كلها عناصر أساسية، وأن تنظيم النظام يعمل على أفضل وجه عندما يقترن بهذه الممارسات الأخرى الفضلى كجزء من نهج شامل إزاء وضع النماذج.

موجز تقنيات تسوية المنازعات

  • L1 تسوية (Lasso) : يضاف القيمة المطلقة للوزن إلى وظيفة الخسارة، ويعزز الفصل واختيار السمات التلقائية، وهو مثالي للبيانات العالية الأبعاد التي لها العديد من السمات غير ذات الصلة
  • L2 نظام (ريدج) : يضاف أوزان مربعة إلى وظيفة الخسارة، ويشجع على توزيع الأوزان الصغيرة، ومعظمها يستخدم تقنية تسوية مختلف أنواع النماذج
  • Dropout]: Randomly deactivates neurons during training, prevents co-adaptation, particularly effective for deep neural networks with fully connected layers
  • Early stopping]: Monitors validation performance and stops training when it stops improving, simple yet effective technique that requires no additional hyperparameters
  • Data Augmentation]: Artificially expands training data through label-preserving transformations, addresses overfitting by increasing effective dataset size
  • Batch Normalization]: Normalizes layer inputs over mini-batches, provides implicit regularization through noise introduced by batch statistics
  • Label Smoothing: تستخدم أهدافاً لينة بدلاً من العلامات الصلبة، وتمنع التنبؤات المفرطة في الثقة وتحسن التعميم
  • Weight Constraints: Directly limits weight magnitudes through constraints like max-norm, provides alternative to penalty-based regularization
  • Elastic Net]: Combines L1 and L2 regularization, provides benefits of both sparsity and weight smoothing
  • Spatial dropout]: إسقاطات كاملة لخرائط خاصة في شبكات التواصل، أكثر ملاءمة من التسرب الموحد للبيانات المكانية

وبفهم هذه الأساليب المتعلقة بالتنظيم وتطبيقها بفكر، يمكنك بناء نماذج للتعلم الآلي لا تؤدي بشكل جيد بيانات التدريب فحسب، بل أيضاً تعميمها بفعالية على سيناريوهات العالم الحقيقي، والمفتاح هو تجربة نتائجك ورصدها بعناية، وتكييف نهجك استناداً إلى الخصائص والمتطلبات المحددة لمشكلتك.