Table of Contents
فهم مدى نجاح نموذجك للتصنيف الآلي في أداءه أمر حاسم لبناء نظم موثوقة ودقيقة، في حين أن العديد من علماء البيانات وممارسي التعلم الآلي يركزون فقط على الدقة كمقياس تقييمهم الأولي، هذا النهج يمكن أن يكون مضللاً بشكل خطير، خصوصاً عندما يعمل مع مجموعات البيانات أو التطبيقات المميزة حيث تحمل أنواع مختلفة من الأخطاء تكاليف مختلفة، ومصفوفة الارتباك هي جدول يوجز أداء نموذج التصنيف
هذا الدليل الشامل سيوصلك إلى كل ما تحتاجه لمعرفة ما هو الارتباك في تطبيقات التعلم الآلاتي من فهم مكوناتها الأساسية لحساب القياسات الأساسية وتفسير النتائج لتحسين نماذجك، سواء كنت تبني نظم كشف الاحتيال، أدوات التشخيص الطبي، مرشحات الترميز، أو أي تطبيق آخر للتصنيف، فإن استخلاص مصفوفات الارتباك أمر أساسي لتقييم أداء نموذجك وتحسينه.
ما هي مصفوفة الكونفوسيون؟
مصفوفة الارتباك هي أداة لتقييم الأداء تستخدم في التعلم الآلاتي تلخص أداء نموذج التصنيف من خلال تدوين التنبؤات الإيجابية الحقيقية والسلبية والباطلة والإيجابية والباطلة السلبية، بدلا من تقديم رقم واحد فقط من حيث الدقة، تعطي مصفوفة الارتباك تفصيلا لكيفية أداء نموذجك في مختلف أنواع التنبؤات.
ومصفوفة كونفوسيون هي مصفوفة ن س ن س تستخدم لتقييم أداء نموذج التصنيف، حيث ن هي العدد الإجمالي للصفوف المستهدفة، وتقارن المصفوفة القيم المستهدفة الفعلية بالقيم التي يتوقعها نموذج التعلم الآلي، وبالنسبة للتصنيف الثنائي، فهي جدول 2x2 مع صفين وأعمدة، وتظهر الرواميس عادة الطبقات الفعلية، وتظهر الأعمدة الفصول المتوقعة.
هذا يسمح بتحليل أكثر تفصيلاً من مجرد ملاحظة نسبة التصنيفات الصحيحة (الصدق) مصفوفة الارتباك لا تكشف فقط ما إذا كان نموذجك يخطئ، بل على وجه التحديد أنواع الأخطاء التي يقوم بها - معلومات أساسية لتحسين الأداء النموذجي وفهم حدوده في تطبيقات العالم الحقيقي.
العناصر الأساسية الأربعة لمصفوفة عقيدة
وتتكون كل مصفوفة للارتباك في التصنيف الثنائي من أربعة عناصر أساسية تصنف جميع نتائج التنبؤ الممكنة، فهم هذه المكونات هو أساس حساب وتفسير جميع مقاييس الأداء الأخرى.
إيجابيات حقيقية
إيجابي حقيقي (TP): إن مجموع عدد الحسابات التي تنبأ بها والقيم الفعلية هي كلاً من الكلاب، أي أن الإيجابيات الحقيقية تمثل حالات يتوقع فيها النموذج بشكل صحيح الصف الإيجابي، فعلى سبيل المثال، في تصنيف بريد إلكتروني مسمّى، يكون إيجابياً حقيقياً بريدا إلكترونياً مُبهجاً بالفعل، وقد تم تحديده بشكل صحيح على أنه مُبَطِّخ من النموذج.
هذه هي الحالات التي حصل فيها نموذجك على ذلك عندما توقعوا الصف الإيجابي
النقائص الحقيقية
سلبي حقيقي (TN): إن مجموع العدات التي تنبأ بها القيم الفعلية ليست كلاً منها، فالأساليب الحقيقية هي حالات يتوقع فيها النموذج بشكل صحيح الصف السلبي، ففي البريد الإلكتروني الساطع، سيكون هناك بريد إلكتروني سلبي حقيقي يصنف على نحو صحيح على أنه ليس مبعثرة.
ومن ناحية أخرى، فإن السلبيات الحقيقية مصنفة بشكل صحيح، مع تحديد دقيق لـ 000 9 رسالة إلكترونية غير موزعة، وهي تمثل توقعات صحيحة للفئة السلبية.
False Positives (FP)
(العلامة الإيجابية) هي التهم الإجمالية التي تنبأ بها (دوغ) بينما لا توجد في الواقع أيّة إيجابية من نوع (فلاس) معروفة أيضاً بالأخطاء من النوع الأول، تحدث عندما يتوقّع النموذج بشكل خاطئ الدرجة الإيجابية، والإيجابات المزيفة هي "إنذارات كاذبة" والسلالات الكاذبة
وفي الكشف عن البصمات، يكون الإيجاب الكاذب هو رسالة إلكترونية مشروعة لا تُعرف بشكل خاطئ على أنها تسبب في عدم وجود رسائل هامة، أما الإيجابيات المزيفة فهي حالات يصف فيها النموذج بصورة غير صحيحة بنتيجة إيجابية، ففي مثالنا، كان هناك 100 بريد إلكتروني غير مبعثرة على نحو غير صحيح.
الزنوج الزعفران
النفي الزائف (FN): إن العدد الإجمالي للتنبؤات ليس كلباً، في حين أنه في الواقع، يحدث سلبيات للكلاب، أو أخطاء من النوع الثاني، عندما لا يحدد النموذج الحالات الإيجابية، مما يصنفها على نحو غير صحيح على أنها سلبية.
وعلى العكس من ذلك، فإن السلبيات الكاذبة هي حالات تُغفل فيها حالات إيجابية فعلية، وفي هذا السيناريو، فقد فوت 300 رسالة إلكترونية، وفي التشخيص الطبي، فإن السلبيات الكاذبة خطيرة للغاية، ومريض يُقال إنه مرض يمكن أن يؤخر العلاج الحرج.
كيف نصنع و نُقّن مصفوفة
إنشاء مصفوفة الارتباك تتضمن مقارنة توقعات نموذجك مع علامات الحقيقة الحقيقية الحقيقية الفعلية لمجموعتك البياناتية العملية مباشرة ولكن تحتاج إلى عناية دقيقة لضمان النتائج الدقيقة
عملية حساب الخطوة خطوة خطوة خطوة إلى الأمام
لخلق مصفوفة الارتباك، عليك أولاً أن تولد التنبؤات النموذجية لبيانات المدخلات ثم تحصل على البطاقات الفعلية، إليك النهج المنهجي:
- Train your classification model ] on your training dataset using your chosen algorithm (logistic regression, decision trees, neural networks, etc.)
- Generate predictions ] on your test or validation dataset - the model your model has not seen during training
- Compare predictions to actual labels] for each instance in your dataset
- Count each outcome type] -tally how many predictions fall into each of the four categories (TP, TN, FP, FN)
- Populate the spec] with these counts in the appropriate cells
كل التوقعات الصحيحة موجودة في تشخيص الطاولة (المنشورة بالأخضر) لذا من السهل فحص الطاولة بصرياً لأخطاء التنبؤ، حيث أن القيم خارج التشخيص ستمثلها، وهذا الهيكل البصري يجعلها واضحة على الفور حيث يعمل نموذجك جيداً وحيث يكافح
تنفيذ مصفوفات الاتحاد في بيتون
إذا أردت أن تولد مصفوفة خلط لبياناتك يمكنك أن تفعل هذا بسهولة بأدوات مثل التزلج
هنا مثال أساسي لطريقة خلق مصفوفة الارتباك باستخدام (بايتون) و تعلم السكيت:
وبغية خلق مصفوفة الارتباك، نحتاج إلى استيراد مقاييس من نموذج التعلم الكحلي، فعندما يتم استيراد القياسات، يمكننا استخدام وظيفة مصفوفة الارتباك على قيمنا الفعلية والمتوقعة، وتشمل هذه العملية استيراد المكتبات اللازمة، وتوليد أو الحصول على قيمكم الفعلية والمتوقعة، ثم استخدام وظيفة الخلط - المفارقة لحصر المصفوفة.
ولخلق عرض بصري أكثر تفسيرا، نحتاج إلى تحويل الطاولة إلى عرض لمصفوفة الارتباك. وهذا التبصر يجعل من الأسهل تفسير النتائج على نحو واضح.
أمراض أساسية مستمدة من مصفوفة الكونفوسيون
باستخدام TP، TN، FP، و FN، يمكنك حساب مختلف مقاييس جودة التصنيف، مثل الدقة والتذكر، هذه القياسات توفر وجهات نظر مختلفة عن أداء نموذجك، كل منها يبرز جوانب محددة تهم مختلف التطبيقات.
Accuracy: Overall Correctness
وتقيس مدى صحة النموذج في كثير من الأحيان. (النظرية الإيجابية + السلبية الحقيقية)/التوقعات الإجمالية هذه هي أكثر القياسات ملاءمة، وهي ببساطة تخبرك النسبة المئوية لجميع التنبؤات الصحيحة.
ويقيِّم الاستحقاق صحة النموذج عموماً بتقسيم مجموع الايجابيات الحقيقية والسلبيات الحقيقية حسب العدد الإجمالي للتنبؤات، وهذا يعادل 0.85 (أو 85 في المائة)، ويعني أن النموذج قد تنبؤ بشكل صحيح بنسبة 85 في المائة من الرسائل الإلكترونية.
غير أن الدقة لها قيود كبيرة، فالآكتوارية ستسفر عن نتائج مضللة إذا لم تكن مجموعة البيانات متوازنة؛ أي عندما تختلف أعداد الملاحظات في مختلف الفئات اختلافا كبيرا، وبالنسبة لمجموعات البيانات المميزة بدرجة كبيرة، حيث يبدو أن درجة واحدة نادرا جدا، تقول 1 في المائة من الوقت، وهو نموذج يتوقع أن يكون سلبيا 100 في المائة من الوقت، سيسجل 99 في المائة على الدقة، رغم عدم جدوى ذلك.
الدقة: نوعية الفرضيات الإيجابية
الدقة، التي تعرف بأنها تيب/توب، تقيّم دقة التنبؤات الإيجابية، وتجيب بدقة على السؤال: "إذا كانت جميع الحالات التي توقع فيها النموذج إيجابية، كم عدد الحالات التي كانت إيجابية فعلاً؟"
الدقة تُقيس دقة التنبؤ الإيجابي، تُجيب على سؤال "عندما كان النموذج يُتوقع أن يكون صحيحاً"
ويكتسي الدقة أهمية خاصة عندما تكون تكلفة الايجاب الكاذب مرتفعة، ويقي ِّم بدقة نسبة التنبؤات الإيجابية الحقيقية بين جميع التنبؤات الإيجابية )البرنامج التنفيذي للتنبؤات المالية( وهذا القياس بالغ الأهمية عندما تكون تكلفة الايجابات الكاذبة مرتفعة.
مثلاً، في تصفية البريد الإلكتروني، الدقة العالية تعني أنه عندما يُسمّى بريد إلكتروني على أنه مُعلّم، من المرجح جداً أن يُخفّض في الواقع خطر الإرساليات المشروعة المهمة التي تُخطّط بشكل غير صحيح.
Recall (Sensitivity): Completeness of Positive Detection
(الرجوع، الذي يعرف باسم (تي بي)/(البرنامج + FN) يقيّم مدى جودة النموذج في تحديد جميع الحالات الإيجابية، ويجيب على: "إذا كانت جميع الحالات الإيجابية الفعلية، كم عدد الحالات التي حددها النموذج بشكل صحيح؟"
اعادة الطلب او الحساسية يقيس عدد الايجابيات الفعلية التي حددها النموذج بشكل صحيح انه يجيب على سؤال "عندما كان الفصل في الحقيقة "تي آر اي كم من المرات حصل عليها المصنف بشكل صحيح ؟
ويكتسي الاسترداد أهمية عندما يتبين أن حالة الطوارئ التي تفتقد إلى درجة إيجابية أسوأ بكثير من الحالات التي تصنف فيها الحالات السلبية بشكل غير صحيح بأنها إيجابية، ويقيّم من نسبة التنبؤات الإيجابية الحقيقية إلى العدد الفعلي للحالات الإيجابية (TP/TP + FN)). وهذا القياس هام عندما تكون الحالات الإيجابية المفقودة باهظة التكلفة.
وفي التشخيص الطبي، فإن التذكرة العالية أمر حاسم - إذ تريد أن تقبض على جميع المرضى الذين يعانون من مرض، حتى وإن كان ذلك يعني بعض الإنذارات الكاذبة، وقد يكون فقدان تشخيص السرطان (الضرر السلبي) قاتلاً، مما يجعل التذكر هو المطب ذي الأولوية.
المواصفات: المعدل السلبي الحقيقي
(أ) التحديد (معدل سلبي نقدي حقيقي): يحسب التحديد نسبة التنبؤات السلبية الحقيقية إلى العدد الفعلي للحالات السلبية (TN/(TN + FP)). ويقيّم هذا القياس مدى تحديد النموذج للحالات السلبية.
والخصوصية مهمة بوجه خاص في السيناريوهات التي تُحدد فيها بشكل صحيح القضايا السلبية، مثلاً، في الفحص الأمني، تريد أن تكون دقيقة للغاية لتجنب الإنذارات غير الضرورية، بينما لا تزال تحافظ على الحساسية الكافية للقبض على التهديدات الفعلية.
F1 Score: Balancing Precision and Recall
النتيجة الـ (إف 1) هي النسق التناسقي للدقة والتذكر، وبالتالي فهي تمثل بدقة وتذكر في قياس واحد، ويضع مؤشر (F1) التوازن بين الدقة والتذكر لنموذج، وتتراوح بين صفر و1، حيث يشير المرء إلى الدقة والتذكر بشكل مثالي، ولا يعني أي أداء ضعيف.
والصيغة الخاصة بمؤشر F1 هي: F1 = 2 × (التصويب × Recall)/ (الدق + Recall)
فبسبب أن التناسق يعني فرض عقوبات على القيم القصوى، فإذا كان للنموذج دقة بنسبة 100 في المائة ولكن تذكر بنسبة 10 في المائة، فإن المتوسط البسيط سيعطي 55 في المائة - وهذا يبدو لائقا، ويعطي النسق 18.2 في المائة - وهو ما يعكس بدقة أكبر مدى سوء النموذج حقا، ولا يرتفع إلا عندما يكون الدقة والتذكر مرتفعين بدرجة معقولة.
قياس النتيجة الـ (إف 1) أمر حاسم عندما تتعامل مع البيانات المُختلِلة أو عندما تريد أن تُوازن بين الدقة والتذكر، استخدام النتيجة الـ (إف 1) عندما يكون الدقة والتذكر مهماً بنفس القدر
عندما يكون للدقة والتذكر كل منهما عشرات مثالية تبلغ 1، و1 سيكون له أيضاً هدف مثالي قدره 1.0.
فهم عملية التداول الدقيقة
إن التبادل بين استخدام القياسات المختلفة في مصفوفة الكونفوسيون أمر أساسي حيث أن هناك تأثيراً على بعضها البعض، فعلى سبيل المثال، تؤدي زيادة الدقة إلى انخفاض التذكر، وهذا سيرشدكم إلى تحسين أداء النموذج باستخدام المعرفة من القيم المتأثّرة.
فالواقع والتذكر كثيرا ما يكونان في حالة توتر مع بعضهما البعض، إذ يمكن للنموذج أن يحقق ثلاثمائة في المائة من التذكر بالتنبؤ بكل شيء على أنه إيجابي - ولكن الدقة التي ينجم عنها قد تهب، وعلى العكس من ذلك، فإن النموذج لا يمكن أن يحقق الدقة على نحو شبه سليم إلا بالتنبؤ بالإيجابية عندما يكون واثقا للغاية - ولكنه سيفتقد كثيرا من الايجابيات الفعلية، مما يستدعي التذكر.
هذا التبادل الأساسي يعني أنك غالباً ما تحتاج إلى اختيار أي مقياس لتحديد الأولويات استناداً إلى تطبيقك المحدد:
- Prioritize Precision] when false positives are costly - such as in loan approval systems where approval bad loans is expensive
- Prioritize Recall] when false negatives are costly - such as in disease screening where missing a diagnosis could be fatal
- Balance both] using F1 score when both types of errors matter equally
الدقة والتذكر عرض المبادلات، أي أن قياس واحد يأتي بتكلفة أخرى، وأكثر دقة ينطوي على انتقاد أشد صرامة (مصنف) يشك حتى العينات الإيجابية الفعلية من مجموعة البيانات، مما يقلل من نقطة التذكر، فهم هذه العلاقة يساعدك على تدوين عتبة قرار نموذجك لتحقيق التوازن الصحيح لتطبيقك.
ترجمة شفوية
بمجرد أن تُحسب مصفوفة الارتباك و تُستمد القياسات الرئيسية الخطوة الحاسمة التالية هي التفسير فهم ما تعنيه هذه الأرقام في سياق تطبيقك المحدد
تحليل هيكل مصفوفة مصفوفة
وعند دراسة مصفوفة الارتباك، تبدأ بالنظر إلى النمط العام للتنبؤات، وتقع جميع التنبؤات الصحيحة في تشخيص الجدول (المنشورة بالأخضر)، وبالتالي من السهل فحص الجدول بصرياً لأخطاء التنبؤ، حيث أن القيم خارج نطاق التشخيص ستمثلها.
وسيتميز نموذج قوي بقيم عالية على طول التشخيص (الإيجابيات الحقيقية والسلبيات الحقيقية) وبقيم منخفضة في الخلايا غير التقليدية (الإيجابيات المزيفة والسلالات الكاذبة) وإذا رأيت قيماً عالية خارج نطاق التشخيص، فإن ذلك يدل على أخطاء منهجية تحتاج إلى تحقيق.
تحديد أوجه الضعف النموذجية
المفرقعة: فهم مختلف أنواع الأخطاء التي ينتجها نموذج التعلم الآلي يوفر المعرفة بمحدوديةه ومجالات التحسين، وبفحص أي خلايا لها قيم عالية بشكل غير متوقع، يمكنك تحديد نقاط ضعف محددة:
- High False Positives : نموذجك عدواني جداً في التنبؤ بمستوى النظر الإيجابي في الفئة التي ترفع عتبة التصنيف أو تضيف سمات تميز بشكل أفضل من الحالات السلبية
- High False Negatives : نموذجك هو أكثر تحفظاً من أن يخفض العتبة أو تحسين هندسة السمات من أجل تحسين التقاط الحالات الإيجابية
- Imbalanced Errors]: إذا تركزت الأخطاء في اتجاه واحد، فإن هذا يشير إلى تحيز منهجي قد يتطلب إعادة التوازن بين بيانات التدريب الخاصة بك أو تعديل الأوزان الصفية
الترجمة الشفوية الفورية
مصفوفة الارتباك "صحيح" تعتمد كلياً على متطلبات طلبك، "المركز 19" كما نعلم جميعاً، غير معروف للانتشار بسرعة، لذا، بالنسبة لنموذج يصنف الصور الطبية (الأشعة السينية أو الأشعة السينية) إلى "المركز" للإيجابية" و"COVID"
وتتطلب التطبيقات المختلفة أولويات مختلفة:
- Medical Diagnosis]: التقليل إلى أدنى حد من السلبيات الكاذبة لتجنب الأمراض المفقودة
- Spam Filtering]: الرصيد المفقود في كلتا الحالتين مزعج، ولكن منع الرسائل الإلكترونية المشروعة أسوأ
- Fraud Detection]: High recall to catch fraud, with manual review handling false positives
- Manufacturing Quality Control]: depends on the cost of defects versus the cost of rejecting good products
مصفوفات الاتحاد للتصنيف المتعدد المستويات
ولا تقتصر مصفوفة الاتحاد على التصنيف الثنائي ويمكن استخدامها في تصنيفات متعددة التصنيفات أيضا، وعندما تعالج أكثر من صفين، تتوسع مصفوفة الارتباك ولكنها تتبع نفس المبادئ الأساسية.
بالنسبة لمشكلة متعددة الطبقات مع الصفوف الوطنية سيكون لديك مصفوفة خلط في الشبكة عندما يتم تقييم صف واحد في وقت واحد (من فئة واحدة)
قراءة المصفوفات المتعددة الكتل
في مصفوفة خلط متعددة الطبقات:
- تمثل الروم الصفوف الفعلية
- تمثّل الكولومات الصفوف المتوقعة
- تظهر التشخيصات الصحيحة لكل فصل
- تبين الخلايا غير التقليدية سوء تصنيف بين أزواج صنف محددين
في المشاكل المتعددة الطبقات، تظهر المصفوفة الرئيسية إيجابيات حقيقية لكل فصل، وهذا يسمح لك برؤية الدقة العامة فحسب، ولكن أي صفات محددة يتعامل نموذجك معها جيداً، وأيها يخلط بينه وبينه.
حساب القياسات الخاصة بالمشاكل المتعددة الكتل
وفيما يتعلق بالتصنيف المتعدد الطبقات، يمكن حساب القياسات مثل الدقة والتذكر والسجلات من الفئة واو-1 بطرق عدة:
- Micro-averaging]: Calculate metrics global by counting total true positives, false positives, and false negative across all classes
- Macro-averaging]: Calculate metrics for each class independently, then take the average
- Weighted averaging: Similar to macro-averaging but weighted by the number of instances in each class
استخدموا المتوسطات المثقلة لمجموعات البيانات المتوازنة، استخدموا المتوسطات الكلية لمجموعات البيانات المتوازنة، والخيار يعتمد على ما إذا كنت تريد أن تعطي أهمية متساوية لجميع الفئات أو ترجيحها حسب تواترها.
التطبيقات والأمثلة العالمية الحقيقية
مصفوفات الكونفوسية لا تقدر بثمن عبر العديد من تطبيقات التعلم الآلاتي فهم كيف تستخدم في الممارسة العملية يساعدك على تطبيقها بفعالية على مشاريعك الخاصة
التشخيص الطبي
التشخيص الطبي: تجد مصفوفة الارتباك استخداما واسعا في الميادين الطبية لتشخيص الأمراض استنادا إلى الاختبارات أو الصور، وهي تساعد على تقدير مدى دقة الاختبارات التشخيصية وتحديد التوازن بين الإيجابيات الكاذبة والسلبيات الكاذبة.
وفي التطبيقات الطبية، تكون تكلفة السالب الكاذب (فقدان المرض) أعلى بكثير من الايجابيات الكاذبة (اختبارات المتابعة غير الضرورية)، ولذلك، عادة ما تُستخدم نماذج التشخيص الطبي لتعظيم التذكر، وقبول المزيد من الإيجابات الكاذبة لضمان عدم إضاعة عدد قليل جدا من الحالات.
Fraud Detection
وتستخدم المصارف والمؤسسات المالية مصفوفات الارتباك لكشف المعاملات الاحتيالية عن طريق إظهار الكيفية التي تساعد بها خوارزميات الشركة على تحديد أنماط الأنشطة الاحتيالية، وهنا توجد بعض الأمثلة على مشاكل التصنيف الثنائي: الكشف عن الاحتيال: التنبؤ إذا كانت عملية الدفع مزورة، والتنبؤات المزخرفة: التنبؤ بالتشهير: التنبؤ إذا كان من المحتمل أن يوقف المستخدم استخدام الخدمة، والتنقيب عن الرصاص: التنبؤ إذا كان من المحتمل أن يتحول عميل محتمل إلى دفع.
وفي مجال الكشف عن الاحتيال، من المهم التذكير بشكل كبير بالقبض على المعاملات الاحتيالية، ولكن الدقة أيضاً هي مسائل مكلفة، حيث أن مصفوفة الارتباك تساعد على إيجاد التوازن الأمثل بين القبض على الاحتيال والتقليل إلى أدنى حد من التحقيقات غير الضرورية.
تجهيز اللغات الطبيعية
(ج) تجهيز اللغات الطبيعية: تستخدم نماذج الخلط بين الخلط بين مقاييس لتقييم تحليل المشاعر وتصنيف النصوص والاعتراف بالكيانات، ففي تصنيف البريد الإلكتروني المسمّى، على سبيل المثال، تكشف مصفوفة الخلط ما إذا كان النموذج يميز بشكل صحيح عن الرسائل الإلكترونية المشروعة وعن أنواع الأخطاء التي يُرتكبها.
Customer Churn Prediction
:: الإدمان على المكشوف: تؤدي مصفوفات الكونفروسيون دورا محوريا في التنبؤ بفترات الزبائن، وتبين كيف تستخدم النماذج التي يقودها المعهد البيانات التاريخية لتوقع وتخفيف تناقص العملاء، وتستخدم الشركات هذه الأفكار لتحديد هوية العملاء المعرضين للمغادرة واتخاذ تدابير استبقاء استباقية.
التصوير والاعتراف بالاعتراض
الاعتراف بالصور والاعتراض: تساعد مصفوفات الكونفوسيون في نماذج التدريب على تحديد الأجسام في الصور، والتكنولوجيات التمكينية مثل السيارات ذات القيادة الذاتية ونظم التعرف على الوجه، ففي المركبات المستقلة، مثلا، تحديد المشاة والمركبات تحديدا صحيحا، والعقبات أمر حاسم بالنسبة للأمان، مما يجعل مصفوفة الارتباك أساسية لتقييم وتحسين نظم الكشف.
الشلالات والحدود المشتركة
وفي حين أن مصفوفات الارتباك أدوات قوية، فإن لديها قيودا ينبغي أن يفهمها الممارسون لتجنب سوء التفسير.
Accuracy Paradox
ومن بين أكثر الأخطاء شيوعاً الاعتماد على الدقة فقط، لا سيما مع مجموعات البيانات غير المتوازنة، فعلى سبيل المثال، إذا كان هناك 95 عينة من السرطان و5 عينات فقط من غير السرطان في البيانات، فإن أحد المصنفين قد يصنف جميع الملاحظات على أنها مصابة بالسرطان، وأن الدقة العامة ستكون 95 في المائة، ولكن بمزيد من التفصيل، سيكون لدى المصنف معدل اعتراف بنسبة 100 في المائة (الحساسية) بالنسبة لفئة السرطانية، ولكن معدل التعرف بنسبة 80 في المائة.
وهذا يدل على السبب في أن دراسة مصفوفة الارتباك الكاملة وحساب القياسات المتعددة أمر أساسي - فالواقع وحده يمكن أن يكون مضللاً للغاية.
القيود الوبائية
وعلى وجه الخصوص، لا يمكن لمصفوفة الارتباك أن تبين ما إذا كانت التوقعات الصحيحة قد تم التوصل إليها من خلال المنطق السليم أو مجرد فرصة (مشكلة معروفة في الفلسفة كحظ ملحمي)، كما أنها لا تستوعب الحالات التي تتغير فيها الحقائق المستخدمة في التنبؤ لاحقاً أو تتحول إلى خطأ (قابلية للتقصير) وهذا يعني أنه في حين أن مصفوفة الارتباك أداة مفيدة لقياس أداء التصنيف، فإنها قد تعطي صورة غير كاملة عن موثوقية النموذج الحقيقية.
مصفوفة الارتباك تخبرك ما الذي توقعه نموذجك لكن ليس السبب، قد يحقق نموذج نتائج جيدة على اختبارك عن طريق استغلال الروابط الناقصة التي لن تُعمم على البيانات الجديدة، وتكمل دائما تحليل مصفوفة الارتباك مع تقنيات التحقق الأخرى والخبرة الفنية في المجال.
حساسية العاهرات
بالنسبة للصنفات الافتراضية، مصفوفة الارتباك تعتمد على عتبة التصنيف المختار، العتبات المختلفة تنتج مصفوفات مختلفة للارتباك، تؤثر على جميع القياسات المستمدّة، من المهم استكشاف كيف تتغير مصفوفة الارتباك عبر عتبات مختلفة واختيار واحدة تتواءم مع أولويات تطبيقك.
التقنيات المتقدمة والمقاييس ذات الصلة
وبالإضافة إلى مصفوفة الارتباك الأساسية، توفر عدة تقنيات متقدمة ومقاييس ذات صلة مزيدا من الأفكار عن الأداء النموذجي.
ماثيوس معامل الراسل
ووفقاً لما ذكره ديفيد تشيكو وغيوسيبي جرمان، فإن أكثر القياسات معلوماتية لتقييم مصفوفة الارتباك هو معامل ماثيوز للترابط، ووفقاً لما ذكره ديفيد شيكو وغيوسيبي جورمان، فإن النتيجة F1 أقل صدقاً وخبرة من معامل ماثيوز للترابط في تصنيف التقييم الثنائي.
تأخذ لجنة الرنين المغناطيسي بعين الاعتبار كل أربع فئات مصفوفة الارتباك وتنتج نقطة بين 1 و + 1 حيث +1 يمثل التنبؤ المثالي
سبورات الملكية الخاصة ووحدات الاتحاد الأفريقي
ويؤكّد منحنى " ريسبيفر " العامل المُقدّم للعامل الإيجابي الحقيقي (القابل) مقابل المعدل الإيجابي الكاذب في مختلف الظروف العتبة، حيث توفر المنطقة الواقعة تحت العنق رقماً واحداً يلخص الأداء على جميع العتبات.
إن منحنىات الترميز تكمّل مصفوفات الارتباك من خلال بيان كيف أن المفاضلة بين الإيجابيات الحقيقية والإيجابات الكاذبة تتغير مع تعديل عتبة التصنيف، وهذا يساعدك على اختيار العتبة المثلى لمتطلبات تطبيقك المحددة.
المنح الدراسية الدقيقة
وفي العادة، لا تناقش علامات الدقة والتذكر بمعزل عن بعضها البعض، بل إن قطعا من منحنى الدقة هي بمثابة مهمة للتذكير؛ وعادة ما تنخفض الدقة مع ازدياد التذكر، وهذه المنحنىات مفيدة بصفة خاصة بالنسبة لمجموعات البيانات غير المتوازنة التي قد تكون فيها منحنىات الترميز متفائلة للغاية.
التعلم الحساس من حيث التكلفة
(ديفيد هاند) والآخرون ينتقدون الاستخدام الواسع النطاق لسجل F1 لأنه يولي أهمية متساوية للدقة والتذكر، وفي الممارسة العملية، فإن مختلف أنواع التصنيفات الخاطئة تتحمل تكاليف مختلفة، وبعبارة أخرى، فإن الأهمية النسبية للدقة والتذكر هي جانب من جوانب المشكلة.
وفي العديد من تطبيقات العالم الحقيقي، تختلف تكاليف مختلف أنواع الأخطاء، إذ أن التعلم الذي يراعي التكلفة يدمج هذه التكاليف مباشرة في عملية التدريب النموذجية، بدلا من استخدامها فقط للتقييم، مما قد يؤدي إلى نماذج أفضل استخداما لمتطلباتكم الخاصة بالأعمال أو التطبيقات.
أفضل الممارسات لاستخدام مصفوفات الكونفوس
للحصول على أكبر قيمة من مصفوفات الارتباك في مشاريعك للتعلم الآلاتي، اتباع هذه الممارسات الفضلى:
دائماً ما تستخدم مجموعة اختبار منفصلة
قم بحساب مصفوفة الارتباك الخاصة بالبيانات التي لم يشاهدها النموذج خلال التدريب، استخدام بيانات التدريب سيعطي نتائج متفائلة للغاية لا تعكس الأداء الحقيقي للعالم، مثالياً، استخدام مجموعة اختبارات مُحتفظ بها أو مُقابلة للثقة للحصول على تقديرات موثوقة.
النظر في القياسات المتعددة
في مجال تقييم التعلم الآلي، مصفوفات الارتباك هي محورية، تساعد في حساب القياسات الرئيسية مثل الدقة والتذكر، هذه القياسات توفر نظرة أعمق لأداء النموذج أكثر من الدقة وحدها، خاصة عندما تعالج مجموعات البيانات التي لا توزع بالتساوي.
لا تعتمد على قياس واحد، فحص الدقة، الدقة، التذكير، علامة F1، ومصفوفة الارتباك الخام معا للحصول على صورة كاملة للأداء النموذجي.
تصور نتائجك
استخدام الأشعة الحرارية أو غيرها من الصور لجعل مصفوفات الارتباك أسهل للتفسير، خاصة بالنسبة للمشاكل المتعددة الطبقات، يساعد التكفير باللونات على تحديد المكان الذي يعمل فيه النموذج جيداً، وحيث يكافح، ومعظم مكتبات التعلم الآلي توفر أدوات للتصوير المبني في مصفوفات الارتباك.
رصد الأداء على مر الزمن
ومن ناحية أخرى، قد يكون من المفيد أيضا رصد العدد المطلق من العلامات الإيجابية والسلبية التي تنبأ بها النموذج والانجراف في التوزيع في التنبؤات النموذجية، وحتى قبل تلقي التعليقات، يمكن أن تكتشف انحرافا في التنبؤات النموذجية (الإنجراف الافتراضي): مثل عندما يبدأ نموذج التنبؤ بـ " الغش " في كثير من الأحيان، وهذا قد يدل على تغير هام في البيئة النموذجية.
وفي نظم الإنتاج، ترصد باستمرار مقاييس مصفوفة الارتباك الخاصة بك، ويمكن أن تشير التغييرات في مصفوفة الارتباك بمرور الوقت إلى انجراف البيانات أو الانجراف المفاهيمي أو غير ذلك من المسائل التي تتطلب إعادة التدريب أو التعديل على النموذج.
مقاييس أليمة مع أهداف الأعمال التجارية
اختيار القياسات التي ستستخدم لتحقيق أقصى قدر من التكاليف والفوائد في العالم الحقيقي لمختلف أنواع الأخطاء في تطبيقك نموذج مثير للإعجاب تقنياً لا يتوافق مع احتياجات الأعمال التجارية لن يحقق قيمة، والعمل مع خبراء المجالات لفهم الأخطاء الأكثر تكلفة، والتفاؤل تبعاً لذلك.
الوثائق اختياراتكم
عندما تختارين عتبة التصنيف، توثقين سبب اختياركِ و ما هو المبادلات التي تمثلها، هذا يساعد الآخرين على فهم سلوك نموذجك ويجعل من الأسهل التكيف إذا تغيرت الشروط.
تطبيق تحليل مصفوفة الكونفوس: نموذج عملي
لنمشي عبر مثال كامل لنري كيف يعمل تحليل مصفوفة الارتباك في الممارسة العملية، أفترض أنك تبني جهاز تصنيف بريد إلكتروني
نموذجك ينتج مصفوفة الارتباك التالية:
- إيجابيات حقيقية (محددة بشكل خاطئ): 85
- النازحين الحقيقيين (المحددين بصورة خاطئة) 870
- False Positives (legitimate marked as spam): 30
- الزنوج (العلامات المميزة بالمشروعية): 15
من مصفوفة الارتباك هذه يمكنك حساب:
Accuracy = (85 + 870) / 1000 = 0.955 أو 95.5 في المائة
Precision] = 85 / (85 + 30) = 0.739 أو 73.9٪
Recall] = 85 / (85 + 15) = 0.85 أو 85 في المائة
F1 Score] = 2 × (0.739 × 0.85) / (0.739 + 0.85) = 0.791 أو 79.1 في المائة
ما الذي يقوله لكم هذا؟ إن النموذج يتسم بدقة عالية (95.5 في المائة) ويبدو جيداً في البداية، غير أن دقة 73.9 في المائة تكشف عن أن حوالي 26 في المائة من الرسائل الإلكترونية التي تحمل علامة على أنها ستام هي في الواقع رسائل مشروعة، مما يتسبب في فقدان المستخدمين لالبريد الإلكتروني الهام، وأن التذكر البالغ 85 في المائة يعني أن النموذج يلتقط أكثر المسامير، ولكن 15 في المائة لا يزالون يمرون.
حسب أولوياتك، قد تضبط عتبة التصنيف، تخفيض العتبة سيزيد من التذكر (يلتقط المزيد من الرش) ولكن يقلل الدقة (أكثر من الإنذارات الخاطئة)
تحسين الأداء النموذجي استنادا إلى المقصات الكونفوسية
مصفوفة الارتباك لا تُقيّم فقط نموذجك يُرشد التحسينات، إليك كيف تستخدم الرؤى الارتباكية لتعزيز الأداء:
الموازنة بين الرتب
إذا كشفت مصفوفة الارتباك عن سوء الأداء في صف الأقلية، اعتبر التقنيات مثل:
- Oversampling the minority class (SMOTE, ADASYN)
- :: أخذ عينات من فئة الأغلبية
- استخدام الأوزان في نموذجك
- جمع المزيد من البيانات للصفوف الممثلة تمثيلا ناقصا
Feature Engineering
إذا رأيت أخطاء منهجية (مثلاً، تخلط بين صفين محددين) هذا يشير إلى أن سماتك لا تميز بينهما بشكل كاف، إضافة سمات جديدة تستوعب الاختلافات بين الفصول المشوشة بشكل عام
القرار المعدّل
بدلاً من استخدام عتبة الـ 0.5، تجربة بعتبات مختلفة لإيجاد التوازن الأمثل بين الدقة والتذكر لتطبيقك، منحنىات دقيقة جداً لتخيص هذه المبادلات.
الطرائق المجمّعة
ويمكن أيضاً أن تساعد مصفوفة الخلط التي تُحسب لنفس مجموعة الاختبارات من مجموعة البيانات، ولكن باستخدام مختلف المصنفات، في مقارنة مواطن القوة والضعف النسبية التي تعاني منها، وفي استخلاص معلومات عن كيفية الجمع بينها (التعلم الجماعي) للحصول على الأداء الأمثل، وإذا أحدثت نماذج مختلفة أنواعاً مختلفة من الأخطاء، فإن الجمع بينها يمكن أن يحسن الأداء العام.
تحليل الأخطاء
وبحث حالات محددة كانت غير مصنفة على نحو سليم، والبحث عن أنماط في الأخطاء - هل هناك أنواع معينة من المدخلات التي تُساء تصنيفها باستمرار؟ وكثيرا ما يكشف هذا التحليل النوعي عن آراء تفتقد إلى قياسات دقيقة.
الأدوات والمكتبات لتحليل مصفوفة
وتيسر عدة أدوات ومكتبات قوية العمل بمصفوفات الارتباك وأكثر فعالية:
التعلم من المهارات (بايتون)
ويوفر التعلم بواسطة الاختراق القدرة على العمل في مصفوفة الارتباك الشاملة من خلال نموذج القياسات الذي يضم مهام حساب مصفوفات الارتباك، وتصويرها، وحساب جميع القياسات القياسية، والمكتبة موثقة توثيقا جيدا وتدمج دون هوادة مع أدوات علم البيانات الأخرى في بيتسون.
TensorFlow and Keras
وبالنسبة لتطبيقات التعلم العميق، توفر شركة " تينسورفلو " و " كيراس " مرافق مصفوفة للارتباك تعمل مع نماذج الشبكة العصبية، وهي تشمل شركة " تينسوربوربوربور " للتصوير والرصد أثناء التدريب.
مجموعات الجرائد
ويمكن لمستعملي نظام R أن يحشدوا مجموعات مثل الرعاة، والمقياس، والارتباك الذي يُستشف من مصفوفة الارتباك الشاملة، وهذه المجموعات توفر قدرات في مجالي الحساب والتصوير مع خيارات واسعة للتكييف.
مجموعة أدوات التصويب المتخصصة
وتوفر أدوات مثل منظمة العفو الدولية، و " الوزن " ، و " بياس " ، و " MLflow " قدرات متقدمة للرصد والتصوير من أجل مصفوفات الارتباك في نظم الإنتاج، مما يسهل تتبع الأداء النموذجي على مر الزمن وكشف التدهور.
خاتمة
إن مصفوفة الارتباك أداة لا غنى عنها في تقييم نماذج التصنيف، إذ إن تحطيم الأداء إلى عناصر مفصلة، يوفر فهما أعمق لكيفية أداء النموذج، ويسلط الضوء على مواطن القوة والضعف على السواء، وسواء كنت مبتدئا أو عالما من ذوي الخبرة في مجال البيانات، فإن استخلاص مصفوفة الارتباك أمر أساسي لبناء نماذج فعالة وموثوقة للتعلم الآلي.
فهم كيفية حساب وتفسير وتصرفات مصفوفة الارتباك يفصل بين الممارسين الفعّالين للتعلم الآلي من أولئك الذين يعتمدون بشكل أعمى على مقاييس واحدة مثل الدقة، وتكشف مصفوفة الارتباك ليس فقط ما إذا كان نموذجك يعمل، ولكن كيف يعمل، حيث يفشل، وما يمكنك القيام به لتحسينه.
بفحص إيجابيات حقيقية، سلبيات حقيقية، إيجابيات كاذبة، وسلبيات كاذبة، تحصل على صورة كاملة لسلوك نموذجك، القياسات المستمدة من هذه المكونات - الدقة، الدقة، التذكر، الـ F1، وغيرها - كل واحد يروي جزء من القصة، معاً، يرشدك إلى نماذج لا تؤدي بشكل جيد على مجموعات الاختبارات فحسب بل تحقق قيمة حقيقية في تطبيقات الإنتاج.
وإذ تقومون ببناء نماذج التصنيف ونشرها، تجعلون تحليل مصفوفة الارتباك جزءاً أساسياً من عملية التقييم، وتتكون من خبرة في المجالات، ومتطلبات الأعمال، والرصد المستمر لإيجاد نماذج غير دقيقة فحسب، بل مفيدة حقاً، والوقت المستثمر في فهم مصفوفات الارتباك يدفع أرباحاً في نوعية النموذج وموثوقيته وتأثيره في العالم الحقيقي.
لمزيد من القراءة عن تقنيات تقييم التعلم الآلي، استكشاف الموارد على ] Scikit-learn's model evaluation documentation ، ] دورة التعلم الخاصة بآلات غوغل بشأن التصنيف ، والورقات الأكاديمية بشأن قياسات التقييم المتقدمة، ويستمر التطور في الميدان، مع ظهور تقنيات جديدة وأفضل الممارسات الأساسية بصورة منتظمة.