وفي خطوط الأنابيب الحديثة للتعلم الآلي، نادرا ما تُستَغَل البيانات الخام مباشرة إلى نموذج، وقبل بدء التدريب، يجب تنظيف البيانات وتحويلها وأخذ عينات منها في كثير من الأحيان لضمان إدارة البيانات الناتجة عنها وتمثيلها على حد سواء، بينما يؤدي فهم الخوارزميات، التي ترتبط عادة بعمليات قواعد البيانات والتفتيش إلى أقصى درجة، إلى زيادة في الأهمية في هذه المرحلة من التجهيز الأولي، وذلك بفرض نظام منطقي على نقاط القفل، بقيمتها الرئيسية.

دور التسوق في تجهيز البيانات لأغراض التعلم في مجال الآلات

ويستهلك تجهيز البيانات جزءا كبيرا من الوقت في أي مشروع للتعلم الآلي، فالتصنيع هو أحد أهم عمليات التجهيز الأولي لأنه يحول مجموعات غير مجهزة إلى هياكل تدعم الاستعادة السريعة والاختيار الفرعي، وعندما يتم فرز البيانات، يمكن للخروفوريث أن تستغل الموقع، وتخفض من إمكانية الوصول إلى الذاكرة العشوائية، وتطبق تقنيات مثل البحث الثنائي لتحديد مواقع مجموعات فرعية محددة في وقت الوصلات.

المكاسب الناتجة عن زيادة الكفاءة في استرداد البيانات

وتستلزم البيانات غير المرخصة إجراء فحص كامل للسجلات التي تستوفي معياراً، فعلى سبيل المثال، فإن اختيار أول نسبة من المعاملات حسب القيمة من قائمة غير مأذون بها تضم بليون قيد ينطوي على فحص كل سجل، مع تصنيف البيانات، تخفض العملية نفسها إلى حساب قياسي بسيط، وبالمثل، يمكن الإجابة على الاستفسارات التي تطلب جميع السجلات في نطاق محدد في حيث [FLT:]

التمكين من تقنيات أخذ العينات المتقدمة

ويعتمد العديد من أساليب أخذ العينات على تمثيل السكان الذي أمر به، ويستلزم أخذ العينات المثبتة تجميع البيانات بواسطة الطبقات؛ ويستلزم أخذ العينات المنهجية فترة ثابتة؛ ويمكن أن يستفيد الممارسون من ترتيب مفرزة للحفاظ على الإنصاف في سياقات التصفيق، فبدون الفرز، تصبح هذه التقنيات محظورة حسابيا أو تفقد ضماناتهم الإحصائية، وبتقديم صورة مدروسة عن البيانات، يمكن للممارسين تنفيذ هذه الأساليب بأقل قدر ممكن من الوقت.

Key Sorting Algorithms and Their Application in Data Sampling

وتتيح الخوارزميات المختلفة لفرز العينات مبادلات مختلفة بالسرعة، واستخدام الذاكرة، والاستقرار، والتوازي، ويمكن أن يؤثر اختيار الخوارزمية تأثيراً كبيراً على الأداء العام لخط أنابيب أخذ العينات، كما أن المفارقات هي الأكثر استخداماً في فرز الخوارزميات في التطبيقات التي تتطلب كثافة البيانات.

QuickSort: Speed and Partitioning

(كويك سورت) هو خوارزمية من نوع (الفجو) و التي تختار (الفيورت) وتقسم الصفوف إلى عناصر أقل من وأكثر من الـ(فيفوت) وتصنف بشكل مستقيم الأجزاء، مع تعقُّد متوسط الوقت في والعوامل الثابتة المنخفضة، غالباً ما تكون ( QuickSorling)

غير أن نظام QuickSort ليس مستقرا ويمكن أن ينحرف إلى على أجزاء غير متوازنة للغاية إذا استخدمت استراتيجية ضعيفة للاختيار المحوري، ومن الأفضل الاعتماد على تنفيذات مكتبية مثل التمرد للتخفيف من ذلك عن طريق التحول إلى نظام هيبسورت عندما تتجاوز الأعماق المتكررة عتبة، ومن الأفضل، بالنسبة لحجم العمل الكبير في أخذ العينات، الاعتماد على تنفيذات التي تشمل هذه الضمانات.

MergeSort: Stable and External Sorting

ويقسم نظام ميرجسورت البيانات إلى أشلاء صغيرة، ويصنف كل قطعة، ثم يدمجها، ويجعلها [(FLT:6]) أسوأ أداء واستقرار (يحافظ على النظام النسبي للعناصر المتساوية) مثالياً لمجموعات البيانات التي لا تتناسب تماماً مع نظام RAM.M.

الاستقرار أمر حاسم عندما توجد مفاتيح ثانوية، على سبيل المثال، إذا تفرزت في الزمان وبعد ذلك بواسطة هوية العملاء، نوع مستقر يحفظ الوقت المستغرق للتسجيلات مع هوية العميل نفسه.

HeapSort: Guaranteed Performance

(هيبسورت) يبني كمية من العجلات القصوى (أو مين-هاب) من البيانات ويستخرج بشكل متكرر أكبر عنصر، ويعمل في [(FLT:7)] أسوأ وقت ويستخدم فقط [(FLT:8)] حيز إضافي، وفي حين أن نظام التصنيف السريع لا يمكن التنبؤ به بسبب ضعف موقع الكيتش، يوفر أكبر عدد من النظم الحقيقية يمكن التنبؤ بها.

العد التنازلي وراديكس سورت: غير التشاركية

وعندما تكون القيم الرئيسية هي متجانسات ذات نطاق محدود (مثلاً، أرقام قياسية من الدرجة صفر إلى 100، سمات كمية)، فإن خوارزميات الفرز غير المقارن مثل عدّة سورت وراديكس سورت يمكن أن تحقق تعقيدات خطية ، وهذه الخوارزميات مفيدة بشكل خاص في أخذ العينات المفصَّلة عندما تُعرَّف كل مواضعها

ويمكن الجمع بين هذه الأساليب في البيانات الرفيعة المستوى، أو نوع الدلو أو فرز ثنائي، وذلك للإسراع في تقسيم البيانات المتعلقة بالعينات المفصَّلة أو العنقودية.

طرق أخذ العينات ذات الأساس الحاد في التجزئة

العينات المُستَغَلَة بالبلايل المُتَلَقَّة

(أ) أن تُضمِّن العينة التي تُحدَّد نسب كل مجموعة فرعية (الحصانة) في السكان، وبدون فرز، يتطلب تنفيذ العينات المفصَّلة إما جداول الحجاب لكل سلة أو عدة مرات على البيانات، ويسمح مسح البيانات [بمؤشر الطول] (مثلاً، علامة الصف) بتقسيم البيانات إلى مجموعات متقاربة، وواحدة لكل سلالة.

In Python, this is easily achieved by sorting a DataFrame with and then using . However, sorting an entire DataFrame may be expensive; for very large datasets, scikit-learns StratifiedShuffleSplit [FLimt:1] provides an

أخذ عينات منتظمة بعد الصراخ

ويختار أخذ العينات المنتظمة كل عنصر بعد نقطة انطلاق عشوائية، ولضمان أن تكون العينة تمثيلية، ينبغي أولاً أن تُفرز البيانات بمفتاح يرتبط بمتغيرات الاهتمام، مثلاً عندما يُستخدم أخذ العينات في سجلات العملاء لإجراء دراسة استقصائية، ويُفرز حسب العمر، ويكفل أن تكون العينة المنتظمة تغطي جميع النطاقات العمرية تناسبياً(15).

ويصبح أخذ العينات المنتظمة بعد الفرز فعالاً بصفة خاصة بالنسبة لمجموعات البيانات الكبيرة المخزنة بصورة متتابعة (مثل ملفات السجلات، ومحفوظات السلاسل الزمنية) لأن الترتيب المفرز يتوافق مع أمر التخزين المادي، ويقلل إلى أدنى حد من المعلوماتية العشوائية.

أخذ عينات المستودع ودور المستودع

أما أخذ العينات في الخزان فهو أسرة من الخوارزميات لاختيار عينة عشوائية من الحجم الثابت من تيار غير معروف، وفي حين أن أخذ العينات في الخزان لا يتطلب بالضرورة فرزها، فإن الفرز يمكن أن يحسن أدائها بطريقتين، أولا، إذا وصل التيار إلى ترتيب متحيز (مثلا، تختلف العناصر المبكرة عن العناصر اللاحقة)، مع ترتيب الخزان بعد أن يساعد كل عملية من عمليات الفرز على الحفاظ على الوزن.

بالنسبة لمجموعات البيانات الخارجية، يمكن بناء خزان مصنّف بمسح البيانات مرة واحدة والاحتفاظ بقائمة مصنّفة من المؤشرات العينية، مما يتيح الإضافات الفعالة وعمليات الإزالة.

الاستحقاقات العملية والمبادلات

انخفاض التعقيد الحاسوبي

وتتمثل أهم الفوائد المباشرة للفرز في الحد من تعقيد الوقت بالنسبة للعمليات في المراحل النهائية، ويمكن أن يكون أخذ العينات من صفيفة ] للحصول على معلومات عشوائية أو فيما يتعلق بالاستفسارات المتعلقة بالمناطق، وبدون فرز، يتطلب العديد من هذه العمليات .() وبالنسبة للبيانات التي تحتوي على ملايين النقاط، يمكن أن يترجم ذلك إلى ساعات من الاختيار المنقذ أثناءه.

غير أن خطوة الفرز نفسها تضيف تعقيداً ، وهذا أمر مقبول عملياً لأن الفرز هو تكلفة غير متكررة يمكن استيعابها على العديد من عمليات أخذ العينات، وبالنسبة لمجموعات البيانات الكبيرة جداً، الموزعة حسب فرز الخوارزميات (مثلاً، نوع الخرائط) متاحة، ويمكن أن توازي التكلفة بين المجموعات.

النظر في الذاكرة ونظر المنظمة

(أ) يتطلب الفرز في الذاكرة جمع البيانات بكاملها في نظام إدارة السجلات والمحفوظات، وهو أمر لا يمكن إلغاؤه في كثير من الأحيان بالنسبة للبيانات ذات النطاق الترابي، أما خوارزميات الفرز الخارجية، مثل تلك التي تنفذ في نظم قواعد البيانات، فتعالج البيانات غير الأساسية باستخدام استراتيجيات مرنة، وعندما تستخلص من هذه البيانات، يكون من الأكفأ عادة إجراء فحص جزئي لـ[الرمز 21].

وبالنسبة لبيانات السلاسل الزمنية، يمكن أيضاً للفرز حسب الزمان أن يحسن الضغط ويقلل من آثار التخزين، ويستفيد بشكل غير مباشر من أداء المنظمة أثناء أخذ العينات.

Accuracy vs. Overhead

وفي حين أن الفرز يحسن كفاءة أخذ العينات، فإنه يمكن أن يُحدث تحيزا إذا كان هذا النظام غير مقصود، كوكيل عشوائي، مثلا، أن الفرز بواسطة مفتاح غير حرفي، ثم أخذ العناصر الأولى ليس أسلوبا سليما لأخذ العينات؛ بل إنه يخلق اختيارا محددا قد لا يمثل السكان، ولذلك يجب أن يكون التفريق بين المكسب غير المسمى وبين آلية اختيار عشوائية سليمة.

وفي الممارسة العملية، تفوق الفوائد كثيرا التكاليف التي تتطلبها استراتيجية أخذ العينات من البيانات التي تم فرزها (مثل أخذ العينات المجزأة أو المنهجية)، أما بالنسبة لأخذ العينات العشوائية البحتة دون تدقيق، فلا داعي للفرز وينبغي تجنبه.

أمثلة عالمية حقيقية وحالات استخدام

مجموعات البيانات المتوازنة للتدريب

وكثيراً ما يتطلب الكشف عن الغش بنسبة 99 في المائة طبيعية، أو 1 في المائة من المحتالين أخذ عينات مفصَّلة للحفاظ على فئة الأقليات، ويتيح تخزين البيانات حسب العلامات الدراسية الحصول بسرعة على جميع العينات الاحتيالية، ثم أخذ عينات أقل من فئة الأغلبية أو أخذ عينات زائدة من فئة الأقليات في الاعتبار.() وفي الممارسة العملية، يستخدم علماء البيانات

عينات من بيانات السيرة الزمنية

وعند معالجة بيانات السلاسل الزمنية، مثل قراءات أجهزة الاستشعار أو المعاملات المالية، يعتبر الفرز حسب الزمان أمرا أساسيا لمنع تسرب البيانات، ويضمن الترتيب المفرز أن تستمد العينات التدريبية من نافذة زمنية متقاربة وأن مجموعات المصادقة تأتي من فترة لاحقة، ويمكن أن ينتج عن ذلك اختزال زمني مفصَّل مع فترات منتظمة (مثل كل ملاحظة 10) مجموعة بيانات مخفضة لا تزال تلتقط على نطاق واسع.

Ar. A.Scale Distributed Sampling

في أطر حسابية موزعة مثل (أباشي سبارك) أخذ العينات غالباً ما يتم أثناء تقطيع البيانات، أخذ مفاتيح التجزؤ قبل أخذ العينات يحسن توازن الحمل ويقلل من الرؤوس العامة للشبكة، وطريقة (سبارك) لمسح البيانات الأولية بأخذ العينات الموزعة بواسطة مفتاح الطبق باستخدام جهاز فرز فرز شامل

وبالنسبة للتعلم الآلي الذي يُعتمد على نظام الأفضليات المعمم، تصنف مكتبات مثل نظام RAPIDS البيانات المتعلقة بوحدة التوزيع العالمي باستخدام نوع من الشعاب الموازية، مما يحقق أوامر سريعة الحجم أسرع من الفرز القائم على أساس وحدة تحليل البرامجيات، مما يتيح أخذ عينات قريبة من الواقع من بيانات تيار نماذج التعلم على الإنترنت.

الاعتبارات المسبقة: تزييف بيئة التوزيع والوحدة

ومع تزايد مجموعات البيانات إلى ما وراء آلة واحدة، يصبح الفرز عملية موزعة، فالأجوريم مثل تقسيم العينات إلى البيانات بواسطة أخذ مفاتيح العينات، ثم إعادة توزيع السجلات على القسم الصحيح، وهذا هو أساس الفرز الموازي في قواعد البيانات وأطر البيانات الكبيرة، وبالنسبة لأخذ العينات، إذا كان الهدف هو الحصول على عينة متداخلة، فإن نفس المنطق الذي يقسم على نحو لا يكفل عملية واحدة.

أصبحت فرز وحدات الشرطة العالمية ذات أهمية متزايدة بالنسبة لخطوط الأنابيب التعليمية العميقة، تقوم مكتبة مكتبة الـ (إنفيدي) و(كيو دي) بتنفيذ أشعة عالية الأداء وفرزات رخوة تُصنف مليارات العناصر في ثواني، وعندما تقترن هذه الأدوات بأخذ عينات على الإنترنت، فإنها تتيح التدريب على مجموعات فرعية ذات عينات دينامية تُفرز دائماً في الذاكرة، مما يتيح إيجاد كميات صغيرة فعالة من أجل الحد الأدنى من التساهل.

وعند اختيار خوارزمية فرز خط أنابيب أخذ العينات، ينبغي للممارسين أن ينظروا في حجم البيانات، ونوعها الرئيسي، وميزانية الذاكرة، والتماثل، وليس هناك حل واحد يناسب الجميع؛ ويوصى بمقارنة خطوة الفرز على المعدات التمثيلية لتجنب الاختناقات.

الأفكار النهائية

إن الخوارزميات المصممة أكثر بكثير من مفهوم الكتاب المدرسي - فهي أداة عملية للتمكين من الحصول على بيانات تتسم بالكفاءة والقابلية للتقسيم، وتأخذ بعينات سليمة من الناحية الإحصائية في مجال التعلم الآلي، ومن خلال تفصيل توزيع البيانات على الفئات إلى تحليل سلاسل زمنية متسارعة، فإن القدرة على طلب أساليب جمع البيانات غير عملية وغير عملية بالنسبة لمجموعات البيانات الحديثة.