Table of Contents

ما هو بحيرة بيانات الحدث؟

وتمثل بحيرة البيانات التي تحركها الأحداث مستودعاً مركزياً يخزن البيانات ويخزنها استجابة للتغيرات التي تحدث في الدولة، أو القادمين الجدد للبيانات، أو الإجراءات التي يتخذها المستخدمون - بخلاف ما هو مدرج في جدول زمني محدد، وعلى عكس البحيرات التقليدية للبيانات التي تعتمد على وظائف الدفعة الدورية، فإن هيكلاً يقوم على الأحداث يتفاعل في الوقت الحقيقي أو في الوقت القريب، مما يتيح توافر البيانات الفورية للآليات، والتعلم الآلي، والقرارات التشغيلية.

والفكرة الأساسية هي أن كل جزء جديد من البيانات يؤدي سلسلة من المهام التي لا تخدم أي خدمة تحقق من البيانات وتحوّلها وتثريها وتحمّلها إلى البحيرة، وهذا النمط يناسب عادة مخازن الجسم السحابي (مثل تخزين أمازون S3 أو أزور بلوب) والخدمات الحاسوبية التي لا تُحصى (مثلاً في شركة AWvisionS Lambda، أو شركة Azure Functions، أو معالجة شركة Google Cloudctions).

خصائص منطقة البحيرات الكبرى

  • Asynchronous Processing:] Events are processed independently, allowing the system to scale horizontally and handle spikes in data volume without manual intervention.
  • Decoupled componentss:] Producers (data sources) and consumers ( processing and analytics services) are loosely coupled through event brokers or triggers. This improves fault tolerance and simplifies maintenance.
  • Real-Time Data Freshness:] Data moves from source to lake in seconds or minutes, supporting time-sensitive use cases like fraud detection, IoT monitoring, and real-time dashboards.
  • Direct Integration with Cloud Services:] Modern cloud platforms provide built-in event triggers (e.g., S3 Event Notifications, Azure Event Grid) that make it easy to chain services without custom middleware.

Event-Driven vs. Batch-Driven Data Lakes

وفي بحيرة بيانات تقليدية مدفوعة بالدفعة، يتم جمع البيانات على نافذة (مثلاً بالساعة أو يومياً) ثم تجهيزها بالجملة، وفي حين أن أساليب الدفع تبسط التنفيذ، فإنها تُحدث التساهل ويمكن أن تفوت أنماطاً عابرة، ويعطي النهج القائم على الأحداث الأولوية للحسن التوقيت والاستجابة، وكثيراً ما يستخدم كوادر الرسائل (مثل أمازون SQS أو Azuret Hubs) لإيقاف الأنشطة قبل الخدمة.

دور التكنولوجيات التي لا تُستخدم

:: توفير خدمات لا تحصى عن طريق الخلاصات بعيدا عن إدارة الهياكل الأساسية، مما يتيح للأفرقة التركيز على المنطق الشفري ومنطق الأعمال التجارية، وفي سياق البحيرات التي تستخدم فيها البيانات، توفر الخدمات التي لا تخدم الحاسوب بيئة تنفيذية لتجهيز خطوط الأنابيب التي تحفزها الأحداث، وتشمل الفوائد الرئيسية ما يلي:

Scalability

وتمتد الوظائف التي لا تُحتمل تلقائياً من صفر إلى آلاف الحالات المتزامنة على أساس حجم الأحداث، وهذا التواضع حيوي بالنسبة لبحيرات البيانات التي تشهد أنماطاً لا يمكن التنبؤ بها، مثل المسامير من وسائط الإعلام الاجتماعية أو النقرات أو الأجهزة المرتبطة بها، ولا تحتاج أبداً إلى تخمين القدرات أو إدارة مجموعات التصعيد الآلي.

الكفاءة في التكاليف

بدون خادم، تدفع فقط للوقت المحسوب والتخزين الذي تستهلكه عندما لا تدخل أي بيانات البحيرة، لا تعمل، وتكلفنا الهبوط إلى الصفر، هذا تناقض صارخ مع الأشعة المقطعية أو الحاويات التي تتكبد رسوماً حتى عندما تسقط

انخفاض النفقات العامة للعمليات

وتعالج المنابر التي لا توصف عملية التصحيح، وقطع الأشجار، والرصد، والتسامح إزاء الأخطاء خارج الصندوق، وتتحرر أفرقة التعبئة من إدارة نظم التشغيل، أو فترات التشغيل، أو الإطارات المتوسطة، مما يعجل دورات التنمية ويقلل من الوقت اللازم لسوق خطوط أنابيب البيانات الجديدة.

المرونة والتكامل

ومعظم مقدمي السحب يقدمون وظائف لا تصلح للخواديم تدمج محلياً مع عشرات الخدمات: قواعد البيانات، وسماسرة الرسائل، وتخزين المواد، وأدوات التعلم الآلي، وأدوات السحب الخاصة بالأطراف الثالثة، مثلاً، يمكن أن يؤدي حدث تحميل S3 وظيفة لامبدا تنادي باعتراف الأمازون بالعلامات، ثم تخزن البيانات الوصفية في قاعدة بيانات دون توفير خادم.

غير أن خامات الخواديم ليست رصاصة فضية، فالبداية الباردة، والحدود الزمنية للتنفيذ (مثل 15 دقيقة بالنسبة إلى لامبدا)، والقيود المتعلقة بالتصميم عديمة الجنسية تعني أن التحولات المعقدة الطويلة الأمد قد لا تزال تتطلب خيارات حسابية بديلة مثل " أوس فارغيت " أو " أو " أزور " للحاويات، وسنعالج هذه القيود في قسم التحديات.

العناصر الرئيسية لتركيب بحيرة البيانات العديمة التحلل

وتشمل بحيرة بيانات غير مجهزة جيداً بالبحوث عدة طبقات قابلة للتشغيل المتبادل، ويمكن تنفيذ كل طبقة باستخدام خدمات السحاب المنظمة، وتكفل الطبيعة التي تحركها الأحداث تدفق البيانات دون هوادة بينها.

عدد الحالات

ويمكن لأي نظام يولد بيانات أن يكون مصدراً للحدث، وتشمل الأمثلة المشتركة ما يلي:

  • Application logs and metrics emitted by web servers, mobile apps, or microservices (e.g., via Amazon CloudWatch, Azure Monitor, or third-party agents).
  • IoT devices and sensors] streaming telemetry through protocols like MQTT, often landing in AWS IoT Core or Azure IoT Hub.
  • Database change streams from transactional databases (using tools like Debezium or native change data capture) that publish row-level changes.
  • User interactions] recorded by front-end analytics SDKs and sent to an event ingestion service like Amazon Kinesis or Google Cloud Pub/Sub.

الاغتيالات والتجمع

ويمكن أن تكون الوظائف التي لا تخدم أي حواسيب خدمة مباشرة من كل حدث كبيرة وغير فعالة، بل إن الأحداث تُوجه عادة عبر كواية للرسالة أو مجرى التدفق أو حافلة للحوادث، وهذا يزيل البيانات من الاستهلاك، ويوفر العزلة، ويتيح إعادة التثبيت، وتشمل الخدمات الرئيسية ما يلي:

  • Amazon SQS] - مجرد استفسار عن عناصر الفصل، ودعم التسليم في الشرق الأدنى، والأسئلة المميتة.
  • Amazon Kinesis] - البث في الوقت الحقيقي للبيانات العالية النواتج، مع المستهلكين عديمي الفائدة عبر لامبدا.
  • Azure Event Hubs] — Fully managed, scalable event ingestion for millions of events per second.
  • Azure Event Grid] - Event routing service for pub/sub across Azure services.
  • Google Cloud Pub/Sub] - Global, durable messaging with automatic scaling and exactly-once delivery (optional).

حاسوب/معالجة

وتشكل المهام التي لا توصف قلب طبقة المعالجة، وهي تُحتج بها استجابة للأحداث التي تصل إلى السكك أو المسار، وتؤدي مهاما مثل التحقق من صحة البيانات، والتصفية، والتحول، والإثراء مع المعايير الخارجية للتصنيف، والتوجه إلى التخزين، وبالنسبة لأعباء العمل الثقيلة، فإن بعض التنفيذ يستخدم:

  • AWS Lambda (الدفعة 15 دقيقة، 10 خافت للذاكرة) للتحولات الخفيفة الوزن.
  • Azure Functions] with consumption plan or instalment plan for longer runtimes.
  • Google Cloud Functions or Cloud Run for containerized event-driven processing.
  • Step Functions] or Durable Functions to orchestrate multi-step workflows, handle failures, and manage state across multiple functions.

كاتب تخزين

تخزين الأجسام هو أساس أي بحيرة بيانات، وخدمات مثل أمازون S3، وAzure Blob، و Google Cloud Storage توفر القدرة على التصعيد، والارتفاع في إمكانية التكرار، وسياسات دورة الحياة لربط البيانات بطبقات تخزين أرخص كلما كان العمر.

  • Raw / Landing Zone] - Unmodified incoming data, stored in native formats (JSON, CSV, Avro, Parquet).
  • Cleaned / Curated Zone] - Data after validation, deduplication, and basic transformations.
  • Aggregated / Analytics Zone] - Data structured for querying, often in columnar formats (Parquet) and partitioned by date or key.

ويمكن أن تشير المحفزات التي تحركها الأحداث (مثل الإخطارات عن الحوادث التي تجرى في إطار الدورة الثالثة) إلى وصول الأجسام الجديدة، مما يؤدي إلى القيام بمهام تجهيز المجرى المائي.

التحليلات والتفسير

وبمجرد أن تستقر البيانات في طبقة التخزين، تتيح محركات الاستفسارات التي لا تخدم الحاسوب للمحللين وعلماء البيانات استكشافها دون توفير مجموعات:

  • AWS Athena ] — Presto-based, pay-per-query service for running SQL directly on data in S3.
  • Azure Synapse Serverless SQL pool] - Query data lake files on demand.
  • Google BigQuery ] — Serverless data warehouse that can query external tables on Cloud Storage.
  • Amazon Redshift Spectrum] - Extends Redshift to query data in S3.

أدوات الرؤية مثل سرعة الأمازون، أو جهاز التحكم بالكهرباء، أو الباحث عن التواصل مع هذه المحركات لأجهزة الطلاء، وخط الأنابيب الذي يقوده الحدث يضمن أن تكون اللوحات بيانات أحدث البيانات بأقل قدر من الكفاءة.

أنماط الهندسة المعمارية لبحيرات البيانات في الأحداث

وهناك أنماط عديدة متكررة تجمع بين العناصر المذكورة أعلاه، ويعتمد اختيار النمط الصحيح على سرعة البيانات وحجمها، والحاجة إلى إعادة العزف على التاريخ.

"فان أوت" مع وظائف لا تُحتمل

وفي هذا النمط، تستهلك وظيفة لا تخدم أي مقياس حدث واحد من طابور، ثم ترسل السجل المجهز إلى نظم متعددة من المجرى المائي (مثل تخزين بحيرة البيانات ومستودع للدماغ في الوقت الحقيقي) وهذا مفيد لتوزيع البيانات على مختلف المستهلكين الذين لا يملكون بنية أساسية إضافية.

Lambda Architecture with Serverless Layers

يستخدم هيكل لامبدا التقليدي طبقة دفعة للدقة التاريخية وطبقة سريعة للتحديثات المنخفضة التردد، وفي عملية تنفيذ لا تحصى، يمكن أن تكون طبقة الخبز وظيفة غير مجهزة للخدمة (مثل وظيفة يومية في لامبدا) تعيد تجميعها، بينما تكون طبقة السرعة مجهزة لتدفقات غير مزودة بخدمة الأحداث.

مبنى كابا (العمل على الدمج)

وبالنسبة للأفرقة التي تريد تجنب الاحتفاظ بقاعدة بيانات، يعامل هيكل كابا جميع البيانات على أنها تيار، ويعالج المستهلكون الذين لا يطاقون مسارها في الوقت الحقيقي، وتخزن النتائج المجهزة في بحيرة البيانات، ويستخدم المجرى نفسه (الموجود في سجل مثل كافكا أو كينسيس) مصدرا للحقيقة، ويتحقق إعادة النظر التاريخية عن طريق إعادة معالجة المسار من نقطة التواؤم.

:: تنفيذ بحيرة بيانات الأحداث

ويتطلب بناء بحيرة بيانات لا تصلح للإنتاج تخطيطا دقيقا على مراحل عديدة، ويتبع ذلك نهجا تدريجيا مستوحاة من تنفيذات العالم الحقيقي.

الخطوة 1: تحديد مصادر البيانات والتظاهرات البارزة

إدراج جميع منتجي البيانات المحتملين وصيغ إنتاجهم - توحيد الكيمياء في المناسبات المشتركة (مثل استخدام السحابات) لتبسيط عملية التجهيز في المراحل النهائية، ولبيانات منظمة، وتحديد الأنواع الميدانية، والبيانات الفوقية المطلوبة مثل المصابيح الزمنية، والتعرف على هوية المصدر.

الخطوة 2: وضع حد للاحتياط

اختيار خدمة التساؤل أو التصفيق التي تتطابق مع متطلباتك من حيث المخرجات والتساهل، وتسمح مصادر التجمع بنشر بياناتها إلى هذا الحاجز، على سبيل المثال، بتمكين الإخطارات عن أحداث 3 من إرسال أحداث لخلق الأجسام إلى قائمة على الترددات، مما يؤدي إلى وظيفة لامبدا، وضمان أن يكون هناك تساؤل مميت عن كيفية التعامل مع الإخفاقات.

الخطوة 3: تصميم هيكل تخزين

(أ) تقرير عن هيكل الملفات لبحيرة البيانات - يتضمن الهيكل الهرمي النموذجي ما يلي: [(FLT:0]، ، و]. (مثلاً، في التاريخ، أو المنطقة، أو نوع الحدث) من أجل تحقيق الأداء الأمثل للاستفسار، ووضع سياسات لدورة الحياة لنقل البيانات القديمة تلقائياً إلى تخزين المحفوظات (Szu Glacier)

الخطوة 4: تنفيذ مهام تجهيز البيانات

:: كتابة مهام لا تُستخدم في إحصاء الأحداث من التساؤل، والقيام بمنطق التحويل (مثلاً، تحويل المركبة " س في " إلى باركيز، وإلغاء الدوائر)، وكتابة النتائج إلى منطقة الهبوط في بحيرة البيانات، وبالنسبة للشبكة المعقدة، فإن سلسلة المهام المتعددة تستخدم خدمة لتركيب تدفق العمل (العمليات التقويمية)، وضمان إمكانية الإيديولوجية: ينبغي تجهيز نفس الحدث بطريقة آمنة.

الخطوة 5: إنشاء الأمن والحوكمة

تطبيق أدوار أقل تقدير في إدارة الهجرة الدولية على كل وظيفة غير مزودة بخدمة، وتبريد البيانات في راحة (استخدام نظام S3 SSE-KMS أو دائرة تخزين الزيور) وفي المرور العابر (TLS) واستخدام ضوابط الدخول المحممة بدقة (مثلاً، إنشاء محطة لغسل السفن، وشركة Azure Purview) لإدارة الأذون على العمود أو على مستوى التسلسل.

الخطوة 6: تعزيز الرصد والإنذار

رصد القياسات الرئيسية: الاستفزازات الوظيفية، ومعدلات الخطأ، والبطء، وعمق التساؤل، واستخدام أدوات غيومية مثل أمازون كلودواتش، ومرصد أزور، أو عمليات السحاب، وتنبيهات على وجود حالات شاذة، مثل التذبذب المفاجئ في رسائل DLQ أو هبوط في المعالجة عن طريق الإنتاج، وتنفيذ إنذارات بشأن التكاليف لمنع تجاوزات الميزانية.

أفضل الممارسات في مجال البحيرات التي لا تُستخدم فيها البيانات

المعالجة المحتملة

وبما أن المنصات التي لا تخدم الحاسوب قد تتراجع عن الاستفزازات الفاشلة، فإن ضمان أن تكون الكتابة إلى بحيرة البيانات أمراً مُثلياً، واستخدام بطاقات هوية فريدة لتجاوز الازدواجية، أو استخدام عمليات الكتابة الذرية (مثلاً، وضعيات خطية S3 المشروطة)، وتجنب الآثار الجانبية التي يمكن أن تسبب فساداً في البيانات على الاسترداد.

تحقيق الحد الأمثل للبدائل الباردة

عند استخدام لامبدا لجهاز الإنذار المبكر، تقليل درجة البدئ إلى أدنى حد ممكن عن طريق:

  • اختيار وقت عمل مع الإسراع في البدء (Node.js, Python) على جافا/C#.
  • استخدام الاتّفاق المُنصّت للمهام الحاسمة.
  • إبقاء المعالين صغيرة وإستعمال الطبقات

استخدام مواد الضغط والأشكال القمرية

(ج) تحويل البيانات إلى شركة باركيت أو أو أوركيك في أقرب وقت ممكن عملياً، مما يقلل تكاليف التخزين ويحسن بشكل كبير أداء الاستفسارات في محركات SQL التي لا تخدم الحاسوب، وبالنسبة للملفات الصغيرة، يُدفع بها باستخدام آلية نافذة (مثل السجلات العازلة لمدة دقيقة أو 000 1 سجل، ثم يكتب ملفاً واحداً).

Manage Vendor Lock-In

وفي حين أن الخدمات السحابية ملائمة، فإنها تنظر في استخدام عناصر من مصادر مفتوحة حيثما أمكن، مثلاً، استخدام أباتشي كافكا كحافلة للحدث (عن طريق السحاب المثمر أو الإدارة الذاتية) بدلاً من خدمة لحيازة الممتلكات، واستخدام تخزين المواد مع أجهزة قياسية ذاتية الكمالية S3) (MinIO) في تركيبات الهجين أو متعددة الأماكن، مما يحفظ إمكانية النقل.

التحديات والنظر في المسألة

ولا يوجد هيكل بدون مقايضة، فالتحديات التالية شائعة في البحيرات التي لا توجد بها بيانات تحركها أحداث، وتتطلب تخفيفاً استباقياً.

اتساق البيانات وأوامرها

وفي توزيعها، لا بد من وجود نظم قائمة على الأحداث، وحدثات خارج نطاق الطلب، وازدواجية في عمليات التسليم، واستخدام وقت الحدث (مؤقت في حمولة الشحن) بدلا من تجهيز الوقت اللازم لإصدار أوامر الأحداث، وتنفيذ طبقة من الإدمان باستخدام مخابئ (مثلا، ريديس أو دينامو ب) تتبع بطاقات هوية الأحداث التي تم تجهيزها مؤخرا.

إدارة التكاليف

ويمكن أن تصبح التكاليف التي لا يمكن التنبؤ بها عندما ترتفع أحجام البيانات بشكل غير متوقع، وتضع الميزانيات وتنفذ الكشف عن الشذوذ في التكاليف، وتستخدم حدوداً متبادلة محجوزة للحد من الحد الأقصى لوظيفة الموظفين، وتختار أرخص مستويات التخزين للبيانات الخام وتتسارع فقط عند الضرورة.

المخاطر الأمنية

وكثيرا ما تكون للمهام التي لا تُقَدَّم بعد إذن واسع النطاق بالتفاعل مع الخدمات الأخرى، وتتبع مبدأ أقل الامتيازات: لا تمنح إلا الإجراءات المحددة اللازمة بشأن موارد محددة، ولا تستخدم وثائق التفويض المؤقتة عن طريق أدوار إدارة المعلومات الإدارية، ولاستخدام التشفير والتصنيع، ولاستخدام أداة لإدارة الوضع الأمني لا رجعة فيها لكشف حالات الاختلال.

Vendor Lock-In

وكما ذُكر، فإن الاعتماد على خدمات الملكية (مثل الإخطارات الصادرة عن حوادث S3، أو عن محركات لامبدا، أو عن منظمة " إيفيت غريد " ) يمكن أن يجعل الهجرة صعبة، ويخفف من حدة ذلك من خلال تقلص طبقة تجهيز الأحداث خلف واجهة (مثلاً، باستخدام سجل " إيفينت بريدج " )، واستخدام معايير مفتوحة (CloudEvents).

درجة بدء التشغيل الباردة للنظم الحالية

وبالنسبة للاحتياجات المنخفضة السرعة (الخامسة) يمكن أن تكون البداية الباردة إشكالية، إذ أن وظائف ما قبل الحرب ذات العضلات المقررة أو تستخدم التناسق الموفر، وكبديل لذلك، تستخدم خدمات الحاويات التي لا تخدم الخدمة (AWS Fargate, Cloud Run) التي لها آثار بدائية باردة أقل من آثار لامبدا أو المهام.

حالات الاستخدام الحقيقي في العالم

تحليلات كليكلستر

وتقوم شركة للتجارة الإلكترونية بجمع بيانات عن نقر المستعمل من موقعها الشبكي عن طريق شبكة AWS Kinesis، وتشغل شركة لامبدا وظائف في مجال التجزئة وثرائها مع البيانات الوصفية للمنتجات، ثم تكتبها إلى S3 في شكل باركيت، وتمارس هيئة منفصلة للاستفسار عن استخدام أجهزة الصرافة (Athena) صلاحيات تفاعلية تظهر فيها مفاتيح التحويل في الوقت الحقيقي، وتسمح الطبيعة التي تحركها الأحداث بالكشف عن التغيرات في سلوك المستعملين في غضون ثوان.

IoT Telemetry and Predictive maintenance

وتتلقى شركة تصنيع قراءات استشعارية من آلاف الآلات عبر مهبط أزور إيوت. وترسل الأحداث إلى هوب الحدث حيث ترشيحات أزور للخصوم وتخزن البيانات الخام في مستودعات بلوب، ويتوقع نموذج ML الذي يُدار على أسوري ML (مُنقَّد بوظيفة تدريب على الزمن) إخفاقات في المعدات ويرسل تنبيهات إلى قاعات المخزن.

كشف الاحتيال المالي

وتقوم شركة من الشركات المفترسة بعمليات المعاملات في الوقت الحقيقي باستخدام شركة غوغل كلود بوب/العمليات الفرعية تحقق كل معاملة باستخدام نموذج تدريبي سابق من نوعه من نوع فيرتكس آي. وتلتزم المعاملات المشروعة بتقديم التقارير، بينما تُعرَّف الاشتباهات على نحو يُستشف من أجل المراجعة اليدوية، ويكفل الهيكل الذي يقوده الحدث عدم تأخير أي معاملة أكثر من بضع مئات من المليثانات.

خاتمة

إن بناء البحيرات التي تُستخدم فيها البيانات بواسطة تكنولوجيات لا تخدمها، يُوفِّر مزيجاً قوياً: مدى قابلية تخزين الأجسام السحابية للتشغيل، وقابلية الارتحال في المحاسب المفاجئ، وباعتماد هذا الهيكل، يمكن للمنظمات أن تلغي التأخير في تجهيز دفعات الصيد، وتخفض النفقات العامة لإدارة الهياكل الأساسية، ولا تدفع إلا ما تستخدمه، وبما أن المنصات التي لا تخدم أيسر تنضج، وتُعد سمات مثل فترات التنفيذ الأطول، وتُ أدنى من سرعة البدء الباردة، وتحسين إدارة الدولة، تُ سد الفجوة مع خيارات المقارنة التقليدية.

غير أن النجاح يتطلب تصميما دقيقا حول الايدمان والاتساق والرصد ومراقبة التكاليف، فالأنماط وأفضل الممارسات المبينة في هذه المادة توفر أساسا صلبا للأفرقة التي تسعى إلى تحديث هياكلها الأساسية للبيانات، وسواء كنت تتدفق النقرات أو القياس عن بعد أو المعاملات المالية، فإن نموذج بحيرة البيانات الذي لا يدبر أحداثا يوفر وسيلة تحول البيانات إلى أفكار.

For further reading, explore the official documentation on Building an Event-Driven Data Lake using AWS Lambda and Amazon S3, ]Microsoft’s Event-Driven Data Lake Architecture, and