Table of Contents
معرفی کتاب های بزرگ مهندسی
تیم های مهندسی امروز حجم بی سابقه ای از داده ها را تولید می کنند - از مدل های پیچیده CAD و تجزیه و تحلیل عناصر محدود به جریان های سنسور زمان واقعی و خروجی شبیه سازی.مدیریت این مجموعه های بزرگ مهندسی داده ها، نقض های امنیتی، و استراتژی های سخت افزاری، بازیابی سرعت، کنترل نسخه و یکپارچگی داده ها، بدون یک رویکرد ساختاری، مهندسان و ذینفعان خطر کند جریان کار، داده ها، نقض های امنیتی، و استراتژی های اطمینان طولانی مدت، بهترین روش های اثبات شده برای کمک به این اطلاعات و تنظیم داده های مهندسی داده های قابل اطمینان، مدیریت داده های بزرگ، و اطمینان از طریق داده ها.
درک چالش های داده های مهندسی بزرگ
بر خلاف داده های کسب و کار معمولی، مجموعه داده های مهندسی اغلب دارای ویژگی های متمایزی هستند که مدیریت مبتنی بر وب را پیچیده می کند. Volume واضح ترین چالش است: یک شبیه سازی منفرد می تواند ترابایت خروجی خروجی تولید کند، در حالی که دوقلوی دیجیتال محصول ممکن است به سرعت در مورد پیچیدگی چرخه عمر خود، لایه دیگری را جمع آوری کند - داده های مهندسی اغلب شامل متاداده های جاسازی شده، نسخه، روابط و مجموعه های پردازش مواد، و همچنین به سرعت از طریق اطلاعات پردازش دقیق پردازش می شود:
نقاط درد مشترک شامل عملکرد آهسته پرس و جو در پایگاه های بزرگ، مشکل حفظ کنوانسیون های نام گذاری مداوم در سراسر تیم ها، و خطر از دست دادن داده ها در طول ویرایش های مشترک، علاوه بر این، فرمت های مختلف فایل -STEP، IGES، STL، CSV، HDF5 - نیاز به تجزیه و تحلیل انعطاف پذیر و نگهداری موتورهای بدون یک استراتژی مدیریت داده قوی، این چالش ها می تواند نوآوری و افزایش زمان برای محصولات جدید.
بهترین روش ها برای مدیریت داده ها
۱) استفاده از راه حل های ذخیره سازی مقیاس پذیر
ذخیره سازی مقیاس پذیر پایه و اساس هر استراتژی مدیریت داده های مهندسی بزرگ است. سرویس های ذخیره سازی اشیاء مبتنی بر ابر، مانند AWS Simple Storage Service (S3) یا Azure Blob Storage، ظرفیت تقریبا نامحدود با پرداخت هزینه های پرداخت-به عنوان-you-go را ارائه می دهند، آنها گره های قرمز، توزیع جغرافیایی و سیاست های چرخه عمر را برای مهاجرت به طور خودکار کمتر به طور خودکار دسترسی داده های سریع تر برای سیستم های دسترسی فایل های متنوع مانند پردازش فایل های متنوع و یا سیستم های متنوع مانند پردازش فایل های متنوع مانند پردازش فایل های متنوع، می توانند پردازش فایل های دسترسی به طور همزمان را در نظر بگیرند.
هنگام استفاده از یک پلت فرم مانند Directus، می توانید آداپتورهای ذخیره سازی فایل خود را برای اتصال به S3 یا Google Cloud Storage به طور مستقیم استفاده کنید، این امر ذخیره فایل های باینری بزرگ (مدل های CAD، نتایج شبیه سازی) را در خارج از پایگاه داده ذخیره می کند در حالی که متاداده و روابط را در یک فروشگاه رابط ساختار یافته حفظ می کند: استفاده از یک پایگاه داده ارتباطی برای متاداده و ذخیره سازی اشیاء برای blobs - عملکرد پرس و جو با استفاده از مناطق ذخیره سازی داده های ذخیره سازی داده های ذخیره سازی اطلاعات نزدیک به کاربران.
۲- پیاده سازی داده های کارآمد Retrieval
بازگرداندن داده های مهندسی خاص از مجموعه های عظیم نیاز به بهینه سازی دقیق دارد.شروع با نمایه سازی پایگاه داده: ایجاد شاخص های کامپوزیت در زمینه های اغلب مبهم مانند ID پروژه، شماره تجدید نظر، تاریخ خلقت و نوع فایل برای داده های سنسور زمان سری، در نظر گرفتن پایگاه های داده های زمان مانند InfluxDB یا TimescaleDB که ارائه می دهند-indownampling و سیاست های حفظ و noSQL مانند پایگاه داده های نیمه انعطاف پذیر، همچنین می توانند طرح های نیمه انعطاف پذیر و مهندسی داده های نیمه نرم افزاری را ارائه دهند.
Caching یکی دیگر از تکنیک های حیاتی است. پیاده سازی یک حافظه چند لایه با استفاده از Redis یا Memcached برای ذخیره اغلب به متاداده، نتایج جستجو، یا تجمع های پیش فرض شده است.در سیستم عامل های وب، هدرهای پاسخ (Cache-Control، ETag) می توانند بار سرور را برای دارایی های غیر قابل تغییر مانند فایل های CAD تایید شده کاهش دهند.
بهینه سازی Query به لایه برنامه گسترش می یابد.استفاده از پرس و جو برای به دست آوردن تنها زمینه های مورد نیاز، جلوگیری از الگوهای جستجوی N+1 با پیوستن به داده های مرتبط در یک درخواست واحد، و دسته بندی قرار دادن / به روز رسانی برای کاهش سفرهای پایگاه داده دوره ای (VACUUM، ANALYZE) برنامه های جستجو را به عنوان داده ها رشد می کند.
۳- امنیت داده ها و کنترل دسترسی
داده های مهندسی اغلب شامل مالکیت فکری، اسرار تجاری یا اطلاعات حیاتی ایمنی، امنیت را در اولویت قرار می دهند.تمام داده ها در استراحت و در حمل و نقل باید با استفاده از الگوریتم های استاندارد صنعت (AES256، TLS 1.3) رمزگذاری سرور را با کلید های مدیریت شده توسط ارائه دهنده یا سازمان شما (KMS) برای شبیه سازی های حساس یا طرح های اختصاصی رمزگذاری مشتری در نظر بگیرید که داده های رمزگذاری شده قبل از ترک مهندسی ایستگاه های ایستگاه کار هستند.
کنترل دسترسی مبتنی بر نقش (RBAC) برای اجرای اصل حداقل امتیاز ضروری است. نقش های تعریف مانند "viewer"، "editor"، "approver"، و "admin" با مجوزهای دانه در پوشه ها، پروژه ها یا حتی زمینه های داده های فردی، Directus یک سیستم قوی RBAC را فراهم می کند که با ارائه دهندگان هویت خارجی (Outh، LDL) ادغام می شود، حذف تک، و هشدار برای هر گونه رفتار دسترسی به دنبال.
علاوه بر این، پیاده سازی اقدامات پیشگیری از از دست دادن داده ها (DLP): محدود کردن دانلود مجموعه داده های بزرگ به مشتریان مجاز، استفاده از علامت های پیش نمایش در تصاویر، و اجرای احراز هویت چند عاملی برای اقدامات اداری. حسابرسی های امنیتی منظم و تست نفوذ کمک به شناسایی سوء پیکربندی ها و آسیب پذیری ها، به ویژه هنگامی که پلت فرم API ها را به شرکای خارجی یا مشتریان مرتبط می کند.
توصیه های اضافی
- نسخه سازی داده: داده های مهندسی از طریق طراحی ⁇ ، اصلاح باگ و تغییرات مورد نیاز تکامل می یابد. پیاده سازی یک سیستم کنترل نسخه برای دارایی های داده شما که ضبط چه و چه زمانی. Directus پشتیبانی از ردیابی تجدید نظر از جعبه برای اکثر انواع میدان استاندارد، اما برای فایل های باینری، ادغام با یک مخزن اختصاصی مانند GitS یا یک نسخه ذخیره سازی قبلی بدون استفاده از داده ها همیشه برای حفظ داده های ذخیره سازی داده های ذخیره سازی.
- اعتبار داده: Garbage in, زباله به طور شدید به مجموعه داده های مهندسی اعمال می شود. قوانین اعتبار سنجی Enforce در سطح پایگاه داده (مداخله, محرک) و در سطح نرم افزار (اعتبار سنجی سرور با استفاده از طرح های پیش تعریف شده) استفاده از ابزار مانند JSON برای متاداده و اعتبار سفارشی برای قوانین مصرف اولیه (به عنوان مثال، باید از داده های خودکار و چگالی (0.13) و چگالی از داده های خودکار جلوگیری شود.
- Automation: مدیریت داده های دستی خطا است و چرخه های مهندسی را کند. Automate داده های مصرف از دستگاه های IoT، ابزار شبیه سازی و سیستم های CAD با استفاده از API یا خط لوله ETL (Apache NiFi، گلو) جریان کار برنامه ریزی شده می تواند پروفایل، استخراج تصاویر، نسل یا ویرایش فایل های ذخیره سازی شده را تحریک کند، و اجازه می دهد تا اطلاعیه های ذخیره سازی قدیمی را به شما اجازه دهد تا خودکار سازی داده های فایل های فایل های ذخیره سازی شده و فایل های فایل های خودکار سازی شده مانند ارسال کند.
- مستندات مشارکتی: یک سیستم مدیریت داده های به خوبی مستند، سود سهام برای نصب مهندسین جدید و عیب یابی طرح های داده سند (موجودات، زمینه ها، روابط)، نامگذاری قراردادها، سیاست های نسخه سازی و دسترسی به قوانین کنترل را می پردازد.استفاده از یک ویکی زندگی یا فایل های مارک شده در کنار نمونه داده ها، اسناد و اسناد و مدارک خود را به عنوان پایگاه داده های پایگاه داده های داده های نرم افزاری، می سازد.
نتیجه گیری
مدیریت مجموعه های بزرگ مهندسی در سیستم عامل های وب نیاز به ترکیبی از زیرساخت های مقیاس پذیر، مکانیسم های بازیابی کارآمد، امنیت قوی و فرآیندهای انضباطی دارد.با اتخاذ ذخیره سازی ابر مقیاس پذیر، بهینه سازی پایگاه های داده و ذخیره سازی برای دسترسی سریع، و اجرای دقیق دسترسی، سازمان های مهندسی می توانند پتانسیل کامل داده های خود را در حالی که به حداقل رساندن ریسک - نسخه داده های اضافی - اتوماسیون، و اطمینان از ساختار داده های جامع پشتیبانی می کنند، و انطباق داده های کامل، و یا انطباق داده های جامع.