مقدمه: نقش حیاتی حفظ پیش بینی

شکست تجهیزات در محیط های مهندسی - از خطوط تولیدی به نیروگاه های برق - می تواند منجر به خرابی پر هزینه، خطرات ایمنی و درآمد از دست رفته، تعمیر و نگهداری واکنش سنتی، که تعمیرات تنها پس از شکست اتفاق می افتد، دیگر در عصر داده های سنسور عظیم و نظارت بر زمان واقعی، تعمیر و نگهداری پیش بینی ماشین، مجهز به یادگیری ماشین، مهندسان را قادر می سازد تا پیش بینی های پیش بینی های پیش بینی شده و کارآمد منابع را فراهم کند.

این مقاله گسترش می دهد که چگونه MLlib می تواند برای پیش بینی شکست مهندسی و ارزیابی ریسک اعمال شود.ما خط لوله کامل را پوشش می دهیم: جمع آوری داده ها و پیش پردازش، مهندسی ویژگی، انتخاب مدل، آموزش، ارزیابی و استقرار سیستم های پیش بینی محصول.

اسپارکس MLlib چیست؟

MLlib کتابخانه یادگیری ماشین Apache Spark است که برای پردازش داده های با کارایی بالا، توزیع شده طراحی شده است.این مجموعه ای از الگوریتم ها را برای طبقه بندی، رگرسیون، خوشه بندی، فیلترینگ مشارکتی و تبدیل ویژگی ها فراهم می کند. برخلاف کتابخانه های تک گره مانند Scikit-learn، MLlib به طور افقی در سراسر خوشه ها، کنترل ترابایت داده ها به طور موثر.

اجزای کلیدی شامل:

  • API های مبتنی بر DataFrame [FLT 1] - ادغام با Spark SQL و DataFrames برای دستکاری داده های یکپارچه.
  • [[۱] [۱۰] [۱۰] [۱۰] [۱] [۱]] [۱]] [۱]] [۱] [۱]] [۱]] [۱]] [۱] [۱]] [۱]] [۱]] [۱] [۱]] [۱] [۱۰] [۱] [۱] [۱] [۱] [۱] [۳] [۳] [۳] [۱] [۱] [۳] [۱] [۳] [۳] [۱] [۱] [۱] [۱] [۱] [۱] [۳] [۳] [۳] [۳] [۱] [۱] [۳]]] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۳] [۱] [۱] [۱] [۳]] [۳] [۳] [۳] [۳] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۳] [۳] [۳] [۱] [۱] [۳] [۳] [۱] [۱] [۱] [۱
  • Hypererparameter تنظیم [FLT 1] - Cross-validation و قطار-validation برای بهینه سازی مدل تقسیم می شود.
  • مدل پایداری - صرفه جویی و مدل های بار با استفاده از / روش های تولید مجدد استفاده می شود.
  • ]Streaming و یادگیری آنلاین - MLlib می تواند با جریان اسپارکس برای پیش بینی های زمان واقعی در تغذیه سنسور زنده یکپارچه شود.

چرا MLlib برای پیش بینی شکست مهندسی؟

داده های مهندسی اغلب حجم، سرعت و تنوع را نشان می دهند.اطلاعات سنسور می تواند میلیون ها رکورد در ساعت تولید کند، نیاز به محاسبات توزیع شده است. پشتیبانی بومی MLlib برای استخراج ویژگی (به عنوان مثال، ، ، و طیف گسترده ای از الگوریتم ها آن را انتخاب ایده آل، علاوه بر این، Sparktime مهندسان بدون انتقال داده ها، و سیستم های واحد را در سیستم های واحد هدایت می کند.

جمع آوری داده ها و پیش پردازش

کیفیت پیش بینی های شکست به شدت به کیفیت و وسعت داده های ورودی بستگی دارد:

  • ] خواندن [FLT 1 ]؛ دما، ارتعاش، فشار، سرعت چرخش، قرعه کشی فعلی.
  • ثبت نام های عملیاتی [FLT 1]؛ زمان شروع / توقف، رویدادهای تعمیر و نگهداری، کدهای خطا.
  • عوامل محیطی [FLT 1]؛ رطوبت، دمای محیط، سطوح گرد و غبار.
  • ] تاریخ اصلی : اقدامات تعمیر، جایگزینی بخش، نتایج بازرسی.

پیش پردازش داده ها در MLlib معمولا شامل مراحل زیر با استفاده از تغییرات DataFrame است:

مدیریت ارزش های گمشده

از MLlib استفاده کنید (FLT:6) برای پر کردن ارزش های عددی از دست رفته با معنی، رسانه یا حالت، شما ممکن است جایگزین ارزش های از دست رفته با یک سهامدار یا استفاده از پس از آن .

عادی سازی و استاندارد سازی

الگوریتم هایی مانند SVM و رگرسیون لجستیکی به مقیاس های ویژگی حساس هستند. اعمال (FLT:9 (z-score) یا [FLT 10] برای به ارمغان آوردن ویژگی های قابل مقایسه.

استخراج از Time Series

جریان های سنسور خام نیاز به تجمع در سراسر پنجره ها دارند.استفاده از توابع پنجره Spark SQL (به عنوان مثال، چرخش به معنی، انحراف استاندارد، min/max در طول ساعت گذشته) برای ایجاد ویژگی های سطح بالا. MLlib's همچنین می تواند تغییرات ویژگی را به طور خلاصه بیان کند.

مهندسی برای پیش بینی شکست

مهندسی محتوا جایی است که تخصص دامنه با یادگیری ماشین مطابقت دارد.در پیش بینی شکست، اغلب ویژگی های آموزنده الگوهایی را که پیش از شکست ها وجود دارد، جذب می کنند:

  • ویژگی های : شیب سنسور خواندن بیش از یک پنجره کشویی (به عنوان مثال، روند افزایش دما).
  • ویژگی های دامنه (FLT:1) : اجزای FFT از داده های ارتعاشی برای تشخیص خطاهای تحمل کننده.
  • ویژگی های فعل و انفعال ؛ محصول دما و فشار، یا دامنه ارتعاش مربع است.
  • [[۱] [۱۰] خلاصه آماری [[۱۰] [۱۰]: [۱]، [۱]،] [۱]، [۱]، [و] [۱]؛ [۱] [۱] [۱] [۱] [۱] [۱]؛ [۲] [۱] [۲] [۱] [۱] [۲] [۱] [۱] [۲] [۲] [۲] [۳] [۱] [۲] [۲] [۲] [۱] [۱] [۱] [۱] [۲] [۱] [۱] [۱] [۲] [۲] [۲] [۱] [۱] [۱]]]] [۱] [۱] [۳] [۱] [۱] [۳] [۱] [۳] [۱] [۱] [۱] [۱] [۳] [۱] [۳] [۳] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۳] [۲] [۲] [۲] [۳] [۲] [۲] [۲] [۱] [
  • [در این باره] از زمان نگهداری (FLT: 1) : یک پروکسی برای پوشیدن و جذب (و یا از آن)

MLlib (FLT:12) را برای ترکیب ستون های متعدد به یک بردار ویژگی واحد فراهم می کند، برای کاهش ابعاد، استفاده از [FLT13] (Principal Component Analysis) هنگامی که شما ده ها یا صدها ویژگی مرتبط دارید.

ساخت مدل پیش بینی شکست

پیش بینی شکست به طور معمول به عنوان یک مشکل طبقه بندی دودویی طراحی شده است: "آیا تجهیزات در ساعت های بعدی شکست می خورند؟" جایگزین، مدل های رگرسیون می توانند زندگی مفید باقی مانده (RUL) را در ساعت ها یا چرخه ها تخمین بزنند.

الگوریتم های طبقه بندی در MLlib

MLlib چندین الگوریتم طبقه بندی مناسب برای پیش بینی شکست را ارائه می دهد:

  • [[۱] [۱۰] [۱] [۱۰] [۱۰] [۱]] [۱۰]] [۱۰] [۱] [۱۰] [۱]] [۱۰] [۱]] [۱۰] [۱] [۱۰]] [۱۰] [۱] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱۰] [۱] [۱] [۵] [۱] [۱] [۱] [۱] [۱] [۱] [۵] [۵] [۱] [۱] [۱] [۱]]]]]] [۱] [۱۰] [۱] [۱] [۱۰] [۱] [۱] [۱] [۱۰] [۱] [۱۰] [۱۰] [۱] [۱۰] [۱۰] [۱۰] [۱] [۱] [۱] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱] [۱۰] [۱۰
  • درختان تصمیم - روابط غیر خطی را مدیریت کنید و برای کارشناسان دامنه آسان است.
  • [[۱] [۱۰] [۱] [۱۰] [۱]] [۱]] [۱]] [۱] [۱]] [۱]] [۱]] [۱] [۱]] [۱] [۱]] [۱]] [۱] [۱]] [۱] [۱] [۱]] [۱] [۳] [۱] [۱] [۱] [۱] [۱] [۱] [۷] [۷] [۸] [۸] [۸] [۷] [۸] [۷] [۷] [۸] [۸] [۸] [۸] [۸] [۸]] [۸] [۸]]] [۷] [۸] [۷] [۷] [۷] [۷] [۷] [۷] [۷] [۷] [۷] [۷]]] [۷] [۷] [۷] [۷] [۷] [۷] [۷] [۷]] [۷] [۷] [۷] [۷] [۷] [۷] [۷] [۷] [۷] [۸] [۷] [۷] [۸] [
  • (فَلَّهُمَهُمَهُمَهُمَهُوا بِهَهُمَهُمَهُمَهُوا مِنَّاِنَهُمْهُمَهُمْهُمَهُمَهُمَهُوا بِهُمَهُمَهُمَهُمَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوا مِهُوا مِهُوَهُوَهُوَهُوَهُمْهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوا بِهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَه
  • ماشین آلات پشتیبانی خطی (SVM) - موثر برای فضاهای با ابعاد بالا اما کمتر قوی به سر و صدا.
  • [در این میان] در حالی که در آن ها از نظر ظاهری، از آن ها، به آسانی و آسان و آسان و آسان است، به آسانی قابل استفاده است.

بازگشت به زندگی مفید

هنگامی که شما اطلاعات مربوط به شکست های شناخته شده را اجرا می کنید، از الگوریتم های رگرسیون استفاده کنید: Regressionion Random Forest Regressor] ، یا GBTgressor [FLT5:] هدف باقی مانده است که می تواند هشدار های مداوم را به سرعت خروجی ML.

آموزش و راه اندازی خط لوله

با استفاده از MLlib's ، شما می توانید تمام مراحل پیش پردازش و آموزش مدل را به یک جریان کاری واحد زنجیره ای کنید.

[در این میان]

ارزیابی ریسک با استفاده از MLlib

ارزیابی ریسک فراتر از پیش بینی شکست دودویی است تا احتمال و عواقب بالقوه شکست را مشخص کند. MLlib از این طریق حمایت می کند:

طبقه بندی مقدماتی

الگوریتم هایی مانند پیش فرض های کلاس خروجی جنگل های تصادفی () می توانند به عنوان امتیاز ریسک برای اولویت بندی تفسیر شوند.به عنوان مثال، احتمال 0.95 نشان دهنده خطر بالا و بازرسی فوری است، در حالی که 0.20 ممکن است به طور معمول تحت نظارت قرار گیرد.

خوشه ای برای تشخیص آنومای

در این میان، |K-means]] یا |Gausian Mixture Models (GMM) می تواند شرایط عملیاتی طبیعی را گروه بندی کند که به هیچ خوشه ای (یا به مراتب دروغ از ۱۰۰٪) تعلق ندارد، پرچم به عنوان نشانه های اولیه استفاده می شود.

تحلیل بقا (Time-to-Event)

در حالی که MLlib یک ماژول تجزیه و تحلیل اختصاصی برای بقا ندارد، می توانید آن را با استفاده از رگرسیون در زمان انتقال داده شده به شکست، یا با ساخت یک مدل طبقه بندی با افق های پیش بینی مختلف، برای تجزیه و تحلیل پیشرفته تر بقا، ادغام اسپارک با کتابخانه های خارجی مانند در R یا استفاده از Spark UDF.

مدل ارزیابی

MLlib فراهم می کند عایق های داخلی برای هر دو طبقه بندی و رگرسیون:

  • ارزیابی کلاس سازی ( - تکمیل منطقه تحت منحنی ROC (AUC) و منطقه تحت منحنی PR.
  • [[۱] [۱۰] [۱۰] ارزیابی چند طبقه بندی [[۱۰] [۱۰]] [۱۰] - Calculates F1score، دقت وزن، به یاد آوردن.
  • [[ویرایش] [۱] [۱۰] [۱] [۱۰] [۱] [۱]] [۱] [۱]] [۱] [۱]] [۱]] [۱] [۱] [۱]] [۱]] [۱] [۱] [۱]] [۱] [۱] [۱]]، [۱]، [۱]، [۱]، [۱]، [۱]، [۱] [۱]، [۱]، [۲] [۱] [۱] [۱] [۲] [۱] [۲] [۲] [۲] [۲] [۲] [۱] [۱]

ولتاژ صلیب (به عنوان مثال، با یک شبکه از hyperparameters) کمک می کند تا از بیش از حد اجتناب و انتخاب بهترین مدل برای داده های شکست عدم تعادل - که در مهندسی که شکست نادر است - استفاده از وزن کلاس (به عنوان مثال، در جنگل تصادفی") و یا بیش از حد اقلیت با استفاده از منطق داده های سفارشی.

دانلود بازی Deployment and Real-Time

هنگامی که مدل آموزش دیده و ارزیابی می شود، آن را با استفاده از برای استنتاج زمان واقعی، شما دو گزینه دارید:

  • ] - دوره ای خط لوله را بر روی داده های جدید (به عنوان مثال، روزانه یا ساعت) با استفاده از مشاغل اسپارک اجرا کنید.
  • ]Stream inference - استفاده از جریان اسپارکس (یا جریان ساختاری) برای مصرف داده های سنسور از کافکا یا فایل ها.استفاده از مدل خط لوله در هر میکروبلاگ برای تولید امتیازات و هشدار های خطر زنده.

مثالی از AST اسنیپت:

[در برابر ]

لینک های خارجی برای خواندن بیشتر

برای عمیق تر کردن درک خود، این منابع معتبر را بررسی کنید:

چالش ها و بهترین تمرین ها

ساخت مدل های پیش بینی شکست موثر نیاز به پرداختن به مشکلات مشترک دارد:

  • عدم تعادل کلاس - شکست حوادث نادر است.استفاده از بیش از حد ذرات مصنوعی (SMOTE) از طریق UDFs سفارشی یا تنظیم وزن کلاس.
  • حرکت اجباری - رفتار تجهیزات در طول زمان به دلیل سایش، فصلی بودن یا شرایط عملیاتی جدید تغییر می کند.
  • اهمیت بهره برداری - استفاده از MLlib (FLT:24] در مدل های مبتنی بر درخت برای شناسایی سنسورهای کلیدی و ایجاد اعتماد به دامنه.
  • قابلیت های - داده های تقسیم شده توسط شناسه دارایی برای اجازه آموزش موازی برای انواع مختلف تجهیزات در همان خوشه.
  • کیفیت داده - ارزش های سنسور کور یا از دست رفته می تواند پیش بینی های مربوط به پیاده سازی بررسی های اعتباری و استراتژی های قوی قطع عضو را کاهش دهد.

نتیجه گیری

Apache Spark MLlib یک ابزار جامع و آماده تولید برای پیش بینی شکست مهندسی و ارزیابی ریسک را فراهم می کند. مقیاس پذیری آن مجموعه داده های عظیم تولید شده توسط شبکه های سنسور مدرن را مدیریت می کند، در حالی که الگوریتم های متنوع آن اجازه می دهد تا مهندسان مدل های چرخه عمر را به حالت های شکست خاص متناسب کنند.با دنبال خط لوله مشخص شده در اینجا - پیش پردازش داده ها، مهندسی، آموزش، ارزیابی و استقرار سیستم ها، صرفه جویی در سیستم های ذخیره سازی صنعتی، به عنوان ابزارهای تعمیر و ML، بهبود روند تعمیر و بهینه سازی میدان، به عنوان ابزار های ذخیره سازی میدان تعمیر و بهینه سازی میدان تعمیر و بهینه سازی میدان تعمیر و بهینه سازی میدان، به عنوان ابزار های بازیافت قطعات ML، به عنوان سیستم های مسیریابی بیشتر، به عنوان سیستم های مسیریابی بیشتر از سیستم های Volvo، به عنوان سیستم های مسیریابی سیستم های مسیریابی سیستم های مسیریابی.