Giới thiệu: Vai trò quan trọng của việc bảo trì dự đoán

Việc bảo trì công nghệ thất bại trong môi trường kỹ thuật - từ dòng sản xuất đến các nhà máy điện - có thể dẫn đến các thời gian bị mất đi, các mối nguy hiểm an toàn và giảm lợi nhuận. bảo trì thông thường, nơi việc sửa chữa chỉ xảy ra sau khi thất bại, không còn khả thi trong một kỷ nguyên của dữ liệu cảm biến khổng lồ và giám sát thời gian thực. Bảo trì dự đoán, phát điện bằng máy, cho phép các kỹ sư dự đoán thất bại trước khi họ xuất hiện và cấp phát nguồn tài nguyên.

Bài báo này mở rộng về cách MLlib có thể được áp dụng cho dự đoán thất bại kĩ thuật và đánh giá rủi ro chúng tôi sẽ bao gồm toàn bộ các đường ống: thu thập dữ liệu và xử lý trước, kỹ thuật tính toán, chọn lọc mô hình, đào tạo, đánh giá và triển khai. kết thúc, bạn sẽ có một sự hiểu biết thực tế về cách để thúc đẩy thuật toán của MLlib và Spark được phân phối để tạo ra các hệ thống dự đoán thất bại cấp sản xuất.

Spark MLlib là gì?

MLlib là thư viện của Apache Spark được thiết kế để phân phối dữ liệu cao, phân phối tập hợp theo chiều ngang, quản lý terabytes dữ liệu hiệu quả.

Thành phần then chốt bao gồm:

  • DataFrame [FI:1) – Hợp nhất với Spark LLLS và DataFrames để xử lý dữ liệu không thể tách rời.
  • Ppelines – Một giao diện thống nhất cho các biến hình và đánh giá, tương tự như .
  • Hyperparameter ) – Đối xứng chéo và va đập xe lửa tách ra cho tối ưu hóa mô hình.
  • Sự kiên trì ) – Lưu và tải mô hình bằng / ) phương pháp tái sử dụng.
  • Học sinh trực tuyến ) – MLlib có thể được kết hợp với Spark luồng để dự đoán thời gian thực về nguồn cảm biến sống.

Tại sao lại dùng phương pháp này để tiên đoán?

Dữ liệu kỹ thuật thường hiển thị khối lượng, vận tốc và đa dạng. Dữ liệu cảm biến có thể tạo ra hàng triệu bản ghi chép mỗi giờ, yêu cầu tính toán phân phối. hỗ trợ bản địa của MLlib để lấy tính năng (v. d., , , [FLT: t], và phạm vi các thuật toán rộng lớn tạo cho nó một lựa chọn lý tưởng. Hơn nữa, các kỹ sư chạy đồng thời của Spark cho phép kết hợp các kỹ sư EL, đào tạo, và suy luận trong một đường ống không có dữ liệu di chuyển giữa các hệ thống.

Bộ sưu tập dữ liệu và tiến trình sẵn

Chất lượng dự đoán thất bại phụ thuộc rất nhiều vào chất lượng và chiều rộng của dữ liệu nhập.

  • Các nhà khí : nhiệt độ, rung động, áp suất, tốc độ quay, vẽ hiện tại.
  • Bản ghi ): dấu thời gian khởi động/ Dừng lại, bảo trì sự kiện, mã lỗi.
  • yếu tố sinh học : độ ẩm, nhiệt độ xung quanh, mức độ bụi.
  • Lịch sử toán ): sửa chữa hành động, thay thế một phần, kết quả thanh tra.

Việc xử lý dữ liệu trong MLlib thường bao gồm các bước sau bằng cách chuyển đổi DataFrame:

Giải quyết những giá trị thiếu sót

Dùng MLlib's để điền vào giá trị số bị mất bằng [FLT: 7) ).

Tiêu chuẩn hóa và chuẩn hóa

Thuật toán như hồi quy và hồi quy bản ghi nhạy cảm với các cán cân đặc trưng. Áp dụng (z- scure) hoặc để mang tính năng đến phạm vi tương ứng.

Name

Các luồng nhạy cần sự tổng hợp trên cửa sổ. Dùng các chức năng cửa sổ kiểu Spark (v. d., chuyển động tiêu chuẩn, lệch chuẩn, phút/ trục trong giờ cuối) để tạo tính năng cấp cao. Llib cũng có thể thể thể hiện sự thay đổi tính năng súc tích gọn.

Kỹ thuật để thất bại trong việc tiên đoán

Trong dự đoán thất bại, những tính năng có tính năng thông tin nhất thường thu lại các mô hình trước khi hỏng:

  • Tính năng ): độ dốc của cảm biến đọc trên cửa sổ trượt (v. g., đang tăng nhiệt độ xu hướng).
  • tính năng định lượng ): thành phần FFT của dữ liệu rung động để phát hiện việc mang lỗi.
  • Tính năng tác động [FLT: 1]: sản phẩm của nhiệt độ và áp suất, hoặc độ rung động bình phương.
  • tóm tắt ): skewness, kurtriasis, và tự động hóa các đoạn đọc gần đây.
  • Thời gian từ khi bảo trì : một ủy nhiệm cho việc mặc quần áo và tai.

MLlib cung cấp để kết hợp nhiều cột thành một tính năng riêng lẻ. Để giảm chiều, hãy dùng (Trích thành phần của principal) khi bạn có hàng chục hay hàng trăm tính năng liên quan.

Xây dựng một mô hình tiên đoán sai

Dự đoán thất bại thường được dàn xếp như một vấn đề phân loại nhị phân: "Liệu các thiết bị sẽ thất bại trong vòng N giờ tới?" Một cách khác, các mô hình hồi quy có thể ước tính những cuộc sống còn lại (RUL) trong giờ hoặc chu kỳ.

Bộ ký tự phân loại trong MLlib

MLlib cung cấp một số thuật toán phân loại thích hợp cho dự đoán thất bại:

  • Sự xâm lược ) – Nhanh, dễ hiểu, và cung cấp những dự đoán xác suất (cần thiết để đánh liều).
  • Cây giảm ) – xử lý các mối quan hệ phi tuyến tính và dễ dàng hình dung đối với các chuyên gia miền.
  • Rừng Random ) – Một loạt cây quyết định làm giảm sự phù hợp và tăng độ chính xác.
  • Cây mạ (GBT:1) ) – thường sản xuất hiệu suất nghệ thuật nhưng cần phải điều chỉnh cẩn thận.
  • Linear Supers (SVM) ) – hiệu quả cho không gian cao chiều nhưng ít mạnh hơn để nhiễu.
  • Naive Bayes ) – đơn giản và nhanh, hữu ích khi tính năng độc lập về điều kiện.

Xâm phạm vì giữ được đời sống hữu ích

Khi bạn chạy tới chiều dọc dữ liệu với thất bại đã biết thời gian, hãy dùng thuật toán hồi quy: [FLT: 1]], Mô hình tái tạo rừng , hoặc [FLT:] [FLT:] Phục hưng [FLT] [FLT: 1]]. Biến số là thời gian còn lại cho đến khi thất bại. Mô hình tái tạo của MLlib có thể liên tục được kích hoạt động cảnh giác.

Thiết lập ống nước và đào tạo

Sử dụng của MLlib , bạn có thể xích tất cả các bước trước xử lý và đào tạo mô hình vào một dòng công việc duy nhất.

Nguy hiểm khi dùng MLlib

Đánh giá rủi ro vượt quá dự đoán thất bại nhị phân để ước lượng khả năng và hậu quả tiềm năng của thất bại. MLlib hỗ trợ thông qua:

Phân loại xác suất

Thuật toán như hồi quy bản ghi và khả năng xuất ngẫu nhiên của lớp rừng (. Những xác suất này có thể được giải thích là điểm rủi ro cho việc ưu tiên. Ví dụ, xác suất của 0.95 cho thấy nguy cơ cao và lệnh kiểm tra ngay, trong khi 0.20 có thể được giám sát thường xuyên.

Xâm phạm để phát hiện bất thường

Các cụm không giám sát với [FLT:] [FLT:] hoặc Trình tổng hợp Gaussasition Models [FLT:] có thể nhóm các điều kiện hoạt động bình thường [FLT:]. Các điểm dữ liệu mới không thuộc về bất kỳ cụm nào (hoặc nằm xa centi- mô- tơ) được đánh dấu là dấu -- non- vô hạn của thất bại.

Phân tích sống sót (thời gian đến)

Trong khi MLlib không có mô-đun phân tích tận tâm, bạn có thể ước lượng nó sử dụng hồi quy vào thời gian được ghi nhật ký để thất bại, hoặc bằng cách xây dựng một mô hình phân loại với chân trời dự đoán khác nhau.

Đánh giá kiểu mẫu

MLlib cung cấp các đánh giá tích hợp được xây dựng cho cả phân loại và hồi quy:

  • Trình phân tích mã hóa ) – Tính diện tích dưới đường cong ROC (AUC) và diện tích dưới đường cong PR.
  • Trình phân tích lớp Multi ) – tính F1- score, chính xác, được cân nhắc, nhớ lại.
  • Người tái phạm ) – RMSE, ME, MAE, R2.

Sự va chạm (v.g., giúp tránh quá trình tương ứng và chọn mô hình tốt nhất. Để làm hỏng dữ liệu, hãy dùng lỗi phân cấp (v. d. trong ln/h/g) hoặc quá trình sắp xếp dữ liệu kiểu lỗi nhỏ sử dụng DataFrane.

Dự đoán thời gian thực

Một khi mô hình được đào tạo và đánh giá, hãy bền bỉ sử dụng .

  • Gọi tắt là: ) – chạy định kỳ các đường ống dẫn trên dữ liệu mới (v. d., hàng ngày hay giờ) sử dụng các công việc Spark. Hãy dùng để tải mô hình đã lưu.
  • Đang ước tính ) – Dùng Spark Chatning (hoặc luồng điện) để tiêu thụ dữ liệu cảm biến từ Kafka hay tập tin. Áp dụng mô hình ống dẫn trên mỗi micro-batch để tạo ra điểm số và cảnh báo nguy hiểm trực tiếp.

Đoạn cắt ví dụ:

Liên kết bên ngoài để đọc thêm

Để hiểu biết sâu sắc hơn, hãy khám phá những nguồn tài nguyên có thẩm quyền này:

Thử thách và thực hành tốt nhất

Xây dựng những dự đoán thất bại hiệu quả đòi hỏi phải giải quyết những cạm bẫy thông thường:

  • Sự mất cân bằng ) – sự kiện thất bại là hiếm. Hãy dùng số ít tổng hợp (SMOTE) để điều chỉnh trọng lượng lớp học.
  • Khả năng kết nối – Phương pháp đạo đức công bằng thay đổi theo thời gian do mặc, thời gian hoặc điều kiện hoạt động mới. Mô hình đào tạo lại thường xuyên dùng dữ liệu cập nhật.
  • tầm quan trọng của sự tự nhiên – Dùng MLlib trong mô hình dựa trên cây để nhận diện các cảm biến khóa và xây dựng lòng tin miền.
  • [FLT: 0] Khả năng – Phân vùng dữ liệu bằng ID tài sản cho phép đào tạo song song các kiểu thiết bị khác nhau trong cùng một cụm.
  • chất lượngta) – giá trị cảm biến bị hỏng hay thiếu có thể làm suy giảm các dự đoán. Việc kiểm tra hiệu lực và phương pháp đầu tư mạnh.

Kết luận

hi vọng sẽ được giải quyết.