Table of Contents
Thông tin được cân bằng là phổ biến trong nhiều ứng dụng thực, như là phát hiện gian lận, chẩn đoán y học, và phát hiện bất thường. Xác định sự mất cân bằng là quan trọng để xây dựng mô hình học máy hữu hiệu. bài báo này khám phá các kỹ thuật thực tế được hỗ trợ bởi các nguyên tắc toán học để xử lý dữ liệu bị mất cân bằng một cách hiệu quả.
Hiểu được sự cân bằng giữa dữ liệu và dữ liệu
Sự mất cân bằng dữ liệu xảy ra khi số trường hợp trong một lớp khác vượt quá số lượng đáng kể. Sự mất cân bằng này có thể thiên vị đối với lớp đa số, giảm khả năng phát hiện các trường hợp cấp số ít. Về mặt toán học [FLT: 0] N [FLT: 0] [FT:] [FT], tỷ lệ nhỏ số mẫu nhỏ, tỷ lệ [L: 6] [L:] [FL:] [FL: FT] [FT] [FT].K] [F].] [F].] [F.T]] [F.T]] [F.T]]
Kỹ thuật cho việc xử lý yêu cầu cân bằng
Một số kỹ thuật có thể giảm thiểu tác động của sự mất cân bằng dữ liệu. những phương pháp này có thể được phân loại rộng rãi thành mức dữ liệu và phương pháp tiếp cận thuật toán.
Phương pháp lý giải dữ liệu
- Quá trình sắp xếp: tăng mẫu lớp phân số, thường dùng phương pháp như SMOTE, tạo ra điểm dữ liệu tổng hợp dựa trên các mẫu phân số hiện có.
- Dưới khi câu hỏi , tạo ra các mẫu lớp đa số để cân bằng bộ dữ liệu, mà có thể có nguy cơ mất thông tin có giá trị.
- Tiếp cận Hybrid:) kết hợp quá trình xếp chồng và giảm dần để cân bằng dữ liệu tối ưu.
Phương pháp thuật toán- Lấp
- Học nhạy cảm: gán cho các chi phí phân loại cao hơn cho lỗi giai cấp thiểu số ảnh hưởng đến tiêu điểm của mô hình.
- Phương pháp dễ hiểu:) Dùng kỹ thuật như tăng cường khả năng nhận biết giai cấp thiểu số.
- Điều chỉnh các ngưỡng quyết định: sửa đổi xác suất cắt giảm để ủng hộ dự đoán giai cấp thiểu số.
Nền tảng toán học
Nhiều kỹ thuật được dựa trên thống kê và các khái niệm toán học. chẳng hạn, SMOTE tạo ra mẫu tổng hợp bằng cách suy luận giữa các điểm phân cấp thiểu số:
x ) ) Mới [FLT:] + subda j - x [FLT: 7) [FL:8]
x ) [FLT:] ) [[FLT:]x [FLT:] [FLT:]] [FLT:] [FLT:]] [FLT:]] [FLTT:]] [FLTT:] [FLT:]] [FLTTTTT:]]] [FLTTT:] [FLT:]] [FLT:]] [FLT:]]] [FLT [FLT [FLT:]]]]]] [F thử nghiệm này đặt những mẫu nhỏ phân loại nhỏ [F thứ hạng mục phân loại tập trung thành phần nhỏ [FLT], [FL:], [H], [ [HT], [ [ [ [HT], s [HT], s [ [ [ [ [ [H:]