Table of Contents
Học tập siêu giám sát là một phương pháp máy học được sử dụng rộng rãi bao gồm đào tạo mô hình trên dữ liệu nhãn. tuy nhiên, các bác sĩ thường gặp những cạm bẫy chung có thể ảnh hưởng đến hiệu suất và sự đáng tin cậy của mô hình của họ. hiểu rõ những vấn đề này và áp dụng các tính toán thích hợp có thể giúp giảm thiểu tác động của họ.
Quá hợp lý và không phù hợp
Quá phù hợp xảy ra khi một mô hình học được dữ liệu đào tạo quá tốt, bao gồm nhiễu, dẫn đến sự tổng quát thấp về dữ liệu mới. Điều này xảy ra khi mô hình quá đơn giản để ghi lại các mẫu bên trong. Tính toán như là các phép luyện và tỷ lệ lỗi hợp lệ hợp lệ có thể giúp nhận diện các vấn đề này.
Thí dụ, so sánh lỗi đào tạo (Etrai ) và lỗi hiệu quả (E) ) có thể chỉ ra sự phù hợp nếu đào tạo [FLT:] trong khi [FLT:] [FLT:] [FLT:] [FL: 3], ngược lại, những lỗi lớn hơn đề nghị về cả hai phía dưới.
Lớp I cân bằng
Sự mất cân bằng cấp độ xảy ra khi một số lớp bị thiếu tính cân bằng trong bộ dữ liệu, dẫn đến các mô hình thiên vị. Tính toán tỷ lệ phần trăm phân phối lớp học giúp xác định sự mất cân bằng.
Giả sử bộ dữ liệu có 1000 mẫu, với 900 mẫu thuộc hạng A và 100 theo hạng B. tỷ lệ phân phối lớp học là:
Hạng A: (900/2000) * 100 = 90%
Hạng B: (100/1000) * 100 = 10%
Đang đánh giá mô hình làm việc
Các chuyên gia như độ chính xác, độ chính xác, sự gợi lại và F1-score là thiết yếu để đánh giá hiệu suất mô hình. tính toán bao gồm các thành phần ma trận nhầm lẫn:
- Những tích cực thật (TIẾNG BỒN)
- Dương tính sai (FP)
- Âm tính sai (FN)
Ví dụ, tính chính xác được tính toán như:
Độ chính xác = TP / (PP + FP)
Xử lý dữ liệu âm thanh
Dữ liệu Noisy có thể bóp méo việc đào tạo mô hình. Tính toán như tỷ lệ nhiễu đến hiệu lực giúp định lượng dữ liệu chất lượng.
Giả sử bộ dữ liệu chứa 100 mẫu nhiễu từ 1000 mẫu tổng số tiếng ồn:
Tỷ lệ nhiễu = (số mẫu nhiễu) / (tách lớn) = 100 / 1000 = 1, 2, 0 hay 10