Table of Contents
Phân tích thành phần chính (PCA) là một kỹ thuật thống kê được dùng để giảm thiểu độ lệch của dữ liệu trong khi giữ lại hầu hết các biến thể của nó. Nó được sử dụng rộng rãi trong phân tích dữ liệu, học tập và nhận diện máy. Việc bổ sung PCA với thư viện như NumPy và SciPy cho phép tính toán hiệu quả và hiểu cấu trúc dữ liệu ẩn.
Hiểu phân tích thành phần hiệu trưởng
PCA biến đổi một tập hợp biến tương quan thành một số nhỏ hơn các biến liên quan đến biến số được gọi là thành phần chính. Các thành phần này được đặt hàng để một số ít giữ lại phần lớn các biến thể trong tập dữ liệu gốc. Quá trình này bao gồm tính toán ma trận covarance, tìm kiếm các giá trị eigen và eigenvetors của nó, và đưa dữ liệu vào các thành phần chính.
Phần mềm tạo âm tính với NumPy và SciPy
Để thực hiện PCA, bắt đầu bằng cách chuẩn hóa dữ liệu, rồi tính toán ma trận đồng biến đổi. Tiếp theo, tìm các giá trị eigen và các nhà biên tập của ma trận này. Các tác nhân biểu diễn các hướng của biến đổi tối đa, và các eigen đánh giá biểu thị số biến đổi trong mỗi hướng. Cuối cùng, dự án dữ liệu lên các thiết bị digenvevetor đã chọn để lấy các thành phần chính.
Bước để giải phẫu PCA
- Tiêu chuẩn hóa dữ liệu để có không có giá trị và biến đổi đơn vị.
- Tính toán ma trận covariance bằng nnp.cov .
- Tính giá trị eigen và eigenvetors [FLT: 0].linalg.egh.
- Sắp xếp các tác nhân di truyền dựa trên giá trị eigen theo thứ tự giảm dần.
- Dự đoán dữ liệu trên các thiết bị định vị đã được chọn để giảm độ nghiêng.