Table of Contents
Principal Principal Principal Component Analysis (PCA) adalah teknik statistik yang digunakan untuk mengurangi dimensialitas data sambil mempertahankan sebagian besar dari variansnya.Ilmunya banyak digunakan dalam analisis data, pembelajaran mesin, dan pengenalan pola. Implementasi PCA dengan perpustakaan seperti NumPy dan SciPy memungkinkan untuk komputasi efisien dan pemahaman struktur data yang mendasari.
Pengertian Bahasa
PCA transforms set variabel yang terkait korelasi menjadi sejumlah variabel yang tidak berhubungan lebih kecil yang disebut komponen-komponen utama. Komponen-komponen ini diperintahkan agar beberapa yang pertama mempertahankan sebagian besar variasi yang ada dalam dataset asli. Proses ini melibatkan perhitungan matriks kovariansi, menemukan eigen nilai dan eigenvektornya, dan memproyeksikan data ke komponen-komponen utama.
Mengimplementasi PCA dengan NumPy dan SciPy
Untuk melakukan PCA, mulai dengan menstandarkan data, kemudian menghitung matriks kovariansi. Selanjutnya, cari eigenvalues dan eigenvektor matriks ini.Eigenvektors mewakili arah dari varians maksimum, dan eigenvalues menunjukkan jumlah varians dalam setiap arah. Akhirnya, proyeksikan data ke eigenvektor terpilih untuk mendapatkan komponen utama.
Langkah - Langkah untuk Implementasi PCA
- Diagnosiskan data untuk memiliki nilai nol dan perbedaan satuan.
- ¡Cula covariansi matriks menggunakan np.cov.
- Mengkomput eigenvalues dan eigenvectors dengan spipy.linalg.eigh.
- Urutkan eigenvektor berdasarkan eigen nilai dalam urutan menurun.
- Proyekkan data ke eigenvektor terpilih untuk mengurangi dimensi.