Table of Contents
प्रिंसिपल कम्पोनेंट एनालिसिस (PCA) एक सांख्यिकीय तकनीक है जिसका उपयोग डेटा की डायनेमिटी को कम करने के लिए किया जाता है जबकि इसकी अधिकांश विविधता को बनाए रखा जाता है। इसका व्यापक रूप से डेटा विश्लेषण, मशीन लर्निंग और पैटर्न मान्यता में उपयोग किया जाता है। NumPy और SciPy जैसे पुस्तकालयों के साथ पीसीए को कार्यान्वित करने से अंतर्निहित डेटा संरचना की कुशल गणना और समझ की अनुमति मिलती है।
मूल घटक विश्लेषण को समझना
PCA कोर से संबंधित चर का एक सेट को मूल घटकों के नाम से असंबंधित चरों की एक छोटी संख्या में बदल देता है। इन घटकों का आदेश दिया जाता है ताकि पहले कुछ मूल डेटासेट में मौजूद भिन्नता का अधिकांश हिस्सा बनाए। इस प्रक्रिया में कोविरेंस मैट्रिक्स की गणना, इसके eigenvalues और eigenvectors को ढूंढना और प्रमुख घटकों पर डेटा पेश करना शामिल है।
NumPy और SciPy के साथ पीसीए को कार्यान्वित करना
पीसीए करने के लिए, डेटा को मानकीकृत करके शुरू करें, फिर समरूपता मैट्रिक्स को गणना करें। इसके बाद, इस मैट्रिक्स के eigenvalues और eigenvectors को ढूंढें। eigenvectors अधिकतम भिन्नता की दिशा का प्रतिनिधित्व करते हैं, और eigenvalues प्रत्येक दिशा में भिन्नता की मात्रा को इंगित करते हैं। अंत में, चयनित eigenvectors पर डेटा को प्रमुख घटकों को प्राप्त करने के लिए प्रोजेक्ट करें।
पीसीए कार्यान्वयन के लिए कदम
- डेटा को शून्य अर्थ और इकाई परिवर्तन के लिए मानकीकृत करें।
- ]np.cov] का उपयोग करके समरूपता मैट्रिक्स की गणना करें।
- Compute eigenvalues and eigenvectors with scipy.linalg.eigh].
- अनुक्रमणिकाओं को क्रमिक क्रमिक रूप से क्रमिक रूप से क्रमिक रूप से क्रमिक रूप से क्रमिक रूप से क्रमिक रूप से प्रदर्शित किया जाता है।
- चयनित eigenvectors पर डेटा को आयामीता को कम करने के लिए परियोजना करें।