प्रिंसिपल घटक विश्लेषण (PCA) एक सांख्यिकीय तकनीक है जिसका उपयोग डेटा की आयामीता को कम करने के लिए किया जाता है जबकि जितना संभव हो उतना परिवर्तन हो सकता है। यह कोर से संबंधित चरों के एक सेट को मूल घटकों के नाम से असंबंधित चरों के एक छोटे सेट में बदल देता है। इस विधि का व्यापक रूप से डेटा विश्लेषण, मशीन लर्निंग और पैटर्न मान्यता में उपयोग किया जाता है।

पीसीए के गणितीय फाउंडेशन

पीसीए के मूल में डेटा के समरूपता मैट्रिक्स की गणना शामिल है, जो चर के बीच संबंधों को कैप्चर करता है। इस मैट्रिक्स के Eigenvalues और eigenvectors तब computed हैं। eigenvectors अधिकतम भिन्नता की दिशा निर्धारित करते हैं, जबकि eigenvalues प्रत्येक प्रमुख घटक द्वारा कब्जा कर लिया गया भिन्नता की मात्रा को इंगित करते हैं।

PCA गणितीय रूप से प्रदर्शन करने के लिए कदमों में शामिल हैं:

  • डेटा को शून्य अर्थ और इकाई परिवर्तन के लिए मानकीकृत करें।
  • मानकीकृत डेटा के समरूपता मैट्रिक्स को पूरा करें।
  • समीकरण मैट्रिक्स के eigenvalues और eigenvectors की गणना।
  • अनुक्रमणिकाओं को क्रमिक क्रमिक रूप से क्रमिक रूप से क्रमिक रूप से क्रमिक रूप से क्रमिक रूप से क्रमिक रूप से प्रदर्शित किया जाता है।
  • चयनित eigenvectors पर डेटा परियोजना प्रमुख घटकों को प्राप्त करने के लिए।

PCA के अनुप्रयोग

PCA का उपयोग जटिल डेटासेट को सरल बनाने और अंतर्निहित पैटर्न को प्रकट करने के लिए विभिन्न क्षेत्रों में किया जाता है। यह विशेष रूप से छवि प्रसंस्करण, आनुवंशिकी, वित्त और भाषण मान्यता में उपयोगी है। डेटा आयामों को कम करके, PCA कम्प्यूटेशनल दक्षता और दृश्यता को बेहतर बनाने में मदद करता है।

आम अनुप्रयोगों में शामिल हैं:

  • डेटा में शोर को कम करना।
  • 2D या 3D भूखंडों में उच्च-आयामी डेटा को दृश्यित करना।
  • मशीन लर्निंग एल्गोरिदम के लिए प्रीप्रोसेसिंग।
  • फ़ीचर निष्कर्षण और चयन।