Begrijpen en uitvoeren van de belangrijkste component analyse met Numpy Scipy
Principal Component Analysis (PCA) is een statistische techniek die wordt gebruikt om de dimensionaliteit van gegevens te verminderen met behoud van het grootste deel van de variantie. Het wordt op grote schaal gebruikt in data-analyse, machine learning en patroonherkenning.
Begrijpen van de analyse van de belangrijkste componenten
PCA transformeert een reeks gecorreleerde variabelen in een kleiner aantal niet-correlerende variabelen die belangrijkste componenten worden genoemd. Deze componenten worden zo geordend dat de eerste paar de meeste variatie in de oorspronkelijke dataset behouden. Dit proces omvat het berekenen van de covariummatrix, het vinden van eigenwaarden en eigenvectoren, en het projecteren van de gegevens op de belangrijkste componenten.
PCA uitvoeren met NumPy en SciPy
Om PCA uit te voeren, beginnen met het standaardiseren van de gegevens, dan de covouriteitsmatrix berekenen. Vervolgens, vind de eigenwaarden en eigenvectoren van deze matrix. De eigenvectoren vertegenwoordigen de richtingen van de maximale variantie, en de eigenwaarden geven de hoeveelheid variatie in elke richting aan. Tenslotte projecteren de gegevens op de geselecteerde eigenvectoren om de belangrijkste componenten te verkrijgen.
Stappen voor de uitvoering van PSO
- Standaardiseren van de gegevens om nul gemiddelde en eenheid variantie hebben.
- Bereken de covariummatrix met np.cov.
- Bereken eigenwaarden en eigenvectoren met scipy.linalg.eigh.
- Sorteer eigenvectoren op eigenwaarden in dalende volgorde.
- Projecteer de gegevens op de geselecteerde eigenvectoren om de dimensionaliteit te verminderen.