Pääkomponenttianalyysi (PCA) on tilastollinen tekniikka, jota käytetään vähentämään datan dimensiota säilyttäen kuitenkin suurimman osan varianssistaan. Sitä käytetään laajalti data-analyysissä, koneoppimisessa ja kuvioiden tunnistamisessa. PCA-analyysin toteuttaminen kirjastojen kuten NumPy ja SciPy avulla voidaan tehokkaasti laskea ja ymmärtää taustalla olevaa datarakennetta.

Pääkomponenttianalyysin ymmärtäminen

PCA muuntaa joukon korreloivia muuttujia pienemmäksi määräksi ei-korreloituja muuttujia, joita kutsutaan pääkomponenteiksi. Nämä komponentit tilataan siten, että ensimmäiset harvojen on säilytettävä suurin osa alkuperäisen aineiston vaihtelusta. Tämä prosessi edellyttää kovarianssimatriisin laskemista, sen eigen-arvojen ja eigenvektorien löytämistä sekä tietojen projisoimista pääkomponentteihin.

PCA-sopimuksen täytäntöönpano NumPy- ja SciPy-ohjelmien kanssa

Suorittaa PCA, aloittaa standardoimalla tiedot, sitten laskea covarice matriisi. Seuraava, löytää eigenarvoja ja eigenvektorit tämän matriisin. Eigenvektorit edustavat suuntiin maksimaalisen varianssin, ja eigenvalues ilmoittaa määrän varianssia kuhunkin suuntaan. Lopuksi projisoida tiedot valittuihin eigenvektorit saada tärkeimmät komponentit.

Kumppanuus- ja yhteistyösopimuksen täytäntöönpanovaiheet

  • Standardoidaan tiedot nollakeskiarvon ja yksikön varianssin saamiseksi.
  • Lasketaan munasarjamatriisi np.cov.
  • Lasketaan eigenarvo ja eigenvektorit sipy.linalg.igh:lla.
  • Järjestä eigenvektorit, jotka perustuvat eigenarvoihin alenevassa järjestyksessä.
  • Projektoi tiedot valittuihin eigenvektoreihin dimensiokyvyn vähentämiseksi.