Hierarkinen klusterianalyysi on klusterianalyysimenetelmä, joka rakentaa klusterihierarkian. Sitä käytetään laajasti data-analyysissä samanlaisten kohteiden ryhmittelyyn niiden ominaisuuksien perusteella. Tämä tekniikka on hyödyllinen tiedon rakenteen ymmärtämiseen ja luonnollisten ryhmittymien tunnistamiseen.

Hierarkisen klusterin peruskäsitteet

Hierarkisen klusterien pääajatus on luoda puumainen rakenne, jota kutsutaan dendrogrammiksi. Tämä dendrogrammi kuvaa, miten datapisteet ryhmitellään samankaltaisuuden eri tasoille. Prosessi voi olla agglomeratiivinen, alkaen yksittäisistä datapisteistä ja yhdistämällä ne, tai divisiivisesti, alkaen kaikista datapisteistä yhdessä ryppäässä ja jakamalla ne.

Vaiheet hierarkisessa ryhmittelyssä

Tyypillisiä vaiheita ovat:

  • Lasketaan datapisteiden välinen etäisyys valitsemalla metrinen, kuten Eukleidean etäisyys.
  • Yhdistä kaksi lähintä kohtaa tai klusteria liitäntökriteerin perusteella.
  • Päivitä etäisyysmatriisi uuden ryppään mukaisesti.
  • Yhdistämisprosessi toistetaan, kunnes kaikki tietopisteet on ryhmitelty yhteen ryppääseen tai pysäytyskriteeri täyttyy.

Käytännön toteutus Esimerkki

Pythonin SciPy-kirjaston avulla hierarkkinen klusteri voidaan toteuttaa tehokkaasti. Seuraava esimerkki osoittaa, miten agglomeratiiviset klusterit voidaan suorittaa datakokonaisuudessa:

Koodin naputus: [

.Python import numpy as np from scipy.cluster.hierarchy import Linking, dendrogram import matplotlib.pyplot # Sample data = np.array([[1, 2], [3, 4], [5, 6], [8, 8], [9, 10]])) # Perform hierarkkinen ryppään klusterointi yhdistetty = link(data, menetelmä='yksi') # Plot dendrogram dendrogramm(linked) plt.show() .

Sovellukset hierarkinen klusteri

Hierarkista klusteria käytetään eri aloilla, kuten biologia geenien ilmentymän analysointiin, markkinointiin asiakassegmentoitumiseen ja kuvan analysointiin objektin tunnistamiseen. Sen kyky paljastaa datan rakenne monitasoisesti tekee siitä monipuolisen työkalun.