Hierarkinen klusteri on menetelmä, jota käytetään data-analyysissä ryhmittelemään samanlaisia tietopisteitä klustereiksi niiden ominaisuuksien perusteella. Sitä sovelletaan laajasti eri aloilla, jotta voidaan tunnistaa kuvioita ja rakenteita monimutkaisten tietokokonaisuuksien sisällä. Tässä artikkelissa tarkastellaan hierarkkisen klusterien menetelmiä ja esitellään tapaustutkimuksia, joissa esitellään sen käytännön sovelluksia.

Menetelmät hierarkinen klusteri

Hierarkinen klusteri rakentaa puumainen rakenne kutsutaan dendrogrammi, joka kuvaa järjestely ryppäiden muodostettu eri tasoilla. On olemassa kaksi päälähestymistapaa: aggglomeratiivisen ja divisiivisen.

Yhteenliittymä

Tämä alhaalta ylöspäin -menetelmä alkaa kunkin datapisteen ollessa yksittäinen klusteri. Se yhdistää iteratiivisesti lähimmät klusteriparit, kunnes pysäytyskriteeri täyttyy, kuten halutun määrän klustereita tai etäisyyden raja-arvoa.

Jakava klusteri

Tämä ylhäältä alaspäin -lähestymistapa alkaa kaikista datapisteistä yhdessä klusterissa. Se jakaa klusterit uudelleen pienemmiksi ryhmiksi, jotka perustuvat erilaisiin muotoihin ja luovat hierarkian laajimmasta erityisklustereihin.

Tapaustutkimukset

Hierarkinen klusteri on onnistuneesti toteutettu erilaisissa reaalimaailman skenaarioissa. Esimerkkejä ovat asiakassegmentoituminen markkinoinnissa, geenien ilmentymäanalyysi biologiassa ja asiakirjaluokitus tiedonhaussa.

  • Asiakassegmentointi:[ Yritykset konserniasiakkaat perustuvat ostokäyttäytymiseen räätälöidä markkinointistrategioita.
  • Genomiikka:[ Tutkijat luokittelevat geenit, joilla on samanlaiset ilmentymismallit, jotta he ymmärtäisivät biologisia toimintoja.
  • Asiakirjojen klusteri:[ Järjestetään suuria kokoelmia aiheista, jotka helpottavat navigointia.