Table of Contents
Valvottu oppiminen on laajalti käytetty koneoppimisen lähestymistapa, johon kuuluu koulutusmalleja tunnuksella varustetussa datassa. Kuitenkin ammattilaiset kohtaavat usein yhteisiä sudenkuoppia, jotka voivat vaikuttaa malliensa suorituskykyyn ja luotettavuuteen. Näiden kysymysten ymmärtäminen ja asianmukaisten laskelmien soveltaminen voivat auttaa lieventämään niiden vaikutuksia.
Yli- ja alivarustelu
Liiallistaminen tapahtuu, kun malli oppii koulutustiedot liian hyvin, mukaan lukien melu, mikä johtaa huono yleistys uutta tietoa. Liiallistaminen tapahtuu, kun malli on liian yksinkertainen kaapata taustalla kuvioita. Laskelmia, kuten koulutus- ja validointivirheen määrät voivat auttaa tunnistamaan nämä ongelmat.
Esimerkiksi koulutusvirheen (Ejunan) ja validointivirheen (Eval) vertailu voi osoittaa yliasennuksen, jos E[juna[]] on hyvin alhainen, kun taas E[val[] on korkea.
Luokka Epätasapaino
Luokan epätasapainoa esiintyy, kun jotkin luokat ovat aliedustettuina aineistossa, mikä johtaa puolueellisiin malleihin. Luokan jakautumisprosentin laskeminen auttaa tunnistamaan epätasapainon.
Oletetaan, että aineistossa on 1000 näytettä, joista 900 kuuluu luokkaan A ja 100 luokkaan B. Luokkajakaumaprosentit ovat:
Luokka A: (900/1000) * 100 = 90%
Luokka B: (100/1000) * 100 = 10%
Mallin suorituskyvyn arviointi
Metriikka, kuten tarkkuus, tarkkuus, takaisinkutsu ja F1-score ovat olennaisia mallin suorituskyvyn arvioinnissa. Laskelmissa on mukana sekavuusmatriisin osia:
- Todelliset positiiviset tulokset
- Väärät positiiviset tiedot (FP)
- Väärät negatiiviset tiedot (FN)
Tarkkuus lasketaan esimerkiksi seuraavasti:
Tarkkuus = TP / (TP + FP)
Melua koskevien tietojen käsittely
Meluiset tiedot voivat vääristää mallikoulutusta. Esimerkiksi melu-signaalisuhteen laskeminen auttaa mittaamaan tietojen laatua.
Oletetaan, että tietokokonaisuus sisältää 100 meluisaa näytettä 1000:sta kokonaisnäytteestä.
Melusuhde = (ääninäytteiden lukumäärä) / (Kokonaisnäytteet) = 100 / 1000 = 0,1 tai 10%