Cross-validointi on tekniikka, jota käytetään koneoppimismallin suorituskyvyn arviointiin. Se auttaa mallin parametrien virittämisessä arvioimalla, kuinka hyvin malli suoriutuu näkymättömistä tiedoista. Prosessissa dataaineisto jaetaan useisiin osiin, koulutetaan mallia joihinkin osiin ja testataan sitä toisilla. Tässä artikkelissa selitetään vaihe vaiheelta ristiinvalidointivirheen laskeminen mallin virittämisen aikana.

Vaihe 1: Tietojen jakaminen

Tiedosto on jaettu 'k' yhtä suuriin osiin, kutsutaan taittuu. Yhteiset valinnat 'k' on 5 tai 10. Jokainen taite toimii validointi settinä kerran, kun taas loput taittuu muodostavat koulutus setti. Tämä prosessi varmistaa, että jokainen tietopiste käytetään sekä koulutukseen ja validointiin.

Vaihe 2: Mallikoulutus ja validointi

Kunkin kertaiseksi, malli on koulutettu jäljellä 'k-1' taittuu. Se on sitten validoitu nykyisen taittuu. Virhe lasketaan mallin ennusteiden verrattuna todelliset arvot validointi taittuu. Tämä vaihe toistetaan kaikille taittuu.

Vaihe 3: Virheen laskeminen

Virheet jokaisesta taitteesta kirjataan. Yhteiset virhemittarit sisältävät keskimääräisen neliövirheen (MSE) tai keskimääräisen absoluuttisen virheen (MAE). Ristivalidointivirhe on näiden virheiden keskiarvo kaikissa taitoissa, mikä antaa arvion mallin suorituskyvystä.

Vaihe 4: Lopullinen virhearvio

Cross-validointiprosessista saatu keskimääräinen virhe toimii arviona siitä, miten malli toimii uusille, näkymättömille tiedoille. Tämä arvo ohjaa optimaalisten malliparametrien valintaa virityksen aikana.