Cross-validering er en teknikk som brukes til å evaluere ytelsen til en maskinlæringsmodell. Det hjelper i tuning modellparametre ved å vurdere hvor godt modellen vil utføre på usynlige data. Prosessen innebærer å dele datasettet i flere deler, trene modellen på noen deler, og teste det på andre. Denne artikkelen forklarer trinn-for-trinn beregningen av kryssvalidering feil under modell tuning.

Trinn 1: Datadeling

Datasettet er delt inn i \"k\" like deler, kalt folder. Vanlige valg for \"k\" er 5 eller 10. Hver fold fungerer som et valideringssett én gang, mens de gjenværende foldene danner treningssettet. Denne prosessen sikrer at hvert datapunkt brukes både for trening og validering.

Trinn 2: Modelltrening og validering

For hver fold blir modellen trent på de gjenværende k-1- foldene. Den valideres deretter på den gjeldende folden. Feilen beregnes basert på modellens spådommer sammenlignet med de faktiske verdiene i valideringsfolden. Dette trinnet gjentas for alle folder.

Trinn 3: Feilberegning

Feilene fra hver fold er registrert. Felles feilmålinger inkluderer gjennomsnittlige sifferfeil (MSE) eller gjennomsnittlig absolutt feil (MAE). Overvalideringsfeilen er gjennomsnittet av disse feilene på tvers av alle folder, noe som gir et estimat av modellens ytelse.

Trinn 4: Siste feil estimasjon

Den gjennomsnittlige feilen som oppnås fra den tverrvalideringsprosessen tjener som et estimat av hvordan modellen vil utføre på nye, usynlige data. Denne verdien styrer valget av optimale modellparametre under tuning.