Table of Contents
Cross-validering er en teknikk som brukes til å vurdere ytelsen til overvåkede læringsmodeller. Det bidrar til å sikre at modellen generaliserer godt til usynlige data ved å dele datasettet i flere undergrupper for opplæring og testing. Gjennomføring kryssvalidering kan forbedre påliteligheten til modellvurderingen.
Forståelse av kryssvalg
Tverrvalidering innebærer å dele datasettet i flere deler eller folder. Modellen er trent på en undergruppe av disse foldene og testet på den gjenværende folden. Denne prosessen gjentas flere ganger, med forskjellige folder som brukes til testing hver gang. Resultatene er deretter gjennomsnittlig for å gi en total ytelsesmetrikk.
Typer av kryss-Validasjon
De vanligste typene inkluderer:
- k-Fold Cross-Validation: Deler data i k like deler, trening på k-1 deler og testing på den resterende delen.
- Strukt k-Fold: sikrer hver fold opprettholder klassefordelingen av hele datasettet.
- Leave-One-Out (LOO): bruker et enkelt datapunkt for testing og resten for trening, gjentatt for hvert datapunkt.
Gjennomføring av kryssverdi i praksis
De fleste maskinlæringsbiblioteker gir innebygde funksjoner for kryssvalidering. For eksempel i Pythons scikit-lære, [FLT: 0] -funksjonen forenkler prosessen. Du må spesifisere modellen, datasettet og antall folder.
Eksempelkodesnutt:
fra sklern.model selection import cross val score
scorer = cross val score(modell, X, y, cv=5)
Denne koden utfører 5-dobbelt kryssvalidering og returnerer poengene for hver fold.