Bias och varians är viktiga begrepp i övervakad lärande som hjälper till att utvärdera prestanda för modeller. Förstå hur man beräknar dessa mätvärden kan förbättra modellval och stämning.
Förstå Bias och Variance
Bias hänvisar till felet som införts genom att approximatera ett verkligt problem med en förenklad modell. Variance mäter hur mycket modellens förutsägelser fluktuerar för olika träningsdatasätt. Båda påverkar modellens noggrannhet och generaliseringsförmåga.
Beräkning av Bias
Bias beräknas genom att jämföra den genomsnittliga förutsägelsen av modellen till det verkliga värdet. Stegen inkluderar:
- Träna modellen flera gånger på olika träningsdataset.
- Förutsäga utgången för en fast testpunkt varje gång.
- Beräkna genomsnittet av dessa förutsägelser.
- Beräkning av skillnaden mellan detta genomsnitt och det verkliga värdet.
- Square denna skillnad för att få bias kvadrat.
Beräkning av varians
Varians mäter variabiliteten hos modellens förutsägelser.
- Använd förutsägelserna från flera modeller som är utbildade på olika datamängder.
- Beräkna medelprediktionen över alla modeller.
- Bestäm den kvadraterade avvikelsen av varje förutsägelse från detta medel.
- Genomsnittliga dessa kvadratdrivna avvikelser för att hitta variansen.
Praktisk Exempel
Anta att du har en dataset och tränar en modell fem gånger på olika undergrupper. För en specifik testpunkt är förutsägelserna 3.2, 3.8, 3.5, 3.7 och 3.3. Det verkliga värdet är 4.0.
Den genomsnittliga förutsägelsen är 3.5. Bias kvadrat är (4.0 - 3.5) ^ 2 = 0.25. Variansen beräknas genom att i genomsnitt de kvadraterade avvikelserna av varje förutsägelse från 3.5, vilket resulterar i 0.14.