Transvers-validare este o tehnică utilizată pentru a evalua performanța unui model de învățare a mașinilor. Ajută la ajustarea parametrilor modelului prin estimarea modului în care modelul va funcționa pe date nevăzute. Procesul implică divizarea setului de date în mai multe părți, formarea modelului pe unele părți, și testarea acestuia pe altele. Acest articol explică calculul pas cu pas al erorii de validare încrucișată în timpul tuningului model.

Etapa 1: Partionarea datelor

Setul de date este împărţit în părţi egale "k," numite pliuri. Alegerile comune pentru "k" sunt 5 sau 10. Fiecare ori acţionează ca un set de validare o dată, în timp ce restul pliurilor formează setul de instruire. Acest proces asigură că fiecare punct de date este utilizat atât pentru formare cât şi pentru validare.

Etapa 2: Model de formare și validare

Pentru fiecare ori, modelul este antrenat pe faldurile "k-1" rămase. Apoi este validat pe pliul curent. Eroarea se calculează pe baza predicțiilor modelului în comparație cu valorile reale din pliul de validare. Acest pas este repetat pentru toate pliurile.

Etapa 3: Calcularea erorilor

Erorile de la fiecare ori sunt înregistrate. Parametrii comuni de eroare includ eroare medie pătrat (MSE) sau eroare absolută medie (MAE). Eroarea de validare încrucișată este media acestor erori pe toate faldurile, oferind o estimare a performanței modelului.

Etapa 4: Estimarea erorii finale

Eroarea medie obținută prin procesul de validare încrucișată servește ca estimare a modului în care modelul va funcționa pe date noi, nevăzute. Această valoare ghidează selectarea parametrilor optimi ai modelului în timpul tuningului.