Validarea încrucişată este o tehnică utilizată pentru evaluarea performanţei modelelor de învăţare supravegheată. Aceasta ajută la asigurarea faptului că modelul generalizează bine datele nevăzute prin divizarea setului de date în mai multe subseturi pentru formare şi testare. Implementarea corectă a validării încrucişate poate îmbunătăţi fiabilitatea evaluării modelului.

Înțelegerea validării încrucișate

Validarea încrucişată presupune împărţirea setului de date în mai multe părţi, sau pliuri. Modelul este instruit pe un subset de aceste falduri şi testat pe pliul rămas. Acest proces este repetat de mai multe ori, cu diferite pliuri utilizate pentru testare de fiecare dată. Rezultatele sunt apoi medii pentru a oferi un metric de performanţă generală.

Tipuri de revalidare încrucișată

Cele mai frecvente tipuri includ:

  • k-Fold Cross-Validation: Datele divides în k părți egale, formarea pe părți K-1 și testarea pe partea rămasă.
  • Strated k-Fold: Se asigură că fiecare ori păstrează distribuția clasei întregului set de date.
  • Leave-One-Out (LOO):Folosiți un singur punct de date pentru testare și restul pentru formare, repetat pentru fiecare punct de date.

Punerea în aplicare a revalidării încrucișate în practică

Majoritatea bibliotecilor de învățare a mașinilor oferă funcții integrate pentru validare încrucișată. De exemplu, în scitit-learn Python, funcția simplifică procesul. Trebuie să specificați modelul, setul de date și numărul de pliuri.

Exemplu de fragmentare a codului:

]de la sklearn.model selection import cross val score

scoruri = cross val score (model, X, y, cv=5)

Acest cod efectuează 5 ori revalidare încrucişată şi returnează scorurile pentru fiecare ori.