Metoda de validare încrucișată în statistică

Metoda de validare încrucișată în statistică

În statistică și știința datelor, una dintre cele mai mari provocări este asigurarea faptului că un model nu numai că are performanțe bune pe datele pe care a fost antrenat, ci și pe date noi, nevăzute anterior. Această problemă este adesea denumită generalizare. Aici intervine validarea încrucișată: o metodă de evaluare a modelului concepută pentru a măsura performanța modelului mai corect și mai consistent decât o singură evaluare folosind un singur set de date.

De ce este necesară validarea încrucișată?

Când construim un model predictiv — de exemplu, un model de regresie pentru a prezice prețurile locuințelor sau un model de clasificare pentru a detecta spamul — de obicei, împărțim datele în două părți: un set de antrenament și un set de testare. Modelul este antrenat pe baza datelor de antrenament și apoi evaluat pe baza datelor de testare. Această abordare este simplă, dar are un dezavantaj: rezultatele evaluării pot depinde în mare măsură de modul în care sunt împărțite datele. Dacă datele de testare sunt „ușoare”, performanța pare ridicată; dacă datele de testare sunt „dificile”, performanța pare scăzută.

Validarea încrucișată reduce dependența de un singur set de date prin efectuarea mai multor procese de antrenament și testare pe diferite seturi de date și apoi prin mediarea rezultatelor. Acest lucru are ca rezultat estimări de performanță mai reprezentative pentru condițiile reale.

Concepte de bază ale validării încrucișate

Esența validării încrucișate constă în împărțirea datelor în mai multe părți (pliuri). La fiecare iterație, unele pliuri sunt folosite pentru a antrena modelul, iar o pliu este folosită pentru a testa modelul. Acest proces se repetă până când fiecare pliu a fost utilizat ca date de testare. Scorurile de evaluare din fiecare iterație sunt apoi combinate (de obicei cu media și uneori și cu deviația standard) pentru a oferi o imagine de ansamblu asupra performanței modelului.

De exemplu, în validarea încrucișată k-fold cu k=5, datele sunt împărțite în 5 pliuri. Prima iterație: pliul 1 ca test, pliurile 2–5 ca antrenament. A doua iterație: pliul 2 ca test și așa mai departe până la pliul 5.

CITIT  Ce este regresia multiplă

Tipuri comune de validare încrucișată

1. Validarea reținerii (divizare antrenament-test)
Deși din punct de vedere tehnic nu este o validare încrucișată „repetată”, metoda holdout este adesea considerată o etapă de validare de bază. Datele sunt împărțite o singură dată, de exemplu, 80% antrenament și 20% testare. Avantajul este că este rapidă și simplă, dar dezavantajul este varianța mare a rezultatelor, deoarece se bazează pe o singură divizare.

Această metodă este utilizată de obicei atunci când datele sunt foarte mari, astfel încât chiar și o singură diviziune este suficient de reprezentativă.

2. Validare încrucișată K-Fold
Aceasta este cea mai populară formă de validare încrucișată. Parametrul k este adesea ales ca 5 sau 10, deoarece se consideră că acesta echilibrează costul de calcul și calitatea estimării.

Avantaje:
– Utilizarea mai eficientă a datelor (fiecare dată devine parte a procesului de antrenare și testare).
– Estimările de performanță sunt mai stabile decât cele cu excepția cazului în care se acceptă o pauză.

Lipsa:
– Durează mai mult deoarece antrenează modelul de k ori.
– Dacă datele sunt foarte mari sau modelul este foarte complex, costurile de calcul pot fi ridicate.

3. Validare încrucișată stratificată K-Fold
Pentru problemele de clasificare, în special dacă clasele sunt dezechilibrate (de exemplu, 90% negativ, 10% pozitiv), k-fold-ul obișnuit poate produce plieri cu distribuții de clase asimetrice. K-fold-ul stratificat asigură că proporția de clase din fiecare pliere este aproximativ aceeași cu proporția de clase din datele originale.

Acest lucru este deosebit de important în evaluarea modelelor de detectare a bolilor, a fraudei sau a altor cazuri în care clasa minoritară este mică.

4. Validare încrucișată Leave-One-Out (LOOCV)
În LOOCV, numărul de plieri este egal cu cantitatea de date (k = n). Aceasta înseamnă că, în fiecare iterație, o singură observație devine data de test, în timp ce restul devin datele de antrenament.

Avantaje:
– Aproape toate datele sunt utilizate pentru antrenament la fiecare iterație, astfel încât eroarea de estimare poate fi mică.

Lipsa:
– Foarte scump din punct de vedere computațional pentru seturi mari de date.
– Varianța estimării poate fi mare în anumite tipuri de probleme, deoarece setul de testare este format din doar un punct per iterație.

LOOCV este adesea utilizat atunci când există foarte puține date, de exemplu, în cercetări cu un eșantion mic.

CITIT  Concepte de bază ale probabilității în statistică

5. Validare încrucișată repetată a K-fold-urilor
Această metodă repetă k-fold de mai multe ori cu diferite atribuiri (aleatoare) de plieri. Scopul este de a reduce dependența de o singură atribuire de pliere și de a produce estimări mai stabile.

De exemplu, „repetat de 10 ori de 3 ori” înseamnă executarea de 10 ori de 3 ori (un total de 30 de antrenamente și evaluări).

6. Validare încrucișată a seriilor temporale
Pentru datele din seriile temporale, validarea încrucișată convențională nu este potrivită deoarece poate „infiltra viitorul” în procesul de antrenament. În seriile temporale, ordinea temporală trebuie păstrată. Prin urmare, abordări precum:
– Fereastră glisantă/rulantă: antrenament în perioada inițială, apoi test în perioada următoare, apoi fereastra se schimbă.
– Fereastră extensibilă: datele de antrenament cresc în timp, apoi sunt testate în perioada următoare.

Această metodă este relevantă pentru predicția vânzărilor lunare, prețurile acțiunilor sau senzorii în timp real.

Metrici de evaluare în validarea încrucișată

Validarea încrucișată este doar un cadru de evaluare; metricile utilizate depind de tipul de problemă:
– Regresie: MSE, RMSE, MAE, R-pătrat.
– Clasificare: acuratețe, precizie, rechemare, scor F1, ROC-AUC.
– Clasificare neechilibrată: ROC-AUC, PR-AUC (precizie-reamintire), acuratețe echilibrată.

Rezultatele validării încrucișate sunt de obicei raportate ca medie metrică și deviație standard (de exemplu, precizie 0,89 ± 0,03). Deviația standard ajută la înțelegerea stabilității modelului.

Validare încrucișată pentru selecția modelului și reglarea parametrilor

Una dintre principalele utilizări ale validării încrucișate este selecția modelului și reglarea hiperparametrilor. De exemplu:
– Alegerea lui k în k-NN.
– Selectați adâncimea maximă în arborele decizional.
– Determinarea parametrilor de regularizare în regresia de tip ridge/lasso.
– Determinarea valorilor C și gamma în SVM.

În practică, procesul de ajustare se efectuează asupra datelor de antrenament folosind validare încrucișată, în timp ce datele de testare finale sunt păstrate separat pentru evaluarea finală. Acest lucru previne „optimismul excesiv” cauzat de supraadaptarea modelului la datele de evaluare.

O abordare mai riguroasă se numește validare încrucișată imbricată, care este validare încrucișată în cadrul validării încrucișate: bucla exterioară este pentru evaluare, bucla interioară este pentru reglare. Această metodă este populară în cercetare, deoarece oferă estimări de performanță mai imparțiale.

CITIT  Statistica în știința criminalistică

Avantajele și limitele validării încrucișate

Ce este Kelebihan Utama:
1. Oferă estimări de performanță mai stabile decât diviziunea individuală.
2. Utilizați datele eficient, în special atunci când setul de date este mic.
3. Ajută la selectarea unui model mai general și reduce riscul de supraadaptare.

Keterbatasan:
1. Costurile de calcul cresc pe măsură ce antrenamentul este repetat de mai multe ori.
2. Scurgerile de date pot apărea în continuare dacă preprocesarea nu este efectuată corect.
3. Pentru datele grupate (de exemplu, datele pacienților care au mai multe înregistrări), este necesară o metodă specială, cum ar fi k-fold-ul de grup, astfel încât un individ să nu apară în tren și în test în același timp.

Bune practici în utilizarea validării încrucișate

Pentru ca o evaluare să fie validă, trebuie respectate câteva principii importante:
– Efectuați preprocesarea (normalizare, imputare, selecție a caracteristicilor) în cadrul fiecărei plieri, nu o singură dată pentru toate datele. În caz contrar, informațiile din plierea de testare s-ar putea scurge în plierea trenului.
– Utilizați k-fold stratificat pentru clasificarea cu clase dezechilibrate.
– Utilizați o schemă specială pentru datele din seriile temporale, astfel încât ordinea să nu fie încălcată.
– Puneți deoparte setul final de teste dacă obiectivul dumneavoastră este să evaluați performanța finală a modelului înainte de implementare.

Închidere

Validarea încrucișată este un instrument fundamental în statistica aplicată și învățarea automată pentru evaluarea performanței modelelor într-un mod mai echitabil și robust. Prin utilizarea repetată a partajării datelor, validarea încrucișată ajută la reducerea erorii cauzate de selecția divizată de tip tren de teste, detectează supraadaptările și susține selecția modelului și reglarea hiperparametrilor. Deși costul de calcul este mai mare, beneficiile merită adesea investiția, mai ales atunci când setul de date este mic sau când deciziile bazate pe rezultatele modelului au consecințe semnificative. Prin alegerea tipului potrivit de validare încrucișată și implementarea celor mai bune practici, putem construi modele mai fiabile, gata de utilizare pe date din lumea reală.

Tinggalkan comentariu