Mètode de validació creuada en estadística

Mètode de validació creuada en estadística

En estadística i ciència de dades, un dels reptes més grans és garantir que un model no només funcioni bé amb les dades amb què s'ha entrenat, sinó que també funcioni bé amb dades noves i no vistes anteriorment. Aquest problema sovint es coneix com a generalització. Aquí és on entra la validació creuada: un mètode d'avaluació de models dissenyat per mesurar el rendiment del model de manera més justa i coherent que una sola avaluació utilitzant un únic conjunt de dades.

Per què cal la validació creuada?

Quan construïm un model predictiu (per exemple, un model de regressió per predir els preus de l'habitatge o un model de classificació per detectar correu brossa), normalment dividim les dades en dues parts: un conjunt d'entrenament i un conjunt de prova. El model s'entrena amb les dades d'entrenament i després s'avalua amb les dades de prova. Aquest enfocament és senzill, però té un inconvenient: els resultats de l'avaluació poden dependre en gran mesura de com es divideixen les dades. Si les dades de prova són "fàcils", el rendiment sembla alt; si les dades de prova són "difícils", el rendiment sembla baix.

La validació creuada redueix la dependència d'un únic conjunt de dades mitjançant la realització de múltiples processos d'entrenament i proves en diferents conjunts de dades i la posterior promediació dels resultats. Això dóna lloc a estimacions de rendiment més representatives de les condicions del món real.

Conceptes bàsics de validació creuada

L'essència de la validació creuada és dividir les dades en diverses parts (plecs). A cada iteració, alguns plecs s'utilitzen per entrenar el model i un plec s'utilitza per provar-lo. Aquest procés es repeteix fins que tots els plecs s'han utilitzat com a dades de prova. Les puntuacions d'avaluació de cada iteració es combinen (normalment amb la mitjana i de vegades també amb la desviació estàndard) per proporcionar una visió general del rendiment del model.

Per exemple, en la validació creuada de k plecs amb k=5, les dades es divideixen en 5 plecs. La primera iteració: plec 1 com a prova, plecs 2–5 com a entrenament. La segona iteració: plec 2 com a prova, i així successivament fins al plec 5.

Tipus comuns de validació creuada

1. Validació de retenció (divisió d'entrenament i prova)
Tot i que tècnicament no es tracta d'una validació creuada "repetida", el mètode de retenció sovint es considera un pas de validació bàsic. Les dades es divideixen una vegada, per exemple, un 80% d'entrenament i un 20% de proves. L'avantatge és que és ràpid i senzill, però el desavantatge és l'alta variància en els resultats perquè es basa en una sola divisió.

Aquest mètode s'utilitza normalment quan les dades són molt grans, de manera que fins i tot una divisió és prou representativa.

2. Validació creuada de K-Fold
Aquesta és la forma més popular de validació creuada. El paràmetre k sovint es tria com a 5 o 10 perquè es considera que equilibra el cost computacional i la qualitat de l'estimació.

Excés:
– Ús de les dades de manera més eficient (cada dada passa a formar part de l'entrenament i la prova).
– Les estimacions de rendiment són més estables que les de suspensió.

Falta:
– Triga més perquè entrena el model k vegades.
– Si les dades són molt grans o el model és molt complex, els costos computacionals poden ser elevats.

3. Validació creuada estratificada de K-Fold
Per a problemes de classificació, especialment si les classes estan desequilibrades (per exemple, 90% negatiu, 10% positiu), el plec k regular pot produir plecs amb distribucions de classes asimètriques. El plec k estratificat garanteix que la proporció de classes a cada plec sigui aproximadament la mateixa que la proporció de classes a les dades originals.

Això és especialment important a l'hora d'avaluar models de detecció de malalties, frau o altres casos en què la classe minoritària és petita.

4. Validació creuada de deixar-ne un fora (LOOCV)
En LOOCV, el nombre de plecs és igual a la quantitat de dades (k = n). Això significa que a cada iteració, només una observació es converteix en les dades de prova, mentre que la resta es converteix en les dades d'entrenament.

Excés:
– Gairebé totes les dades s'utilitzen per a l'entrenament a cada iteració, de manera que el biaix d'estimació pot ser petit.

Falta:
– Molt costós computacionalment per a conjunts de dades grans.
– La variància d'estimació pot ser alta en alguns tipus de problemes perquè el conjunt de proves és només d'un punt per iteració.

El LOOCV s'utilitza sovint quan hi ha molt poques dades, per exemple, en investigacions amb una mostra petita.

5. Validació creuada repetida de K-Fold
Aquest mètode repeteix el plec k diverses vegades amb diferents assignacions de plecs (aleatòries). L'objectiu és reduir la dependència d'una sola assignació de plec i produir estimacions més estables.

Per exemple, "repetit 10 vegades 3 vegades" significa executar-se 10 vegades 3 vegades (un total de 30 entrenaments i avaluacions).

6. Validació creuada de sèries temporals
Per a dades de sèries temporals, la validació creuada convencional no és adequada perquè pot "filtrar el futur" en el procés d'entrenament. En les sèries temporals, s'ha de preservar l'ordre temporal. Per tant, enfocaments com ara:
– Finestra mòbil/lliscant: entrena en el període inicial, després prova en el període següent i, a continuació, la finestra canvia.
– Finestra expansiva: les dades d'entrenament augmenten amb el temps i després es proven en el període següent.

Aquest mètode és rellevant per a la predicció de vendes mensuals, preus de les accions o sensors en temps real.

Mètriques d'avaluació en validació creuada

La validació creuada és només un marc d'avaluació; les mètriques utilitzades depenen del tipus de problema:
– Regressió: MSE, RMSE, MAE, R quadrat.
– Classificació: exactitud, precisió, recuperació, puntuació F1, ROC-AUC.
– Classificació desequilibrada: ROC-AUC, PR-AUC (precisió-recuperació), exactitud equilibrada.

Els resultats de la validació creuada es presenten normalment com a mitjana mètrica i desviació estàndard (per exemple, amb una precisió de 0,89 ± 0,03). La desviació estàndard ajuda a entendre l'estabilitat del model.

Validació creuada per a la selecció de models i l'ajust de paràmetres

Un dels principals usos de la validació creuada és la selecció de models i l'afinació d'hiperparàmetres. Per exemple:
– Escollir k en k-NN.
– Seleccioneu la profunditat màxima a l'arbre de decisió.
– Determinar els paràmetres de regularització en la regressió de ridge/lasso.
– Determinar C i gamma en SVM.

En bones pràctiques, el procés d'afinació es realitza sobre les dades d'entrenament mitjançant validació creuada, mentre que les dades de prova finals es mantenen separades per a l'avaluació final. Això evita el "sobreoptimisme" a causa del sobreajustament del model a les dades d'avaluació.

Un enfocament més rigorós s'anomena validació creuada imbricada, que és una validació creuada dins de la validació creuada: el bucle exterior és per a l'avaluació, el bucle interior és per a l'ajust. Això és popular en la recerca perquè proporciona estimacions de rendiment més imparcials.

Avantatges i limitacions de la validació creuada

Principals avantatges:
1. Proporciona estimacions de rendiment més estables que una sola divisió.
2. Utilitzeu les dades de manera eficient, especialment quan el conjunt de dades és petit.
3. Ajuda a seleccionar un model més general i redueix el risc de sobreajustament.

Limitacions:
1. Els costos computacionals augmenten a mesura que l'entrenament es repeteix moltes vegades.
2. Encara es poden produir fuites de dades si el preprocessament no es fa correctament.
3. Per a dades agrupades (per exemple, dades de pacients que tenen diversos registres), cal un mètode especial, com ara el k-plegament grupal, perquè un individu no aparegui al tren i a la prova alhora.

Bones pràctiques en l'ús de la validació creuada

Perquè una avaluació sigui vàlida, cal seguir diversos principis importants:
– Realitzar el preprocessament (normalització, imputació, selecció de característiques) dins de cada plec, no una vegada per a totes les dades. En cas contrari, la informació del plec de prova podria filtrar-se al plec de tren.
– Utilitzeu el plec k estratificat per a la classificació amb classes desequilibrades.
– Utilitzar un esquema especial per a dades de sèries temporals de manera que no es violi l'ordre.
– Reserveu el conjunt de proves final si el vostre objectiu és avaluar el rendiment final del model abans del desplegament.

Tancament

La validació creuada és una eina fonamental en estadística aplicada i aprenentatge automàtic per avaluar el rendiment dels models de manera més justa i robusta. Mitjançant la compartició repetida de dades, la validació creuada ajuda a reduir el biaix causat per la selecció dividida de proves d'entrenament, detecta el sobreajustament i admet la selecció de models i l'afinació d'hiperparàmetres. Tot i que el cost computacional és més elevat, els beneficis sovint valen la pena, especialment quan el conjunt de dades és petit o quan les decisions basades en els resultats del model tenen conseqüències significatives. Si triem el tipus correcte de validació creuada i implementam les millors pràctiques, podem construir models més fiables que estiguin llestos per ser utilitzats en dades del món real.

Deixa un comentari