Esempio di domanda di discussione sul coefficiente di determinazione

Esempio di una domanda di discussione sul coefficiente di determinazione

Il coefficiente di determinazione (R²) è un parametro importante nell'analisi di regressione, in quanto indica quanto bene un modello di regressione spieghi la variabilità effettiva dei dati. In questo articolo, spiegheremo il concetto di coefficiente di determinazione attraverso un esempio dettagliato e una discussione.

Concetto base del coefficiente di determinazione

Il coefficiente di determinazione o \( R^2 \) è misurato su una scala da 0 a 1, dove:

– \( R^2 = 0 \) indica che il modello di regressione non è in grado di spiegare affatto la variabilità dei dati.
– \( R^2 = 1 \) mostra che il modello di regressione è in grado di spiegare perfettamente tutta la variabilità dei dati.

La formula base per il calcolo del coefficiente di determinazione è:

\[ R^2 = 1 – \frac{SSR}{SST} \]

Di mana:
– L'SSR (Somma dei Residui al Quadrato) è la somma dei quadrati delle differenze tra i valori previsti dal modello e i valori effettivi.
– La SST (Somma Totale dei Quadrati) è la somma dei quadrati delle differenze tra il valore effettivo e la media dei valori effettivi.

Esempio di problemi

Analizziamo un esempio pratico per comprendere più a fondo il calcolo del coefficiente di determinazione.

Esempio di problema:

Supponiamo di avere dati sul numero di ore di studio (X) e sui punteggi degli esami (Y) di 10 studenti:

| Studenti | Ore di studio (X) | Punteggio dell'esame (Y) |
|——-|——————–|——————–|
| 1 | 2 | 58 |
| 2 | 3 | 64 |
| 3 | 4 | 70 |
| 4 | 5 | 85 |
| 5 | 2 | 57 |
| 6 | 3 | 68 |
| 7 | 4 | 72 |
| 8 | 5 | 90 |
| 9 | 3 | 62 |
| 10 | 4 | 78 |

LEGGI ANCHE  Vettori equivalenti nel sistema di coordinate cartesiane

Creeremo un semplice modello di regressione lineare in cui i punteggi degli esami (Y) vengono previsti in base alle ore di studio (X).

Discussione

1. Costruzione di un modello di regressione lineare semplice

Un semplice modello di regressione lineare ha la seguente forma:

\[ Y = a + bX \]

Di mana:
– \( Y \) è il punteggio previsto del test.
– \( X \) è il numero di ore di studio.
– \( a \) è l'intercetta (il punto di intersezione sull'asse Y quando X = 0).
– \( b \) è la pendenza (inclinazione della retta di regressione).

Per calcolare i parametri \( a \) e \( b \), utilizziamo la seguente formula:

\[ b = \frac{n(\sum{XY}) – (\sum{X})(\sum{Y})}{n(\sum{X^2}) – (\sum{X})^2} \]
\[ a = \frac{\somma{Y} – b(\somma{X})}{n} \]

Dove \( n \) è il numero di dati (in questo caso n = 10).

Dalla tabella possiamo calcolare:
– \(\somma{X} = 36\)
– \(\somma{Y} = 704\)
– \(\sum{X^2} = 140\)
– \(\somma{Y^2} = 50428\)
– \(\somma{XY} = 2576\)

Calcoliamo prima b:

\[ b = \frac{10(2576) – (36)(704)}{10(140) – (36)^2} \]
\[ b = \frac{25760 – 25344}{1400 – 1296} \]
\[ b = \frac{416}{104} \]
\[ b = 4 \]

Quindi calcoliamo:

\[ a = \frac{704 – 4(36)}{10} \]
\[ a = \frac{704 – 144}{10} \]
\[ a = \frac{560}{10} \]
\[ a = 56 \]

LEGGI ANCHE  Esempio di domande di discussione sulla dimensione del collocamento

Il modello di regressione lineare che otteniamo è quindi:

\[ Y = 56 + 4X \]

2. Calcola il valore previsto (Y')

Successivamente, calcoliamo il valore previsto \( Y' \) per ogni \( X \):

| Studenti | Ore di studio (X) | Punteggio dell'esame (Y) | Punteggio previsto (Y') |
|——-|——————–|——————–|————————-|
| 1 | 2 | 58 | \( 56 + 4(2) = 64 \) |
| 2 | 3 | 64 | \( 56 + 4(3) = 68 \) |
| 3 | 4 | 70 | \( 56 + 4(4) = 72 \) |
| 4 | 5 | 85 | \( 56 + 4(5) = 76 \) |
| 5 | 2 | 57 | \( 56 + 4(2) = 64 \) |
| 6 | 3 | 68 | \( 56 + 4(3) = 68 \) |
| 7 | 4 | 72 | \( 56 + 4(4) = 72 \) |
| 8 | 5 | 90 | \( 56 + 4(5) = 76 \) |
| 9 | 3 | 62 | \( 56 + 4(3) = 68 \) |
| 10 | 4 | 78 | \( 56 + 4(4) = 72 \) |

3. Calcolo di SSR e SST

Successivamente, calcoliamo SSR e SST per ottenere \( R^2 \.

RSS:

\[ SSR = \somma{(Y – Y')^2} \]
\[ SSR = (58 – 64)^2 + (64 – 68)^2 + (70 – 72)^2 + (85 – 76)^2 + (57 – 64)^2 + (68 – 68)^2 + (72 – 72)^2 + (90 – 76)^2 + (62 – 68)^2 + (78 – 72)^2 \]
\[ SSR = 36 + 16 + 4 + 81 + 49 + 0 + 0 + 196 + 36 + 36 \]
\[ SSR = 454 \]

LEGGI ANCHE  Valore atteso della distribuzione normale

SSST:

\[ SST = \sum{(Y – \bar{Y})^2} \]
Di mana:
\[ \bar{Y} = \frac{\sum{Y}}{n} = \frac{704}{10} = 70.4 \]

\[ SST = (58 – 70.4)^2 + (64 – 70.4)^2 + (70 – 70.4)^2 + (85 – 70.4)^2 + (57 – 70.4)^2 + (68 – 70.4)^2 + (72 – 70.4)^2 + (90 – 70.4)^2 + (62 – 70.4)^2 + (78 – 70.4)^2 \]
\[ SST = 153.76 + 40.96 + 0.16 + 213.16 + 178.56 + 5.76 + 2.56 + 384.16 + 70.56 + 57.76 \]
\[ SST = 1107.44 \]

4. Calcolo del coefficiente di determinazione \( R^2 \):

\[ R^2 = 1 – \frac{SSR}{SST} \]
\[ R^2 = 1 – \frac{454}{1107.44} \]
\[ R^2 = 1 – 0.41 \]
\[ R^2 = 0.59 \]

conclusione

Dai calcoli precedenti, abbiamo ottenuto un coefficiente di determinazione (R2 = 0.59). Ciò indica che il modello di regressione lineare da noi creato può spiegare circa il 59% della variabilità dei punteggi d'esame in base alle ore di studio. Il restante 41% della variabilità potrebbe essere dovuto ad altri fattori non inclusi nel modello.

Comprendendo i passaggi e i calcoli sopra descritti, possiamo cogliere l'importanza del coefficiente di determinazione nella valutazione di quanto bene il modello di regressione che costruiamo spieghi la variabilità effettiva dei dati. Si tratta di uno strumento molto utile nell'analisi statistica e nella modellazione dei dati.

Lascia un commento