Hva er multippel regresjon

Hva er multippel regresjon

Multippel regresjon er en statistisk analyseteknikk som brukes til å forstå forholdet mellom én avhengig variabel og to eller flere uavhengige variabler. Denne metoden brukes ofte i sosial, økonomisk, forretningsmessig, helsemessig, utdanningsmessig og datavitenskapelig forskning fordi den kan forklare hvordan flere faktorer samlet sett påvirker et utfall.

La oss for eksempel si at noen ønsker å forutsi en students eksamensresultater. Eksamensresultater (den avhengige variabelen) kan påvirkes av studietimer, oppmøte og tilgang til veiledning (de uavhengige variablene). Multippel regresjon hjelper med å svare på spørsmål som: Hvilke faktorer er mest innflytelsesrike? Hvis studietimene øker, hvor mye vil den gjennomsnittlige eksamensresultatet øke, når andre faktorer holdes konstante?

-

Definisjon og formål med multippel regresjon

Enkelt sagt har multippel regresjon som mål å:

1. Forutsi verdien av den avhengige variabelen basert på flere uavhengige variabler.
2. Forklar hvor stor innflytelse hver uavhengige variabel har på den avhengige variabelen.
3. Reduserer skjevhet som kan oppstå hvis vi bare bruker én uavhengig variabel, selv om et fenomen i realiteten er påvirket av mange faktorer.
4. Kontrollere andre variabler (kontroll) når man tester påvirkningen av en bestemt variabel.

Med enkel regresjon ser vi bare på forholdet mellom én faktor og et utfall. I den virkelige verden overlapper imidlertid effekter ofte hverandre. Det er her multippel regresjon blir mer realistisk: den forsøker å se det «store bildet» ved å inkludere mange variabler samtidig.

-

Generell form for multippel regresjonsligning

Multippel regresjon skrives vanligvis som ligningen:

Y = a + b1X1 + b2X2 + b3X3 + … + bnXn + e

Informasjon:
– Y = avhengig variabel (som skal forklares/prediktes)
– a = konstant (verdien av Y når alle X-er er 0)
– b1, b2, … bn = regresjonskoeffisienter for hver uavhengige variabel
– X1, X2, … Xn = uavhengige variabler
– e = feil/residual (den delen av variasjonen i Y som ikke kan forklares av modellen)

Koeffisienten b er den komponenten som oftest tolkes. Hvis for eksempel b1 = 2,5, vil hver økning i X1 på 1 enhet øke Y med 2,5, forutsatt at andre uavhengige variabler forblir konstante. Uttrykket «alt annet konstant» er viktig fordi det representerer et sentralt trekk ved multippel regresjon: det måler den «delvise» effekten av en variabel.

-

Eksempel på anvendelse av multippel regresjon

For å gjøre det enklere, her er et enkelt forretningseksempel. Anta at et selskap ønsker å vite faktorene som påvirker produktsalg (Y). Selskapet samler inn data:
– X1 = annonseringskostnader (i millioner rupiah)
– X2 = produktpris (i tusen rupiah)
– X3 = antall aktive forhandlere

Resultatene av analysen produserer ligningen:
Salg = 100 + 8X1 – 5X2 + 12X3

Tolkningen:
– Konstant 100: Når annonseringskostnader, priser og forhandlere regnes som 0, estimeres salget til å være 100 enheter (dette er bare en matematisk tolkning, noen ganger gir det ikke mening i virkeligheten).
– 8X1: hver ekstra million i annonsekostnader er anslått å øke salget med 8 enheter, dersom prisen og forhandleren forblir den samme.
– -5X2: hver prisøkning på 1 tusen rupiah er estimert til å redusere salget med 5 enheter, hvis andre variabler forblir konstante.
– 12X3: hver ekstra aktiv forhandler øker salget med 12 enheter, hvis andre variabler forblir konstante.

Med denne modellen kan bedrifter lage retningslinjer: for eksempel bestemme kombinasjonen av reklame, priser og antall forhandlere for å oppnå salgsmål.

-

Når er multippel regresjon passende å bruke?

Multippel regresjon er egnet for bruk når:

1. Du har ett hovedutfall du vil forutsi (Y).
2. Det er mer enn én faktor som mistenkes å påvirke utfallet (X).
3. Data er på en numerisk skala eller kan endres til numerisk form (for eksempel endres kategorier til dummies).

Denne metoden kan også brukes til å «teste teorier» i forskning, for eksempel om effekten av utdanning på inntekt fortsatt er signifikant etter å ha kontrollert for arbeidserfaring og bosted.

-

Viktige antagelser i multippel regresjon

For at resultatene skal være gyldige, har multippel regresjon flere forutsetninger som må tas i betraktning:

1. Linearitet
Forholdet mellom de uavhengige og avhengige variablene antas å være lineært. Hvis det faktiske forholdet er buet (ikke-lineært), kan den lineære modellen være mindre nøyaktig.

2. Det er ingen høy multikollinearitet
Uavhengige variabler bør ikke være for sterkt korrelert. Hvis X1 og X2 er nesten identiske, vil det være vanskelig å skille deres respektive effekter.

3. Homoscedastisitet
Den residuale variansen forventes å være relativt konstant på tvers av alle predikerte verdier. Hvis residualet blir større ved en viss verdi (heteroskedastisitet), kan estimeringen være mindre effektiv.

4. Normalitet av residualer (ofte ønsket)
Residualer bør være tilnærmet normalfordelt, spesielt for signifikanstesting.

5. Uavhengighet av feil
Feil mellom observasjoner bør ikke korreleres. Dette problemet oppstår ofte i tidsseriedata.

Kontroll av antagelser gjøres vanligvis gjennom residualgrafer, statistiske tester (f.eks. VIF for multikollinearitet) og andre diagnostiske analyser.

-

Måling av modellkvalitet: R² og signifikansetester

I multippel regresjon brukes flere vanlige indikatorer:

– R² (Bestemmelseskoeffisient)
Viser andelen av variasjonen i Y som kan forklares av modellen. R²-verdiene varierer fra 0–1. Jo større R² er, desto mer variasjon forklarer den uavhengige variabelen. En stor R² betyr imidlertid ikke automatisk at modellen er «riktig»; overtilpasning kan forekomme.

– Justert R²
En versjon av R² som tar hensyn til antall uavhengige variabler. Dette hjelper med å sammenligne modeller med ulikt antall variabler.

– F-test (samtidig)
Testing av om de uavhengige variablene sammen har en signifikant effekt på Y.

– t-test (delvis)
Test om hver koeffisient (b1, b2 osv.) er statistisk signifikant.

Med denne testen kan forskere vurdere om modellen er nyttig og hvilke variabler som faktisk bidrar.

-

Fordeler og begrensninger ved multippel regresjon

Overskudd
– Mer realistisk fordi det tar hensyn til mange faktorer samtidig.
– Kan brukes til prediksjon og forklaring.
– Tillater partiell effektanalyse (kontroll av andre variabler).
– Det er grunnlaget for mange avanserte metoder innen statistikk og maskinlæring.

Begrensninger
– Mottakelig for multikollinearitet.
– Resultatene kan være misvisende hvis forutsetningene ikke oppfylles.
– Indikerer ikke automatisk en årsakssammenheng; regresjon viser sammenheng, og årsakssammenheng krever et sterkt forskningsdesign.
– Overtilpasning kan oppstå hvis det er for mange variabler sammenlignet med datamengden.

-

Lukking

Multippel regresjon er et viktig statistisk verktøy for å analysere forholdet mellom en enkelt avhengig variabel og flere uavhengige variabler. Ved å bruke en relativt enkel ligning hjelper denne metoden forskere og praktikere med å forstå innflytelsesrike faktorer, måle styrken på hver variabels innflytelse og gjøre mer nøyaktige prediksjoner enn å bruke én enkelt faktor alene.

Multippel regresjon er imidlertid ikke et «magisk verktøy». Det krever god datakvalitet, rimelig variabelvalg og antagelseskontroll for å sikre nøyaktig tolkning. Når den brukes riktig, kan multippel regresjon gi et solid grunnlag for datadrevet beslutningstaking på en rekke felt.

Hvis du ønsker det, kan jeg hjelpe deg med å lage en versjon av denne artikkelen for en spesifikk kontekst (f.eks. for en hovedoppgave, for forretningsdrift eller for lesere på videregående skole), komplett med enkle beregningseksempler og hvordan du leser SPSS/Excel/R-utdata.

Legg igjen en kommentar