Kas ir daudzkārtēja regresija
Daudzkārtējā regresija ir statistiskās analīzes metode, ko izmanto, lai izprastu saistību starp vienu atkarīgo mainīgo un diviem vai vairākiem neatkarīgiem mainīgajiem. Šo metodi bieži izmanto sociālajos, ekonomiskajos, biznesa, veselības, izglītības un datu zinātnes pētījumos, jo tā var izskaidrot, kā vairāki faktori kopā ietekmē rezultātu.
Piemēram, pieņemsim, ka kāds vēlas paredzēt studenta eksāmenu rezultātus. Eksāmenu rezultātus (atkarīgo mainīgo) var ietekmēt mācību stundas, apmeklētība un piekļuve privātstundām (neatkarīgie mainīgie). Daudzkārtējā regresija palīdz atbildēt uz tādiem jautājumiem kā: Kuri faktori ir visietekmīgākie? Ja mācību stundu skaits palielināsies, cik lielā mērā palielināsies vidējais eksāmenu rezultāts, ja citi faktori būs nemainīgi?
Sākot no
Vairākkārtējas regresijas definīcija un mērķis
Vienkārši sakot, daudzkārtējās regresijas mērķis ir:
1. Paredziet atkarīgā mainīgā vērtību, pamatojoties uz vairākiem neatkarīgiem mainīgajiem.
2. Paskaidrojiet, cik liela ietekme katram neatkarīgajam mainīgajam ir uz atkarīgo mainīgo.
3. Samazina neobjektivitāti, kas var rasties, ja izmantojam tikai vienu neatkarīgu mainīgo, pat ja patiesībā parādību ietekmē daudzi faktori.
4. Citu mainīgo lielumu kontrole (kontrole), pārbaudot konkrēta mainīgā lieluma ietekmi.
Ar vienkāršu regresiju mēs aplūkojam tikai viena faktora saistību ar rezultātu. Tomēr reālajā pasaulē ietekme bieži pārklājas. Šeit daudzkārtēja regresija kļūst reālistiskāka: tā mēģina redzēt "kopējo ainu", vienlaikus iekļaujot daudzus mainīgos.
Sākot no
Vairāku regresijas vienādojumu vispārīgā forma
Daudzkārtējā regresija parasti tiek uzrakstīta kā vienādojums:
Y = a + b1X1 + b2X2 + b3X3 + … + bnXn + e
Informācija:
– Y = atkarīgais mainīgais (kas ir jāizskaidro/jāparedz)
– a = konstante (Y vērtība, kad visi X ir 0)
– b1, b2, … bn = regresijas koeficienti katram neatkarīgajam mainīgajam
– X1, X2, … Xn = neatkarīgi mainīgie
– e = kļūda/atlikums (Y variācijas daļa, ko modelis nevar izskaidrot)
Koeficients b ir visbiežāk interpretētā komponente. Piemēram, ja b1 = 2,5, tad katrs X1 pieaugums par 1 vienību palielinās Y par 2,5, pieņemot, ka pārējie neatkarīgie mainīgie paliek nemainīgi. Frāze "visi pārējie ir nemainīgi" ir svarīga, jo tā atspoguļo daudzkārtējās regresijas galveno iezīmi: tā mēra mainīgā "daļējo" efektu.
Sākot no
Vairāku regresiju pielietojuma piemērs
Lai atvieglotu darbu, šeit ir vienkāršs biznesa piemērs. Pieņemsim, ka uzņēmums vēlas uzzināt faktorus, kas ietekmē produktu pārdošanas apjomus (Y). Uzņēmums apkopo datus:
– X1 = reklāmas izmaksas (miljonos rūpiju)
– X2 = produkta cena (tūkstošos rūpiju)
– X3 = aktīvo tālākpārdevēju skaits
Analīzes rezultāti rada vienādojumu:
Pārdošanas apjoms = 100 + 8X1 – 5X2 + 12X3
Interpretācija:
– Konstante 100: ja reklāmas izmaksas, cenas un tālākpārdevējus uzskata par 0, pārdošanas apjoms tiek lēsts kā 100 vienības (tā ir tikai matemātiska interpretācija, dažreiz tā realitātē nav loģiska).
– 8X1: tiek lēsts, ka katrs papildu 1 miljons reklāmas izmaksās palielinās pārdošanas apjomu par 8 vienībām, ja cena un tālākpārdevējs paliek nemainīgi.
– -5X2: tiek lēsts, ka katrs cenas pieaugums par 1 tūkstoti rūpiju samazina pārdošanas apjomus par 5 vienībām, ja citi mainīgie paliek nemainīgi.
– 12X3: katrs papildu 1 aktīvais tālākpārdevējs palielina pārdošanas apjomu par 12 vienībām, ja citi mainīgie paliek nemainīgi.
Izmantojot šo modeli, uzņēmumi var izveidot politikas: piemēram, noteikt reklāmas, cenu un tālākpārdevēju skaita kombināciju, lai sasniegtu pārdošanas mērķus.
Sākot no
Kad ir piemērota daudzkārtējās regresijas izmantošana?
Daudzkārtējā regresija ir piemērota lietošanai, ja:
1. Jums ir viens galvenais iznākums, kuru vēlaties paredzēt (Y).
2. Pastāv aizdomas, ka iznākumu ietekmē vairāk nekā viens faktors (X).
3. Dati ir skaitliskā mērogā vai arī tos var pārveidot skaitliskā formā (piemēram, kategorijas tiek pārveidotas par fiktīviem piemēriem).
Šo metodi var izmantot arī, lai “pārbaudītu teorijas” pētījumos, piemēram, vai izglītības ietekme uz ienākumiem joprojām ir būtiska pēc darba pieredzes un dzīvesvietas kontroles.
Sākot no
Svarīgi pieņēmumi daudzkārtējā regresijā
Lai rezultāti būtu derīgi, daudzkārtējai regresijai ir vairāki pieņēmumi, kas jāņem vērā:
1. Linearitāte
Tiek pieņemts, ka attiecības starp neatkarīgajiem un atkarīgajiem mainīgajiem ir lineāras. Ja faktiskā attiecība ir izliekta (nelineāra), lineārais modelis var būt mazāk precīzs.
2. Nav augstas multikolinearitātes
Neatkarīgajiem mainīgajiem nevajadzētu būt pārāk cieši korelētiem. Ja X1 un X2 ir gandrīz identiski, būs grūti atdalīt to attiecīgo ietekmi.
3. Homoskedastisms
Paredzams, ka atlikusī dispersija visās prognozētajās vērtībās būs relatīvi nemainīga. Ja atlikums noteiktā vērtībā kļūst lielāks (heteroskedastiskums), novērtējums var būt mazāk efektīvs.
4. Atlikumu normalitāte (bieži vien vēlama)
Atlikumiem jābūt aptuveni normāli sadalītiem, īpaši nozīmīguma pārbaudes nolūkos.
5. Kļūdu neatkarība
Kļūdām starp novērojumiem nevajadzētu būt korelētām. Šī problēma bieži rodas laika rindu datos.
Pieņēmumu pārbaude parasti tiek veikta, izmantojot atlikumu grafikus, statistiskos testus (piemēram, VIF multikolinearitātei) un citas diagnostiskās analīzes.
Sākot no
Modeļa kvalitātes mērīšana: R² un nozīmīguma testi
Vairākkārtējā regresijā tiek izmantoti vairāki kopīgi rādītāji:
– R² (noteikšanas koeficients)
Parāda Y variācijas proporciju, ko var izskaidrot ar modeli. R² vērtības svārstās no 0 līdz 1. Jo lielāka R², jo lielāku variāciju neatkarīgais mainīgais izskaidro. Tomēr liels R² automātiski nenozīmē, ka modelis ir “pareizs”; var rasties pārmērīga pielāgošana.
– Pielāgots R²
R² versija, kas ņem vērā neatkarīgo mainīgo skaitu. Tas palīdz salīdzināt modeļus ar atšķirīgu mainīgo skaitu.
– F tests (vienlaicīgs)
Pārbauda, vai neatkarīgie mainīgie kopā būtiski ietekmē Y.
– t-tests (daļējs)
Pārbaudiet, vai katrs koeficients (b1, b2 utt.) ir statistiski nozīmīgs.
Ar šo testu pētnieki var novērtēt, vai modelis ir noderīgs un kuri mainīgie faktiski veicina tā darbību.
Sākot no
Vairāku regresiju priekšrocības un ierobežojumi
Pārmērīgs
– Reālistiskāk, jo vienlaikus tiek ņemti vērā daudzi faktori.
– Var izmantot prognozēšanai un skaidrošanai.
– Ļauj veikt daļēju efektu analīzi (citu mainīgo lielumu kontrole).
– Tas ir pamats daudzām progresīvām metodēm statistikā un mašīnmācībā.
Ierobežojumi
– Pakļauts multikolinearitātei.
– Rezultāti var būt maldinoši, ja netiek izpildīti pieņēmumi.
– Nenorāda automātiski cēloņsakarību; regresija parāda saistību, un cēloņsakarībai ir nepieciešams spēcīgs pētījuma dizains.
– Pārmērīga pielāgošana var notikt, ja mainīgo ir pārāk daudz, salīdzinot ar datu apjomu.
Sākot no
Pennutup
Daudzkārtējā regresija ir svarīgs statistikas rīks, lai analizētu attiecības starp vienu atkarīgu mainīgo un vairākiem neatkarīgiem mainīgajiem. Izmantojot relatīvi vienkāršu vienādojumu, šī metode palīdz pētniekiem un praktiķiem izprast ietekmējošos faktorus, izmērīt katra mainīgā ietekmes stiprumu un izdarīt precīzākas prognozes nekā izmantojot tikai vienu faktoru.
Tomēr daudzkārtējā regresija nav "burvju rīks". Lai nodrošinātu precīzu interpretāciju, ir nepieciešama laba datu kvalitāte, saprātīga mainīgo izvēle un pieņēmumu pārbaude. Pareizi izmantota, daudzkārtējā regresija var nodrošināt stabilu pamatu uz datiem balstītai lēmumu pieņemšanai dažādās jomās.
Ja vēlaties, varu palīdzēt jums izveidot šī raksta versiju konkrētam kontekstam (piemēram, diplomdarbam, uzņēmējdarbībai vai vidusskolas lasītājiem), iekļaujot vienkāršus aprēķinu piemērus un to, kā lasīt SPSS/Excel/R izvadi.