Գծային ռեգրեսիայի օրինակի հարցեր և քննարկում
Գծային ռեգրեսիան վիճակագրական մեթոդ է, որն օգտագործվում է երկու կամ ավելի փոփոխականների միջև կապը որոշելու համար: Այս մեթոդը լայնորեն կիրառվում է տարբեր ոլորտներում, այդ թվում՝ տնտեսագիտության, բիզնեսի, հասարակական գիտությունների և բնական գիտությունների: Այս հոդվածում մենք կքննարկենք գծային ռեգրեսիան, դրա հաշվարկման եղանակը և կներկայացնենք մի քանի օրինակելի խնդիրներ՝ բացատրություններով, որոնք կօգնեն ընթերցողներին խորությամբ հասկանալ այս հասկացությունը:
Գծային ռեգրեսիայի հասկացումը
Գծային ռեգրեսիան վերլուծական մեթոդ է, որն օգտագործվում է մեկ կամ մի քանի անկախ փոփոխականների (կանխատեսող գործոնների) և կախյալ փոփոխականի (պատասխանի) միջև փոխհարաբերությունը մոդելավորելու համար: Պարզ գծային ռեգրեսիան ներառում է մեկ անկախ փոփոխական և մեկ կախյալ փոփոխական, մինչդեռ բազմակի գծային ռեգրեսիան ներառում է մեկից ավելի անկախ փոփոխական:
Պարզ գծային ռեգրեսիայի գծի հավասարումը հետևյալն է.
\[ Y = a + bX \]
Որտեղ՝
– \( Y \)-ն կախյալ փոփոխական է։
– \(X \)-ն անկախ փոփոխական է։
– \(a \)-ն հատման կետն է, որը Y-ի արժեքն է, երբ X = 0 է։
– \(b \)-ն ռեգրեսիայի գործակիցն է, այսինքն՝ որքանով է Y-ը փոխվում, եթե X-ը փոխվում է մեկ միավորով։
Գծային ռեգրեսիայի քայլեր
1. Տվյալների հավաքագրում. Նախ, հավաքեք վերլուծվող տվյալները:
2. Տվյալների գծապատկեր. Ստեղծեք ցրման գրաֆիկ՝ տեսնելու համար, թե արդյոք փոփոխականների միջև գծային կապ կա։
3. Հաշվարկեք ռեգրեսիայի գործակիցը. լավագույն գիծը որոշելու համար օգտագործեք նվազագույն քառակուսիների մեթոդը։
4. Մոդելի ստուգում. Ստուգեք ռեգրեսիայի գործակիցների նշանակալիությունը t-թեստով և որոշեք R-քառակուսի արժեքը՝ տեսնելու համար, թե որքանով է մոդելը համապատասխանում տվյալներին։
Հարցերի և քննարկման նմուշներ
Օրինակ՝ հարց 1. Պարզ գծային ռեգրեսիա
Հարց՝
Հետազոտողը ցանկանում է իմանալ ուսումնական ժամերի քանակի (X) և ուսանողների քննությունների միավորների (Y) միջև եղած կապը։ Ստացված տվյալները հետևյալն են՝
| Ուսումնական ժամեր (X) | Քննության միավոր (Y) |
|——————–|——————–|
| 2 | 70 |
| 3 | 75 |
| 5 | 80 |
| 7 | 85 |
| 8 | 90 |
Այս տվյալներից կազմեք գծային ռեգրեսիայի հավասարում։
Քննարկում.
1. Միջինի հաշվարկը.
\[
\bar{X} = \frac{2 + 3 + 5 + 7 + 8}{5} = 5
\]
\[
\բար{Y} = \frac{70 + 75 + 80 + 85 + 90}{5} = 80
\]
2. Ռեգրեսիայի գործակցի հաշվարկը \(b \):
\[
b = \frac{\sum (X_i – \bar{X})(Y_i – \bar{Y})}{\sum (X_i – \bar{X})^2}
\]
\[
\sum (X_i – \bar{X})(Y_i – \bar{Y}) = (2 – 5)(70 – 80) + (3 – 5)(75 – 80) + (5 – 5)(80 – 80) + (7 – 5)(85 – 80) + (8 – 5)(90 – 80)
\]
\[
= (-3)(-10) + (-2)(-5) + (0)(0) + (2)(5) + (3)(10) = 30 + 10 + 0 + 10 + 30 = 80
\]
\[
\sum (X_i – \bar{X})^2 = (2 – 5)^2 + (3 – 5)^2 + (5 – 5)^2 + (7 – 5)^2 + (8 – 5)^2
\]
\[
= 9 + 4 + 0 + 4 + 9 = 26
\]
\[
b = \frac{80}{26} \մոտավորապես 3.08
\]
3. Հատման հաշվարկը \(a \):
\[
a = \bar{Y} – b\bar{X}
\]
\[
a = 80 – 3.08 \times 5 = 80 – 15.4 = 64.6
\]
4. Ռեգրեսիայի հավասարում.
\[
Y = 64.6 + 3.08X
\]
Այսպիսով, տվյալների գծային ռեգրեսիայի հավասարումը հետևյալն է՝ Y = 64.6 + 3.08X։ Սա նշանակում է, որ ուսումնասիրության յուրաքանչյուր լրացուցիչ ժամ կբարձրացնի թեստի միավորը 3.08 միավորով։
Օրինակ հարց 2. Մոդելի թեստ և մեկնաբանություն
Հարց՝
Շարունակելով նույն տվյալներով, հաշվարկեք R-քառակուսի (R²) արժեքը՝ չափելու համար, թե որքան լավ է մոդելը համապատասխանում տվյալներին: Ստուգեք նաև ռեգրեսիայի գործակցի (b) նշանակալիությունը:
Քննարկում.
1. Հաշվարկեք քառակուսիների ընդհանուր գումարը (SST), քառակուսիների ռեգրեսիոն գումարը (SSR) և քառակուսիների սխալի գումարը (SSE):
\[
SST = \sum (Y_i – \bar{Y})^2
\]
\[
ՍՍՏ = (70 – 80)^2 + (75 – 80)^2 + (80 – 80)^2 + (85 – 80)^2 + (90 – 80)^2 = 100 + 25 + 0 + 25 + 100 = 250
\]
\[
ՍՍՀ = \sum (\hat{Y}_i – \bar{Y})^2
\]
որտեղ \( \hat{Y}_i \)-ն ռեգրեսիայի հավասարման կանխատեսված արժեքն է։
\[
\hat{Y}_i = 64.6 + 3.08X_i
\]
\[
\hat{Y} = [67.76, 70.84, 76.0, 82.16, 85.24]
\]
\[
\bar{Y} = 80
\]
\[
ՀՍՀ = (67.76 – 80)^2 + (70.84 – 80)^2 + (76.0 – 80)^2 + (82.16 – 80)^2 + (85.24 – 80)^2
\]
\[
ՍՍՀ = (-12.24)^2 + (-9.16)^2 + (-4.0)^2 + 2.16^2 + 5.24^2 = 149.8
\]
2. SSE-ի հաշվարկը.
\[
ՀՍԷ = ՀՍՏ – ՀՍՀ = 250 – 149.8 = 100.2
\]
3. R-քառակուսի հաշվարկը.
\[
R^2 = \frac{SSR}{SST} = \frac{149.8}{250} = մոտավորապես 0.6
\]
R-քառակուսի 0.6 արժեքը ցույց է տալիս, որ այս մոդելը բացատրում է տվյալների տատանման մոտավորապես 60%-ը։ Սա ցույց է տալիս, որ ռեգրեսիայի գիծը բավականին լավ է համապատասխանում տվյալներին։
4. t-փորձարկում գործակցի \(b \) նշանակության համար:
\[
t = \frac{b}{SE(b)}
\]
\[
SE(b) = \sqrt{\frac{SSE}{n-2}} / \sqrt{\sum (X_i – \bar{X})^2}
\]
\[
SE(b) = \sqrt{\frac{100.2}{5-2}} / \sqrt{26}
\]
\[
SE(b) = \sqrt{33.4} / \sqrt{26} \approx 1.13
\]
\[
t = \frac{3.08}{1.13} \մոտավորապես 2.73
\]
t-վիճակագրության մոտավոր 2.73-ի դեպքում, եթե օգտագործենք նշանակալիության ընդհանուր շեմ (α = 0.05), այն համեմատում ենք t-աղյուսակի հետ։ Օրինակ՝ df = 3-ի դեպքում կրիտիկական t-ն մոտավորապես 2.353 է։ Այնուհետև t-դիտարկվող > t-կրիտիկական գործակիցը ցույց է տալիս, որ գործակիցը նշանակալի է։
Եզրակացություն
Այս հոդվածում մենք անդրադարձել ենք գծային ռեգրեսիայի հիմունքներին, ռեգրեսիայի գործակիցը և հատույթը հաշվարկելուն, ինչպես նաև արդյունքների մեկնաբանմանը՝ օգտագործելով օրինակելի խնդիրներ: Այս մեթոդը հմտորեն օգտագործելու համար անհրաժեշտ է հաճախակի պրակտիկա կատարել տարբեր տվյալների հավաքածուների հետ: Գծային ռեգրեսիան արժեքավոր գործիք է տվյալների վերլուծության մեջ և կարող է խորը պատկերացում տալ փոփոխականների միջև եղած կապերի մասին: