سوالات و بحث نمونه رگرسیون خطی
رگرسیون خطی یک روش آماری است که برای تعیین رابطه بین دو یا چند متغیر استفاده میشود. این روش به طور گسترده در زمینههای مختلف از جمله اقتصاد، تجارت، علوم اجتماعی و علوم طبیعی مورد استفاده قرار میگیرد. در این مقاله، ما در مورد رگرسیون خطی، نحوه محاسبه آن بحث خواهیم کرد و چندین مثال به همراه توضیحات ارائه خواهیم داد تا به خوانندگان کمک کنیم این مفهوم را به طور عمیق درک کنند.
درک رگرسیون خطی
رگرسیون خطی یک روش تحلیلی است که برای مدلسازی رابطه بین یک یا چند متغیر مستقل (پیشبینیکننده) و یک متغیر وابسته (پاسخ) استفاده میشود. رگرسیون خطی ساده شامل یک متغیر مستقل و یک متغیر وابسته است، در حالی که رگرسیون خطی چندگانه شامل بیش از یک متغیر مستقل است.
معادله یک خط رگرسیون خطی ساده به صورت زیر است:
\[ Y = a + bX \]
کجا:
– \(Y \) متغیر وابسته است.
– \(X \) متغیر مستقل است.
- \(a \) نقطه تقاطع است، که مقدار Y است وقتی X = 0.
- \(b \) ضریب رگرسیون است، یعنی اینکه اگر X یک واحد تغییر کند، Y چقدر تغییر میکند.
مراحل رگرسیون خطی
۱. جمعآوری دادهها: ابتدا، دادههایی را که باید تجزیه و تحلیل شوند، جمعآوری کنید.
۲. رسم دادهها: یک نمودار پراکندگی ایجاد کنید تا ببینید آیا رابطه خطی بین متغیرها وجود دارد یا خیر.
۳. محاسبه ضریب رگرسیون: از روش حداقل مربعات برای تعیین بهترین خط استفاده کنید.
۴. آزمون مدل: معناداری ضرایب رگرسیون را با آزمون t بررسی کنید و مقدار R-squared را تعیین کنید تا ببینید مدل چقدر با دادهها برازش دارد.
Contoh Soal Dan Pembahasan
مثال سوال ۱: رگرسیون خطی ساده
سوال:
یک محقق میخواهد رابطه بین تعداد ساعات مطالعه (X) و نمرات امتحانی دانشآموزان (Y) را بداند. دادههای بهدستآمده به شرح زیر است:
| ساعات مطالعه (X) | نمره امتحان (Y) |
|———————–|——————–|
| ۲۰۵ | ۱۰۰ |
| ۲۰۵ | ۱۰۰ |
| ۲۰۵ | ۱۰۰ |
| ۲۰۵ | ۱۰۰ |
| ۲۰۵ | ۱۰۰ |
از این دادهها یک معادله رگرسیون خطی بسازید!
بحث:
۱. محاسبه میانگین:
\[
\bar{X} = \frac{2 + 3 + 5 + 7 + 8}{5} = 5
\]
\[
\bar{Y} = \frac{70 + 75 + 80 + 85 + 90}{5} = 80
\]
۲. محاسبه ضریب رگرسیون (b):
\[
b = \frac{\sum (X_i – \bar{X})(Y_i – \bar{Y})}{\sum (X_i – \bar{X})^2}
\]
\[
\sum (X_i – \bar{X})(Y_i – \bar{Y}) = (2 – 5)(70 – 80) + (3 – 5)(75 – 80) + (5 – 5)(80 – 80) + (7 – 5)(85 – 80) + (8 – 5)(90 – 80)
\]
\[
= (-3)(-10) + (-2)(-5) + (0)(0) + (2)(5) + (3)(10) = 30 + 10 + 0 + 10 + 30 = 80
\]
\[
\sum (X_i – \bar{X})^2 = (2 – 5)^2 + (3 – 5)^2 + (5 – 5)^2 + (7 – 5)^2 + (8 – 5)^2
\]
\[
= ۹ + ۴ + ۰ + ۴ + ۹ = ۲۶
\]
\[
b = \frac{80}{26} \تقریباً 3.08
\]
۳. محاسبهی عرض از مبدا (a):
\[
a = \bar{Y} – b\bar{X}
\]
\[
a = 80 – 3.08 ضربدر 5 = 80 – 15.4 = 64.6
\]
۴. معادله رگرسیون:
\[
Y = 64.6 + 3.08X
\]
بنابراین، معادله رگرسیون خطی برای دادهها به صورت \(Y = 64.6 + 3.08X \) است. این بدان معناست که انتظار میرود هر ساعت مطالعه اضافی، نمره آزمون را 3.08 امتیاز افزایش دهد.
مثال سوال ۲: آزمون و تفسیر مدل
سوال:
با ادامه دادن با همان دادهها، مقدار ضریب تعیین (R²) را برای اندازهگیری میزان برازش مدل با دادهها محاسبه کنید. همچنین، معناداری ضریب رگرسیون (b) را آزمایش کنید.
بحث:
۱. محاسبه مجموع مربعات کل (SST)، مجموع مربعات رگرسیون (SSR) و مجموع مربعات خطا (SSE):
\[
SST = \sum (Y_i – \bar{Y})^2
\]
\[
دمای سطح دریا = (70 – 80)^2 + (75 – 80)^2 + (80 – 80)^2 + (85 – 80)^2 + (90 – 80)^2 = 100 + 25 + 0 + 25 + 100 = 250
\]
\[
SSR = \sum (\hat{Y}_i - \bar{Y})^2
\]
که در آن \( \hat{Y}_i \) مقدار پیشبینیشده معادله رگرسیون است:
\[
\hat{Y}_i = 64.6 + 3.08X_i
\]
\[
\hat{Y} = [67.76، 70.84، 76.0، 82.16، 85.24]
\]
\[
\bar{Y} = 80
\]
\[
SSR = (67.76 – 80)^2 + (70.84 – 80)^2 + (76.0 – 80)^2 + (82.16 – 80)^2 + (85.24 – 80)^2
\]
\[
SSR = (-12.24)^2 + (-9.16)^2 + (-4.0)^2 + 2.16^2 + 5.24^2 = 149.8
\]
۲. محاسبه SSE:
\[
SSE = SST – SSR = 250 – 149.8 = 100.2
\]
۳. محاسبه ضریب تعیین (R):
\[
R^2 = \frac{SSR}{SST} = \frac{149.8}{250} \تقریباً 0.6
\]
مقدار ضریب تعیین (R) برابر با ۰.۶ نشان میدهد که این مدل تقریباً ۶۰٪ از تغییرات دادهها را توضیح میدهد. این نشان میدهد که خط رگرسیون به خوبی با دادهها برازش دارد.
۴. آزمون t برای معناداری ضریب \(b \):
\[
t = \frac{b}{SE(b)}
\]
\[
SE(b) = \sqrt{\frac{SSE}{n-2}} / \sqrt{\sum (X_i – \bar{X})^2}
\]
\[
SE(b) = \sqrt{\frac{100.2}{5-2}} / \sqrt{26}
\]
\[
SE(b) = ...
\]
\[
t = \frac{3.08}{1.13} \approx 2.73
\]
با یک \( آماره t تقریباً 2.73 \)، اگر از یک آستانه مشترک برای معناداری (α = 0.05 \) استفاده کنیم، آن را با جدول t مقایسه میکنیم. به عنوان مثال، برای \( df = 3 \)، مقدار بحرانی \(t \) تقریباً 2.353 است. سپس \( t-observed > t-critical \) که نشان میدهد ضریب معنادار است.
نتیجه گیری
در این مقاله، اصول اولیه رگرسیون خطی، نحوه محاسبه ضریب رگرسیون و عرض از مبدا، و نحوه تفسیر نتایج با استفاده از مسائل نمونه را پوشش دادهایم. تمرین مکرر با مجموعه دادههای مختلف برای کسب مهارت در استفاده از این روش ضروری است. رگرسیون خطی ابزاری ارزشمند در تحلیل دادهها است و میتواند بینش عمیقی در مورد روابط بین متغیرها ارائه دهد.