Basit Doğrusal Regresyon Analizi
Basit doğrusal regresyon, iki nicel değişken arasındaki ilişkiyi analiz etmek için kullanılan istatistiksel bir tekniktir. Tahmin etmeye çalıştığımız değişkene bağımlı veya yanıt değişkeni, tahmini yapmak için kullanılan değişkene ise bağımsız veya tahmin edici değişken denir. Basit doğrusal regresyonda, bu iki değişken arasındaki ilişkiyi en iyi şekilde tanımlayan düz çizgiyi bulmaya çalışırız.
Basit Doğrusal Regresyonun Temel Kavramları
Basit doğrusal regresyon, bağımlı değişken \(Y\) ile bağımsız değişken \(X\) arasında doğrusal bir ilişki olduğu varsayımına dayanır. Basit doğrusal regresyon modelinin genel formu şöyledir:
\[ Y = \beta_0 + \beta_1 X + \epsilon \]
Mana'da:
– \( Y \) bağımlı değişkendir.
– \( X \) bağımsız değişkendir.
– \( \beta_0 \) kesişim noktasıdır ve \(X = 0\) olduğunda \(Y\) değerini ifade eder.
– \( \beta_1 \) eğim veya gradyandır; bu, \(X\)'teki her bir birimlik değişim için \(Y\)'deki ortalama değişimdir.
– \( \epsilon \), \(Y\)'deki değişkenliğin \(X\) ile açıklanamayan kısmını temsil eden hata veya artık terimdir.
Basit doğrusal regresyonun amacı, modelin \(X\) değeriyle ilişkili \(Y\) değerini tahmin etmek için kullanılabilmesi amacıyla \(\beta_0\) ve \(\beta_1\) parametrelerini tahmin etmektir.
En Küçük Kareler Yöntemi
Basit doğrusal regresyon modelini uydurmak için en yaygın kullanılan yöntemlerden biri En Küçük Kareler yöntemidir. Bu yöntem, gerçek gözlemler ile model tarafından tahmin edilen değerler arasındaki dikey sapmaların karelerinin toplamını en aza indirmeyi amaçlar. n adet gözlemimiz olduğunu varsayalım; bu gözlemler, \(i = 1, 2, …, n\) için \((x_i, y_i)\) çiftlerinden oluşmaktadır. En aza indirilecek fonksiyon şöyledir:
\[ S(\beta_0, \beta_1) = \sum_{i=1}^{n} (y_i – (\beta_0 + \beta_1 x_i))^2 \]
Bu fonksiyonu minimize eden \(\beta_0\) ve \(\beta_1\) değerlerini bulmak için, \(S(\beta_0, \beta_1)\)'in her bir parametreye göre kısmi türevlerini alıp bu türevleri sıfıra eşitleriz. Matematiksel hesaplama şu şekilde basitleştirilebilir:
\[ \beta_1 = \frac{\sum_{i=1}^{n} (x_i – \bar{x})(y_i – \bar{y})}{\sum_{i=1}^{n} (x_i – \bar{x})^2} \]
\[ \beta_0 = \bar{y} – \beta_1 \bar{x} \]
Mana'da:
– \(\bar{x}\), \(X\)'in ortalamasıdır.
– \(\bar{y}\), \(Y\)'nin ortalamasıdır.
\(\beta_0\) ve \(\beta_1\) parametreleri elde edildikten sonra, her bir \(X\) değeri için \(Y\) değerini tahmin etmek için basit bir doğrusal regresyon modeli kullanılabilir.
Basit Doğ线性 Regresyondaki Varsayımlar
Geçerli ve güvenilir sonuçlar için, basit doğrusal regresyon birkaç varsayıma dayanır:
1. Doğrusallık: Bağımlı değişken ile bağımsız değişken arasındaki ilişki doğrusal olmalıdır.
2. Bağımsızlık: Gözlemler birbirlerinden bağımsız olmalıdır.
3. Homoskedastisite: Artık değişkenlik, bağımsız değişkenin değer aralığı boyunca sabit olmalıdır.
4. Kalıntı Normalliği: Kalıntılar (hatalar) normal dağılıma uymalıdır.
Bu varsayımlar karşılanmazsa, basit bir doğrusal regresyon modelinin sonuçları güvenilir olmayacak ve doğru tahminler yapamayabilir.
Regresyon Modeli Değerlendirmesi
Basit doğrusal regresyon modelinin ne kadar iyi tahmin yaptığını değerlendirmenin bir yolu, Belirleme Katsayısını (\(R^2\)) kullanmaktır. Belirleme katsayısı, bağımlı değişkendeki değişkenliğin bağımsız değişkenlerdeki değişkenlikle açıklanabilen oranını gösterir.
\[ R^2 = \frac{\sum_{i=1}^{n} (\hat{y}_i – \bar{y})^2}{\sum_{i=1}^{n} (y_i – \bar{y})^2} \]
Mana'da:
– \(\hat{y}_i\), \(Y\)'nin tahmini değeridir.
– \(y_i\), \(Y\)'nin gerçek değeridir.
– \(\bar{y}\), \(Y\) değerlerinin ortalamasıdır.
\(R^2\) değeri 0 ile 1 arasında değişir. 1'e yakın bir \(R^2\) değeri, modelin bağımlı değişkendeki değişkenliğin büyük bir kısmını açıklayabildiğini gösterir.
Programlama Dilinde Uygulama
Basit doğrusal regresyonu uygulamak için çeşitli istatistiksel yazılımlar veya programlama dilleri kullanabiliriz. Aşağıda, `scikit-learn` kütüphanesini kullanan Python dilinde bir örnek uygulama bulunmaktadır:
piton
numpy'yi np olarak içe aktar
matplotlib.pyplot dosyasını plt olarak içe aktar
sklearn.linear_model'den LinearRegression'ı içe aktarın
sklearn.metrics'ten import_squared_error, r2_score
Veri
X = np.array([[1], [2], [3], [4], [5]]).astype(np.float64)
y = np.array([1.5, 3.6, 3.5, 2.9, 5.5]).astype(np.float64)
Model
model = LinearRegresyon ()
model.fit (X, y)
Tahmin
y_pred = model.predict (X)
Katsayı
beta_0 = model.kesişim_
beta_1 = model.coef_[0]
print(f'Kesme noktası: {beta_0}')
print(f'Eğim: {beta_1}')
print(f'Ortalama karesel hata: {mean_squared_error(y, y_pred)}')
print(f'Belirleme katsayısı (R^2): {r2_score(y, y_pred)}')
Veri grafiği ve regresyon doğrusu
plt.scatter(X, y, color='blue')
plt.plot(X, y_pred, color='red')
plt.xlabel('X')
plt.ylabel('Y')
plt.show ()
"
Yukarıdaki örnekte, öncelikle gerekli kütüphaneleri içe aktarıyoruz, verileri \(X\) ve \(Y\) olarak tanımlıyoruz ve ardından `scikit-learn` kütüphanesinden `LinearRegression` nesnesini kullanarak verilere bir model uyduruyoruz. Model uydurulduktan sonra, tahminlerde bulunuyoruz ve katsayıları, ortalama karesel hatayı ve belirleme katsayısını hesaplıyoruz. Son olarak, verileri ve regresyon doğrusunu çiziyoruz.
Sonuç
Basit doğrusal regresyon, iki nicel değişken arasındaki ilişkiyi açıklamak için kullanılan güçlü bir istatistiksel analiz aracıdır. Doğrusallık, bağımsızlık, homoskedastisite ve normallik hakkındaki bazı temel varsayımlarla, bağımsız değişkenlerin değerlerine dayanarak bağımlı değişkenin değerini tahmin edebiliriz. En Küçük Kareler yöntemi, bir regresyon doğrusunu uydurmak ve en uygun parametreleri belirlemek için etkili bir yol sağlar. Belirleme katsayısı (R²) aracılığıyla model değerlendirmesi, modelimizin ne kadar iyi performans gösterdiğine dair fikir verir.
Basit doğrusal regresyonun, yalnızca iki değişkeni ele alabilmesi ve karşılanması gereken varsayımlar gibi sınırlamaları olmasına rağmen, bu teknik istatistik ve veri analizinde önemli bir temel olmaya devam etmekte ve daha karmaşık yöntemlere geçmeden önce değişkenler arasındaki ilişkiyi anlamanın ilk adımı olarak sıklıkla kullanılmaktadır.