En küçük kareler yöntemi

En Küçük Kareler Yöntemi: Tahmine Matematiksel Bir Yaklaşım

giriiş

En küçük kareler yöntemi, bir regresyon modelindeki parametreleri, gerçek değerler ile model tarafından tahmin edilen değerler arasındaki kare hataların toplamını en aza indirgeyerek tahmin etmek için kullanılan istatistiksel bir tekniktir. Bu yöntem çok popülerdir ve ekonomi, mühendislik, biyoloji ve sosyal bilimler gibi çeşitli alanlarda sıklıkla kullanılır. En küçük kareler kavramı ilk olarak 19. yüzyılın başlarında Adrien-Marie Legendre tarafından önerilmiş ve daha sonra Carl Friedrich Gauss tarafından geliştirilmiştir.

Temel Anlayış

Genel olarak, en küçük kareler yöntemi, artıkların veya tahmin hatalarının karelerinin toplamını en aza indirgeyerek bir veri kümesi için en uygun regresyon doğrusunu bulmayı amaçlar. Artık, gözlemlenen değer ile tahmin edilen değer arasındaki farktır.

Eğer elimizde \((x_1, y_1), (x_2, y_2), …, (x_n, y_n)\) gözlem çiftlerinden oluşan bir veri seti varsa, amacımız kare hataların toplamını \( \sum_{i=1}^{n} (y_i – (mx_i + b))^2 \) en aza indiren \(y = mx + b\) doğrusunu bulmaktır.

Bu yöntem hem basit doğrusal regresyon hem de çoklu doğrusal regresyon için uygulanabilir. Basit doğrusal regresyonda yalnızca bir bağımsız değişkenimiz (x) varken, çoklu doğrusal regresyonda birden fazla bağımsız değişken söz konusudur.

Basit Doğrusal Regresyon

Öncelikle basit doğrusal regresyonla başlayalım. Diyelim ki elimizde \((x_1, y_1), (x_2, y_2), …, (x_n, y_n)) veri seti var. Uyarlamak istediğimiz basit doğrusal regresyon modeli şöyledir:

\[ y = mx + b + \epsilon \]

Burada \( m \) eğim, \( b \) kesişim noktası ve \( \epsilon \) rastgele hatadır.

En küçük kareler yöntemini kullanarak, karesel hata fonksiyonunu minimize ederek \( m \) ve \( b \) parametrelerinin tahminlerini bulabiliriz:

OKU  İstatistiksel Verilerde Çeyrekler, Onluklar ve Yüzdelikler Nasıl Hesaplanır?

\[ S(m, b) = \sum_{i=1}^{n} (y_i – (mx_i + b))^2 \]

\( S(m, b) \)'yi en aza indirmek için, \( S \)'nin \( m \) ve \( b \)'ye göre kısmi türevlerini buluruz ve ardından bu denklemi \( m \) ve \( b \) için çözeriz:

\[ \begin{aligned}
\frac{\partial S}{\partial m} &= -2 \sum_{i=1}^{n} x_i (y_i – (mx_i + b)) = 0 \\
\frac{\partial S}{\partial b} &= -2 \sum_{i=1}^{n} (y_i – (mx_i + b)) = 0
\end{aligned} \]

Basitleştirme işleminden sonra aşağıdaki iki normal denklemi elde ederiz:

\[ \begin{aligned}
n\bar{y} &= m \sum_{i=1}^{n} x_i + nb \\
\sum_{i=1}^{n}x_i y_i &= m \sum_{i=1}^{n}x_i^2 + b \sum_{i=1}^{n}x_i
\end{aligned} \]

Yukarıdaki denklem sistemini çözerek, karesel hatayı en aza indiren \( m \) ve \( b \) değerlerini bulabiliriz.

Çoklu Doğrusal Regresyon

Çoklu doğrusal regresyonda, birden fazla bağımsız değişkene sahip olduğumuz bir durumla karşı karşıyayız. Örneğin, verilerimizin \((x_{i1}, x_{i2}, …, x_{ik}, y_i)\) şeklinde bir demet halinde olduğunu varsayalım. Kullanacağımız regresyon modeli şöyledir:

\[ y = b_0 + b_1 x_1 + b_2 x_2 + … + b_k x_k + \epsilon \]

Bu denklem matris biçiminde şu şekilde yazılabilir:

\[ \mathbf{y} = \mathbf{X} \mathbf{b} + \mathbf{\epsilon} \]

Nerede:
– \( \mathbf{y} \) gözlemlenen y değerlerinin sütun vektörüdür.
– \( \mathbf{X} \) gözlemlenen x değerlerinin matrisidir (kesişim için 1. sütun dahil).
– \( \mathbf{b} \) parametrelerin ( \( b_0 \) dahil) bir sütun vektörüdür.

En küçük kareler yönteminin amacı, aşağıdaki ikinci dereceden hata fonksiyonunu en aza indirmektir:

\[ S(\mathbf{b}) = (\mathbf{y} – \mathbf{Xb})^T (\mathbf{y} – \mathbf{Xb}) \]

Bu fonksiyonu minimize etmek için, S'nin \( \mathbf{b} \)'ye göre kısmi türevini alıp sıfıra eşitleriz. Bu, çoklu doğrusal regresyon için normal denklemi verir:

OKU  Standart sapma nasıl hesaplanır?

\[ \mathbf{X}^T \mathbf{Xb} = \mathbf{X}^T \mathbf{y} \]

Yukarıdaki denklem sistemini çözerek, \( \mathbf{b} \) parametresinin bir tahminini elde edebiliriz:

\[ \mathbf{b} = (\mathbf{X}^T \mathbf{X})^{-1} \mathbf{X}^T \mathbf{y} \]

Avantajlar ve Dezavantajlar

En küçük kareler yönteminin birçok avantajı vardır. Kullanımı çok verimli ve basittir. Eğer \( \mathbf{X}^T \mathbf{X} \) tersine çevrilebilir ise benzersiz bir çözüm sunar, bu da onu birçok pratik uygulama için güvenilir kılar.

Ancak en küçük kareler yönteminin de sınırlamaları vardır. Karesel hata, küçük farklardan ziyade büyük farkları vurguladığı için aykırı değerlere karşı çok hassastır. Ayrıca, iyi sonuçlar elde etmek için hataların sıfır ortalama ve sabit varyansa sahip normal dağılıma sahip olduğu klasik varsayımının karşılanması gerekir.

Aplikasi Praktis

En küçük kareler yöntemi, veri trend analizi, tahmin ve makine öğreniminde tahmine dayalı modeller oluşturmak için sıklıkla kullanılır. Finans sektöründe, hisse senedi fiyatlarını veya piyasa performansını tahmin etmek için kullanılır. Tıpta, ilaç dozajı ile hasta yanıtı arasındaki ilişkiyi modellemek için kullanılır. Sosyal bilimlerde ise eğitim ve gelir gibi değişkenler arasındaki ilişkiyi anlamaya yardımcı olur.

Sonuç

En küçük kareler yöntemi, istatistik ve veri analizindeki temel tekniklerden biridir. Kavram olarak basit olmasına rağmen, bu yöntem değişkenler arasındaki ilişkileri modelleme ve anlama konusunda önemli bir güç sunar. Çok çeşitli alanlarda yaygın uygulamalarıyla, bu yöntemin sağlam bir şekilde anlaşılması hem profesyoneller hem de araştırmacılar için paha biçilmezdir. Gelecekte, büyük veri çağında karşılaşılan veri hacminin artmasıyla birlikte, en küçük kareler gibi klasik yöntemlerin uyarlanması ve uygulanması giderek daha da önem kazanacaktır.

Yorum ekle