লজিস্টিক রিগ্রেশন সূত্র

লজিস্টিক রিগ্রেশন সূত্র

লজিস্টিক রিগ্রেশন হলো পরিসংখ্যান এবং ডেটা সায়েন্সের অন্যতম জনপ্রিয় একটি পদ্ধতি, যা একাধিক স্বাধীন চলক (প্রেডিক্টর) এবং একটি ক্যাটাগরিক্যাল নির্ভরশীল চলকের (বিশেষত বাইনারি, যেমন—হ্যাঁ/না, সাফল্য/ব্যর্থতা, অসুস্থ/সুস্থ) মধ্যকার সম্পর্ক মডেল করার জন্য ব্যবহৃত হয়। লিনিয়ার রিগ্রেশনের মতো নয়, যা অবিচ্ছিন্ন মান তৈরি করে, লজিস্টিক রিগ্রেশন কোনো একটি ঘটনার সম্ভাবনা অনুমান করার জন্য ডিজাইন করা হয়েছে, তাই এর চূড়ান্ত ফলাফল ০ থেকে ১-এর মধ্যে থাকে। এই প্রবন্ধে আমরা লজিস্টিক রিগ্রেশনের সূত্র, এর প্রতিটি উপাদানের অর্থ এবং কীভাবে এর ব্যাখ্যা করতে হয় তা নিয়ে আলোচনা করব।

লজিস্টিক রিগ্রেশন কেন প্রয়োজন?

যদি আমরা সম্ভাবনা ভবিষ্যদ্বাণী করার জন্য লিনিয়ার রিগ্রেশন ব্যবহার করি, তাহলে মডেলটি ০-এর নিচে বা ১-এর উপরে মান তৈরি করতে পারে, যা সম্ভাবনার জন্য স্পষ্টতই অযৌক্তিক। লজিস্টিক রিগ্রেশন একটি নন-লিনিয়ার ফাংশন ব্যবহার করে এই সমস্যার সমাধান করে, যা গণনাকৃত ফলাফলকে (যা যেকোনো মান হতে পারে) ০ এবং ১-এর মধ্যে একটি সম্ভাবনার মানে রূপান্তরিত করে। সবচেয়ে বেশি ব্যবহৃত ফাংশনটি হলো লজিস্টিক বা সিগময়েড ফাংশন।

উদাহরণস্বরূপ, ধরুন আমরা একজন গ্রাহকের বয়স, সাবস্ক্রিপশনের সময়কাল এবং ব্যবহারের ফ্রিকোয়েন্সির উপর ভিত্তি করে ভবিষ্যদ্বাণী করতে চাই যে সে চলে যাবে কিনা। ভবিষ্যদ্বাণী করা ফলাফলের কেবল দুটি সম্ভাবনা রয়েছে: চলে যাওয়া (1) অথবা চলে না যাওয়া (0)। লজিস্টিক রিগ্রেশন এই ধরনের পরিস্থিতির জন্য বিশেষভাবে উপযুক্ত।

লজিস্টিক রিগ্রেশনের মৌলিক সূত্র

লজিস্টিক রিগ্রেশনের মূল উদ্দেশ্য হলো প্রেডিক্টর ভ্যারিয়েবল \( X \)-এর মান দেওয়া থাকলে, \( Y = 1 \) (ঘটনাটি ঘটার) সম্ভাবনা \( p \)-কে মডেল করা।

লজিস্টিক রিগ্রেশন মডেল সাধারণত দুটি গুরুত্বপূর্ণ রূপে লেখা হয়:

১) সম্ভাবনার রূপ (সিগময়েড)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

Dengan

\[
z = β₀ + β₁ X₁ + β₂ X₂ + ... + βk Xₕ
\]

তথ্য:
– \( p \) হলো ঘটনাটির সম্ভাবনা (যেমন: গ্রাহক হারানো = ১)।
– \( e \) হলো অয়লারের সংখ্যা (প্রায় ২.৭১৮২৮)।
– \( z \) হলো প্রেডিক্টরগুলোর একটি রৈখিক সমাহার।
– \( \beta_0 \) হলো ছেদক (ধ্রুবক)।
– \( \beta_1, \beta_2, \ldots, \beta_k \) হলো রিগ্রেশন সহগসমূহ।
– \( X_1, X_2, \ldots, X_k \) হলো স্বাধীন চলকসমূহ।

পড়ুন  আন্তর্জাতিক সম্পর্কে পরিসংখ্যানের গুরুত্ব

সিগময়েড ফাংশন নিশ্চিত করে যে \( z \)-এর মান যাই হোক না কেন, \( p \)-এর মান 0 এবং 1-এর মধ্যে থাকে।

২) লজিট ফর্ম (লগ অডস)

আরেকটি অত্যন্ত গুরুত্বপূর্ণ রূপ হলো লজিট ফর্ম, যা হলো সম্ভাবনার লগারিদম:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

তথ্য:
– \( \frac{p}{1-p} \) কে সম্ভাবনা (আপেক্ষিক সুযোগ) বলা হয়।
– \( \ln \) হলো স্বাভাবিক লগারিদম।

লজিট ফর্ম ব্যাখ্যা করে যে, লজিস্টিক রিগ্রেশন আসলে প্রেডিক্টরগুলোর একটি লিনিয়ার ফাংশন হিসেবে লগ অডস-কে মডেল করে। এটি কোএফিসিয়েন্টগুলোর ব্যাখ্যাকে আরও স্পষ্ট করে তোলে, বিশেষ করে অডস রেশিওর প্রেক্ষাপটে।

সম্ভাবনা এবং সম্ভাবনা অনুপাত বোঝা

লজিস্টিক রিগ্রেশন সূত্রটি সঠিকভাবে বোঝার জন্য, আমাদের সম্ভাবনা এবং প্রতিকূলতার মধ্যে পার্থক্য করতে হবে।

– সম্ভাবনা \( p \): কোনো ঘটনা ঘটার সুযোগ (০ থেকে ১)।
– সম্ভাবনা: কোনো কিছু ঘটার ও না ঘটার সম্ভাবনার তুলনা:

\[
সম্ভাবনা = p{1-p}
\]

উদাহরণ: যদি \( p = 0{,}8 \) হয়, তাহলে:

\[
সম্ভাবনা = (0, 8) / (0, 2) = 4
\]

এর মানে হলো, ঘটনাটি ঘটার সম্ভাবনা না ঘটার সম্ভাবনার চেয়ে ৪ গুণ বেশি।

লজিস্টিক রিগ্রেশনে, সহগ \( \beta \)-কে প্রায়শই অডস রেশিওর মাধ্যমে ব্যাখ্যা করা হয়:

\[
অথবা = e^{\beta}
\]

– যদি \( \beta > 0 \) হয়, তাহলে \( e^{\beta} > 1 \): অর্থাৎ, ভবিষ্যদ্বাণীকারীটি ঘটনাটির সম্ভাবনা বাড়িয়ে দেয়।
– যদি \( \beta < 0 \) হয়, তাহলে \( e^{\beta} < 1 \): প্রেডিক্টরটি ঘটনাটির সম্ভাবনা কমিয়ে দেয়। - যদি \( \beta = 0 \) হয়, তাহলে \( e^{\beta} = 1 \): সম্ভাবনার উপর কোনো প্রভাব পড়ে না। উদাহরণস্বরূপ, যদি \( \beta_1 = 0{,}7 \) হয়, তাহলে: \[ e^{0{,}7} \approx 2{,}01 \] এর মানে হলো, \( X_1 \)-এর প্রতি ১ একক বৃদ্ধি ঘটনাটির সম্ভাবনাকে প্রায় ২.০১ গুণ বাড়িয়ে দেবে (অন্যান্য ভ্যারিয়েবল অপরিবর্তিত থাকলে)। একটি সরল লজিস্টিক রিগ্রেশন মডেলের উদাহরণ ধরুন, আমাদের কাছে একটি মাত্র প্রেডিক্টর ভ্যারিয়েবল \( X \) আছে, যেমন প্রতি সপ্তাহে অধ্যয়নের ঘণ্টার সংখ্যা, যা একটি পরীক্ষায় পাস করার পূর্বাভাস দেয় (পাস = ১, ফেল = ০)। মডেলটি:

পড়ুন  অনুমানমূলক পরিসংখ্যানে টি-টেস্ট
\[ \text{logit}(p) = \beta_0 + \beta_1 X \] যদি আনুমানিক ফলাফল হয়: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) তাহলে: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] যদি \( X = 6 \) ঘন্টা অধ্যয়ন হয়: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] ব্যাখ্যা: প্রতি সপ্তাহে 6 ঘন্টা অধ্যয়নের সাথে, সম্ভাব্যতা প্রায় 69% স্কোর নিয়ে উত্তীর্ণ হয়েছে। সহগ অনুমান: ন্যূনতম বর্গ পদ্ধতি কেন নয়? লিনিয়ার রিগ্রেশনে, সহগগুলো প্রায়শই লিস্ট স্কোয়ার্স পদ্ধতি ব্যবহার করে গণনা করা হয়। তবে, লজিস্টিক রিগ্রেশনে, প্রেডিক্টর এবং সম্ভাবনার মধ্যে সম্পর্কটি অরৈখিক, তাই লিস্ট স্কোয়ার্স পদ্ধতিটি আদর্শ নয়। লজিস্টিক রিগ্রেশন সাধারণত ম্যাক্সিমাম লাইকলিহুড এস্টিমেশন (MLE) ব্যবহার করে সেই সহগ মান \( \beta \) খুঁজে বের করে যা পর্যবেক্ষণ করা ডেটার লাইকলিহুডকে সর্বাধিক করে তোলে। সংক্ষেপে, বাইনারি পর্যবেক্ষণ \( y_i \in \{0,1\} \) এবং পূর্বাভাস \( p_i \)-এর জন্য লাইকলিহুড হলো: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] এরপর গণনা সহজ করার জন্য এটিকে প্রায়শই লগ-লাইকলিহুডে রূপান্তরিত করা হয়: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] \( \ell(\beta) \)-কে সর্বোচ্চ করার জন্য \( \beta \)-এর মান নির্বাচন করা হয়। নিউটন-র‍্যাপসন বা গ্রেডিয়েন্ট ডিসেন্টের মতো সাংখ্যিক পদ্ধতিগুলো প্রায়শই পরিসংখ্যানগত সফটওয়্যার দ্বারা ব্যবহৃত হয়। লজিস্টিক রিগ্রেশনের সুবিধা এবং সীমাবদ্ধতা সুবিধা ১. ফলাফলগুলো সম্ভাবনার আকারে থাকে, তাই এগুলোকে সিদ্ধান্তে রূপান্তর করা সহজ। ২. অডস রেশিওর মাধ্যমে সহগগুলোর ব্যাখ্যা স্পষ্ট হয়। ৩. বাইনারি ক্লাসিফিকেশন সমস্যার জন্য উপযুক্ত এবং মাল্টিনোমিয়াল/অর্ডিনাল পর্যন্ত সম্প্রসারিত করা যায়। সীমাবদ্ধতা ১. প্রেডিক্টর এবং লগ অডসের মধ্যে একটি রৈখিক সম্পর্ক ধরে নেয়, সরাসরি সম্ভাবনার সাথে নয়। ২. মাল্টিকোলিনিয়ারিটি বা অত্যন্ত ভারসাম্যহীন ডেটা থাকলে সমস্যা হতে পারে। ৩. খুব জটিল সম্পর্কের ধরনের জন্য, অন্যান্য অরৈখিক পদ্ধতি (যেমন, র‍্যান্ডম ফরেস্ট বা নিউরাল নেটওয়ার্ক) আরও উন্নত হতে পারে।
পড়ুন  বহুচলকীয় পরিসংখ্যান বলতে কী বোঝায়?
উপসংহারস্বরূপ, লজিস্টিক রিগ্রেশন ফর্মুলা মূলত প্রেডিক্টর ভ্যারিয়েবলগুলোর একটি লিনিয়ার কম্বিনেশনকে একটি সিগময়েড ফাংশনের সাথে একত্রিত করে সম্ভাবনা তৈরি করে। এর সবচেয়ে প্রচলিত রূপটি হলো: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] অথবা লজিট আকারে: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] ফর্মুলার এই দুটি রূপ বোঝার মাধ্যমে, আমরা বিভিন্ন বাইনারি ক্লাসিফিকেশন সমস্যার জন্য প্রেডিক্টিভ মডেল তৈরি করতে পারি এবং অডস রেশিও \( e^{\beta} \) এর মাধ্যমে ভ্যারিয়েবলগুলোর প্রভাব ব্যাখ্যা করতে পারি। ডেটা বিশ্লেষণে লজিস্টিক রিগ্রেশন একটি গুরুত্বপূর্ণ ভিত্তি হিসেবে রয়ে গেছে, কারণ এটি সহজ, শক্তিশালী এবং ব্যাখ্যামূলক—এবং প্রায়শই আরও জটিল মডেল তৈরির আগে এটিই প্রথম পদক্ষেপ। আপনি চাইলে, আমি অল্প ডেটা দিয়ে একটি উদাহরণ গণনা (টেবিল), অথবা আউটপুটের ব্যাখ্যাসহ পাইথন/আর-এ লজিস্টিক রিগ্রেশনের একটি উদাহরণ ইমপ্লিমেন্টেশন যোগ করতে পারি।

একটি মন্তব্য করুন