Формула логистической регрессии
Логистическая регрессия — один из самых популярных методов в статистике и анализе данных для моделирования взаимосвязи между рядом независимых переменных (предикторов) и категориальной зависимой переменной, особенно бинарной (например, да/нет, успех/неудача, больной/здоровый). В отличие от линейной регрессии, которая выдает непрерывные значения, логистическая регрессия предназначена для оценки вероятности события, поэтому конечный результат находится в диапазоне от 0 до 1. В этой статье мы обсудим формулу логистической регрессии, значение каждого компонента и способы его интерпретации.
Зачем нужна логистическая регрессия?
Если мы используем линейную регрессию для прогнозирования вероятностей, модель может выдавать значения ниже 0 или выше 1, что явно неразумно для вероятности. Логистическая регрессия решает эту проблему, используя нелинейную функцию, которая сопоставляет вычисленный результат (который может быть любым значением) со значением вероятности от 0 до 1. Наиболее часто используемой функцией является логистическая или сигмоидная функция.
Например, предположим, мы хотим предсказать, откажется ли клиент от услуг, исходя из его возраста, продолжительности подписки и частоты использования. Предсказанный результат имеет только две возможности: отток (1) или отсутствие оттока (0). Логистическая регрессия хорошо подходит для подобных ситуаций.
Базовая формула для логистической регрессии
Суть логистической регрессии заключается в моделировании вероятности \( p \) того, что \( Y = 1 \) (событие происходит), при условии значения переменной-предиктора \( X \).
Модели логистической регрессии обычно представляются в двух важных формах:
1) Вероятностная форма (сигмоидная)
\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]
с
\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
Примечания:
– \( p \) – это вероятность события (например: отток клиентов = 1).
– \( e \) – это число Эйлера (примерно 2,71828).
– \( z \) представляет собой линейную комбинацию предикторов.
– \( \beta_0 \) – это точка пересечения с осью Y (константа).
– \( \beta_1, \beta_2, \ldots, \beta_k \) – коэффициенты регрессии.
– \( X_1, X_2, \ldots, X_k \) являются независимыми переменными.
Сигмоидная функция гарантирует, что независимо от значения \( z \), значение \( p \) остается в пределах от 0 до 1.
2) Логит-форма (логарифм отношения шансов)
Ещё одна очень важная форма — это логит-форма, которая представляет собой логарифм отношения шансов:
\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
Примечания:
– \( \frac{p}{1-p} \) называется шансом (относительной вероятностью).
– \( \ln \) — натуральный логарифм.
Логит-форма объясняет, что логистическая регрессия фактически моделирует логарифм отношения шансов как линейную функцию предикторов. Это делает интерпретацию коэффициентов более понятной, особенно в контексте отношения шансов.
Понимание шансов и коэффициентов шансов
Для того чтобы по-настоящему понять формулу логистической регрессии, необходимо различать вероятность и шансы.
– Вероятность (p): вероятность наступления события (от 0 до 1).
– Шансы: сравнение вероятности того, что событие произойдет, с вероятностью того, что оно не произойдет:
\[
\text{шансы} = \frac{p}{1-p}
\]
Пример: если \( p = 0{,}8 \), то:
\[
\text{шансы} = \frac{0{,}8}{0{,}2} = 4
\]
Это означает, что вероятность того, что событие произойдёт, в 4 раза выше, чем вероятность того, что оно не произойдёт.
В логистической регрессии коэффициент \( \beta \) часто интерпретируется через отношение шансов:
\[
ИЛИ = e^{\beta}
\]
– Если \( \beta > 0 \), то \( e^{\beta} > 1 \): предиктор увеличивает вероятность события.
– Если \( \beta < 0 \), то \( e^{\beta} < 1 \): предиктор уменьшает вероятность события. – Если \( \beta = 0 \), то \( e^{\beta} = 1 \): это не влияет на вероятность. Например, если \( \beta_1 = 0{,}7 \), то: \[ e^{0{,}7} \approx 2{,}01 \] Это означает, что каждое увеличение \( X_1 \ на 1 единицу увеличит вероятность события примерно в 2,01 раза (при условии, что другие переменные остаются постоянными). Пример простой модели логистической регрессии. Предположим, у нас есть только одна переменная-предиктор \( X \), например, количество часов учебы в неделю, для прогнозирования успешной сдачи экзамена (сдал = 1, не сдал = 0). Модель: