Формула логистической регрессии

Формула логистической регрессии

Логистическая регрессия — один из самых популярных методов в статистике и анализе данных для моделирования взаимосвязи между рядом независимых переменных (предикторов) и категориальной зависимой переменной, особенно бинарной (например, да/нет, успех/неудача, больной/здоровый). В отличие от линейной регрессии, которая выдает непрерывные значения, логистическая регрессия предназначена для оценки вероятности события, поэтому конечный результат находится в диапазоне от 0 до 1. В этой статье мы обсудим формулу логистической регрессии, значение каждого компонента и способы его интерпретации.

Зачем нужна логистическая регрессия?

Если мы используем линейную регрессию для прогнозирования вероятностей, модель может выдавать значения ниже 0 или выше 1, что явно неразумно для вероятности. Логистическая регрессия решает эту проблему, используя нелинейную функцию, которая сопоставляет вычисленный результат (который может быть любым значением) со значением вероятности от 0 до 1. Наиболее часто используемой функцией является логистическая или сигмоидная функция.

Например, предположим, мы хотим предсказать, откажется ли клиент от услуг, исходя из его возраста, продолжительности подписки и частоты использования. Предсказанный результат имеет только две возможности: отток (1) или отсутствие оттока (0). Логистическая регрессия хорошо подходит для подобных ситуаций.

Базовая формула для логистической регрессии

Суть логистической регрессии заключается в моделировании вероятности \( p \) того, что \( Y = 1 \) (событие происходит), при условии значения переменной-предиктора \( X \).

Модели логистической регрессии обычно представляются в двух важных формах:

1) Вероятностная форма (сигмоидная)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

с

\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Примечания:
– \( p \) – это вероятность события (например: отток клиентов = 1).
– \( e \) – это число Эйлера (примерно 2,71828).
– \( z \) представляет собой линейную комбинацию предикторов.
– \( \beta_0 \) – это точка пересечения с осью Y (константа).
– \( \beta_1, \beta_2, \ldots, \beta_k \) – коэффициенты регрессии.
– \( X_1, X_2, \ldots, X_k \) являются независимыми переменными.

ЧИТАТЬ  Статистика в этике научных исследований

Сигмоидная функция гарантирует, что независимо от значения \( z \), значение \( p \) остается в пределах от 0 до 1.

2) Логит-форма (логарифм отношения шансов)

Ещё одна очень важная форма — это логит-форма, которая представляет собой логарифм отношения шансов:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Примечания:
– \( \frac{p}{1-p} \) называется шансом (относительной вероятностью).
– \( \ln \) — натуральный логарифм.

Логит-форма объясняет, что логистическая регрессия фактически моделирует логарифм отношения шансов как линейную функцию предикторов. Это делает интерпретацию коэффициентов более понятной, особенно в контексте отношения шансов.

Понимание шансов и коэффициентов шансов

Для того чтобы по-настоящему понять формулу логистической регрессии, необходимо различать вероятность и шансы.

– Вероятность (p): вероятность наступления события (от 0 до 1).
– Шансы: сравнение вероятности того, что событие произойдет, с вероятностью того, что оно не произойдет:

\[
\text{шансы} = \frac{p}{1-p}
\]

Пример: если \( p = 0{,}8 \), то:

\[
\text{шансы} = \frac{0{,}8}{0{,}2} = 4
\]

Это означает, что вероятность того, что событие произойдёт, в 4 раза выше, чем вероятность того, что оно не произойдёт.

В логистической регрессии коэффициент \( \beta \) часто интерпретируется через отношение шансов:

\[
ИЛИ = e^{\beta}
\]

– Если \( \beta > 0 \), то \( e^{\beta} > 1 \): предиктор увеличивает вероятность события.
– Если \( \beta < 0 \), то \( e^{\beta} < 1 \): предиктор уменьшает вероятность события. – Если \( \beta = 0 \), то \( e^{\beta} = 1 \): это не влияет на вероятность. Например, если \( \beta_1 = 0{,}7 \), то: \[ e^{0{,}7} \approx 2{,}01 \] Это означает, что каждое увеличение \( X_1 \ на 1 единицу увеличит вероятность события примерно в 2,01 раза (при условии, что другие переменные остаются постоянными). Пример простой модели логистической регрессии. Предположим, у нас есть только одна переменная-предиктор \( X \), например, количество часов учебы в неделю, для прогнозирования успешной сдачи экзамена (сдал = 1, не сдал = 0). Модель:

ЧИТАТЬ  Статистические методы для анализа данных
Если оценочный результат равен: - (β₀ = -4) - (β₁ = 0,8), то: [z = -4 + 0,8X] [p = 1 + e⁻(-4 + 0,8X)] Если X = 6 часов обучения: [z = -4 + 0,8(6) = 0,8] [p = 1 + e⁻⁴ - 0,8X] Если X = 6 часов обучения: [z = -4 + 0,8(6) = 0,8] [p = 1 + e⁻⁰,8] ≈ 0,69] Интерпретация: при 6 часах обучения в неделю вероятность сдачи экзамена составляет около 69%. Оценка коэффициентов: почему не метод наименьших квадратов? В линейной регрессии коэффициенты часто рассчитываются с использованием метода наименьших квадратов. Однако в логистической регрессии связь между предикторами и вероятностями нелинейна, поэтому подход наименьших квадратов не идеален. В логистической регрессии обычно используется оценка максимального правдоподобия (MLE) для нахождения значения коэффициента \( \beta \), которое максимизирует правдоподобие наблюдаемых данных. В итоге, вероятность для бинарных наблюдений \( y_i \in \{0,1\} \) и предсказаний \( p_i \) определяется следующим образом: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Затем её часто преобразуют в логарифмическую функцию правдоподобия для упрощения вычислений: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Значение \( \beta \) выбирается таким образом, чтобы максимизировать \( \ell(\beta) \). Численные методы, такие как метод Ньютона-Рафсона или градиентный спуск, часто используются статистическим программным обеспечением. Преимущества и ограничения логистической регрессии Преимущества 1. Результаты представлены в виде вероятностей, поэтому их легко использовать для принятия решений. 2. Интерпретация коэффициентов понятна благодаря отношению шансов. 3. Подходит для задач бинарной классификации и может быть расширена до многомерных/порядковых распределений. Ограничения 1. Предполагает линейную зависимость между предикторами и логарифмом шансов, а не непосредственно от вероятностей. 2. Может быть проблематичным при наличии мультиколлинеарности или сильно несбалансированных данных. 3. Для очень сложных взаимосвязей другие нелинейные методы (например, случайный лес или нейронная сеть) могут быть предпочтительнее.
ЧИТАТЬ  Дискриминантный анализ в статистике
Заключение. Формула логистической регрессии, по сути, объединяет линейную комбинацию переменных-предикторов с сигмоидной функцией для получения вероятностей. Наиболее распространенная форма: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] или в логит-форме: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \]. Понимая эти две формы формулы, мы можем строить прогностические модели для различных задач бинарной классификации, интерпретируя влияние переменных через отношение шансов \( e^{\beta} \). Логистическая регрессия остается важной основой в анализе данных, поскольку она проста, эффективна и позволяет проводить интерпретацию — и часто является первым шагом перед попыткой построения более сложных моделей. При желании я могу добавить пример расчета с небольшим объемом данных (таблица) или пример реализации логистической регрессии на Python/R с интерпретацией результатов.

Тинггалкан комментарий