逻辑回归公式
逻辑回归是统计学和数据科学中最常用的方法之一,用于建模多个自变量(预测变量)与分类因变量(尤其是二元因变量,例如,是/否、成功/失败、生病/健康)之间的关系。与生成连续值的线性回归不同,逻辑回归旨在估计事件发生的概率,因此最终结果介于 0 到 1 之间。本文将讨论逻辑回归公式、各组成部分的含义以及如何解释结果。
为什么需要逻辑回归?
如果我们使用线性回归来预测概率,模型可能会产生小于 0 或大于 1 的值,这显然不符合概率的实际情况。逻辑回归通过使用非线性函数来解决这个问题,该函数将计算结果(可以是任何值)映射到 0 到 1 之间的概率值。最常用的函数是逻辑函数或 Sigmoid 函数。
例如,假设我们想根据客户的年龄、订阅时长和使用频率来预测其是否会流失。预测结果只有两种可能:流失 (1) 或不流失 (0)。逻辑回归非常适合这种情况。
逻辑回归的基本公式
逻辑回归的本质是,在给定预测变量 \( X \) 的值的情况下,对 \( Y = 1 \)(事件发生)的概率 \( p \) 进行建模。
逻辑回归模型通常以两种重要形式表示:
1)概率形式(S型曲线)
\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]
dengan
\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
凯特兰甘(Keterangan):
– \( p \) 是事件发生的概率(例如:流失 = 1)。
– \( e \) 是欧拉数(约等于 2,71828)。
– \( z \) 是预测变量的线性组合。
– \( \beta_0 \) 是截距(常数)。
– \( \beta_1, \beta_2, \ldots, \beta_k \) 是回归系数。
– \( X_1, X_2, \ldots, X_k \) 是独立变量。
sigmoid 函数保证无论 \( z \) 的值如何,\( p \) 的值都保持在 0 到 1 之间。
2) Logit 形式(对数比值)
另一种非常重要的形式是logit形式,即赔率的对数:
\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
凯特兰甘(Keterangan):
– \( \frac{p}{1-p} \) 称为赔率(相对机会)。
– \( \ln \) 是自然对数。
逻辑回归模型中的logit形式解释了逻辑回归实际上是将对数比值建模为预测变量的线性函数。这使得系数的解释更加清晰,尤其是在比值比的背景下。
理解赔率和赔率比
为了真正理解逻辑回归公式,我们需要区分概率和比值。
– 概率 \( p \): 事件发生的机会(0 到 1)。
赔率:某事发生的概率与某事不发生的概率的比较:
\[
赔率 = p/(1-p)
\]
例如:如果 \( p = 0{,}8 \),则:
\[
赔率 = 0.8 / 0.2 = 4
\]
这意味着该事件发生的可能性是不发生的4倍。
在逻辑回归中,系数 \( \beta \) 通常通过优势比来解释:
\[
\text{OR} = e^{\beta}
\]
– 如果 \( \beta > 0 \),则 \( e^{\beta} > 1 \):预测因子增加了事件发生的几率。
– 如果 \( \beta < 0 \),则 \( e^{\beta} < 1 \):预测变量会降低事件发生的概率。– 如果 \( \beta = 0 \),则 \( e^{\beta} = 1 \):预测变量对事件发生的概率没有影响。例如,如果 \( \beta_1 = 0,7 \),则:\[ e^{0,7} \approx 2,01 \] 这意味着 \( X_1 \) 每增加 1 个单位,事件发生的概率大约会增加 2.01 倍(假设其他变量保持不变)。简单逻辑回归模型示例:假设我们只有一个预测变量 \( X \),例如每周学习的小时数,用于预测考试是否通过(通过 = 1,不通过 = 0)。模型如下: