逻辑回归公式

逻辑回归公式

逻辑回归是统计学和数据科学中最常用的方法之一,用于建模多个自变量(预测变量)与分类因变量(尤其是二元因变量,例如,是/否、成功/失败、生病/健康)之间的关系。与生成连续值的线性回归不同,逻辑回归旨在估计事件发生的概率,因此最终结果介于 0 到 1 之间。本文将讨论逻辑回归公式、各组成部分的含义以及如何解释结果。

为什么需要逻辑回归?

如果我们使用线性回归来预测概率,模型可能会产生小于 0 或大于 1 的值,这显然不符合概率的实际情况。逻辑回归通过使用非线性函数来解决这个问题,该函数将计算结果(可以是任何值)映射到 0 到 1 之间的概率值。最常用的函数是逻辑函数或 Sigmoid 函数。

例如,假设我们想根据客户的年龄、订阅时长和使用频率来预测其是否会流失。预测结果只有两种可能:流失 (1) 或不流失 (0)。逻辑回归非常适合这种情况。

逻辑回归的基本公式

逻辑回归的本质是,在给定预测变量 \( X \) 的值的情况下,对 \( Y = 1 \)(事件发生)的概率 \( p \) 进行建模。

逻辑回归模型通常以两种重要形式表示:

1)概率形式(S型曲线)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

dengan

\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

凯特兰甘(Keterangan):
– \( p \) 是事件发生的概率(例如:流失 = 1)。
– \( e \) 是欧拉数(约等于 2,71828)。
– \( z \) 是预测变量的线性组合。
– \( \beta_0 \) 是截距(常数)。
– \( \beta_1, \beta_2, \ldots, \beta_k \) 是回归系数。
– \( X_1, X_2, \ldots, X_k \) 是独立变量。

  统计学在国际关系中的重要性

sigmoid 函数保证无论 \( z \) 的值如何,\( p \) 的值都保持在 0 到 1 之间。

2) Logit 形式(对数比值)

另一种非常重要的形式是logit形式,即赔率的对数:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

凯特兰甘(Keterangan):
– \( \frac{p}{1-p} \) 称为赔率(相对机会)。
– \( \ln \) 是自然对数。

逻辑回归模型中的logit形式解释了逻辑回归实际上是将对数比值建模为预测变量的线性函数。这使得系数的解释更加清晰,尤其是在比值比的背景下。

理解赔率和赔率比

为了真正理解逻辑回归公式,我们需要区分概率和比值。

– 概率 \( p \): 事件发生的机会(0 到 1)。
赔率:某事发生的概率与某事不发生的概率的比较:

\[
赔率 = p/(1-p)
\]

例如:如果 \( p = 0{,}8 \),则:

\[
赔率 = 0.8 / 0.2 = 4
\]

这意味着该事件发生的可能性是不发生的4倍。

在逻辑回归中,系数 \( \beta \) 通常通过优势比来解释:

\[
\text{OR} = e^{\beta}
\]

– 如果 \( \beta > 0 \),则 \( e^{\beta} > 1 \):预测因子增加了事件发生的几率。
– 如果 \( \beta < 0 \),则 \( e^{\beta} < 1 \):预测变量会降低事件发生的概率。– 如果 \( \beta = 0 \),则 \( e^{\beta} = 1 \):预测变量对事件发生的概率没有影响。例如,如果 \( \beta_1 = 0,7 \),则:\[ e^{0,7} \approx 2,01 \] 这意味着 \( X_1 \) 每增加 1 个单位,事件发生的概率大约会增加 2.01 倍(假设其他变量保持不变)。简单逻辑回归模型示例:假设我们只有一个预测变量 \( X \),例如每周学习的小时数,用于预测考试是否通过(通过 = 1,不通过 = 0)。模型如下:

  推断统计学中的t检验
\[ \text{logit}(p) = \beta_0 + \beta_1 X \] 如果估计结果为: - \( \beta_0 = -4 \) - \( \beta_1 = 0,8 \) 则:\[ z = -4 + 0,8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0,8X)}} = \frac{1}{1 + e^{4 - 0,8X}} \] 如果 \( X = 6 \) 小时的学习时间:\[ z = -4 + 0,8(6) = 0,8 \] \[ p = \frac{1}{1 + e^{-0,8}} \approx 0,69 \] 解释:每周学习 6 小时,概率通过率约为 69%。系数估计:为什么不使用最小二乘法?在线性回归中,系数通常使用最小二乘法计算。然而,在逻辑回归中,预测变量和概率之间的关系是非线性的,因此最小二乘法并不理想。逻辑回归通常使用最大似然估计 (MLE) 来找到使观测数据似然性最大化的系数 β。总之,二元观测值 \( y_i \in \{0,1\} \) 和预测值 \( p_i \) 的似然函数为:\[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] 为了便于计算,通常会将其转换为对数似然函数:\[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] \( \beta \) 的值通过最大化 \( \ell(\beta) \) 来选择。统计软件通常使用牛顿-拉夫逊法或梯度下降法等数值方法。逻辑回归的优点和局限性 优点:1. 结果以概率形式呈现,易于转化为决策。2. 通过优势比可以清晰地解释系数的含义。3. 适用于二分类问题,并且可以扩展到多项/有序分类问题。局限性:1. 假设预测变量与对数优势比之间存在线性关系,而非直接与概率相关。2. 如果存在多重共线性或数据高度不平衡,则可能出现问题。3. 对于非常复杂的关系模式,其他非线性方法(例如随机森林或神经网络)可能更优。
  什么是多元统计学?
结论:逻辑回归公式本质上是将预测变量的线性组合与 sigmoid 函数相结合,从而生成概率。最常见的形式是:\[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] 或 logit 形式:\[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] 通过理解这两种形式的公式,我们可以构建各种二元分类问题的预测模型,并通过优势比 \( e^{\beta} \) 来解释变量的影响。逻辑回归仍然是数据分析的重要基础,因为它简单、强大且易于解释,并且通常是尝试构建更复杂模型的第一步。如果您需要,我可以添加一个包含少量数据(表格)的示例计算,或者一个用 Python/R 实现的逻辑回归示例以及对输出结果的解释。

请留言