统计显著性检验

统计显著性检验

在定量研究中,最常见的问题之一是:数据中观察到的差异或关系是真实存在的,还是仅仅是随机波动造成的巧合?为了回答这个问题,研究人员会使用统计显著性检验。这些检验基于特定的概率框架,有助于确定从样本中获得的结果是否足够可靠,可以推广到总体。虽然术语听起来可能很专业,但基本概念很简单:我们将观察到的结果与假设没有这种效应时的结果进行比较。

定义和目的

统计显著性检验是一种正式的程序,用于评估数据证据是否支持关于总体的陈述(假设)。其主要目的是确定某种效应(例如,两组均值之间的差异、两个变量之间的相关性或某种处理的效果)是否足够大且足够稳定,以至于不太可能是偶然发生的。

实际上,显著性检验并不能“证明”某个理论是正确的,而是衡量数据对特定假设的否定程度。因此,理解统计学本身就存在不确定性至关重要。不存在绝对的确定性,只有数据所支持的置信度。

零假设和备择假设

显著性检验通常基于以下两个陈述:

1. 零假设(H₀):表明不存在差异、关系或影响。例如:“A班的平均成绩与B班相同”,或者“学习时间和考试成绩之间没有关系”。
2. 备择假设(H₁ 或 Hₐ):指出存在差异、关系或影响。例如:“A 班的平均成绩与 B 班不同”,或者“学习时间和考试成绩之间存在关系”。

显著性检验的初始假设是原假设H₀为真。然后,分析数据,判断在H₀为真的情况下,结果是否极其罕见。如果结果非常罕见,我们倾向于拒绝原假设H₀。

p 值(p-value)及其含义

显著性检验的核心概念是p值。简而言之,p值是指在原假设成立的情况下,获得至少与数据中观察到的结果一样极端的结果的概率。

– 如果 p 很小,这意味着当 H₀ 为真时,观察到的结果很少发生,因此我们有理由拒绝 H₀。
– 如果 p 很大,则意味着如果 H₀ 为真,观察到的结果仍然有可能发生,因此我们没有足够的证据拒绝 H₀。

然而,p值经常被误解。p值并非假设H₀为真或为假的概率,也不是效应大小的度量。p值仅仅表明在特定框架下,反对假设H₀的证据强度。

显著性水平(α)

为了做出决策,研究人员会设定一个显著性水平,用 α(alpha)表示。常用的值是 0,05 (5%) 或 0,01 (1%)。规则是:

– 如果 p ≤ α,则称结果具有统计学意义,拒绝原假设 H₀。
– 如果 p > α,则结果不显著,不拒绝 H₀。

选择α值并非纯粹的技术性决定,还要考虑具体情况。例如,在涉及患者安全的医学研究中,研究人员可能会选择更严格的α值(0,01)以降低得出错误结论的风险。

第一类错误和第二类错误

由于统计检验涉及在不确定性下做出决策,因此总是存在出错的可能性:

1. 第一类错误(假阳性):当原假设H₀为真时拒绝原假设H₀。该概率由α控制。
2. 第二类错误(假阴性):当原假设 H₁ 为真时,未能拒绝原假设 H₀。该概率用 β(beta)表示;其倒数称为功效,即 1 − β。

在现实生活中,这两种类型的错误都可能造成严重后果。例如,误认为某种药物有效而实际上无效(第一类错误)可能造成危害,而误认为某种药物无效而实际上有效(第二类错误)则可能导致错失治疗良机。

常见显著性检验类型

显著性检验有很多种,选择哪种取决于检验目的、数据类型以及需要满足的假设。一些最常用的显著性检验包括:

– t检验:比较两组(例如,实验组与对照组)的均值。t检验有独立样本t检验和配对样本t检验两种形式。
– 方差分析:比较两个以上组的平均值(例如,三种学习方法)。
– 卡方检验:检验分类变量之间的关系(例如性别和专业选择)。
– Pearson/Spearman 相关性:检验两个数值变量之间的关系(Pearson 用于正态数据,Spearman 用于有序/非正态数据)。
– 线性/逻辑回归:检验一个或多个预测变量对结果变量的影响。

每项检验都有其假设,例如正态性、方差齐性或数据独立性。违反这些假设会导致误导性的检验结果,因此数据诊断和前提检验至关重要。

统计显著性与实际显著性

对显著性检验的一种批评是,研究人员过于关注结果是否“显著”或“不显著”,而忽略了其实际意义。在大样本的情况下,即使影响微乎其微,微小的差异也可能具有统计学意义。相反,在小样本的情况下,由于统计效力不足,一些实际上非常重要的效应可能无法达到显著水平。

因此,显著性检验应始终伴随以下信息:
– 效应量,例如 Cohen's d、eta 平方或优势比。
– 置信区间用于显示合理的参数值范围。

p 值、效应量和置信区间的结合提供了更完整的图像:不仅是“是否存在效应”,而是“效应有多大,以及我们对该估计有多确定”。

进行显著性检验的一般步骤

一般来说,流程如下:
1. 根据研究问题,制定 H₀ 和 H₁。
2. 确定 α(例如 0,05)。
3. 根据数据类型和研究设计选择合适的检验方法。
4. 检查检验假设(正态性、方差、独立性等)。
5. 计算检验统计量并获得 p 值。
6. 将 p 值与 α 进行比较并得出结论。
7. 完整报告结果,包括效应量和置信区间(如有可能)。

好的报道还应包括背景信息,例如样本特征、测量方法和潜在偏差。

关闭

统计显著性检验是评估数据结果是否可能反映总体状况,还是仅仅是随机波动的结果的重要工具。然而,这些检验并非科学真理的唯一评判标准。必须精确理解p值,并结合效应量、置信区间以及对结果相关性的背景评估。

正确使用显著性检验有助于提高研究的客观性和可追溯性。反之,如果机械地使用而未理解其假设和局限性,则可能导致错误的结论。因此,对概念的理解、深思熟虑的解读和透明的报告是利用显著性检验支持数据驱动决策的关键。

请留言