正态性分析

正态性分析

所属分类:描述性分析

这个方法是做什么的

检验一个或多个数值变量是否服从正态分布。它的原假设是「服从正态」,所以 p 小于 0.05 表示拒绝正态,p 大于等于 0.05 表示没有足够证据拒绝——这两句话的差别很关键,见下方「容易误读的地方」。

报告同时给出三种检验(以 Shapiro-Wilk 为主判据)、不随样本量变化的形态指标(偏度与超额峰度及其置信区间),以及直方图、P-P 图与 Q-Q 图。

什么时候用它

  • 决定某个指标该报「均值±标准差」还是「中位数(四分位距)」
  • 做参数方法之前先了解数据的分布形态
  • 论文的方法部分需要交代正态性是怎么判定的

什么时候不要用它

  • 你要检验的其实是回归残差:残差的正态性已经在「线性回归」的第一张卡里给出了,不需要把原始变量单独拿来跑(原始变量正态与否,本来就不是回归的前提)。
  • 变量是分类或等级:正态性对它们没有意义。
  • 样本量非常小:检验几乎检不出任何偏离,「不拒绝正态」是必然结果,这时看图形与偏度峰度比看 p 值有用得多。

容易误读的地方

  • 「p 大于等于 0.05」不能写成「数据服从正态分布」。 所有正态性检验都只能拒绝正态,不能证明正态。p 大只意味着「现有数据不足以否定它」——样本量小的时候,这句话几乎总是成立。规范的表述是「未拒绝正态假设」。
  • 结论几乎由样本量决定。 同一份只是轻微右偏的数据,n = 30 时不显著、n = 3000 时必然显著。所以大样本下的「拒绝正态」往往没有实际意义:真正该看的是偏度和峰度这两个不随样本量变化的量。不少方法学文献认为偏度绝对值小于 2、超额峰度绝对值小于 7 时,参数方法仍然相当稳健。
  • 别用它来决定「能不能用 t 检验 / 方差分析 / 回归」。 这些方法要求的从来不是原始变量正态,而是残差近似正态,或者样本量足够大(中心极限定理)。「先跑正态性检验,不过就改非参数」这个流程本身是反的:它在小样本时因为检不出而放行,在大样本时因为几乎必然显著,把本来完全稳健的情形赶去用效能更低的非参数方法——两头都错。
  • 同时检验多个变量会累积假阳性。 一次拖 5 个变量就是 5 次检验。第四张卡给出 Holm 校正后的判定,以它为准。

需要准备什么数据

  • 数值变量(≥1个):至少 1 个,定量变量(数值)

数据要求

  • 数据表至少 3 行。
  • 单列缺失率不超过 50%。
  • 不接受取值全都一样的列(零方差列没有可分析的变异)。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

报告里有什么

  1. 输出结果一:数据概览与前提检验
  2. 输出结果二:主结果表(正态性检验)
  3. 输出结果三:可视化(直方图 / P-P图 / Q-Q图)
  4. 输出结果四:效应量与事后分析
  5. 输出结果五:结论与解读

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程