卡方检验

卡方检验

所属分类:差异性分析

这个方法是做什么的

用来看两个分类变量之间有没有关联。做法是把它们交叉成一张列联表,比较每一格的实际人数,和「假如两个变量毫无关系时本该有的人数」(期望频数)差多少。差得越离谱,卡方值越大。

它回答的是「有没有关联」。关联有多强、来自哪一格,是另外两个问题,分别由关联强度指标和逐格残差回答。

什么时候用它

  • 吸烟与否 × 疾病严重程度
  • 用户来源渠道 × 是否付费
  • 学历分组 × 满意度等级
  • 问卷里两道选择题之间的交叉分析

要求每个观测只落进一个格子,且不同观测互相独立。

什么时候不要用它

  • 同一批人被测了两次(治疗前后是否达标、改版前后是否点击):这是配对的分类数据,独立性前提不成立,应改用「配对卡方检验」(McNemar)。
  • 期望频数太小:2×2 表要求所有格的期望频数不低于 5;更大的表要求所有格不低于 1,且期望频数小于 5 的格子占比不超过 20%。不满足时看「Fisher精确检验」或「Yates校正卡方检验」,或者先把语义相近的低频类别合并成一类。
  • 表格里填的是均值、金额或比例,而不是人数、次数。卡方检验的输入必须是计数。
  • 想检验一个分类变量的分布是否符合某个理论比例(不是两个变量的关联):用「卡方拟合优度检验」。

容易误读的地方

  • 卡方值的大小不能当关联强度用。 同样的百分比结构,样本量翻十倍,卡方值大致也翻十倍,p 值随之变小,但两个变量的关联一点没变强。要说「关联有多强」,只能用第四张卡的 Cramér's V(2×2 表还有 φ 与优势比),这些指标不随样本量放大。
  • 显著只说明「不独立」,没告诉你问题出在哪一格。 一张 3×2 表显著,很可能只是其中一格严重偏离。定位差异来源要看第四张卡的逐格调整后标准化残差:正残差表示这一格的实际人数明显多于独立情况下的期望,负残差反之,且那里的 p 已做过 Bonferroni 校正。常见的错误是直接指着列百分比最高的那一格说「就是它导致了关联」——百分比高低和「偏离期望」完全是两回事。
  • 期望频数的条件是对期望频数说的,不是对实际频数。 某一格实际只有 2 个人并不一定违规,要看那一格的期望是多少;反过来,实际人数不算少但期望很小的情况也存在。第一张卡逐格给出期望频数,直接照着核对即可。
  • 关联不等于因果,也不指示方向。 「吸烟状况与疾病严重程度显著关联」在统计上只意味着这两列不独立:既不能推出吸烟导致疾病,也不能排除年龄、职业之类的第三变量同时影响了两者。

需要准备什么数据

  • 放入分组 [定类] 变量X:定类变量(分组/标签)
  • 放入 [定类] 变量Y:至少 1 个,定类变量(分组/标签)

数据要求

  • 数据表至少 20 行。
  • 单列缺失率不超过 30%。
  • 不接受取值全都一样的列(零方差列没有可分析的变异)。
  • 「放入分组 [定类] 变量X」的类别数需在 2~15 之间。
  • 「放入 [定类] 变量Y」的类别数需在 2~15 之间。
  • 「放入分组 [定类] 变量X」的每一组至少 5 个样本。
  • 「放入 [定类] 变量Y」的每一组至少 5 个样本。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

报告里有什么

  1. 输出结果一:数据概览与前提检验
  2. 输出结果二:卡方检验交叉表与主结果
  3. 输出结果三:交叉分析可视化
  4. 输出结果四:效应量与事后分析
  5. 输出结果五:结论与学术表述

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程