卡方检验(独立性)功效

所属分类:功效分析

这个方法是做什么的

回答“要检出两个分类变量之间的关联,列联表总共需要多少例”,以及“现有这张表,检出这种强度关联的把握有多大”。拖入行变量与列变量各 1 个(各自 2~20 个类别),控件里只填显著性水平 α(默认 0.05)。效应量是卡方族专用的 Cohen's w = √(χ²/N),由观测列联表的 χ² 反推;Cohen 惯例是 0.1 小、0.3 中、0.5 大,2×2 表时 w 就等于 φ 系数。

卡① 先核查卡方近似能不能用:列联表规模、自由度 df =(行数−1)×(列数−1)、总样本量、期望频数(由 scipy 的 chi2_contingency 实算,不做连续性校正)、最小期望频数,以及 Cochran 规则的达标情况(期望频数 < 5 的格子不超过 20%,且没有 < 1 的格子)。卡② 给 χ²、df、观测 w、事后功效和达到 80% / 90% 功效所需的总样本量。卡③ 是功效随 N 变化的曲线。卡④ 给 MDES(Cohen's w)、α 取 0.01 / 0.05 / 0.10 三档的功效对照与达标样本量。卡⑤ 是论文表述模板。引擎是 scipy 的非中心卡方 ncx2,非中心参数 λ = w²·N,df 在外推时保持不变。

需要准备什么数据

  • 放入[定类]行变量:1 个,定类变量(分组/标签)
  • 放入[定类]列变量:1 个,定类变量(分组/标签)

数据要求

  • 数据表至少 10 行。
  • 单列缺失率不超过 30%。
  • 「放入[定类]行变量」的类别数需在 2~20 之间。
  • 「放入[定类]列变量」的类别数需在 2~20 之间。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

什么时候用它

  • 问卷调查设计阶段,估算“要检出学历与岗位类别之间的关联,得发多少份”
  • 已有一张列联表,想知道现有样本能检出多弱的关联
  • 类别太细、期望频数偏小,想比较“归并类别”和“再加样本”哪个更划算
  • 因为同时检验了多张列联表、α 要收紧,先看效能损失
  • 投稿需要在方法部分写明关联强度口径与达标样本量

前提是每个观测只落进一个格子(行、列变量都是互斥的分类),且卡方近似成立。后一条卡① 会逐项核对:期望频数、Cochran 规则、边缘分布有没有空类别。类别数越多,格子数按乘法涨,期望频数被摊薄,近似质量与效能会一起掉。

什么时候不要用它

  • 只有一个分类变量、比的是它与某组理论比例的吻合程度:那是拟合优度问题,用「卡方拟合优度检验」。产品没有它的功效模块,本模块的 df 口径(行列交叉)在那里不适用。
  • 2×2 表且期望频数达不到 Cochran 规则:卡方近似失效,反推出来的 w 与功效都不可信,检验应改用「Fisher精确检验」。产品没有精确功效模块,此时只能报告样本量不足以支撑近似,不要照抄本模块的数。
  • 2×2 表且真正关心的是两组事件率之差:用「两比例(率差)功效」。它给 Cohen's h、率差及其置信区间、可检出的 p₂ 范围和分配比方案,比一个笼统的 w 好落地得多。
  • 同一批对象在前后两个时点各分一次类:那是配对的分类数据,用「配对卡方检验」。产品没有它的功效模块,按独立列联表算会低估所需样本量。
  • 需要按第三个变量分层后再看关联:用「分层卡方分析」;本模块只处理单张二维表。
  • 只想知道两个变量是否独立:那是「卡方检验」的事,本模块不输出 p 值,卡① 的结论文案专门声明了这一点。

容易误读的地方

  • 在这个模块里,事后功效几乎就是观测 χ² 的另一种写法。 非中心参数 λ = w²·N,而 w = √(χ²/N),两式一乘,λ 恰好等于本次算出来的 χ² = 13.9598。也就是说卡② 的功效是把这次的 χ² 原封不动当非中心参数代进去的结果——它和卡方检验的 p 值由同一个数唯一决定,一一对应,不含任何新信息。“不显著是不是样本量不够”这个问题,用事后功效回答就是循环论证;该看的是卡④ 的 MDES。
  • 期望频数不达标时,整条链一起失真。 卡① 的 Cochran 规则不是走过场:期望频数偏小时 χ² 会系统性偏大,反推的 w 跟着偏大,卡② 的事后功效偏高、达标样本量偏小,卡④ 的 MDES 也偏乐观。本例 E_min = 15.900、< 5 的格子占 0.0%,所以后面的结论可用;换一张稀疏表就不是这样了。
  • 归并低频类别常常比加样本更划算。 卡④ 的结论文案原话是:MDES 依赖自由度,归并低频类别会同时降低 df 并抬高期望频数,往往能在不加样本的前提下改善效能与近似质量。本例 3×3 表 df = 4,若在专业上说得通、并成 2×2,df 降到 1,同样的 N 与 w 下功效明显更高。代价是丢掉类别层面的分辨力,所以归并必须先在专业上站得住,不能为了凑功效而合。
  • 卡② 的达标样本量假定“扩样以后行列比例结构不变”。 表注与卡③ 都写明了这一点。现实中再招一批人,学历或岗位的构成常常跟着变,df 虽然不变,期望频数的分布变了,实际效能就会偏离这条曲线。按本模块规划抽样时,最好同时约束各层的配额。
  • w 由本次数据反推,不能拿来规划本次数据。 设计阶段该代入的 w 来自文献或专业判断,而文献多半报的是 Cramér's V 或 φ:换算关系是 w = V × √(min(行数, 列数) − 1),2×2 时 w = V = φ。本模块的卡④ 没有其他四个功效模块那样的“观测效应量 ×0.5 / ×0.75”情景表,要做保守规划只能自己折算,卡② 给了比例关系——所需样本量与 w² 成反比,关联强度减半,样本量约变 4 倍。

报告里有什么

  1. 输出结果一:数据概览与前提检验
  2. 输出结果二:功效与所需样本量
  3. 输出结果三:功效曲线
  4. 输出结果四:敏感性分析(MDES / α 敏感性 / 达标样本量)
  5. 输出结果五:结论与样本量报告表述
功效曲线(功效 vs 总样本量 N)
图1 功效曲线(功效 vs 总样本量 N)
曲线为检验功效随总样本量 N 的变化,橙色虚线为目标功效参考线;可切换为表视图查看逐点采样值。

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程