卡方拟合优度检验
这个方法是做什么的
只看一个分类变量,把它各个类别的实际频数,与某套理论比例下“本该有”的期望频数比一比,差得越离谱卡方值越大。默认按均等比例检验(各类一样多),也可以在“自定义期望比例 (%)”控件里逐个类别填百分比,总和须为 100。它和「卡方检验」的分工要先分清:那边是两个分类变量交叉成列联表、看有没有关联,这边是一个变量对一套外部比例。判断标准很直接——你拖进来的是一列还是两列。
除了整体显著性,报告并列 Pearson χ² 与似然比 G² 两个统计量互为佐证;卡④给 Cohen's w 与 Cramér's V 及其 95% 置信区间,回答“偏离有多大”;同一张卡逐类别给出标准化残差 z、未校正 P 与 Bonferroni 校正 P,回答“是哪几类偏了”;卡①逐类别列出期望频数,并按 Cochran 判据判断卡方的渐近近似是否成立。
需要准备什么数据
- 分析变量 (X):定类变量(分组/标签)
数据要求
- 数据表至少 10 行。
- 单列缺失率不超过 50%。
- 不接受取值全都一样的列(零方差列没有可分析的变异)。
- 「分析变量 (X)」的类别数需在 2~30 之间。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 血型、星座、出生月份的分布是不是均匀的
- 样本的学历或地区构成,与普查公布的比例是否一致(用自定义期望比例)
- 遗传实验的表型比是否符合 9:3:3:1
- 骰子各面、随机数发生器各档的出现频次是否均等
- 抽样得到的样本构成与抽样框是否吻合,用来检查抽样有没有偏
前提是每个观测只落进一个类别、观测之间互相独立,且拖进来的必须是分类列本身(计数由系统统计,类别数上限 30)。理论比例同样必须是外部给定的:从这批数据自己估出来再拿回去检验,检验就失去了意义。
什么时候不要用它
- 关心的是两个分类变量之间有没有关联(渠道 × 是否付费):用「卡方检验」。
- 同一批个体被前后分类了两次(治疗前后是否达标):观测不独立,用「配对卡方检验」。
- 变量只有两个类别:本模块能跑,但「二项式检验」给的是精确 p 与 Clopper-Pearson 区间,小样本下更可靠,还附带率差 / 率比 / 比值比。
- 想检验一个数值变量是否服从正态分布:这不是本模块的事,用「正态性分析」。名字里的“拟合优度”只针对定类计数。
- 期望频数不满足 Cochran 判据(有类别期望 <1,或期望 <5 的类别超过 20%):先把语义相近的低频类别合并再做;合并到只剩两类时改用「二项式检验」。
容易误读的地方
- 默认的“均等比例”不是中性基准,它本身就是一个很强的假设。 血型均等、月份均等、学历均等在现实里几乎都不成立,所以用默认设置跑出来的显著,只说明“不是均分”,通常并不回答你真正想问的问题。若你要检验的是“与全国人口构成一致”,就必须把普查比例填进自定义期望比例;不填而直接引用 p 值,等于换了一个原假设还沿用原来的结论。
- 自由度恒等于类别数减 1,期望比例里含估计参数时它是错的。 卡②的 df 固定为 k−1。如果你的理论比例中有参数是从同一份数据估来的(先估一个比例、一个 λ,再据此算期望频数),正确的自由度还要再减去所估参数的个数,此时报告给出的 p 值会偏大,也就是偏向“拟合得很好”。模块无从知道你的比例是哪来的,这个扣减只能你自己做。
- 卡④的逐类别显著说的是“这一类偏了”,不是“这一类占比高或低”。 标准化残差比的是实际频数与期望频数的距离。样例里占比只有 11.33% 的 AB 型 z=−5.467,是最强的偏离源;占比 32% 的 A 型 z=2.800,偏离反而小得多。拿百分比排序去代替残差排序,是这张表最常见的读错方式。
- 能写进结论的是 Bonferroni 校正后那一列。 逐类别追问“是哪个类别偏了”会做 k 次比较,每多一次就多一分假阳性机会,所以卡④把未校正 P 和校正 P 并排放着。样例里 O 型的未校正 P=0.023 看着显著,校正后 0.094 就不显著了。只引用未校正那一列,等于把 k 次机会当一次用。
- p 大于 0.05 不等于“分布符合理论比例”。 它只说明这批数据不足以推翻你设定的比例。此时 Cohen's w 的 95% 区间下限必然是 0,但这只是单向的:下限为 0 反推不出不显著——区间是等尾的,p 落在 0.025 与 0.05 之间的显著结果,下限同样会是 0。真正该看的是上限:若区间是 [0, 0.28],说明一个中等程度的偏离同样与这批数据相容,离“拟合良好”还很远。要论证“确实符合”,得先定义多大算不符合,那是另一套设计。
检验只能拒绝原假设,不能证明它成立。p = 0.42 既可能是真的没有差别,也可能是样本量不够、差别没被检出来,两者从这个 p 值上分不开。规范的写法是「没有证据表明……」;要论证「两者确实相当」,需要另做等价性检验。
报告里有什么
- 输出结果一: 数据概览与前提检验
- 输出结果二: 卡方拟合优度检验表
- 输出结果三: 拟合度对比图
- 输出结果四: 效应量与事后逐类别分析
- 输出结果五: 结论与学术表述
该图表直观地比较了每个类别的实际观测频数与理论期望频数。