多重对应分析

所属分类:问卷分析

这个方法是做什么的

把两个以上定类变量的全部类别一起投影到同一张低维图上,看哪些类别倾向于在同一批人身上共同出现。它是对应分析在多变量情形下的推广:分析变量区可以放任意多个定类变量,提取维度数在控件里选 2 或 3。除了类别点坐标,它还输出样本坐标——坐标相近的样本拥有更相似的分类变量组合;但这份坐标只印在报告里(且只印前 100 行),没有写回数据集的通道。

MCA 本身不产生显著性,显著性来自它另配的一套检验:卡② 对每一对变量做卡方独立性检验,给 Cramér's V 及其 95%CI,并用 Holm 校正;卡④ 把所有列联格的调整标准化残差排序,定位“关联具体发生在哪些类别组合上”(示例 40 个格子里 Holm 校正后 8 格显著)。惯量这一侧要特别注意口径:MCA 的总惯量恒等于 J/Q−1(类别总数除以变量个数再减 1,示例 2.6667),原始惯量占比会被类别数机械稀释,因此报告同时给出 Benzécri 校正惯量与更保守的 Greenacre 调整解释率。

需要准备什么数据

  • 放入[定类]分析变量:至少 2 个,定类变量(分组/标签)

数据要求

  • 数据表至少 30 行。
  • 单列缺失率不超过 20%。
  • 不接受取值全都一样的列(零方差列没有可分析的变异)。
  • 「放入[定类]分析变量」的类别数需在 2~20 之间。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

什么时候用它

  • 把性别、学历、职业、消费偏好等多道单选题放在一张图上,做人群画像与类型学探索
  • 类别很多、逐对交叉表看不过来时,先用几何图找出成簇的类别组合
  • 需要在图之外拿到统计证据:变量两两是否关联、具体哪些格子超额
  • 需要样本层面的降维坐标,作为后续聚类的输入

前提:所有变量必须是定类(定量变量请先分箱);每个变量 2~20 个类别;每个类别的频数建议不少于 5,低频类别会在几何空间中被推到极远处、主导整个构形;样本量建议不少于 5 倍的类别总数(示例 N=240、J=11,N/J=21.82);缺失按整行删除。卡① 会把这些条件连同“变量之间确有关联”一起逐条实算。

什么时候不要用它

  • 只有两个分类变量:不必用 MCA,用「对应分析」,它给的是行点与列点分离的简单对应图,还有维度惯量分解与似然比检验。
  • 变量是定量的:MCA 只接定类变量,定量变量之间的结构用「主成分分析(PCA)」,要提取潜在构念并做旋转用「因子分析(探索性)」。
  • 只想检验某几个类别组合是否显著超额,不需要几何图:用「列联(交叉)分析」看逐格调整残差,只做一对且需要期望频数证据用「卡方检验」。
  • 要给多维列联表建模、比较不同交互项的拟合:MCA 是描述性的、不做模型比较,用「对数线性模型」。
  • 目的是把受访者分成若干类人群:MCA 只给样本坐标、不给分群标签,而这份坐标没有写回数据集的通道,“先拿坐标再去聚类”在产品里落不了地。可行的走法是回到原始数据:把其中一个本来就有序的定类变量(学历层次、会员等级、满意度)用“数据编码”转成数值列放进「二阶聚类」的定量区,其余定类变量原样放定类区、由它内部做独热编码。实测本篇这份 240 行三定类变量的数据照此跑通、给出 3 个簇;这样只有那一个真有序的变量被 Z-score 处理,其余仍不被强加顺序。

容易误读的地方

  • “前两维只解释了 36.22%”几乎必然是低估,不能直接写进论文。 原始惯量占比被指示矩阵的编码方式机械稀释,示例中经 Greenacre 调整后是 96.10%。两个数相差近三倍,模块卡⑤ 的报告规范提示专门就此提醒:规范做法是同时报告调整解释率。抄错一个,同一张图会被说成“几乎没有解释力”或“近乎完美”。
  • 总惯量不是效应量。 效应量表把 J/Q−1 这一行明确标注为“结构常数,不反映关联强度,不可用作效应量”——它只由类别总数与变量个数决定,换一批数据只要类别数不变它就不变。真正衡量关联强弱的是各变量对的 Cramér's V(示例三对分别为 0.239、0.258、0.273,均属中效应)与 Greenacre 总惯量 Ī(示例 0.1514)。
  • 跨变量的类别点靠得近,不构成关联的证据。 类别点坐标表的表注写明:跨变量的类别点距离不能直接按欧氏距离解读为关联强度。要判断某个类别组合是否真的超额,得回到卡④ 的逐格残差表——示例中偏离最强的是“学历层次=高中及以下 × 消费偏好=潮流型”,观测 12 人、期望 27.60 人,调整残差 −4.542,是显著地少于期望。图上挨得近而残差并不显著的组合非常常见。
  • cos² 之和低于 0.3 的类别,它在图上的位置不能解释。 示例 11 个类别里有 2 个落在这条线以下。同一张表里的贡献率要对着均等基准 1/J(示例 9.09%)看,超过它的类别才是塑造该维度的主力。而且贡献与表征是两回事:示例“消费偏好 = 品质型”对维度2 的贡献高达 30.56%,对维度1 却只有 0.29%——一个点完全可能只在某一个方向上有意义。
  • 前提里最容易被跳过的一条是“变量之间确有关联”。 卡① 用两两卡方来实测它,表注说得很直白:若各变量两两独立,类别点的分布只是随机噪声的几何投影,任何“靠得近所以相关”的解读都不成立。低频类别是同一件事的另一面——频数很小的类别会被推向几何空间的极远处、占据不成比例的惯量,所以卡① 专门实测最小类别频数(示例 42,充足)。这两条不过关时,图画得再漂亮也不能拿去解释。

报告里有什么

  1. 输出结果一:数据概览与前提检验
  2. 输出结果二:主结果表(维度摘要与变量间关联检验)
  3. 输出结果三:可视化(类别点分布图与碎石图)
  4. 输出结果四:效应量与事后分析
  5. 输出结果五:结论与学术表述
多重对应分析类别点分布图
图1 多重对应分析类别点分布图
特征值碎石图(含 1/Q 阈值线)
图2 特征值碎石图(含 1/Q 阈值线)
类别点分布图展示各类别在前两维上的位置;碎石图可用左上角切换器切到柱状图/数据表,虚线为 Benzécri 保留阈值 1/Q。

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程