交叉分析【多选&单选】
这个方法是做什么的
把一道多选题的各个选项,同时与若干个单选题(分组变量)交叉。多选项至少 2 列且必须是 0/1 编码,单选变量可以放多个——这是它与「交叉分析【单选&多选】」最主要的分工差别,后者的单选区只收 1 个。统计做法相同:不对整张共现表做一次卡方,而是把每个“多选项 × 单选变量”的组合还原成“未选/已选 × 各类别”的 2×C 列联表逐项检验,每位受访者在每张表里恰好计入一次。
它的交叉表按单选变量分张呈现,单元格是“频数(行百分比)”,行百分比的分母是“选中该多选项的总人数”,因此读出来的是构成比:选了这一项的人当中,各类人群各占多少。主结果表给 χ²、df、p 与 Holm 校正 p,族系按同一个单选变量内的全部多选项划分;2×2 表施加 Yates 连续性校正,期望频数不足时自动改用 Fisher 精确检验。卡④ 给 Cramér's V 及其置信区间、Bergsma 偏倚校正 V,2 类分组变量另给优势比 OR 并强制标注参照类别,以及对整体显著的表做逐格残差定位。
需要准备什么数据
- 多选题(字段):至少 2 个,定类变量(分组/标签)
- 单选题(字段):至少 1 个,定类变量(分组/标签)
数据要求
- 数据表至少 30 行。
- 单列缺失率不超过 20%。
- 不接受取值全都一样的列(零方差列没有可分析的变异)。
- 「单选题(字段)」的类别数需在 2~20 之间。
- 「多选题(字段)」必须正好是 2 个类别。
- 「单选题(字段)」的每一组至少 5 个样本。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 一道多选题需要同时按性别、年龄段、会员等级等多个变量拆开看
- 问卷报告里“选择这一因素的人群是什么构成”这类描述(分母是选中该项的人数)
- 需要在一份报告里同时拿到多张交叉表、逐项检验、效应量与逐格残差
- 分组变量的类别数不止 2 类(示例的“会员等级”是 3 类,走 2×3 表、不加连续性校正)
前提:多选列必须恰为 0/1,且每列都要既有人选中又有人未选中;单选变量须为定类,2~20 个类别、每类建议至少 5 个观测;同一列不能同时放进两个区;数据表至少 30 行。单选变量的类别过多会让期望频数普遍偏低,应先归并低频类别再进来。
什么时候不要用它
- 只有一个分组变量、而且你想要的是“这类人里有多少人选了它”(选择率而非构成比):用「交叉分析【单选&多选】」,它的交叉表给列百分比,卡③ 还多一张“已选”格的残差热力图。
- 两边都是多选题:本模块的单选区只接定类单选变量,两组多选题的关联用「交叉分析【多选&多选】」。
- 两边都是单选题:一张列联表就装得下全部信息,用不着拆成多张 2×C 表——一个分组变量对多道单选题批量扫描用「列联(交叉)分析」,单独一对并需要 Cohen's w 这类效应量用「卡方检验」。
- 不涉及任何分组,只想看这道多选题自身:用「多选分析」,它给两种比率、Cochran's Q 主检验与选项间的 McNemar 两两比较。
- 想在控制第三个变量之后再看关联(例如扣掉会员等级的影响再看性别):本模块逐项独立建表、不做分层,用「分层卡方分析」。
容易误读的地方
- 交叉表里的百分比是行百分比,分母是“选中该多选项的人数”,不是那一类人的人数。 示例“性别”表中 66(60.55%) 的含义是:选了“购买考虑-价格实惠”的 109 人里有 60.55% 是女性。同一列(同一个多选项)上下相加恰为 100%,同一行左右相加则没有意义。这与「交叉分析【单选&多选】」的口径正好互为转置,两个模块的表长得很像,读之前先看表注。
- 构成比看起来均匀,不是“无关联”的证据。 示例“会员等级”那张表三列都落在 33% 上下,原因是三个等级的人数本就接近——即使完全独立,行百分比也会自然趋近各等级的人数占比。反过来,一个 90% 集中在某一类的分组变量,会让所有多选项的行百分比都偏向那一类,看着“关联很强”其实只是人数构成使然。有没有关联要看卡② 的检验(示例中“会员等级”四项 Holm 校正后 p 全是 1.000),不能看百分比像不像。
- 报告里有两个样本量口径并存,表注专门解释过一次。 多选题的描述统计(总响应次数、普及率、人均勾选数)以全部数据行为分母;而独立性检验只能用单选变量非缺失的行。示例数据无缺失,两者都是 200,看不出差别;一旦单选变量有缺失,卡① 的“选中人数”就会大于交叉表里的对应合计。表注原话是“两者不一致是缺失剔除所致,不是计算错误”。
- OR 必须连同括号里的参照类别一起誊写。 示例“购买考虑-价格实惠”ד性别”给的是 OR = 2.573(“女”相对“男”,后者为参照类别)。表注说明参照类别取该表保留下来的类别顺序中的第二个,与交叉表的行序一致——也就是由数据里的类别排列决定,不是由你拖入的先后决定。不标参照类别时 OR=2 与 OR=0.5 无从区分,抄走一半就会把方向说反。
- Holm 校正是按单选变量分族做的,不是按检验总数一次做完。 示例共 8 次检验,分成“性别”下 4 项与“会员等级”下 4 项两个族系,每族各按 4 次校正。所以放进更多单选变量并不会让已有变量的判定变严。写论文时必须交代族系是怎么划分的,否则读者会按 8 次去核对校正后的 p 而对不上。
报告里有什么
- 输出结果一:数据概览与前提检验
- 输出结果二:交叉列联表与独立性检验(主结果表)
- 输出结果三:交叉汇总图
- 输出结果四:效应量与事后分析
- 输出结果五:结论与学术表述
可通过图表上方的下拉框切换分析指标(行百分比/列百分比/频数)与图表类型;也可用右上角的视图切换器在柱状图、条形图、折线图、雷达图与表格之间切换。