缺失模式分析表
这个方法是做什么的
回答“缺失长什么样”:每个变量缺了多少、整份数据一共出现过几种缺失组合、每种组合各占多少人、哪些变量倾向于一起缺。模式用 0/1 编码列出,1 表示该位置缺失,位序与变量清单一一对应;另有一张按“每行缺几个变量”统计的分布表,缺 0 个的那一行就是完整案例。它只做诊断,一个缺失格也不会填。
除了枚举模式,它给两样直接影响下一步决策的判断依据。一是缺失结构是“单调”还是“任意”,这决定了能用哪一类插补方法;二是 MCAR 的必要条件检验——对每一对“某变量是否缺失 × 另一变量的取值”做 Welch t 检验,只要有一对显著,完全随机缺失就被证伪。卡④ 本该放效应量的位置换成了共缺失关联强度,用 φ 系数与 Jaccard 指数衡量两个变量的缺失有多同步。
需要准备什么数据
- 放入分析变量:至少 1 个
数据要求
- 数据表至少 5 行。
- 本方法允许所选变量含缺失值——缺失本身就是分析对象的一部分,不会因为「完整记录不够」被拦下。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 在决定“整行删掉”还是“插补”之前,这是必须先跑的一步
- 缺失率不低(超过 10%)时,判断完整案例分析会不会把结论带偏
- 怀疑某几个变量来自同一个采集环节(同一页问卷、同一台仪器、同一批未采集),看它们是不是成组地一起缺
- 论文要交代各变量缺失率、缺失处理方式与机制判断依据
至少放 1 个变量,不限定量还是定类。但卡① 的 MCAR 必要条件检验需要至少 2 个定量变量才能执行,只放定类变量时那一行会写“未做该检验”,报告不会对机制下任何判断。变量越多可识别的模式越丰富,但模式最多有 2 的 k 次方种,一次分析建议不超过 10 个变量,否则表格会被极稀疏的模式淹没;整列全缺失的变量无法被任何方法插补,应先剔除。
什么时候不要用它
- 已经确定要把缺失填上:单一插补用「均值估计/回归插补」,后续要做统计推断则用「多重插补」;本模块只诊断,不产出填好的数据。
- 只想知道每列缺了多少、完整记录还剩几行:这些在「数据概览」的完整率与逐列缺失里已经有了,不必为此跑模式分析。
- 想要 Little's MCAR 整体检验:本模块不实现它,只给必要条件的逐对检验,两者不等价,论文里必须按实际所用方法写。要在机制判断之后继续往前走,把变量交给「多重插补」——它在 MAR 假设下给出计入缺失不确定性的合并估计,并用缺失信息比量化有多少信息来自插补。
- 想看缺失是否与某个分类变量有关(比如男性更容易漏答收入):本模块的逐对检验只针对定量变量的取值,做不了这件事;需要另外构造一列“是否缺失”的 0/1 标记,再用「列联(交叉)分析」或「卡方检验」去交叉。
- 缺失出现在分类变量上且打算填补:产品里的两个插补模块都只接受定量列。定类变量的缺失通常是把“缺失”本身当作一个类别参与分析,再用「频数分析」看它占多少、用「列联(交叉)分析」看它是否与别的变量相关。
容易误读的地方
- “未证伪 MCAR”不等于“数据是 MCAR”。 检验的方向是单向的,但别读成“一对显著就定案”:这 8 对逐对检验互不校正,真 MCAR 下至少一对撞上 α=0.05 的概率约三分之一。示例里 8 对中有 3 对显著,这个数量不容易由偶然产生,据此说 MCAR 被证伪是站得住的——结论挂在“3/8”上,不是挂在“至少一对”上;全部不显著却只说明“没找到证据”,很可能只是样本量不够。更要紧的是这个检验的覆盖面——它只看得到定量变量之间的关系,缺失若与一个没放进来的分类变量有关,它一点也看不到。所以论文里不能把这一行写成“经检验数据满足 MCAR”。
- MAR 与 MNAR 在原理上分不出来,任何模块都分不出来。 高收入者更倾向于拒答收入,缺失取决于那个没被观测到的值本身,这是 MNAR;它在已观测数据上留下的痕迹可以和 MAR 完全一样。所以卡① 最多把你从“不是 MCAR”推到“至少按 MAR 处理”,剩下那一步只能靠对采集过程的了解。怀疑 MNAR 时,插补结果一律要配敏感性分析,不能只报一个数。
- “单调 / 任意”说的是缺失位置的形状,“MCAR / MAR / MNAR”说的是缺失产生的原因,两组词毫不相干。 单调是指把变量按缺失率排好序后,某条记录一旦在某个变量上缺失,其后所有变量也都缺失;任意就是不满足这个形状。示例判定为“任意”,紧跟的说明写的是需要能处理任意结构的链式方程插补。看到“任意”就以为是“随机缺失”,是这张表最常见的误读。
- 共缺失那一列写“—”是因为无定义,不是“两者无关”。 φ 系数算的是两个“是否缺失”指示变量的相关,只要其中一个变量从不缺失(示例里“年龄”缺失率 0%),2×2 表就退化、φ 没有定义,表里如实写“不可估计”,同一行的 Jaccard 记作 0.0。示例 6 对里有 3 对属于这种情况,表注也写明了“可估计的变量对 3/6”。把这三个 0 读成“缺失彼此独立”,会把结论算反。
- 强共缺失不只是线索,它直接决定插补模型能不能成立。 示例里“家庭月收入 × 周加班时长”φ=0.825、Jaccard=0.733,同时缺失 33 例——这种同步通常来自同一处跳答、同一台设备或同一批未采集。关键后果是:这两个变量在缺失的那些行上彼此都没有值,谁也没法替对方提供预测信息。所以做「多重插补」时必须再拉进第三个、在这些行上仍有取值的变量,否则它们只会被填回各自均值附近,多重插补相对单一插补的优势会大幅缩水。
- 模式占比的分母是全部样本,容易让人低估缺失的影响。 示例中“无缺失”这一行占 72.50%,看着很安心;真正要读的是它的补数——27.5%、共 55 条记录至少缺了 1 格,整行删除就会全部丢掉。累计占比那一列同理,它告诉你少数几种模式覆盖了多少人,而不是“问题不大”。
4 组要做 6 次两两检验,每次 5% 的假阳性概率累积到 26.5%。方差分析先用一次整体检验把这个概率压回 5%,显著之后再做自带校正的事后比较——绕开整体检验直接两两比,等于把这笔账藏了起来。
报告里有什么
- 输出结果一:数据概览与缺失总览
- 输出结果二:缺失模式三线表
- 输出结果三:可视化(缺失率 / 模式频数 / 缺失热力图)
- 输出结果四:缺失占比与共缺失关联强度
- 输出结果五:结论与插补建议
三张图分别回答:哪个变量缺得最多、哪种模式最常见、各模式具体缺了哪些变量。