协方差分析
这个方法是做什么的
在比较各组均值之前,先扣掉一个或多个定量协变量的线性影响,再看组间还剩不剩差别。因变量 1 个,分组变量至少 1 个定类变量,协变量至少 1 个定量变量——协变量是必填的,这正是它区别于普通方差分析的地方。
除了“扣除协变量后组间是否仍有差异”的 F 检验,报告还给出协变量校正后的边际均值(EMMeans)及其置信区间与校正量、各效应的偏 η² 与偏 ω²,以及一张前提检验表:回归斜率同质性(主效应模型 vs 含“分组×协变量”交互模型的嵌套 F 检验)、方差齐性、残差正态性、协变量与因变量的 Pearson 相关。
需要准备什么数据
- 放入 [定量] 因变量:定量变量(数值)
- 放入 [定类] 分组变量:至少 1 个,定类变量(分组/标签)
- 放入 [定量] 协变量:至少 1 个,定量变量(数值)
数据要求
- 数据表至少 15 行。
- 单列缺失率不超过 20%。
- 不接受取值全都一样的列(零方差列没有可分析的变异)。
- 「放入 [定类] 分组变量」的类别数需在 2~20 之间。
- 「放入 [定类] 分组变量」的每一组至少 3 个样本。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 比较几种治疗方案的疗效,同时扣掉基线评分或年龄的影响
- 非随机分组的准实验:两组本来在某个定量指标上就不齐,拉平后再比
- 比较不同教法的后测成绩,控制前测成绩
- 需要报告“若各组协变量水平相同,各组的期望值分别是多少”
两条前提最要紧:协变量必须在处理之前测得、不受处理影响;协变量与因变量近似线性相关。各组回归斜率是否相同,由卡①的嵌套 F 检验直接判定。
什么时候不要用它
- 没有定量协变量可放:协变量区必填。一个因子用「单因素方差分析」,两个因子用「双因素方差分析」,更多因子用「多因素方差分析」。
- 想看的是两个分组变量之间的交互:这里的“是否分析交互效应”开关加进模型的是“分组×协变量”交互项,不是分组×分组。要检验因子之间的交互,用「双因素方差分析」或「三因素方差分析」,把协变量放进它们各自的协变量区。
- 要控制的是定类变量(性别、地区):协变量区只收定量变量,把它当第二个因子放进「双因素方差分析」。
- 协变量在处理之后测得、可能已被处理改变(如依从性):那是中介不是混杂,用「平行中介效应」或「链式中介效应」。
- 因变量不止一个:用「多变量方差分析」,它同样能放协变量。
- 同一批对象被重复测量:用「重复测量方差分析」。若同时还想扣掉基线等协变量的影响,那个模块也做不了,别在两边来回试,直接用「混合模型」。
容易误读的地方
- 协变量不是“控制变量”的同义词,它必须在处理之前测得。 若协变量本身受处理影响——例如拿“治疗依从性”去校正“治疗方案”的效应——校正会把真实处理效应的一部分一并扣掉,效应被系统性低估。麻烦在于这条前提在数据里查不出来:前提表把它和“观测独立”一样标为“不可统计检验”,只能靠研究设计判断。
- 回归斜率同质性检验 p ≥ 0.05,不等于各组斜率相同。 它的原假设是“前提成立”,不显著只说明这批数据没能推翻它,样本量小时尤其容易不显著。而这条前提一旦真不成立,“校正后的组间差异”就不再是一个数——组间差会随协变量取值而变,你在协变量均值处算出的那个差值只对那一点成立。检验被拒绝时报告给的建议是改做简单斜率分析或 Johnson-Neyman 区间,而不是照旧报主效应。
- 该写进结论的是校正后边际均值,不是卡①的原始均值。 卡①表注写明那是“未经协变量校正”的原始值,卡④才给校正后边际均值及其置信区间,还专列一列“校正量”让你看两套数差多少。拿卡①的均值配卡②的 p 值写结论是常见错误——p 来自校正后的模型,均值却没校正,两个数不是一套口径。
- 卡①只用 Pearson 相关判断协变量有没有校正价值,查的是线性关系。 ANCOVA 扣掉的也确实只有线性那部分。协变量与因变量呈明显曲线关系时,相关系数可能接近 0、被判为无校正价值,真实的混淆却一点没被处理;反过来相关很弱还硬塞进模型,只白白消耗一个误差自由度。
- 偏 η² 不能当成变异分解比例加起来读。 表注写明偏 η² = SS效应/(SS效应+SS误差),分母只含“本效应 + 误差”,同一模型里各效应的偏 η² 之和完全可能超过 1。它回答“扣除其他效应后这个效应解释了多少”,不是“这个因子占总变异的百分之几”。
检验只能拒绝原假设,不能证明它成立。p = 0.42 既可能是真的没有差别,也可能是样本量不够、差别没被检出来,两者从这个 p 值上分不开。规范的写法是「没有证据表明……」;要论证「两者确实相当」,需要另做等价性检验。
两条线平行时,B 的效果在 A 的两个水平上一致,可以单独报「B 有效」;两条线交叉时,B 的效果方向随 A 而变,此时说「B 平均有效」会同时误导两类人,必须分水平报告。
报告里有什么
- 输出结果一:数据概览与前提检验
- 输出结果二:协方差分析主体表
- 输出结果三:均值对比图
- 输出结果四:效应量、校正后边际均值与事后分析
- 输出结果五:结论与学术表述
上图为各分组变量水平对应的因变量原始均值(未修正)的可视化对比。可通过图表顶部的下拉框切换图表类型。