相关分析(Pearson)功效
这个方法是做什么的
回答“要检出两个定量变量之间的线性相关,需要多少对观测”,以及“现有这批成对数据,检出这种强度相关的把握有多大”。拖入两个定量变量,控件里只填显著性水平 α(默认 0.05)。它是功效分析这一族里唯一一个效应量就是统计量本身的模块——不需要换算成 d、f 或 w,Pearson 相关系数 r 直接就是效应量,Cohen 惯例是 0.1 弱、0.3 中等、0.5 强。
卡① 给两个变量的描述统计与各自的 Shapiro-Wilk,再给 Pearson r、Spearman ρ 以及二者绝对值之差——这一行是线性性的启发式对照,表注明确写着它不是正式的线性性检验。卡② 给成对样本量、Fisher z = atanh(|r|)、事后功效,以及达到 80% / 90% 功效所需的成对观测总数。卡③ 是功效随成对样本量变化的曲线。卡④ 给 MDES(|r|)、α 取 0.01 / 0.05 / 0.10 三档的对照与达标样本量。卡⑤ 是论文表述模板。计算方法是 Fisher z 变换加正态近似,并含小样本均值偏差校正 E[z] = atanh(ρ) + ρ/(2(n−1)),检验的原假设固定为双侧 H₀: ρ = 0。
需要准备什么数据
- 放入[定量]变量1:1 个,定量变量(数值)
- 放入[定量]变量2:1 个,定量变量(数值)
数据要求
- 数据表至少 4 行。
- 单列缺失率不超过 30%。
- 不接受取值全都一样的列(零方差列没有可分析的变异)。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 问卷或量表研究设计阶段,估算“要检出中等强度的相关,得收多少份”
- 已有成对数据,想知道现有规模能稳定检出多弱的相关
- 投稿被要求补相关分析的样本量论证,需要 MDES 与达标对数
- 一次考察多对变量、α 要做多重比较校正,先看效能会掉到什么程度
- 比较“再收一批样本”和“改进测量、降低误差”哪个更能提升效能
前提是两列成对(同一行来自同一个对象)、关系近似线性、且抽样没有被人为截断。成对去缺失后至少要 4 对(Fisher z 的自由度是 n−3),但四五对时正态近似本身很粗糙,结论只能当量级参考。r 对极端值极其敏感,卡⑤ 的【前提约束】要求样本量论证之前先完成异常值核查。
什么时候不要用它
- 关系明显非线性、或变量本身是等级评分:分析改用「Spearman相关分析」。产品没有秩相关的功效模块,常见做法是在本模块给出的对数上加 10%~15%。
- 要在控制第三个变量之后看相关:用「偏相关分析」。产品没有它的功效模块;一个够用的近似是把本模块算出的成对样本量再加上被控制变量的个数,因为偏相关每控制一个变量就少一个自由度。
- 真正关心的是一组自变量对因变量的整体解释力:用「线性回归功效」,它按 f² = R²/(1−R²) 算效应量并考虑自变量个数;只有一个自变量时两者等价。
- 要评估的是两次测量的一致性而不是相关:用「组内相关系数(ICC)」或「Kappa一致性检验」。相关高不等于一致——一台仪器整体偏高 5 个单位,r 仍可以是 1,本模块的功效对这类系统偏移完全不敏感。
- 只想知道相关系数显不显著:那是「Pearson相关性分析」的事,本模块不输出 p 值。
容易误读的地方
- 它只回答“相关是否不为零”这一个问题。 卡② 的表注把原假设写死了:双侧 H₀: ρ = 0。如果你的研究问题是“相关能否达到 0.7 以上”(信度、效标关联的常见阈值),或者“甲组的相关是否强于乙组”,这个功效数答非所问——产品没有针对非零 ρ₀ 或两个 r 之差的功效模块,不要把这里的对数当成那类论证的依据。
- 在本模块里,事后功效与 p 值的重合最赤裸。 别的功效模块还要先把数据折算成 d、f、w,这里效应量就是 r 本身。事后功效完全由 |r| 与 n 决定,Pearson 相关的 p 也完全由 |r| 与 n 决定,二者是同一对数字的两个单调函数,一一对应。所以“相关不显著会不会是样本量不够”,用事后功效回答等于什么也没说;要回答它,读卡④ 的 MDES:本例 n = 120 时 80% 功效的可检出下限是 |r| = 0.2524,弱于这个强度的真实相关,本设计大概率漏检。
- 范围限制和测量误差会同时压低 r,把规划带偏。 卡④ 的结论文案把“避免范围限制”和“降低两变量的测量误差(衰减校正)”与“加样本”并列为提高效能的三条正当途径。只在高分段抽样(比如只招已入职的优秀员工)会让 r 缩水,据此规划出的样本量偏大;反过来,专挑两端极值估出来的 r 虚高,规划出的样本量偏小。所以从文献取 r 时,要看那篇研究的抽样范围与你是否可比。
- Spearman 与 Pearson 差得小,不等于关系是线性的。 卡① 那一行是启发式提示,本例差 0.009(阈值 0.10),只能说“未见明显的非线性迹象”。典型的反例是 U 形关系:r 和 ρ 可以同时接近 0,两者之差也接近 0,而变量之间其实关系很强。判断线性性最终得靠散点图和专业知识,不能靠这一行数字。
- 别拿本次算出来的 r 去规划本次研究。 观测 r 是有噪估计,样本越小抖得越厉害,而 Pearson r 又对极端值极敏感——个别离群点就能把 r 从 0.15 抬到 0.45,卡②④ 的样本量随之整体缩水。本模块的卡④ 没有其他四个功效模块那样的“效应量 ×0.5 / ×0.75”情景表,保守规划只能自己折算,卡② 给了量级关系:|r| 从 0.5 降到 0.25,80% 效能所需样本量约变 4 倍以上。正当的 r 来源是文献、预实验,或专业上认为“值得检出”的最低相关强度。
报告里有什么
- 输出结果一:数据概览与前提检验
- 输出结果二:功效与所需样本量
- 输出结果三:功效曲线
- 输出结果四:敏感性分析(MDES / α 敏感性 / 达标样本量)
- 输出结果五:结论与样本量报告表述
横轴为成对样本量 n,纵轴为检验功效(1-β),橙色虚线为目标功效 0.80 参考线;可切换为表视图查看逐点采样值。