Pearson相关性分析

Pearson相关性分析

所属分类:相关性分析

这个方法是做什么的

衡量两个数值变量之间线性关系的强弱与方向,结果就是相关系数 r:+1 是完全正向的直线关系,−1 是完全反向,0 是没有线性关系。r 与量纲无关,所以「元」和「分钟」之间也能比。

一次拖入多个变量时,它会把所有两两组合都算一遍,给出逐对的三线表、相关矩阵和热力图,并对这些检验做多重比较校正。

什么时候用它

  • 想快速看清一批指标彼此之间怎么共变(问卷各维度得分、门店各项经营指标)
  • 建回归模型之前先摸底自变量之间是不是高度相关
  • 需要一个标准化、可跨研究比较的关联强度

什么时候不要用它

  • 两个变量的关系明显不是直线(U 形、指数、有天花板效应):r 会严重低估这种关系。先看散点图,或改用「Spearman相关分析」。
  • 变量是等级或序数(满意度 1~5 星、名次):用「Spearman相关分析」或「Kendall's tau-b相关分析」。
  • 有明显的极端值:Pearson 对极端点极其敏感,几个点就能把 r 从 0.1 拉到 0.6。第一张卡的留一法诊断就是查这个的。
  • 你真正想问的是「控制住某个变量之后还剩多少关联」:用「偏相关分析」。
  • 你想知道的是「X 能不能预测 Y、影响有多大」,而不是「两者共变」:用「线性回归」。

容易误读的地方

  • 相关不等于因果——这条比它听起来更容易违反。 r 显著只说明两个变量一起变;谁先谁后、谁影响谁,数据里没有这个信息。更常见的情况是第三个变量同时推动了两者(「冰淇淋销量」和「溺水人数」都由气温驱动)。如果你已经能说出可能的混杂变量,请改用偏相关把它控制住再看。
  • r 接近 0 只能排除线性关系,不能排除关系。 一个漂亮的倒 U 形(投入太少和投入太多效果都差)算出来的 r 可能就是 0.02。画散点图是必须的一步,不能只看系数表。
  • 一次拖 5 个变量,就是同时做了 10 次检验。 每次检验各有约 5% 的假阳性概率,10 次下来「至少中一次」的概率远高于 5%。第四张卡给出 Holm 校正后的 p 与判定,以校正后的为准,而不是主结果表里未校正的那一列——两者结论不一致是很常见的。
  • 显著的相关不一定是有用的相关。 样本量到 1000 时,r = 0.07 就能做到 p 小于 0.05,但它对应的 r² 只有 0.005,两个变量几乎没有共同变化。判断有没有实际价值要看 r 与 r² 的大小;r² 是两列数字重叠的方差比例,也别把它读成「一个变量决定了另一个的百分之多少」这种因果语气。

需要准备什么数据

  • 放入[定量]分析变量:至少 2 个,定量变量(数值)

数据要求

  • 数据表至少 30 行。
  • 单列缺失率不超过 20%。
  • 不接受取值全都一样的列(零方差列没有可分析的变异)。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

报告里有什么

  1. 输出结果一:数据概览与前提检验
  2. 输出结果二:Pearson 相关分析主结果表
  3. 输出结果三:可视化
  4. 输出结果四:效应量与多重比较校正
  5. 输出结果五:结论与学术表述

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程