主成分分析(PCA)
这个方法是做什么的
主成分分析是纯数学降维:把一批相关的数值变量线性重组成几个互不相关的成分,第一主成分吸走最多方差,其后依次递减。它不假定背后存在什么“公共因子”,只做正交变换。报告给出方差解释表(初始特征根与提取部分)、主成分载荷(载荷即原始变量与成分的相关系数)、每个变量的共同度,以及得分系数矩阵(系数 = 相关矩阵的逆 × 载荷矩阵),据此算出各样本的成分得分。
它被放进综合评价类别,是因为最后那张“综合得分表”:把各成分得分按其方差解释率占比加权求和,得出一个总分与名次。这是学界常见但有争议的用法——争议不在算得对不对,而在“解释方差越多的成分越重要”这个隐含假定是不是你要的评价标准;报告的卡②结论文案对此有明确提醒。第四张卡给的是这套做法的检验工具:Horn 平行分析(500 次随机模拟、固定种子,取各位次特征根的 95 百分位当参考线)、共同度诊断,以及成分数 ±1 时综合得分排名的 Spearman 一致性。
需要准备什么数据
- 放入 [定量] 变量:至少 2 个,定量变量(数值)
- 放入 [定类] 摘要 (可选)(可选):定类变量(分组/标签)
数据要求
- 数据表至少 5 行。
- 单列缺失率不超过 20%。
- 不接受取值全都一样的列(零方差列没有可分析的变异)。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 变量太多且彼此高度相关,想压成少数几个互不相关的综合指标再拿去回归或聚类
- 需要一套完全由数据决定、可复现、能写进论文的综合得分与排名
- 想知道降维之后每个原始变量的信息保留了多少(共同度)
- 需要一个客观判据来定成分个数,而不是拍脑袋
第一张卡先做适用性体检:KMO(>0.6 可接受、>0.8 良好)、各变量单项 MSA(<0.5 建议剔除)、Bartlett 球形检验(不显著就说明降维本身没有意义)、相关矩阵行列式,以及样本量与变量数之比。分析基于标准化数据与相关矩阵,因此不受原始量纲影响。
什么时候不要用它
- 你想验证或命名背后的潜在维度:用「因子分析(探索性)」,它区分公共因子与特殊因子,还提供多种旋转方式让载荷更好解释。
- 指标里有“越小越好”的成本型:本模块没有正向/负向指标区,得分会把方向混在一起;改用「优劣解距离法(TOPSIS)」或「秩和比综合评价法(RSR)」。
- 只想要一套指标权重、不想降维:用「熵值法」「CRITIC权重法」或「变异系数法」。
- Bartlett 球形检验不显著、KMO 太低:变量之间没有可提取的公共信息,改用不依赖相关结构的「变异系数法」或「独立性权系数法」。
- 目的是把样本分成几组而不是排序:用「聚类分析(K-Means)」;混着定类变量用「二阶聚类」,还要顺带把离群样本挑出来用「密度聚类(DBSCAN)」。别选「分层聚类」——本产品的它是 R 型的,聚的是变量不是数据行。
- 只是想找出哪些变量彼此冗余:用「VIF共线性诊断」或「Pearson相关性分析」更直接。
容易误读的地方
- 本模块不认识指标方向,综合得分只有在全部变量“越大越好”时才能读成综合水平。 拖拽区只有分析项和一个可选的分类摘要项,没有正负向区。混入一个成本型指标,它的高值会照样推高总分。演示数据里三个变量的载荷都是正的(0.948/0.900/0.944),得分才恰好可读;载荷若有正有负,第一主成分表达的是“对比”而不是“水平”,此时综合得分没有排名含义。
- 特征根大于 1 不是可靠的成分数判据。 Kaiser 准则在变量较多时系统性高估。第四张卡的平行分析才是客观依据:演示数据第 1 成分实际特征根 2.600 高于随机参考线 1.752 建议保留,第 2 成分 0.277 低于 1.134 不建议保留。把顶部改成“特征根阈值为 0.20”后模块保留 2 个成分,摘要会直接写“与平行分析建议的 1 个不一致,需说明取舍依据”——看到这句就该回去说明理由,而不是当它没出现。
- 累计方差解释率不是“模型有多准”。 86.66% 只表示前几个成分重构了原始变量这么多比例的方差,既没有做假设检验,也不保证换一批样本还成立。除了第一张卡的 Bartlett,本模块不产生任何 p 值与置信区间。
- 综合得分是标准化尺度上的相对值。 均值约为 0,正值只表示优于本批样本的平均水平,不代表及格或达标;换一批样本标准化基准就变,跨批次不能比较。综合得分表按“行索引”标识样本(从 0 开始计数),没有对象名称列,核对时别把行号当成序号。另外成分得分与综合得分都只印在报告里,没有写回数据集的通道——想把成分得分当作别的模块的输入变量,产品里做不到,那类需求只能拿原始变量去跑。
- 成分数改一改,名次就跟着动。 第四张卡把成分数 ±1 各重拟合一次并重算得分:演示数据上保留 2 个成分与保留 1 个成分的排名 Spearman ρ=0.9857,算是稳的;ρ 明显偏低时说明名次其实是“选了几个成分”选出来的,不能只报当前这一版。
报告里有什么
- 输出结果一:数据概览与前提检验
- 输出结果二:方差解释、载荷与综合得分主结果表
- 输出结果三:可视化(碎石图与载荷图)
- 输出结果四:成分保留判据与信息保留诊断
- 输出结果五:结论与学术表述
上图为碎石图,可切换为柱形图/表格视图,橙色虚线为平行分析在同规模随机数据上得到的特征根 95 百分位参考线 —— 实际特征根高于该线的成分才被认为携带了超出随机噪声的信息;因保留成分数不足 2,未绘制载荷图。