权重分析(熵权法)
这个方法是做什么的
在多指标综合评价里客观地定权重:某个指标在各评价对象上取值差异越大,它提供的信息越多、权重越高;各对象取值高度一致的指标区分不出优劣,权重接近 0。计算路径是固定的——正向指标按 (x−min)/极差、负向指标按 (max−x)/极差做 0-1 极差标准化,算信息熵 e=−k·Σp·ln p(k=1/ln N),信息效用 d=1−e,权重 w=d/Σd,再按权重加权求和得到每个对象的综合得分与排名。它与综合评价分类下的「熵值法」是同一套公式,区别在报告:那一个多了指标间的冗余诊断与权重 ±20% 扰动下的排名稳定性,这一个多了下面这些不确定性证据。
卡② 给每个权重的 Bootstrap 95% 置信区间与“是否显著偏离均权 1/m”的检验(B=1000,种子固定,Holm 校正)。卡④ 给权重集中度、HHI、最高/最低权重之比等“偏离等权多远”的度量,并做留一法敏感性——逐个剔除指标重跑,看新旧排名的 Spearman 相关与前 10% 名单保留率,以及各指标与综合得分的等级相关(用于核对正负向有没有标反)。
需要准备什么数据
- 正向指标 (数值越大越好)(可选):至少 0 个,定量变量(数值)
- 负向指标 (数值越小越好)(可选):至少 0 个,定量变量(数值)
数据要求
- 数据表至少 10 行。
- 单列缺失率不超过 20%。
- 不接受取值全都一样的列(零方差列没有可分析的变异)。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 绩效考核、区域发展评价、供应商打分这类需要一套不掺主观判断的权重
- 需要给权重配上不确定性,而不是只交一列百分比
- 想知道最终排名主要由哪个指标主导(留一法比权重表更能回答这件事)
- 想核对正向/负向标注有没有搞反(各指标与综合得分的相关方向)
前提:所有指标必须是定量数值,文本类别请先转成数值;正向区与负向区合计至少 2 个指标,同一列不能同时放进两个区;任一指标不得为常数列,极差为 0 时它不提供任何区分信息、权重会退化为 0;评价对象至少 10 行,实测 9 行会被直接拦下,实务上建议更多。指标方向由你在拖拽区指定,统计上不可检验——标错会让该指标的贡献完全反号。
什么时候不要用它
- 你要的权重应当体现“理论上有多重要”:任何客观赋权都做不到这件事,本模块只看数据的离散程度。产品内可换的仍是客观口径——想同时惩罚指标间的信息重复用「CRITIC权重法」,只按相对离散度赋权用「变异系数法」;若必须体现专家判断,权重要在模块之外先定好再做加权。
- 指标之间高度相关,同一份信息被重复计权:熵权法逐指标独立计算信息熵,不惩罚冗余,两个几乎同义的指标会各拿一份权重。要把“冲突性”纳入赋权,用「CRITIC权重法」。
- 你要的是完整的排序择优方案而不只是权重:加权求和只是最简单的合成方式,按与正负理想解的贴近度排序用「优劣解距离法(TOPSIS)」,序列形态相似性用「灰色关联分析」,需要给出折衷方案排序用「多准则妥协解排序法(VIKOR)」。
- 数据行数不足 10 行,或存在常数指标、缺失偏多而被拦下:改用「熵值法」,同一套熵权公式但门槛更松(至少 3 行、常数指标自动剔除而不是拦截),代价是没有 Bootstrap 区间与显著性检验。
- 目的是把多个指标压缩成少数几个综合维度,而不是加权求和成一个总分:用「主成分分析(PCA)」,要提取并解释潜在构念用「因子分析(探索性)」。
容易误读的地方
- 熵权法定的是“区分能力”,不是“重要性”。 卡⑤ 的方法学提示写得很直白:一个理论上极重要、但各对象取值都差不多的指标,会被赋予极低的权重。把权重表当成“哪个指标更关键”的排序拿去汇报,是这个方法最根本的误用——它回答的是“哪个指标把这批对象拉开了差距”。
- 权重是这批评价对象的属性,而且由极差驱动、对极端值极敏感。 概览表注写明:权重完全由数据的离散程度决定,换一批评价对象权重就会变化。同一件事的另一面是单个极端值就能拉大某个指标的极差、人为抬高它的权重,所以卡① 用 3×IQR 规则逐指标实测极端值个数(示例 6 个指标都是 0),描述表也把变异系数 CV 列出来作为赋权结果的直观预告。别人论文里的熵权不能直接搬用,自己的权重必须连同样本构成与标准化方式一起报告。
- 权重高不等于对排名影响大。 卡④ 的图注原话:一个权重高但取值高度一致的指标,对最终排序其实没有区分贡献。示例剔除权重最高的“产品体验Q2”(32.31%)后,新排名与原排名的 Spearman ρ 掉到 0.7392、前 10% 名单只保留 60%,而剔除其余五个指标 ρ 都在 0.96 以上——它确实主导排名。同一张表里的 p 值全部极显著,但表注提醒那检验的是“两套排名是否相关”,几乎必然显著;有信息量的是 ρ 的大小与名单保留率。
- 删掉一个指标不会改变其余指标之间的相对权重,会变的是排名。 这是恒等式而非经验:信息熵只依赖该指标自己那一列的标准化取值,删掉别的列不改变它,剩下的权重只是按 Σd 等比重新归一化。表注专门写了这一条并说明它因此不作为一列输出。所以“再加一个指标进来会不会稀释某个指标的地位”这个担心在熵权法里不成立;真正需要担心的是新指标会不会改变谁排在前面。
- 没有指标显著偏离均权时,等权法可能是更稳妥的选择。 示例 6 个指标经 Holm 校正后 0 个显著偏离 1/m=16.667%,权重集中度只有 0.0417(0 表示完全等权),模块的结论句直接给出了这个建议。此时看到“产品体验Q2”拿到 32.31% 就宣布“它最关键”,忽略了它的 95%CI 是 [20.372, 37.101]、Holm 校正后 p=0.0600——那是把一次抽样的波动当成了结构。
报告里有什么
- 输出结果一:数据概览与前提检验
- 输出结果二:权重主结果表
- 输出结果三:可视化(权重分布与综合得分分布)
- 输出结果四:效应量与事后分析
- 输出结果五:结论与学术表述
上图为各指标权重(虚线为均权基准,灰色标记为 Bootstrap 95%CI 上下限);下图为综合得分的分布。两图均可用左上角切换器在条形图/柱状图/饼图/数据表之间切换。