熵值法
这个方法是做什么的
熵值法用信息熵度量每个指标在评价对象之间的离散程度,据此定权重:某个指标在各对象上取值越均匀,信息熵 e 越接近 1、信息效用 d=1−e 越小、权重越低;取值越参差,权重越高。计算前先做同向化与无量纲化——负向指标按 max−x 正向化,全部指标再按 (x−min)/(max−min) 映射到 [0,1],因此结果不受原始量纲影响。熵基常数 k = 1/ln(评价对象数),第一张卡会把它连同对象数一起打出来。
与本类别里只出权重的几个模块不同,本模块还给综合得分:得分 = Σ(标准化后的指标值 × 权重),取值域 [0,1],并按降序排名。第四张卡是权重敏感性——每个指标各 ±20% 扰动再加等权对照,逐情景完整重算得分与名次,报告 Spearman ρ、首位是否易位、最大名次变动。读这份报告时最该带着的问题是“权重高的那个指标,业务上真的重要吗”:卡③的结论文案已经把话说在前面——某个业务上重要的指标权重偏低,说明它在当前样本中没体现出应有的差异,这是数据层面的结论,不等于该指标不重要。
需要准备什么数据
- 正向指标 (越大越好)(可选):至少 0 个,定量变量(数值)
- 负向指标 (越小越好)(可选):至少 0 个,定量变量(数值)
数据要求
- 数据表至少 3 行。
- 单列缺失率不超过 30%。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 有一批可比对象和一套指标,想要一套完全由数据决定、不掺主观判断的权重与综合得分
- 各指标量纲不同、无法直接相加,需要系统一步完成同向化与无量纲化
- 需要一个可复现、能写进论文方法部分的客观赋权口径
- 想看到“换一套权重名次还成立吗”的敏感性证据
前提是正负两区合计至少 2 个定量指标,以及足够多的评价对象——熵基常数依赖对象数,对象太少时熵值几乎不含信息(见下方第三条)。零方差的常数指标会被自动剔除,剔除后剩余指标须仍不少于 2 个,第一张卡的“纳入状态”列会标出被剔掉的是哪几个。
什么时候不要用它
- 想让权重惩罚指标之间的信息重复:用「CRITIC权重法」,它在离散度之外乘一个冲突性项;只关心冗余不关心离散度的用「独立性权系数法」。
- 要按正负理想解的距离排序,并输出 D+/D− 结构:用「优劣解距离法(TOPSIS)」,它内部同样可以选熵权法赋权。
- 结论要落在分档而不是精确名次:用「秩和比综合评价法(RSR)」。
- 指标分成“投入”和“产出”两类,你想评的是转化效率:用「数据包络分析(DEA)」,它不需要事先赋权。
- 对象只有一个,你要判断它属于哪个等级:用「模糊综合评价」。
- 要做的是问卷题项赋权、还想要权重的区间估计:用「权重分析(熵权法)」,它是问卷分析类别下的另一个熵权实现。
容易误读的地方
- 权重只反映数据拉得开不开,不反映业务重要性。 把同一份数据(15 个对象、4 个指标)分别喂给四个客观赋权模块实测:“床位使用率”在本模块拿到 16.78%,在「变异系数法」只有 7.48%,在「独立性权系数法」却高达 33.17%。四个方法都“客观”,给出的答案却相差四倍多。选哪一个是研究者的判断,不能说成数据自己得出的结论。
- 它不惩罚信息冗余,高度相关的指标会重复计权。 熵值逐指标独立计算,两列携带同一份信息也各算一次。第一张卡的冗余诊断专门报这个——演示数据上报出“人均GDP”与“平均住院日”的 r=−0.902,并建议先精简指标或改用 CRITIC 法。看到这条提示还照抄权重表,等于给那份信息偷偷加倍。
- 只有两个评价对象时,熵权法会悄悄退化成等权。 实测:把演示数据截成 2 行重跑,5 个指标的权重齐刷刷都是 20.000%、信息效用 d 全是 1.0。原因是 min-max 归一化后每列只剩 0 和 1 两个值,各列的熵完全相同。截成 3 行才开始出现区分(31.9%~14.3%)。对象数很少时权重表看着正常,其实没有任何信息,别据此讨论“哪个指标最关键”。
- 单个离群对象就能抬高一个指标的权重。 极差被一个极端值拉大后,该指标的离散度上升、熵值下降、权重随之上升。分析前应先核一遍第一张卡描述统计里的最小值与最大值,权重异常集中在某个指标上时尤其要回头查数据。
- 综合得分是 [0,1] 上的相对值,而且表里只有行号没有对象名。 标准化基准来自本批对象的极值,换一批对象权重与得分同时改变,跨批次不可比。本模块也没有索引项拖拽区,卡②的结论用的是“原始数据第 4 行”这种说法,表格默认只显示前 10 行,要按名称呈现名次得自己按行号回原表对照。第四张卡的判定文字还要连着读完:演示数据整体判为“较稳定”,同一段却写明有 1 个情景的首位对象发生易位——这时第一名的领先并不牢固,不该单独拎出来宣传。
报告里有什么
- 输出结果一:数据概览与前提检验
- 输出结果二:权重与综合得分主结果表
- 输出结果三:可视化(指标权重图)
- 输出结果四:权重敏感性与排名稳定性
- 输出结果五:结论与学术表述
横轴为权重百分比,纵轴为指标名称,条形越长代表权重越大;可切换为柱形图/饼图/表格视图,数据源与表2 一致。