Kendall一致性检验
这个方法是做什么的
多位评分者对同一批对象打分,问他们排出来的名次是否趋同。做法是先在每一位评分者的行内把各对象排秩,再看各对象的秩和分散得有多开:大家看法一致,某些对象就会稳定地拿高秩、另一些稳定地拿低秩,秩和的离散度自然就大。协同系数 W 取值在 0 到 1 之间,1 表示所有评分者给出完全相同的排序,0 表示排序之间毫无关联。它只看名次,对某位评分者整体打分偏高或偏低完全不敏感。
除了 W 与显著性检验,报告还给出 W 的 Bootstrap 95% 置信区间(以评分者为重抽样单位)、评分者两两秩相关的平均值 r̄s、并列修正项 ΣT,以及 χ² 与 F 两套近似检验——对象数少时 χ² 近似偏向拒绝原假设,此时以 F 近似为准。第四张卡另有一组事后 Wilcoxon 符号秩两两比较(Holm 校正),回答“大家一致地把哪些对象排在了前面”。第一张卡还有一项专门的数据布局核查,见下文第一条。
需要准备什么数据
- 放入[定量/定序]被评价对象:至少 2 个,定量变量(数值)
数据要求
- 数据表至少 10 行。
- 单列缺失率不超过 20%。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 若干位专家对同一组方案、候选人或指标重要性排序,判断专家意见是否收敛
- 德尔菲法每一轮之后计算协调系数,看几轮下来是不是在收敛
- 多位评委给同一批作品打分,各人给分的松紧差别很大,只关心名次
- 感官评定:多位品评员对若干样品做偏好排序
数据布局是这个模块最容易出错的地方,而且它和「组内相关系数(ICC)」正好相反:这里每一行是一位评分者,每一列是一个被评价对象。评分至少要是定序尺度(能排出高低),各评分者必须独立打分、不能商量后再给分——这一条由研究设计保证,数据本身检验不出来。任一对象缺失的行排不出全秩,会被整行剔除。W 是纯秩方法,不要求正态、也不要求方差齐性,所以卡① 不列这两项检验。
什么时候不要用它
- 评分是定量分数、你关心的是绝对一致(不只是名次,还包括给分高低本身):用「组内相关系数(ICC)」。W 对整体平移完全不敏感——两位评委一个平均给 8 分、一个平均给 4 分,只要名次相同 W 就是 1。
- 评价者给的是无序类别而不是可排序的分数:用「Kappa一致性检验」。
- 只有两位评分者:此时 r̄s 就是这两列的 Spearman 秩相关,直接用「Spearman相关分析」或「Kendall’s tau-b相关分析」更好读、也更好报告。
- 只有两个被评价对象:每位评分者的排序只剩两种可能,W 退化,卡① 会把“对象数 k ≥ 3”单列为一项前提。你真正想问的其实是“这两个对象哪个更好”,用「配对样本Wilcoxon检验」。
- 你要问的是对象之间到底有没有差别,而不是评分者是否一致:用「多配对样本Friedman检验」。两者用的是同一张行内秩表,无并列时 W 的 χ² 近似统计量 m(k−1)W 就是 Friedman 统计量;差别在报告重心——W 报的是标准化的一致性强度,Friedman 报的是对象之间的差异。
容易误读的地方
- 表拖反了不会报错,只会算出一个几乎为 0 的 W。 这是本模块最高频的事故:把“一行一个对象、一列一位评价者”的表(也就是 ICC 要的那种布局)直接拖了进来。第一张卡有一项专门核查——当列间平均 Spearman 相关不低于 0.5、W 却低于 0.3、且行数多于列数时,它会判为“疑似行列颠倒”,并把这句提示一路写进结论段和可誊入论文的表述里。判据的道理是:同一批对象被多位评分者重复评分时,列与列之间必然强相关;列间高度相关却排不出一致的行内顺序,这个组合在真实数据里几乎只能由转置造成。看到这条提示,先把数据转置再重跑,不要去解释那个 W。
- W 显著只说明评分者看法趋同,不说明这个共同看法是对的。 一群人受同一份有倾向的材料影响、共享同一个先入之见,同样会产生很高的 W。W 度量的是共识度,不是正确性——这一点和 Kappa、ICC 完全同理。
- 只报 p 不报 W 是错的,χ² 会随评分者人数放大。 χ² = m(k−1)W:评分者从 20 位增加到 200 位,同样的 W 会把 χ² 放大十倍,p 值随之变小,可排序的一致程度一点没变。W 本身才是标准化的一致性效应量,不随人数变化,必须连同它的 Bootstrap 置信区间一起报告。反过来也要小心:评分者很少时 W 不显著,不等于“没有一致性”,只等于这批数据不足以下结论。
- 对象数少的时候看 F 近似,别看 χ² 近似。 卡① 把“m ≥ 10 且 k ≥ 5”列为 χ² 大样本近似的经验条件,不满足时 χ² 近似偏松,报告因此同时给出 F 近似。示例正落在这种情况里:60 位评分者却只有 3 个对象,两套近似给出的 p 分别是 0.124 与 0.125,方向一致;但两者结论打架时,以 F 为准。
- 整行同分的评分者等于没投票。 行内并列会通过修正项 ΣT = Σ(t³ − t) 从 W 的分母里扣掉,避免并列人为抬高一致性;而如果某位评分者给所有对象打了完全相同的分,这一行不提供任何排序信息,卡① 会把它单列为“退化行”提示。评分尺度太粗——比如只有 1~5 分却要区分 10 个对象——就会大量产生这种行,此时该做的是加细尺度或改为直接排序,而不是接受那个被稀释的 W。
同一个差异,只把样本量从 20 加到 2000:效应量 Cohen's d 始终是 0.30,p 却从 0.35 掉到小于 0.001。p 变小说明「证据变足」,不说明「差异变大」——差多少要看效应量与它的置信区间。
ICC 的格子里是分数、Kappa 是类别、Kendall 一致性检验是名次;前两者一行一个被评对象、一列一位评价者,Kendall 恰好相反。表拖反了不会报错,只会算出一个几乎为 0 的 W。
报告里有什么
- 输出结果一:数据概览与前提检验
- 输出结果二:Kendall's W 一致性检验主结果表
- 输出结果三:可视化
- 输出结果四:效应量与事后两两比较
- 输出结果五:结论与学术表述
柱高为各对象的平均秩(1 ~ 3),橙色虚线为「若各对象无差异」时的期望平均秩 (k+1)/2 = 2.00;右上角切换器可改看条形图/折线图或明细表(契约 §3)。
箱线图展示每个对象在全部评分者上的评分分布(最小值 / P25 / 中位数 / P75 / 最大值)。