惩罚分析(JAR)
这个方法是做什么的
用在配方与感官评测上。每个属性用三级 JAR(Just-About-Right)量表问一句“太弱/正好/太强”,同时收一个总体喜好评分;然后以“正好”组的平均喜好为基准,看落在“太少”和“太多”两侧的人,喜好被拉低了多少。这个差值就是 mean drop——它是这个方法的全部核心:偏离理想点要付出的代价。
报告分两层。描述层给逐“属性-方向”的人数、占比、平均喜好、mean drop 及其 95%CI,以及加权惩罚 = 该方向人数占比 × mean drop——既看拉低幅度,也看多少人落在那个方向。推断层给 Welch t 检验(不要求方差齐)、经小样本校正的 Hedges' g 及其 95%CI、按“属性-方向”家族大小做的 Bonferroni 校正,还有属性层级的单因素方差分析(太少/正好/太多三组的平均喜好)与 η²、ω²。卡① 先逐属性核对四件事:编码是不是 1/2/3 三级、JAR%(正好组占比)有没有到 70%、每个方向组人数够不够 20、三组喜好的 Levene 方差齐性;总体喜好的 Shapiro-Wilk 正态性不按属性重复,它单占一行、标着“(全体)”,整份报告只跑一次。
需要准备什么数据
- 放入[定量]JAR量表属性:至少 1 个
- 放入[定量]总体喜好评分:不限
数据要求
- 数据表至少 60 行。
- 单列缺失率不超过 20%。
- 不接受取值全都一样的列(零方差列没有可分析的变异)。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 食品饮料配方评测:甜度、咸度、浓稠度里哪一维调过头了
- 日化、香氛等感官属性的水平校准,判断该往哪个方向改
- 已有三级 JAR 问卷加总体喜好评分的回收数据
- 想在“改这一维值不值”上给出一个可排序的依据(加权惩罚)
前提:每个 JAR 属性列按 1=太弱/太少、2=正好、3=太强/太多 编码,五级 JAR 量表必须先合并成三级再上传;总体喜好为定量评分且数值越大越喜欢;每个方向组(含“正好”基准组)建议至少 20 人,某方向不足 2 人时该方向直接标 N/A;数据不少于 60 行。缺失是逐属性成对处理的——某个属性缺失只影响那个属性,不会牵连其它属性的样本量。
什么时候不要用它
- 只有 JAR 量表、没有总体喜好评分:mean drop 的定义就是两组喜好之差,缺了喜好列什么都算不出来。只想看各属性的三级分布用「频数分析」,想比较不同配方或不同人群的 JAR 分布是否有差异用「列联(交叉)分析」。
- 属性问的是“有没有这个功能”而不是“程度够不够”:那是双问法的需求归类,用「Kano模型」;要看各属性相对重要度的排序,用「MaxDiff最大差异分析」。
- 你要比的是几个配方版本的总体喜好高低,而不是某一维的偏离方向:同一批人试吃多版用「配对样本T检验」,不同人各试一版用「独立样本T检验」,三版及以上用「单因素方差分析」再接「事后多重比较」。
- 想直接估“把甜度调回正好能提升多少分”:mean drop 是观察性的组间差,不是干预效果,卡⑤ 的研究局限逐字写明了这一点。要估干预效果得做配方对照试验,再用「独立样本T检验」比较,或用「协方差分析」扣掉基线差异后比较。
- 手上是五级 JAR 还没合并:本模块只认 1/2/3,五级作答会被判为越界并剔除。先在“数据处理”里合并成三级;只想看五级作答本身的分布,用「频数分析」。
容易误读的地方
- mean drop 不是“改回正好能涨多少分”。 它是横截面的组间差:示例里觉得咸度“太多”的 62 个人,平均喜好比觉得“正好”的 137 个人低 1.633 分。这两拨人不是同一批人,也不是随机分配的——口味重的人可能本来就对这个品类评价更低。把 1.633 读成“减盐后总体喜好会涨 1.633”,是把观察性差异当成因果效应,卡① 与卡⑤ 都对此做了明确声明。真要这么说,需要一次配方对照试验,而不是这份问卷。
- 加权惩罚和 mean drop 说的是两件事,只看一个会把资源投错。 加权惩罚 = 占比 × mean drop。加权惩罚大但 mean drop 不显著,是“人多但每人影响小”;mean drop 显著但加权惩罚小,是“影响大但人少”,后者往往指向一个特定的细分人群。卡② 的结论文案直接点出这两者的运营含义完全不同。另外加权惩罚带着喜好评分的量纲——9 分制和 5 分制算出来的不是一回事,跨产品、跨研究比较必须换成 Hedges' g。
- JAR% 低于 70% 时,惩罚排序基本没有实践意义。 示例三个属性的 JAR% 是 52.0%、54.8%、53.2%,全部不达标,卡① 逐条打出了“该属性的水平设定整体偏离,惩罚值可算但产品配方本身即需调整”。这时候比较“哪个方向惩罚最大”,回答的是“这一团糟里哪里最糟”,而正确动作是重做配方而不是微调某一维。这条判定在卡①,读报告的人却往往直接跳到卡② 看排名。
- 两侧惩罚都显著,不等于“水平取中间就对了”。 三级 JAR 的“正好”是每位受访者自己心里的锚点,不是一把客观的尺子。示例甜度两侧的 mean drop 几乎一样大(太少 1.076、太多 1.072),最合理的解释不是“甜度刚好卡在中间”,而是人群里存在两拨理想点相反的消费者,当前配方落在他们中间——往任何一边调都会得罪一半人。该做的是分人群或分产品线,而不是继续在一维上找中点。
- 前提检验通过与否,不改变本模块实际使用的检验。 卡① 给了总体喜好的 Shapiro-Wilk 与三组的 Levene,但表注写得很清楚:mean drop 一律用 Welch t 检验,Levene 结果仅作数据特征描述。所以看到“方差不齐”不必换方法。反过来更要小心:Shapiro-Wilk 的 p=0.5044 只意味着没有足够证据拒绝正态,不等于证明了数据服从正态——前提检验不显著从来不是“前提成立”的证据,样本越小它越容易不显著。
检验只能拒绝原假设,不能证明它成立。p = 0.42 既可能是真的没有差别,也可能是样本量不够、差别没被检出来,两者从这个 p 值上分不开。规范的写法是「没有证据表明……」;要论证「两者确实相当」,需要另做等价性检验。
看到 r = 0.62,X 导致 Y、Y 导致 X、第三个变量同时影响两者、纯属巧合这四种情况都可能,相关系数本身分不清它们。能分清的是研究设计——随机化、工具变量、断点,而不是往模型里多塞几个控制变量。
报告里有什么
- 输出结果一:数据概览与前提检验
- 输出结果二:各属性 JAR 分组、mean drop 与加权惩罚
- 输出结果三:可视化(加权惩罚与 JAR 分布)
- 输出结果四:效应量与事后多重比较
- 输出结果五:结论与学术表述
上图为加权惩罚条形图(红=正惩罚需优化,绿=非正),下图为各属性的 JAR 三级分布。