配对t检验功效

所属分类:功效分析

这个方法是做什么的

回答“同一批对象在两种条件下(前 / 后、A / B)各测一次,要检出这两次测量的差,需要多少对样本”,以及“现有的这批配对,检出能力有多大”。拖入两个定量列,按行一一对应;控件里只填显著性水平 α(默认 0.05)。效应量口径是 Cohen's d_z = d̄ / s_d ——分子分母都取自差值那一列,与两次测量各自的标准差无关。

卡① 摆三张表:样本构成、两次测量与差值的描述统计(差值单独成行)、以及前提检验。前提表里只对差值做 Shapiro-Wilk,不对两列各自做——配对 t 只要求差值近似正态。卡② 给事后功效与达到 80% / 90% 功效所需的配对数。卡③ 是功效随配对数变化的曲线。卡④ 给三张敏感性表:当前配对数下的 MDES(|d_z|) 及其乘回 s_d 得到的最小可检出均值差、α 取 0.01 / 0.05 / 0.10 三档的对照、以及把观测效应量按 ×0.5 / ×0.75 / ×1.25 缩放的情景。卡⑤ 是速览表加论文表述模板。引擎是 statsmodels 的 TTestPower(非中心 t,双侧),与「单样本t检验功效」用的是同一个——因为配对 t 本质就是对差值做一次单样本 t。

需要准备什么数据

  • 放入[定量]变量1(前/条件A):1 个,定量变量(数值)
  • 放入[定量]变量2(后/条件B):1 个,定量变量(数值)

数据要求

  • 数据表至少 10 行。
  • 单列缺失率不超过 30%。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

什么时候用它

  • 干预前后各测一次某个量表分,估算正式研究要招多少人
  • 交叉设计里同一批被试跑 A、B 两种条件,论证样本量
  • 同一份样本用两台仪器各测一次,规划方法学比对的例数
  • 已有配对数据,想知道现有规模能稳定检出多小的前后差
  • 审稿要求补样本量论证,需要 MDES 与达标配对数

前提是两列真的按行配对,也就是同一行来自同一个对象。这一条由研究设计保证,数据本身查不出来:卡① 的前提表把它单列一行,判定文字明确说“该前提由研究设计决定,数据本身无法检验”,模块只替你做了成对删除缺失。另外差值不能是常数,s_d = 0 时 d_z 无定义。

什么时候不要用它

  • 两列来自两批不同的对象:那不是配对数据,用「两独立样本t检验功效」。按行硬凑成“对”是虚构出来的对应关系:差值均值虽仍等于两组均值之差,但 s_d 会随两列的行序而变——把其中一列重排一遍,d_z 和所需配对数就跟着变,结论根本不稳定。
  • 同一批对象测了三次及以上:分析用「重复测量方差分析」。产品没有它的功效模块;若你只关心其中某两个时点,可以用本模块,但要为多次比较把 α 收紧,卡④ α = 0.01 那一行给的就是收紧后的功效与配对数。
  • 手上已经有一列现成的差值:直接用「单样本t检验功效」,把检验值 μ₀ 填 0,结果与本模块一致。
  • 差值严重偏态或量表本身是等级评分:检验改用「配对样本Wilcoxon检验」;产品没有非参数功效模块,常见做法是在本模块的配对数上加 10%~15%。
  • 配对的结局是“有效 / 无效”这类二分类:差值均值没有意义,检验用「配对卡方检验」;产品没有它的功效模块,本模块的结果不能挪用。
  • 只想知道前后差异显不显著:那是「配对样本T检验」的事,本模块不输出 p 值。

容易误读的地方

  • 卡② 的“12”是配对总数,不是每组 12 人。 表注原文写着“所需样本量为在观测效应量下达到该功效所需的配对总数(不是每组人数)”。这一条最容易和「两独立样本t检验功效」混——那边给的是等组设计下的每组人数,要乘 2 才是总量;这边 12 对就是 12 个对象、24 次测量。两个模块并排看时格外要认表注。
  • 事后功效算到 1.0000,不说明设计做得好。 本例卡② 的事后功效是 1.0000,卡④ α 敏感性三行也全是 1.0000——不是三档 α 没差别,是观测效应量太大,功效早已饱和到读不出差别。事后功效由观测 d_z 与 n 唯一决定,和配对 t 的 p 值一一对应,它只是把“这次结果有多显著”换了个说法。卡① 的结论文案原句是:它不能用来论证“不显著是因为样本量不足”。
  • 别把文献里的 Cohen's d 直接当 d_z 填进规划。 论文里的 d 多半以单次测量的标准差为分母,本模块的 d_z 以差值的标准差为分母,两者只在两次测量的相关系数 r = 0.5 时才相等。换算关系是 d_z = d / √(2(1−r)):r = 0 时 d_z 只有 d 的 0.707 倍,r = 0.8 时是 1.58 倍。r 越高,s_d 越小,d_z 越大,需要的配对数越少。配对设计省样本,省的正是这一块个体间变异——但也意味着照抄组间 d 会把配对数估错,方向取决于 r。
  • 卡② 的达标配对数是“假定真实效应量恰好等于本次观测值”才成立的。 卡④ 第三张表把代价摆出来了:基准 d_z = −0.9372 只要 12 对,按 ×0.5 的保守情景(−0.4686)就要 38 对。表注说明观测效应量是有噪估计且倾向被高估,正式论证通常按观测值的 50%~75% 做保守情景。真正该代入的效应量来自文献、预实验,或专业上认可的最小有意义差值,而不是这次数据自己算出来的那个。
  • 差值的 Shapiro-Wilk 不显著,不等于差值正态。 卡① 给的 p = 0.9070 只说明没有足以拒绝正态的证据,配对数少时它几乎拒绝不了任何分布。同时也别反过来担心两列各自不正态——本模块本来就不检验这一项,配对 t 的正态前提只落在差值上。真正会毁掉外推的是差值里的极端值:它同时拉动 d̄ 与 s_d,d_z 一变,卡②③④ 的配对数整条链跟着变。
前提检验不显著不等于前提成立
概念图1 前提检验不显著不等于前提成立
检验只能拒绝原假设,不能证明它成立。p = 0.42 既可能是真的没有差别,也可能是样本量不够、差别没被检出来,两者从这个 p 值上分不开。规范的写法是「没有证据表明……」;要论证「两者确实相当」,需要另做等价性检验。

报告里有什么

  1. 输出结果一:数据概览与前提检验
  2. 输出结果二:功效与所需样本量
  3. 输出结果三:功效曲线
  4. 输出结果四:敏感性分析(MDES 与 α/效应量敏感性)
  5. 输出结果五:结论与样本量报告表述
配对 t 检验功效曲线
图1 配对 t 检验功效曲线
横轴为配对数 n,纵轴为在观测效应量 |d_z| = 0.9372、α = 0.050 下的检验功效 (1-β),橙色虚线为 0.80 目标功效参考线。可用右上角切换器切到「表格」逐点读数。

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程