两独立样本t检验功效
这个方法是做什么的
回答“比较两组不同对象在同一个数值指标上的均值差,需要每组多少人”,以及“现有的这两组人,检出这样的差距把握有多大”。拖入 1 个恰好两水平的分组变量和 1 个定量测量变量,控件里只需填显著性水平 α(默认 0.05)。效应量口径是 Cohen's d =(x̄₁ − x̄₂)/ s_pooled,合并标准差由两组数据按自由度加权算出。
卡① 摆三张表:样本构成、各组均值标准差与合并标准差、以及前提检验(Levene 方差齐性用中位数中心化,附 SD 比;两组各自的 Shapiro-Wilk)。卡② 给事后功效和达到 80% / 90% 功效所需样本量。卡③ 是功效随每组样本量变化的曲线。卡④ 是本族里最全的一张敏感性组合:当前样本量下的 MDES(|d|) 及其换回原始单位的最小可检出均值差、α 取三档的对照、1:0.5 / 1:1 / 1:2 三种分配比各自的人数需求、以及把观测效应量按 ×0.5 / ×0.75 / ×1.25 缩放后的四个情景。卡⑤ 是结论速览表加一段可誊入论文的表述。引擎是 statsmodels 的 TTestIndPower(非中心 t,双侧),不产生 p 值。
需要准备什么数据
- 放入[定类]分组变量:1 个,定类变量(分组/标签)
- 放入[定量]测量变量:1 个,定量变量(数值)
数据要求
- 数据表至少 10 行。
- 单列缺失率不超过 30%。
- 不接受取值全都一样的列(零方差列没有可分析的变异)。
- 「放入[定类]分组变量」必须正好是 2 个类别。
- 「放入[定类]分组变量」的每一组至少 2 个样本。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 设计随机对照试验,要论证试验组与对照组各收多少例
- 对照组资源受限、只能按 1:2 招募,想知道总样本量要多付出多少
- 已有两组数据,想知道现有规模能稳定检出多大的均值差
- 审稿意见要求补 MDES,需要一个换算回原始量表分数的可检出下限
- 用预实验的两组数据估效应量,为正式研究做保守情景规划
前提是两组观测相互独立——一个对象只出现在一组里,且组内个体互不影响。这条由抽样与实验设计保证,数据里查不出来。能查的方差齐性与组内正态性都在卡① 上;分组变量必须恰好两个水平,多于两组会被数据要求直接拦下。
什么时候不要用它
- 两列是同一批对象的前后两次测量:用「配对t检验功效」。配对设计的效应量按差值的标准差算,个体间差异被消掉,前后测相关越高,同样的实质差异需要的对象数越少;按独立样本口径规划会白白多招人。
- 分组多于两个:用「单因素方差(ANOVA)功效」,它按 Cohen's f 算效应量并给出按组均分的总样本量。
- 结局是“有效 / 无效”这类二分类:均值差没有意义,用「两比例(率差)功效」,它用 Cohen's h 并给出可检出的率范围。
- Levene 拒绝方差齐性、两组人数又不相等:本模块的 d 与功效自始至终按合并方差算,不会切换口径,卡① 的判定列只会提示这一点。产品没有 Welch 校正的功效模块,可行的做法是把实际检验放到「独立样本T检验」里做(它会自动改用 Welch),本模块的样本量结果按较大的那个组标准差重算一遍取保守值。
- 组内严重偏态且样本不大:检验改用「独立样本 Mann-Whitney U 检验」;产品没有非参数功效模块,常见做法是在本模块的样本量上加 10%~15%。
- 要在比较两组时扣掉协变量(如比较疗效时控制基线值):分析用「协方差分析」。产品没有它的功效模块,此时本模块给出的样本量偏保守——控制协变量会压低残差方差,实际需要的人数通常更少。
容易误读的地方
- 卡② 的“33”是每组 33,不是一共 33。 表注写得很清楚:所需样本量是等组设计(ratio = 1)下的每组人数,总样本量是它的 2 倍。更容易混的是同一张卡里两个口径不一样——事后功效按你数据里的实际分配比算,达标样本量却按等组设计算。数据本来就 1:1 时二者一致,一旦两组人数悬殊,把这两个数并排读会得出自相矛盾的结论。
- 事后功效与 t 检验的 p 值是同一份信息。 本模块只有 α 一个控件,没有地方输入目标效应量,d 只能从这批数据估。所以事后功效高低完全由观测 d 与 n 决定,与 p 一一对应。卡① 的结论文案原文就写着:它不能用来论证“不显著只是因为样本量不够”。要论证样本量够不够,看卡④ 的 MDES。
- 别把观测效应量当真实效应量去规划下一次研究。 卡④ 第四张表就是为这件事准备的:同样的数据,按观测 d = 0.7056 算每组只要 33 人,按 ×0.5 的保守情景(d = 0.3528)就要每组 128 人,差 4 倍。观测效应量是有噪估计且倾向被高估,尤其小样本;表注给的惯例是按观测值的 50%~75% 做保守情景。真正正当的效应量来源是文献、预实验或专业上有意义的最小差异。
- 分配比表不是“1:2 更省人”的意思。 目标功效同为 80% 时,1:1 合计 66 例,1:0.5 合计 74 例,1:2 合计 75 例——等组设计在总样本量给定时功效最高。非等组只在“暴露组稀少”“对照资源受限”这类现实约束下才用,代价是总人数更多,不是优化手段。
- MDES 要看换回原始单位的那一列。 |d| = 0.5157 是个抽象数,乘上 s_pooled = 7.5201 得到 3.8782 个量表分,这才是能拿去问专家“这么大的差算不算事”的量。如果这个下限已经大到没有实际意义,说明当前样本量对本研究问题不够;反之若小到没人在乎,加样本也没有价值。
报告里有什么
- 输出结果一:数据概览与前提检验
- 输出结果二:功效与所需样本量
- 输出结果三:功效曲线
- 输出结果四:敏感性分析(MDES 与 α/分配比/效应量敏感性)
- 输出结果五:结论与样本量报告表述
横轴为**等组设计下的每组样本量**,纵轴为在观测效应量 |d| = 0.7056、α = 0.050 下的检验功效 (1-β),橙色虚线为 0.80 目标功效参考线。可用右上角切换器切到「表格」逐点读数。