单样本t检验功效
这个方法是做什么的
回答两个问题:手上这批数据,检出“某个定量指标的均值偏离给定标准值 μ₀”的能力有多大;以及要稳定检出这样的偏离,正式研究该收多少个观测。拖入 1 个定量变量,在控件里填检验值 μ₀(默认 0)和显著性水平 α(默认 0.05)。效应量口径是 Cohen's d =(x̄ − μ₀)/ s,由这批数据自己估出来。
除了功效这个数,它还给:卡② 的事后功效与达到 80% / 90% 功效所需样本量(单样本设计即观测个数,不是“每组”);卡③ 功效随 n 变化的曲线,可切成表视图逐点读数;卡④ 当前 n 与 α 下达到 80% / 90% 的最小可检出效应量 MDES(|d|),并折算回原始单位(例如 |d| = 0.2578 对应 |x̄ − μ₀| ≥ 0.2009),外加 α 取 0.01 / 0.05 / 0.10 三档的功效对照;卡⑤ 一段可直接誊进论文的表述模板。引擎是 statsmodels 的 TTestPower(非中心 t),双侧 H₀: μ = μ₀。卡① 先摆描述统计、Shapiro-Wilk、偏度峰度和 3×IQR 外极端值占比——因为 d 的分子和分母都由样本估计,这些量直接决定后面的外推可不可信。
需要准备什么数据
- 放入[定量]分析变量:1 个,定量变量(数值)
数据要求
- 数据表至少 3 行。
- 单列缺失率不超过 30%。
- 不接受取值全都一样的列(零方差列没有可分析的变异)。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 用预实验数据估计“要论证某指标偏离国标限值,正式研究得收多少样本”
- 投稿被要求补样本量论证,需要 MDES 与达标样本量两个数
- 已经做完单样本比较,想知道现有样本量能稳定检出多小的偏离
- 因为做了多重比较校正、α 要收到 0.01,先看看效能会掉多少
- 论证“改进测量方法、把 s 压下去”比“再加一批样本”更划算
前提有两条。一是 μ₀ 必须在控件里填对:默认值是 0,忘了改就等于在问“均值是否等于 0”,d 会被算得离谱地大,卡②④⑤ 全线跟着错。二是 t 族的功效公式假定总体近似正态,卡① 的 Shapiro-Wilk、偏度峰度与极端值占比就是给这一条把关。
什么时候不要用它
- 比较的是两组不同对象:用「两独立样本t检验功效」,它按合并标准差算 d,并额外给出分配比与每组人数。
- 同一批对象的前后两次测量:用「配对t检验功效」,它按差值的均值与标准差算 d_z。把“后测”那一列单独拖进本模块、拿前测均值当 μ₀,会把个体间差异算进标准差,前后测相关越高,所需样本量被高估得越厉害。
- 结局是“发生 / 未发生”这类二分类:均值与标准差对 0/1 变量没有实质意义。检验一个率是否等于给定值用「二项式检验」,两组率比较的样本量规划用「两比例(率差)功效」。
- 数据严重偏态或本身是等级评分:检验改用「单样本Wilcoxon符号秩检验」。产品没有非参数的功效模块,常见的保守做法是在本模块给出的样本量上再加 10%~15%。
- 只想知道均值与 μ₀ 的差异显不显著:那是「单样本T检验」的事。本模块不输出 p 值,卡② 的图注写明了功效分析不检验任何原假设。
容易误读的地方
- 卡② 的“事后功效”不能拿来解释“为什么没做出显著结果”。 本模块只有 μ₀ 和 α 两个控件,没有任何地方让你输入目标效应量——d 只能由这批数据自己算。于是事后功效和单样本 t 的 p 值是同一批数字的两种写法,p 越小事后功效越高,一一对应,不含任何新信息。“不显著是因为功效低”是循环论证,卡⑤ 的【方法学提示】原文就是这么写的。
- 规划下一次研究,不要照抄卡② 那个达标样本量。 它成立的前提是“真实效应量恰好等于本次观测到的 d”。观测 d 是有噪估计,小样本下系统性偏大,照它算出来的新研究往往功效不足。正当来源只有三种:文献、预实验,或专业上有意义的最小差异。本模块的卡④ 不像两独立样本、配对、两比例、线性回归那四个功效模块那样给“观测效应量 ×0.5 / ×0.75”的保守情景表,得自己折算——卡② 的结论文案给了换算关系:所需样本量与 d² 成反比,效应量减半,样本量约变 4 倍。
- 读 MDES 要读折算回原始单位的那一列,不是 |d| 本身。 |d| = 0.2578 听着很小,折成 0.2009 mmol/L 才能判断这个幅度在专业上算不算事。反过来,若折算后的下限大到“临床上根本无所谓”,说明当前样本量对这个研究问题明显不够。另外这个折算用的是本样本的 s,s 本身也是估计值,换一批数据会漂。
- α 敏感性那三行不是让你挑一个功效最高的 α。 把 α 从 0.05 放宽到 0.10,功效从 0.8441 升到 0.9089,代价是第一类错误率翻倍。α 应当在看数据之前定死。提高效能的正当途径卡④ 也写了:增大样本量、降低测量误差以压低 s、或在专业允许时改用配对设计消除个体间变异。
- Shapiro-Wilk 不显著不等于“正态成立”。 卡① 的 p = 0.249 只说明这批数据不足以拒绝正态,样本小的时候它几乎拒绝不了任何分布。真正该看的是同一张表里的偏度、峰度和 3×IQR 外极端值占比:极端值会同时拉动 x̄ 并抬高 s,d 一动,卡②③④ 的样本量整条链都跟着动。
检验只能拒绝原假设,不能证明它成立。p = 0.42 既可能是真的没有差别,也可能是样本量不够、差别没被检出来,两者从这个 p 值上分不开。规范的写法是「没有证据表明……」;要论证「两者确实相当」,需要另做等价性检验。
报告里有什么
- 输出结果一:数据概览与前提检验
- 输出结果二:功效与所需样本量
- 输出结果三:功效曲线
- 输出结果四:敏感性分析(MDES / α 敏感性 / 达标样本量)
- 输出结果五:结论与样本量报告表述
横轴为样本量 n,纵轴为检验功效(1-β),橙色虚线为目标功效 0.80 参考线;可切换为表视图查看逐点采样值。