连续效应Meta(MD/SMD)
这个方法是做什么的
把多项研究的“两组连续结局”合并成一个总的效应估计。要拖六列:两组各自的均值、标准差、样本量(研究标签可选)。一行是一项研究,不是一个受试者——你填的是每篇文献表格里那一行汇总统计量,不是原始数据。效应量由选择器决定:标准化均值差 SMD(默认,用 Hedges g)或均值差 MD,两者都在原尺度上合并,不做对数变换。
除了合并值与它的 95% 置信区间,第一张卡逐项列出各研究的效应量、95%CI、固定效应权重与随机效应权重,并把 Q 检验、I²(附 95% 置信区间)、τ² 与 τ、H² 排成一张诊断表;第二张卡把固定效应(逆方差)与随机效应(DerSimonian-Laird)并排给出,再加一行 95% 预测区间;第三张卡是森林图与漏斗图;第四张卡做留一法与四项发表偏倚诊断(Egger、Begg、Duval-Tweedie 剪补、Rosenthal 失安全数);第五张卡整理成可誊写的学术表述。选 SMD 时表注会逐字给出 Hedges g 的合并标准差、小样本校正因子 J 与方差公式。
需要准备什么数据
- 研究标签 (可选)(可选):不限
- 试验组均值:不限
- 试验组标准差:不限
- 试验组样本量:不限
- 对照组均值:不限
- 对照组标准差:不限
- 对照组样本量:不限
数据要求
- 数据表至少 3 行。
- 单列缺失率不超过 30%。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 多项随机对照试验报告了同一个连续结局的两组均值±标准差(评分、浓度、时长)
- 各研究用的量表不同但测的是同一个构念,需要一个可跨量表比较的效应量(选 SMD)
- 各研究用的是同一把尺子、同一个单位,希望结论保留原始单位(选 MD)
- 系统评价需要合并效应并一并报告异质性与发表偏倚
数据上的前提:六列都是数值,两组标准差严格大于 0,两组样本量都不小于 2,至少 3 项研究(合并本身 2 项就够,I² 的区间估计与发表偏倚检验需要 k ≥ 3)。选 MD 还多一条硬前提:各研究必须使用同一量表、同一单位,否则只能选 SMD。
什么时候不要用它
- 想按剂量、随访时长或人群分层看效应怎么变:本模块没有亚组与调节变量的拖拽区,把各研究的效应量与其标准误整理好,改用「通用效应量Meta(亚组/回归)」。
- 原文只给了中位数与四分位距,或只给了 t 值、p 值,拿不到均值与标准差:六个必填区填不满;能从原文换算出效应量与标准误的,用「通用效应量Meta(亚组/回归)」。
- 是单臂研究,只有一组治疗前后变化的均值与标准差,没有对照组:两组结构填不进去,先算好效应量与其标准误,再用「通用效应量Meta(亚组/回归)」。
- 结局是二分类(有效/无效、复发/未复发):用「二分类效应Meta(OR/RR/RD)」。
- 各研究报告的是相关系数与样本量:用「相关系数Meta」。
- 手上是一项研究的原始个体数据,不是多项研究的汇总:那不是 Meta 分析,两组比较用「独立样本T检验」。
容易误读的地方
- MD 和 SMD 不是精度之别,是单位之别,而 SMD 的分母会把结论搅进来。 MD 就是两组均值相减,保留原单位;SMD 先除以合并标准差,把差异折算成“多少个标准差”。除下去的这一步意味着:同样的绝对疗效,纳入人群越同质(标准差越小),SMD 就越大。本次数据里 Li 2017 的原始均值差是 9.44,比 Zhang 2016 的 8.12 更大,但它的 Hedges g 反而更小(0.8073 对 0.8525)——因为 Li 那批人的标准差更大。所以 SMD 的排序不等于疗效的排序,它同时反映了各研究招了一批多整齐的人。
- 换一个效应量口径,异质性和发表偏倚的结论跟着变,可它们是同一批研究。 同样这 12 项研究:选 MD 时 I² = 79.2%(高度异质)、Egger 检验 p = 0.051;选 SMD 时 I² = 73.5%(中度异质)、Egger p = 0.509。数据一个字没改,只是换了折算方式。这说明 I² 不是“这批证据的异质性”这种绝对量,它是研究间变异占总变异的比例,分母里的研究内方差随口径与样本量而动;也说明漏斗不对称检验的结论比大多数人以为的脆弱得多。要谈异质性的绝对大小,看 τ(SMD 下 τ = 0.2835 个标准差,对着合并值 0.6004 看就知道有多大),不要只看 I² 那个百分数。
- 选 SMD 时,效应量和它的精度在算术上就不独立。 表注给出的方差公式是 (n₁+n₂)/(n₁n₂) + g²/(2(n₁+n₂)):g 越大,方差越大,标准误越大,权重越小。也就是说,一项研究只要效应量大,它在漏斗图上就会自动往标准误大的一侧挪一点——而 Egger 与 Begg 检验的正是“效应量与精度是否相关”。所以 SMD 的漏斗不对称里,天然掺着一份与发表偏倚无关的机械成分,把它单独当作发表偏倚的证据要更谨慎。
- 置信区间说的是这个平均值有多准,预测区间说的才是下一项研究会怎样。 本次随机效应合并 SMD = 0.6004,95%CI [0.4128, 0.7881],看起来结论很硬;但同一张表下面那行 95% 预测区间是 [−0.0662, 1.2671],把 0 包了进去。两者不矛盾:前者刻画“各研究真值的平均落在哪”,后者刻画“再做一项同类研究可能落在哪”。异质性越大两者差得越远,写讨论时把预测区间一起报出来,比只报一个漂亮的置信区间诚实得多。
- 0.2 / 0.5 / 0.8 是统计学惯例,不是临床意义的分界。 表注给的这套判读来自经验,它不知道你的量表一分值多少钱。同一个 g = 0.6,在一把 100 分的生活质量量表上可能只对应几分、低于最小重要差值,在另一个结局上却可能改变治疗决策。要回答“值不值得”,MD 的原单位比 SMD 更能与临床对话——如果各研究确实同量表同单位,不妨两个口径都跑一遍:用 SMD 判断证据强度,用 MD(本次 6.0033,95%CI [3.9989, 8.0077],单位就是你那把尺子的单位)向读者解释这意味着什么。
报告里有什么
- 输出结果一:纳入研究概览与异质性前提检验
- 输出结果二:合并效应主结果表
- 输出结果三:森林图与漏斗图
- 输出结果四:敏感性分析与发表偏倚检验
- 输出结果五:结论与学术表述
森林图在 标准化均值差 SMD(Hedges g) 的自然尺度上展示:每行一个研究,圆点为点估计(面积 ∝ 随机效应权重),横须为 95% 置信区间;底部红色菱形为随机效应合并效应及其区间;灰色虚线为无效参考线(标准化均值差 SMD(Hedges g) = 0.00),区间跨过该线即在 0.05 水平不显著。
漏斗图横轴为各研究的效应量(分析尺度),纵轴为标准误(越靠上越精确);两条斜虚线为 95% 伪置信漏斗边界。若不存在小研究效应,散点应大致对称分布在漏斗内。