二分类效应Meta(OR/RR/RD)
这个方法是做什么的
把多项研究各自的 2×2 四格表合并成一个总的效应估计。要拖四列:试验组事件数、试验组总数、对照组事件数、对照组总数(研究标签可选)。这里的一行是一项研究,不是一个受试者。效应量由一个选择器决定:比值比 OR(默认)、风险比 RR、风险差 RD——OR 与 RR 在对数尺度上合并后再取指数展示,RD 直接在原尺度上合并。
除了合并值和它的 95% 置信区间,报告给的是一整套判断材料。第一张卡逐项列出各研究的效应量、95%CI、固定效应权重与随机效应权重,再用一张诊断表给出 Q 检验、I²(附 95% 置信区间)、τ² 与 τ、H² = Q/(k−1)。第二张卡把固定效应(逆方差)与随机效应(DerSimonian-Laird)并排放着,并补一行 95% 预测区间。第三张卡是森林图与漏斗图,第四张卡做留一法与四项发表偏倚诊断(Egger、Begg、Duval-Tweedie 剪补、Rosenthal 失安全数),第五张卡整理成可直接誊写的学术表述。
需要准备什么数据
- 研究标签 (可选)(可选):不限
- 试验组事件数:不限
- 试验组总数:不限
- 对照组事件数:不限
- 对照组总数:不限
数据要求
- 数据表至少 3 行。
- 单列缺失率不超过 30%。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 多项随机对照试验报告了同一个二分类结局(有效/无效、复发/未复发、死亡/存活)
- 多项队列或病例对照研究给出了同一个暴露与同一个结局的四格表
- 系统评价需要一个合并的 OR 或 RR,并要一并报告异质性与发表偏倚
- 已有四格表,想换一个效应量口径重算,看结论稳不稳
数据上的前提:四列都是非负整数计数,事件数不超过对应组的总数,组总数为正;至少 3 项研究(合并本身 2 项就够,但 I² 的区间估计与发表偏倚检验需要 k ≥ 3)。更要紧的前提在数据之外——这些研究得是在回答同一个问题,这一条报告查不出来,只能靠纳入标准把关。
什么时候不要用它
- 想看效应在哪些研究里更大,按地区、剂量或年份分层:本模块没有亚组与调节变量的拖拽区,把各研究的 ln(OR) 及其标准误整理好,改用「通用效应量Meta(亚组/回归)」。
- 原文只报了 OR/RR 与其 95% 置信区间,拿不到四格表:四格表反推不出来,取对数并由区间宽度反算标准误后用「通用效应量Meta(亚组/回归)」。
- 结局是生存时间,各研究报的是 HR:同样用「通用效应量Meta(亚组/回归)」输入 ln(HR) 与标准误;单项研究自己的生存分析用「Cox比例风险回归」。
- 没有对照组,只想合并一个发生率:用「单率Meta」。
- 结局是连续变量(评分、浓度、时长):用「连续效应Meta(MD/SMD)」。
- 手上只有一项研究的四格表:那不是 Meta 分析,用「卡方检验」;某格期望频数过小时用「Fisher精确检验」。
容易误读的地方
- OR、RR、RD 不是“哪个更保守”的三个档位,它们回答三个不同的问题。 换口径连各研究的权重都会变:Wang 2017 那一行(两组事件率 33.1% vs 61.6%)在 OR 下是 0.3075、占固定效应权重 6.59%,在 RR 下是 0.5365、权重升到 10.90%,在 RD 下是 −0.2857、权重又降到 5.33%;合并值相应是 OR 0.6453、RR 0.7484、RD −0.0931。OR 与 RR 的无效值同为 1,两者之中 OR 离 1 更远、看起来更“强”,但表1 的表注已写明 OR 在事件率较高时会明显夸大风险比。RD 是唯一带绝对量纲、能换算 NNT = 1/|RD| 的口径,代价是它依赖各研究的基线风险。先想清楚要回答的是“风险变成几倍”还是“每一百人里少几例”再选,不要三个都跑一遍再挑好看的报。
- 固定效应与随机效应之别不在保守程度,而在假设。 固定效应假定这 12 项研究估的是同一个真值,随机效应假定它们各有各的真值、你估的是这些真值的平均。表2 末行按 I² ≥ 50% 或 τ² > 0 给出模型建议,那是启发式而不是检验结论:I² 高不等于必须换随机效应,I² 低也不等于固定效应就成立,该看的是这些研究在人群与干预上能不能视作同一个真值的重复。另外本模块的 τ² 只有 DerSimonian-Laird 矩估计一种,不提供区间校正,k 小时 DL 会低估 τ²、使随机效应区间偏窄,方法学部分要如实写明估计方法。
- I² 自己也带着抽样误差,别把点估计当刻度用。 本次 I² = 53.9% 落在“中度”档,但同一格给出的 95% 置信区间是 [11.5%, 76.0%],从低到高整个横跨——这个数其实定不了档。判断异质性的实际大小该看 τ:它与效应量同尺度(本次 ln(OR) 尺度上 τ = 0.2952),而 I² 是个比例,分母含研究内方差,各研究样本量变大时 I² 会跟着涨,哪怕研究间的真实差异一点没变。同理,合并 OR 的 95%CI 是 [0.5131, 0.8116],而 95% 预测区间是 [0.3181, 1.3092],已经跨过 1——“下一项同类研究可能看不到保护效应”,这件事置信区间不会告诉你。
- 留一法一列“结论不变”,只说明显著性没翻,不说明结果稳。 表4 的表注把这层意思写在明处:“更重要的是逐行比较合并点估计与区间的漂移幅度。”同一张表还带一列 I²,值得一并逐行看:本次剔除 Smith 2019 后合并 OR 从 0.6453 变成 0.5933,I² 从 53.9% 塌到 12.5%——显著性一路未变,但异质性几乎全部来自这一项研究,这个信息比“结论不变”重要得多。
- 零格的 0.5 连续性校正只作用在 OR 与 RR 上。 四格中任一格为 0 时 ln(OR) 会发散,模块按惯例给该研究四格各加 0.5,表1 末条表注会明写本次校正了几项(本次数据无零格,写的是未做校正)。这个常数会把效应往无效值方向拉,零事件研究较多时 OR/RR 的合并结果会被它明显左右;而 RD 按 p₁ − p₂ 直接算,算法里根本没有这一步。这正是数据要求里“零事件较多时建议改用风险差 RD”的由来。
报告里有什么
- 输出结果一:纳入研究概览与异质性前提检验
- 输出结果二:合并效应主结果表
- 输出结果三:森林图与漏斗图
- 输出结果四:敏感性分析与发表偏倚检验
- 输出结果五:结论与学术表述
森林图在 比值比 OR 的自然尺度上展示:每行一个研究,圆点为点估计(面积 ∝ 随机效应权重),横须为 95% 置信区间;底部红色菱形为随机效应合并效应及其区间;灰色虚线为无效参考线(比值比 OR = 1.00),区间跨过该线即在 0.05 水平不显著。
漏斗图横轴为各研究的效应量(分析尺度),纵轴为标准误(越靠上越精确);两条斜虚线为 95% 伪置信漏斗边界。若不存在小研究效应,散点应大致对称分布在漏斗内。