二分类概率单位回归(Probit)

所属分类:回归分析

这个方法是做什么的

和「逻辑回归」一样,用一组自变量解释“发生 / 不发生”这类两分类结果,估计的都是事件发生的概率。两者的差别只在连接函数:逻辑回归假定潜在倾向的误差服从 Logistic 分布,Probit 假定它服从标准正态分布。两条 S 形曲线几乎重合,选哪个通常不由数据决定,而由学科惯例决定——生物测定、心理物理学与经济学的离散选择模型习惯用 Probit,医学与流行病学习惯用逻辑回归。

真正的差别在系数怎么读:Probit 的 β 是潜变量尺度上的效应,取指数得不到优势比,报告里也不会出现 OR 这一列。为了让系数可解释,系数表另给“平均边际效应 AME”一列(AME = 平均 φ(xβ) × β),含义是该自变量每增加 1 个单位、事件概率平均变化多少——要谈概率只能用这一列。此外报告给出模型整体的似然比检验、AIC/BIC、三个伪 R²、Brier 分数、ROC 与 AUC(含 95%CI)、Hosmer-Lemeshow 校准检验、Cohen's κ、分类交叉表与无信息率检验,以及各斜率 p 值的 Holm 校正列。

需要准备什么数据

  • 因变量 (Y):定类变量(分组/标签)
  • 自变量 (X):至少 1 个

数据要求

  • 数据表至少 30 行。
  • 单列缺失率不超过 20%。
  • 不接受取值全都一样的列(零方差列没有可分析的变异)。
  • 「因变量 (Y)」必须正好是 2 个类别。
  • 「因变量 (Y)」的每一组至少 5 个样本。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

什么时候用它

  • 结局是两分类,且本学科的既有文献与模型就是按 Probit 报告的(剂量-反应、离散选择、心理物理阈值)
  • 想直接说出“这个因素让事件概率平均提高几个百分点”,而不是绕道优势比
  • 需要与已发表的 Probit 系数对齐:只有同一尺度上的系数才能互相比较
  • 事件与非事件都不算罕见,样本量够支撑最大似然估计

拖入的因变量必须恰好 2 个取值、每类至少 5 例,自变量可定量可定类(定类会自动展开哑变量,参照类为排序最前的水平)。卡① 实测四条前提:EPV(较少一类的例数 ÷ 待估斜率个数,经验要求 ≥10)、事件率是否落在均衡区间、有没有完全分离(按最大 |系数| 与最大标准误的量级判断)、最大 VIF。要注意 Probit 的核心假定——潜变量误差服从标准正态——数据本身检不出来,卡① 明说了这一条,只能靠卡④ 的 Hosmer-Lemeshow 与 Brier 分数间接评估。

什么时候不要用它

  • 需要报告优势比 OR:Probit 系数取指数没有意义,医学与流行病学的报告惯例又是 OR——直接用「逻辑回归」,它给的就是 OR 及其 95% 置信区间。
  • 结局多于两类:本模块要求因变量恰好 2 个取值,否则直接拒绝。类别有序(轻 / 中 / 重)用「有序逻辑回归」;无序多分类所需的多项 Logistic 本产品未提供,可行的做法是按研究问题合并成两类后回到本模块,或改用能直接处理多分类的「CHAID决策树」「随机森林分类」。
  • 数据是按剂量分组的反应率(每个剂量给出受试数与反应数,要算 LD50/EC50 与 95% 置信限):那是另一套口径,用「概率单位回归(剂量分析)」。
  • 配对或成组匹配的病例对照:本模块按独立观测估计,会把系数朝无效方向拉、白白损失效能(不是把 p 值算得过小——忽略匹配在这里偏保守)——用「条件逻辑回归」;同一对象多次测量或分层嵌套的数据用「广义估计方程(GEE)」或「广义线性混合模型(GLMM)」。
  • 关心的是“多久之后发生”而不是“是否发生”,且随访有删失:用「Cox比例风险回归」。
  • 结局本身是数值或计数:不要为了套用本模块而人为二分化,那会丢掉信息且结论随切点变化——数值用「线性回归 (最小二乘法)」,计数用「计数数据回归」。

容易误读的地方

  • 先看卡① 的“因变量编码”那一行,本模块没有让你指定事件类别的开关。 因变量是数值时取较大值为 1,是文本时按类别名称的字符顺序排、排在后面的记为 1。取值写成“复发 / 未复发”时,“复发”会被编成 0、“未复发”编成 1,于是整份报告算的是不复发的概率,全部系数与 AME 的正负都反了过来。「逻辑回归」顶部有“事件类别”输入框可以纠偏,Probit 这里没有——方向不对只能回到数据里把该列改成 0/1 数值编码(要当事件的那一类填 1)再重跑。
  • Probit 系数与 Logit 系数不能比大小。 同一份数据,Logit 的系数大约是 Probit 的 1.6 倍,这只是两种误差分布的方差标定不同,不代表效应更强。报告卡⑤ 专门写了这条尺度提示。跨文献比较、或把两个模型的结果并排放进同一张表,都必须先说明各自的尺度,或干脆改比 AME——AME 在概率尺度上定义,两种模型可比。
  • AME 是“平均”边际效应,不是每个人的边际效应。 概率曲线是 S 形,同样增加 1 个单位,处在概率 0.5 附近的观测变化最大,处在两端的几乎不动;AME 把全样本的 φ(xβ) 平均之后再乘 β,得到的是一个代表值。它的 95%CI 由 β 的置信区间乘同一个平均密度得到,属于近似区间,没有计入平均密度本身的抽样波动(表注写明了),因此比它看上去要乐观一点。
  • Hosmer-Lemeshow 不显著不等于模型正确,AUC 高也不等于能预测新样本。 HL 检验的原假设是“预测概率与实测发生率一致”,p 大才是好消息,方向与常规检验相反;它功效低、对十分位分组敏感,某些组期望频数太小时统计量算不出来,表里显示“—”,那表示这次没做成,不能读成拟合良好。AUC、准确率、κ、Brier 全部由同一批数据既拟合又评估得出,卡③ 与卡④ 都注明会高估真实判别力,要当预测模型用必须另做外部验证。
  • 准确率必须跟无信息率比。 卡④ 直接给出 NIR(恒判为多数类能达到的准确率)和“准确率 ≤ NIR”的单侧精确二项检验——只有超出 NIR 的那部分才是模型的贡献。同时 0.5 只是固定阈值不是最优阈值:灵敏度与特异度的取舍完全由阈值决定,漏判代价高就该调低阈值,卡③ 的 ROC 表视图给了 Youden 最优阈值可参照。
  • 本模块不检验连续自变量的线性,但它照样需要线性。 Probit 假定连续自变量与潜变量指数 xβ 成线性关系,而卡① 的前提清单里没有这项检验(「逻辑回归」那边有 Box-Tidwell 检验可查)。散点或专业知识提示关系是 U 形、阈值型时,应先给该变量分段或加平方项后重跑,或改用「限制性立方样条(RCS)」把非线性形状画出来。
前提检验不显著不等于前提成立
概念图1 前提检验不显著不等于前提成立
检验只能拒绝原假设,不能证明它成立。p = 0.42 既可能是真的没有差别,也可能是样本量不够、差别没被检出来,两者从这个 p 值上分不开。规范的写法是「没有证据表明……」;要论证「两者确实相当」,需要另做等价性检验。

报告里有什么

  1. 输出结果一:数据概览与前提检验
  2. 输出结果二:模型整体检验与回归系数主结果表
  3. 输出结果三:系数森林图、ROC 与校准可视化
  4. 输出结果四:效应量与事后分析
  5. 输出结果五:结论与学术表述
Probit 回归系数森林图(点估计与 95%CI,零线为不显著界)
图1 Probit 回归系数森林图(点估计与 95%CI,零线为不显著界)
ROC 曲线(模型内拟合,AUC=0.808)
图2 ROC 曲线(模型内拟合,AUC=0.808)
校准图(各十分位组的预测概率 vs 实测发生率)
图3 校准图(各十分位组的预测概率 vs 实测发生率)
卡③ 用三张图看模型:森林图看各系数的方向与显著性,ROC 看判别力,校准图看预测概率是否可信。

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程