逻辑回归

逻辑回归

所属分类:回归分析

这个方法是做什么的

因变量是「发生 / 不发生」这类两分类结果时用的回归方法。它不直接预测 0 或 1,而是预测事件发生的概率,并把每个自变量的影响表达成优势比 OR:OR 大于 1 是危险因素,小于 1 是保护因素,等于 1 表示没有关联。

报告除了系数与 OR,还给出模型整体检验、伪 R²、校准检验、ROC 曲线与混淆矩阵。自变量可以是数值也可以是分类,分类的会自动做哑变量编码。

什么时候用它

  • 患者术后是否复发,与年龄、肿瘤直径、术前指标的关系
  • 用户是否付费,与访问次数、来源渠道、注册时长的关系
  • 设备是否在保修期内发生故障

什么时候不要用它

  • 因变量多于两类:本模块会直接拒绝。类别有序(轻 / 中 / 重)时用「有序逻辑回归」。
  • 因变量本身是数值(评分、金额):不要为了用这个方法而人为二分化,那会丢掉大量信息,且结论随切点变化;用「线性回归」。
  • 事件数太少:经验准则是每个自变量至少要有 10 个少数类事件。300 个样本里只有 12 例复发却放了 5 个自变量,系数会被系统性高估。第一张卡直接给出这个比值的实测值。
  • 某个自变量能完美区分结局(完全分离):极大似然估计不存在,系数与置信区间会变成天文数字。第一张卡会核查这一条。

容易误读的地方

  • 先确认系统把哪一类当成了「事件」。 因变量是文字类别时,模块按类别名称的字符编码顺序自动指定:排在前面的编成 0(参照/非事件),后面的编成 1(事件)。举例来说,取值是「复发 / 未复发」时,「复发」会被编成 0、「未复发」编成 1——于是整份报告算的是不复发的优势比,所有 OR 都成了你想要的那个方向的倒数,真正的危险因素会显示成「保护因素」。第一张卡有一行写明了实际编码,每次都要先看这一行。 方向不对时,在顶部的「事件类别」里填上你关心的那一类(例如填「复发」),系统就会按它来编码;填错了会直接报错并列出实际有哪几类,不会悄悄按别的方向算。留空则沿用上面说的自动判定。
  • OR 不是风险倍数。 OR 是「优势」之比,优势 = 发生概率 ÷ 不发生概率,它和「概率之比」不是一回事。事件很罕见时两者接近,但事件率一高,OR 就会明显夸大相对风险。把 OR = 2 写成「风险翻倍」是最常见的误报之一;准确的说法是「优势为对照组的 2 倍」。
  • 报告里的 AUC、准确率、灵敏度全是训练集回代结果,必然偏乐观。 它们衡量的是模型在自己见过的数据上表现如何,不是换一批人能达到什么。本模块没有做交叉验证或外部验证——真要当预测模型用,这一步必须另做。
  • 准确率要和「无脑基线」比才有意义。 如果 90% 的人都不复发,一个永远预测「不复发」的模型准确率就有 90%。看准确率时先看第一张卡里因变量的分布,比出来高的那几个百分点才是模型的贡献。
  • 分类阈值 0.5 是默认值,不是最优值。 灵敏度和特异度的取舍完全由阈值决定;漏诊代价远高于误诊时就该把阈值调低,而不是沿用 0.5 再抱怨灵敏度不够。

需要准备什么数据

  • 放入[定类]因变量Y:1 个,定类变量(分组/标签)
  • 放入[定量]或[定类]自变量X:至少 1 个
  • 放入[定量]权重项W (可选)(可选):定量变量(数值)

数据要求

  • 数据表至少 30 行。
  • 单列缺失率不超过 30%。
  • 「放入[定类]因变量Y」必须正好是 2 个类别。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

报告里有什么

  1. 输出结果一:数据概览与前提检验
  2. 输出结果二:回归系数表与模型整体检验
  3. 输出结果三:优势比可视化与 ROC 曲线
  4. 输出结果四:效应量、拟合优度与分类性能
  5. 输出结果五:结论与学术表述

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程