线性回归 (最小二乘法)

线性回归 (最小二乘法)

所属分类:回归分析

这个方法是做什么的

用一个或多个自变量去解释一个数值型因变量。每个自变量给出一个系数 B,含义是「在模型里其他自变量保持不变的前提下,这个自变量每增加 1 个单位,因变量平均变化多少」。

除了系数,报告还给出模型整体的解释力、每个自变量各自的唯一贡献,以及一整套「这些 p 值和置信区间能不能信」的诊断:共线性、残差正态、同方差、误差独立、设定形式、强影响点。定类自变量可以直接拖进来,系统会自动做哑变量编码。

什么时候用它

  • 想量化「广告投入每多花 1 万元,月销售额平均多几万」这类问题
  • 多个因素同时存在时,想分离出每个因素的净关联
  • 需要一张可解释、能写进论文的系数表,而不是一个黑箱预测器

什么时候不要用它

  • 因变量是「是 / 否」:用「逻辑回归」。
  • 因变量是等级(1~5 星、轻 / 中 / 重):用「有序逻辑回归」。
  • 因变量是计数(每天的投诉件数,且有很多 0):用「计数数据回归」。
  • 自变量之间高度相关:系数会变得极不稳定——换一批相似的数据,系数可能大幅变化甚至变号。第一张卡的 VIF 诊断就是查这个的,严重时考虑「岭回归(Ridge)」或先做变量筛选。
  • 观测之间不独立(同一批对象的多期数据、同一所学校内的学生):普通最小二乘会低估标准误,把 p 值算得过小,需要面板或混合模型一类的方法。
  • 样本量勉强够、自变量却塞了一堆:下方「数据要求」里的行数下限是技术下限,不是统计下限。经验上每个自变量至少需要 10~20 个观测,第一张卡会给出实测的观测数与自变量数之比。

容易误读的地方

  • 系数是「控制其他自变量之后」的偏效应,不是这个变量单独的效果。 同一个变量,模型里多放或少放一个别的变量,它的系数会变,极端情况下还会变号。所以「广告投入的系数是 3.58」这句话离开了「模型里还有门店面积和折扣力度」就没有意义——报告时必须把整套自变量一起写出来。
  • R² 高不等于预测准。 报告里的 R²、拟合图和各类效应量全部是在训练这批数据上回代算出来的。自变量越多 R² 只会越高(哪怕加进去的是随机数),所以要看调整 R²。至于换一批新数据还能不能行,本模块没有评估,需要另做交叉验证或用新样本验证。
  • 前提不成立时,先失真的是 p 值和置信区间,不是系数本身。 存在异方差时,B 的点估计仍然无偏,但标准误算错了,于是 p 值和置信区间都不能用。第一张卡的 Breusch-Pagan、Durbin-Watson、Ramsey RESET 与残差正态性检验就是逐条查这个的。看到某一项不满足,正确的反应是换稳健标准误或改模型设定,而不是照抄那张系数表。
  • 系数只在你观测到的自变量取值范围内有意义。 样本里门店面积是 20~355 平米,就不要拿这个模型去推 1000 平米的店会怎样。
  • 回归系数不是因果效应。 「控制了其他变量」控制的只是你放进模型的那些。任何一个没放进去、又同时影响 X 和 Y 的变量,都会让系数偏掉,而报告里看不出来。要做因果解读靠的是研究设计(随机化、工具变量、断点),不是往模型里多塞几个控制变量。

需要准备什么数据

  • 因变量 Y (定量):定量变量(数值)
  • 自变量 X (定量/定类):至少 1 个,定量变量(数值)或定类变量(分组/标签)

数据要求

  • 数据表至少 20 行。
  • 单列缺失率不超过 30%。
  • 不接受取值全都一样的列(零方差列没有可分析的变异)。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

报告里有什么

  1. 输出结果一:数据概览与前提检验
  2. 输出结果二:回归系数与模型整体检验
  3. 输出结果三:拟合效果与残差诊断图
  4. 输出结果四:效应量与方差分解
  5. 输出结果五:结论与学术表述

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程