稳健回归(Huber M估计)
这个方法是做什么的
和普通最小二乘一样,用若干定量自变量解释一个定量因变量,给出每个自变量的系数 B、标准误、标准化系数 Beta、95% 置信区间与 p。差别在拟合准则:最小二乘让残差平方和最小,于是一个离得很远的点被平方放大后能把整条回归线拽过去;Huber M 估计改用迭代重加权最小二乘(IRLS),标准化残差落在调谐常数 c=1.345 以内的观测按权重 1 计入,超出的按残差大小降权,越离谱压得越低。它不要求误差正态——这正是它相对最小二乘的优势——但仍然要求线性设定成立、自变量之间没有严重共线,而且它不处理异方差。
报告有两处是普通回归报告里没有的。卡① 的“离群倾向检验”把本次被降权的观测数拿去和“正态误差下本来就会被降权的比例”做单侧二项检验,这个基准是 17.9%(即 |标准化残差|>1.345 的正态概率),强离群(权重<0.5)的基准是 0.71%。卡④ 的“稳健性对照”把 Huber 系数与同一组变量的最小二乘系数并排列出,逐个算相对偏移。另外要注意,报告里的 R²、调整 R²、Cohen f² 与整体 F 是由稳健残差套用最小二乘公式换算的参考值,表注写明它们“不是稳健估计固有的拟合统计量”。
需要准备什么数据
- 因变量 (Y):定量变量(数值)
- 自变量 (X):至少 1 个,定量变量(数值)
数据要求
- 数据表至少 30 行。
- 单列缺失率不超过 20%。
- 不接受取值全都一样的列(零方差列没有可分析的变异)。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 因变量里有少数几个异常高或异常低的观测,删掉没有正当理由、留着又怕它主导结论
- 误差呈厚尾(主体紧凑、两端拖着几个远点),但你仍然想要一张可解释、能写进论文的系数表
- 已经跑过最小二乘,想加一道“换个拟合准则、结论还在不在”的保险
- 样本量不大,单个极端观测的影响足以改变某个系数的大小甚至符号
因变量与自变量都必须是定量列——本模块不做哑变量编码,拖入定类列会被直接拦下并提示先编码;两侧都不能是常数列。有效样本量至少为“自变量个数+3”,声明的行数下限是 30,因为 IRLS 迭代在更小的样本上不稳定。
什么时候不要用它
- 异常出在自变量一侧(高杠杆点):Huber M 只对因变量方向的离群稳健,卡⑤“模型局限”明确写了它对自变量空间中的高杠杆点稳健性有限。先用「线性回归 (最小二乘法)」的 Cook's D 与「VIF共线性诊断」把这些点定位出来,再决定处理方式。
- 真正的问题是异方差而不是离群:本模块不处理异方差,异方差下它的标准误同样失真。改用推断不依赖同方差的「分位数回归」,或先做「数据变换(Box-Cox/Yeo-Johnson)」再回到「线性回归 (最小二乘法)」。
- 你要的是一整条“多个设定下结论都不变”的证据链(按分组做子样本回归、滞后一期等变体):用「稳健性检验」,它成套地重复估计并汇总各变体的结论。
- 只是想把极端值压回可接受范围、之后照常走常规流程:用「缩尾处理(Winsorize)」,那是改数据;稳健回归是改拟合准则,两者不是一回事。
- 因变量不是连续量:二分类用「逻辑回归」,计数用「计数数据回归」,在某个阈值处堆积用「Tobit回归」。
- 两个变量都带测量误差、你要的是方法间一致性而非因果解释:用「Deming回归」。
容易误读的地方
- “有 24 个观测被降权”本身不构成离群证据。 正态误差下本来就约有 17.9% 的观测会被降权,这是 c=1.345 这个调谐常数的直接后果,不是数据有问题。演示数据里降权 24/120(20.0%)对正态期望 21.4 个,单侧二项检验 p=0.3046,强离群 0 个(期望 0.9 个),报告因此判定“未见超出正态预期的离群倾向”。该看的是降权率与基准的差距,不是降权的个数。
- Huber 与最小二乘的系数几乎一样,不等于这一趟白跑,那本身就是可以写进论文的结论。 演示数据的最大相对偏移出现在常量(3.34%),三个斜率全在 1.5% 以内,说明结论对拟合准则不敏感、可以沿用最小二乘。反过来,若某个系数偏移到几十个百分点,就必须以稳健估计为准并在文中说明差异。卡④ 这张对照表是这份报告最该先看的一张。
- 卡① 的正态性检验在这里不是前提检验。 稳健回归本来就不要求误差正态,这项检验的角色是“值不值得改用稳健回归”:Shapiro-Wilk 不显著时报告写的是“最小二乘已接近最优,稳健回归主要起保险作用”,显著才说明厚尾确实存在。把它读成“前提通过”是反过来了。同一张表里的 Breusch-Pagan 才是真前提——它不显著也不等于同方差成立。
- 系数表的列名写着 t,推断口径却是渐近正态。 表注写明 p 值由 z=系数/标准误 得到、95% CI = B ± 1.96×SE。小样本时这个近似偏乐观,区间会比按 t 分布算的窄一点,报告边缘显著的结论时要意识到这一层。
- 降权不是剔除,被降权的观测仍然参与估计。 权重最小的那个观测(演示数据里 0.5223)影响力被压到约一半,而不是被丢掉。所以不要在文中写成“剔除了 24 个异常值后重新回归”;规范的写法是说明所用的 M 估计范数与调谐常数、被降权观测的数量,以及与最小二乘对照的系数差异——卡⑤ 的结论文案就是这么要求的。
检验只能拒绝原假设,不能证明它成立。p = 0.42 既可能是真的没有差别,也可能是样本量不够、差别没被检出来,两者从这个 p 值上分不开。规范的写法是「没有证据表明……」;要论证「两者确实相当」,需要另做等价性检验。
报告里有什么
- 输出结果一:数据概览与前提检验
- 输出结果二:回归模型系数表
- 输出结果三:自变量重要性
- 输出结果四:效应量与事后分析
- 输出结果五:结论与学术表述
此图基于标准化系数 Beta 绝对值对自变量影响力进行可视化排序。可用图上方切换器在「柱状图 / 条形图 / 表格」之间切换。