差分分析

所属分类:计量经济模型

这个方法是做什么的

把一条非平稳的时间序列做差分(ΔYₜ = Yₜ − Yₜ₋₁)变成平稳序列,回答一个具体问题:ARIMA(p, d, q) 里的 d 该取几。做法是把原序列到 d 阶差分序列逐一送进两个方向相反的检验——ADF 的原假设是“存在单位根(非平稳)”,KPSS 的原假设是“平稳”——取首个同时通过两者的阶数作为建议的 d。

除了平稳性判定,第二张卡的逐阶表还并排给出每一阶的长度、方差与一阶自相关 ρ₁;第四张卡把差分的“效应量”拆成方差比(趋势被去掉了多少)、|ADF| 改进(离拒绝单位根还有多远)、Ljung-Box p(还剩多少可建模的结构),并把“方差不降反升”与“ρ₁ ≤ −0.5”两条经典判据合并成一列“过度差分?”,单元格里会注明触发的是哪一条。第三张卡给原序列、差分序列以及最终差分序列的 ACF / PACF——这是本模块特有的着眼点:它交付的不只是一个 d,还有认 p 与 q 用的那两张图,所以看图之前一定要确认它画的是哪一阶。

需要准备什么数据

  • Y (定量序列):定量变量(数值)
  • 时间字段 (可选)(可选):定量变量(数值)或定类变量(分组/标签)

数据要求

  • 数据表至少 20 行。
  • 单列缺失率不超过 20%。
  • 不接受取值全都一样的列(零方差列没有可分析的变异)。

以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。

什么时候用它

  • 准备做 ARIMA 建模,需要先定差分阶数 d
  • 手上一条经济 / 销售 / 监测序列,想知道它到底平不平稳
  • 已经差过分了,想确认有没有差过头
  • 想同时拿到定 p、q 用的 ACF / PACF 图

前提是 Y 为定量列且按时间等间隔采样。每做一阶差分损失 1 个观测,高阶差分在短序列上会迅速耗尽样本;缺失值按整行剔除,这会打断时间轴的等间隔性,缺失较多时应先做无效值处理。时间字段是可选区,不指定时以原始行顺序为时间顺序。

什么时候不要用它

  • 已经确定要建模并预测:差分只是中间步骤,直接用「时间序列分析(ARIMA)」,带季节成分的用「季节性ARIMA模型」。
  • 只想单独判一条序列平不平稳:用「单位根检验(ADF)」,它专做这件事。
  • 序列是确定性趋势而非随机趋势:强行差分会引入不可逆的 MA 结构,正确做法是去趋势——用「季节分解模型」把趋势项与季节项分离出来。
  • 关心的是几条序列之间的长期均衡关系:先用「协整检验」判有没有协整,再用「ECM模型」同时刻画长期均衡与短期修正。
  • 怀疑序列中间发生过结构突变:ADF / KPSS 在有突变时功效很低,先用「突变点检测(Pettitt)」定位。

容易误读的地方

  • 那个可选的“时间字段”会重排整条序列,拖错一列结论会整个反过来。 实测同一列销售额数据:往时间字段拖入一个并非时间的数值列时,第一张卡写“按……排序”,原序列 ρ₁ = 0.3146、ADF = −0.5997(p = 0.871),判“原序列非平稳,需要差分”,建议 d = 1;什么都不拖(按原始行顺序)时同一列变成 ρ₁ = −0.0466、ADF = −11.3490(p < 0.001),判“原序列已平稳,理论上无需差分”,建议 d = 0,Ljung-Box p = 0.840 还额外提示“已是白噪声”。第一张卡的“时间排序依据”那一行是整份报告里唯一能看出用了哪种口径的地方,动笔之前先核对它。
  • 控件里选的阶数和报告推荐的阶数是两个不同的数,而图是按你选的那个画的。 实测把差分阶数选成 4:第一张卡写“本次差分阶数 d = 4”,第五张卡写“建议差分阶数 d = 1”,第三张卡的图注写“ACF / PACF 基于 四阶差分 后的序列绘制”。也就是说你此刻在看的那两张识图,用的是一条被判定为过度差分的序列。要按建议的 d 去认 p 和 q,必须把控件改回去重跑一次。
  • ADF 显著不代表差分做对了——过度差分的序列照样一路显著。 实测 1 至 4 阶的 ADF 全部 p < 0.001,而方差一路涨:170.4304 → 233.2684 → 661.7100 → 2117.8650 → 7260.5021,ρ₁ 从 −0.4142 跌到 −0.7732,第四张卡把每一阶都判成“是”。所以判断有没有差过头,看的是方差比与 ρ₁ 那两列,不是 ADF 的 p 值。
  • “建议 d = 1”与“第 1 阶存在过度差分迹象”会同时出现,这不是自相矛盾。 两句话的判据本来就不同:建议的 d 取首个同时通过 ADF 与 KPSS 的阶数,过度差分则是“方差不降反升”(该阶方差高于上一阶)或“ρ₁ ≤ −0.5”任一成立即判。而对一条自相关本就不强的序列,差分必然抬高方差——平稳序列差分后的方差约为原方差的 2(1−ρ₁) 倍,ρ₁ 低于 0.5 时这个倍数就大于 1。实测 ρ₁ = 0.3146、原方差 170.4304,按此式约得 233.6,实发 233.2684,两者对得上。两句话同时出现时,该怀疑的是“这条序列究竟需不需要差分”,而不是去找 bug。
  • KPSS 那一列的 p 值是被截断的,“>0.100”不是 0.1。 表注写明 statsmodels 把 KPSS 的 p 值截断在 [0.01, 0.10] 区间内,表中以“>”“<”标注这种截断。所以它只能用来判过不过线,不能拿去做精确比较,更不能写成“KPSS 的 p 值为 0.100”。

报告里有什么

  1. 输出结果一:数据概览与前提检验
  2. 输出结果二:逐阶差分平稳性检验
  3. 输出结果三:序列与自相关可视化
  4. 输出结果四:差分效应量与过度差分诊断
  5. 输出结果五:结论与学术表述
月度销售额(万元) 原始序列
图1 月度销售额(万元) 原始序列
月度销售额(万元) 一阶差分序列
图2 月度销售额(万元) 一阶差分序列
自相关函数 (ACF)
图3 自相关函数 (ACF)
偏自相关函数 (PACF)
图4 偏自相关函数 (PACF)
上方依次为原始序列、各阶差分序列,以及最终差分序列的 ACF / PACF。每张图都可用右上角切换器在「折线/柱状/表格」间互切,切换后的数据与图形完全同源。ACF / PACF 基于 一阶差分 后的序列绘制,红色虚线为 ±1.96/√n = ±0.1797 的 95% 近似置信带,超出该带的滞后阶才视为显著。

在线统计分析平台 · 233 种分析方法 · AI 智能解读

在线使用
使用教程