时间序列分析(ARIMA)
这个方法是做什么的
Box-Jenkins 的标准建模流程:先用 d 阶差分把序列变平稳,再用 p 个自回归项吸收序列对自身滞后值的依赖、q 个移动平均项吸收对滞后误差的依赖,最后外推预测。三个阶数由控件填入,也可以打开“参数自动寻优”让它按信息准则搜。
报告按“定阶依据—估计—诊断—精度”四段走。卡① 用方向相反的 ADF 与 KPSS 联合判断 d 阶差分后是否真的平稳,并给出每个待估参数摊到多少观测。卡④ 是这个模块最值得细看的一卡:Ljung-Box 的卡方自由度按 lag−(p+q) 扣减已估参数,因此低阶的 Q 会显示成“不可估计”而不是通过;再加残差正态性、异方差检验,以及承担效应量角色的预测精度——其中 Theil's U2 把模型误差与“下一期=本期”这个最朴素的基准直接相除,是唯一无量纲、可跨序列比较的指标。读这份报告的着眼点是:拟合优度是回代出来的,真正判断模型好不好用的是残差诊断和 U2,不是 R²。
需要准备什么数据
- 放入时间序列数据 [定量] 变量Y:1 个,定量变量(数值)
- 放入时间项 [定类] 变量(可选):0~1 个,定类变量(分组/标签)
数据要求
- 数据表至少 50 行。
- 单列缺失率不超过 20%。
- 不接受取值全都一样的列(零方差列没有可分析的变异)。
- 「放入时间项 [定类] 变量」的类别数需在 2~1000000 之间。
- 「放入时间项 [定类] 变量」的每一组至少 1 个样本。
以上条目由系统从该方法的校验规则直接生成,与上传数据时的实际拦截规则一致。
什么时候用它
- 一条没有明显季节性的业务或经济序列,需要短期预测与预测区间
- 需要按 Box-Jenkins 规范定阶并留下完整的定阶依据与残差诊断
- 想用一个统计模型作为基准,去对比更复杂方法的增量价值
- 需要写进论文的标准表述:模型设定、参数显著性、信息准则、残差白噪声
前提是等间隔、已按时间排序,至少 50 行——49 行会被直接拦下,这也是 Box-Jenkins 的经验建议。注意“时间项”拖拽区要的是定类变量,它只用于标注横轴,模块不按它排序:把演示数据行序打乱重跑,RMSE 从 1.2071 变成 8.8081、AIC 从 426.94 变成 951.19,而报告不会有任何异常提示。
什么时候不要用它
- 序列有明显的固定周期(月度数据的年周期、季度数据的四季):本模块是非季节性 ARIMA,残差会保留季节自相关,用「季节性ARIMA模型」。
- 只想要一条平滑的外推曲线、不需要定阶:用「指数平滑模型」,它自带趋势与季节状态方程。
- 样本很短(几个到十几个点):ARIMA 定阶在短序列上不可靠,用「灰色预测模型GM(1,1)」。
- 均值看不出结构、波动却明显扎堆:要建模的是条件方差,用「GARCH模型」。
- 有多条互相影响的序列:用「VAR向量自回归模型」。
- 你要的只是拆出趋势项与季节项、不做预测:用「季节分解模型」。
容易误读的地方
- 控件默认的差分阶数是 2,对多数序列是差过头了。 演示数据原序列 ADF p=0.190、一阶差分后 p<0.001,d=1 就够。按默认的 (2,2,2) 跑,AIC 是 430.82;打开自动寻优给出 (2,1,0),AIC 426.71。更要紧的是过度差分的症状:(2,2,2) 的 ma.L1 系数 −0.8129 标准误却高达 5.6880(p=0.886),这是近 MA 单位根导致参数不可识别的典型表现。而卡① 只检查“差分后是否平稳”,不检查“是不是差过头了”——它照样会写“差分设定与平稳性检验结果一致”。
- Ljung-Box 表里的“不可估计”不是通过。 自由度按 lag−(p+q) 扣减,所以 (1,1,1) 模型的 Q(1)、Q(2) 没有有效自由度,(2,2,2) 则是 Q(1)~Q(4) 都没有。这些行不参与模型充分性判定。判断模型够不够充分,要求所有有有效自由度的滞后阶的 p 都不小于 0.05,只要有一阶显著就说明信息没提干净。
- R² 是对原序列水平回代算的,d≥1 时会被自然抬高。 演示的 R²=0.9817 看着极好,但一条有水平持续性的序列,哪怕用“下一期=本期”去预测也能得到很高的 R²。这就是报告同时给 Theil's U2 的原因:U2=0.6684 才是“比朴素预测好多少”的实话。跨模型比较不同 d 的设定时,AIC/BIC 也不可比(因变量都不一样了),只能比预测精度。
- 预测区间比它看起来的要窄。 卡③ 的表注写明:区间只包含参数已知条件下的随机误差,未计入参数估计误差与模型设定误差,因此实际覆盖率通常低于 95%。区间随步长变宽是正常的,但不要把它当成对未来的完整不确定性刻画,尤其在 d≥1 时区间会按 √h 或更快发散。
- 所有精度指标都是样本内的。 拟合值是用全部观测估出来的模型回代得到的,会系统性优于真实的样本外表现。本模块不做滚动原点回测,所以报告里的 RMSE、MAPE 不能用来宣称预测能力;要评价预测能力必须自己留出验证期。
报告里有什么
- 输出结果一:数据概览与平稳性前提检验
- 输出结果二:ARIMA 模型系数估计与信息准则
- 输出结果三:可视化(差分、ACF/PACF、拟合与预测)
- 输出结果四:模型诊断与拟合优度
- 输出结果五:结论与学术表述
本卡依次给出:差分后时序图、ACF、PACF、拟合与预测图,以及预测数值表(可切换为折线视图)。
本卡回答三个问题:残差是不是白噪声(模型够不够充分)、残差满不满足分布假设、模型预测得有多准。