MCM520 ← 资料站首页 方法选型决策指南:预测类问题怎么选方法(深度版) 打开交互阅读器 →

方法选型决策指南:预测类问题怎么选方法(深度版)

面对『未来会是多少』,先看数据有没有时间顺序、够不够长、稳不稳,再选插值/回归/时序/机器学习。

分类:🔮 预测类 适用:销量/人口/负荷预测、趋势外推、含季节性的时间序列

一、这个指南适合谁(适用场景)

  • 销量/人口/负荷预测
  • 趋势外推
  • 含季节性的时间序列

二、选型决策要素

  1. 看数据结构:是否带时间索引
  2. 看样本量:大/小
  3. 看平稳性/季节性
  4. 看是否要解释性
  5. 匹配方法→误差评估

三、选型的底层逻辑

预测的本质是函数估计 y^=f(x)\hat y=f(x):从历史或特征中学会一个映射,外推到未来。这里有两对核心张力,决定方法选型:①偏差—方差权衡——简单模型(线性、指数平滑)偏差大但方差小、稳;复杂模型(神经网络、集成)方差大但偏差小、表达强。样本少时复杂模型会过拟合(方差爆炸),样本多时才值得上。②可识别性——时序预测能否成立,取决于历史是否蕴含未来的统计规律;非平稳序列(均值/方差随时间变)破坏了这种可迁移性,必须先差分/去趋势再建模。所以选方法不是"越高级越好",而是在"样本量、平稳性、可解释性"三个约束下,选偏差—方差最优点。

四、决策模型与推导

预测误差分解(偏差—方差):预测误差的期望平方

E[(y−y^)2]=Bias2[y^]+Var[y^]+σ2 E[(y-\hat y)^2]=\text{Bias}^2[\hat y]+\text{Var}[\hat y]+\sigma^2

σ2\sigma^2 为不可约噪声。模型复杂度上升→偏差↓但方差↑。最优复杂度在两者之和最小处:

c∗=arg⁡min⁡c(Bias2(c)+Var(c)) c^*=\arg\min_c\bigl(\text{Bias}^2(c)+\text{Var}(c)\bigr)

小样本时选低复杂度(灰色/平滑),避免 Var\text{Var} 主导;大样本时可选高复杂度。

平稳性与 ADF:对非平稳序列直接拟合会产生"伪回归"。ADF 检验原假设 H0H_0:存在单位根(非平稳)。拒绝 H0H_0 才可用 ARIMA 等。差分阶数 dd 取使序列平稳的最小整数。

模型选择准则:在候选阶数/复杂度间选

AIC=2k−2ln⁡L^,BIC=kln⁡n−2ln⁡L^ \text{AIC}=2k-2\ln\hat L,\qquad \text{BIC}=k\ln n-2\ln\hat L

kk 为参数个数,nn 为样本。AIC/BIC 越小越好,它们在"拟合优度"与"复杂度惩罚"间权衡,避免过拟合——这正是"至少 2 种方法对比、用测试集误差评估"的理论依据。

五、选型流程(怎么选)

  1. 无时间顺序、只有『x→y』→ 回归(线/多项式/岭)。
  2. 有时间序列、样本少、要解释 → 灰色预测 GM(1,1)。
  3. 有时间序列、平稳、要短期 → 移动平均/指数平滑/ARIMA。
  4. 有明显季节/周期 → 季节性分解 + SARIMA 或 Prophet。
  5. 样本大、非线性、不苛求解释 → 随机森林/XGBoost/神经网络。
  6. 用 MAE/RMSE/MAPE 横向比多种方法。

六、问题 → 方法 映射

  • 灰色 GM(1,1):小样本(<30)、近似指数增长首选;注意残差检验。
  • ARIMA:平稳序列经典;先做差分/ADF 检验。
  • 机器学习:大样本、特征多;警惕过拟合,要交叉验证。

七、常见误选与对策

  • 小样本硬上深度学习 → 过拟合、不可解释。
  • 不做平稳性直接 ARIMA → 伪回归。
  • 无误差对比只报一个点 → 不可信。
  • 把训练误差当预测精度 → 要测集误差。

八、选型自检清单

  • 已判断数据是否时序
  • 方法匹配样本量与平稳性
  • 至少 2 种方法对比
  • 用测试集误差(MAPE/RMSE)评估
  • 结果有置信/区间说明

九、配套资源与搭配

  • 灰色预测 GM(1,1) 速成手册
  • 算法速成手册(预测类)
  • 敏感性分析与误差分析

本指南由 MCM520 资料站自动生成(深度版),配套算法速成手册可在资源页下载。

10、实战案例

案例:预测问题选题

常见类型:销量预测、股价预测、人口预测
推荐模型:ARIMA、灰色预测、神经网络


实战案例

预测类问题选型实战

场景:根据数据特性(平稳/周期/多变量)选预测模型。
任务:用数据诊断驱动模型选择。

完整代码(text)

诊断流程:
1. 平稳性 ADF 检验
   - 不平稳 → 差分/对数转平稳
2. 周期性检测(FFT/自相关)
   - 有周期 → 季节模型(SARIMA/Prophet)
3. 多变量?
   - 是 → VAR / 机器学习(XGBoost)
   - 否 → ARIMA / 指数平滑

速查:
短期→指数平滑;长期→ARIMA/ML;
多特征→XGBoost/LSTM。

运行效果

选型案例:

  • 平稳无季节 → ARIMA(1,1,1)
  • 强季节(销售)→ Prophet/SARIMA
  • 多因素(房价)→ XGBoost
  • 长期依赖(股价)→ LSTM
    坑:直接上LSTM训不出→先用ARIMA基线。