方法选型决策指南:预测类问题怎么选方法(深度版)
面对『未来会是多少』,先看数据有没有时间顺序、够不够长、稳不稳,再选插值/回归/时序/机器学习。
分类:🔮 预测类 适用:销量/人口/负荷预测、趋势外推、含季节性的时间序列
一、这个指南适合谁(适用场景)
- 销量/人口/负荷预测
- 趋势外推
- 含季节性的时间序列
二、选型决策要素
- 看数据结构:是否带时间索引
- 看样本量:大/小
- 看平稳性/季节性
- 看是否要解释性
- 匹配方法→误差评估
三、选型的底层逻辑
预测的本质是函数估计 :从历史或特征中学会一个映射,外推到未来。这里有两对核心张力,决定方法选型:①偏差—方差权衡——简单模型(线性、指数平滑)偏差大但方差小、稳;复杂模型(神经网络、集成)方差大但偏差小、表达强。样本少时复杂模型会过拟合(方差爆炸),样本多时才值得上。②可识别性——时序预测能否成立,取决于历史是否蕴含未来的统计规律;非平稳序列(均值/方差随时间变)破坏了这种可迁移性,必须先差分/去趋势再建模。所以选方法不是"越高级越好",而是在"样本量、平稳性、可解释性"三个约束下,选偏差—方差最优点。
四、决策模型与推导
预测误差分解(偏差—方差):预测误差的期望平方
为不可约噪声。模型复杂度上升→偏差↓但方差↑。最优复杂度在两者之和最小处:
小样本时选低复杂度(灰色/平滑),避免 主导;大样本时可选高复杂度。
平稳性与 ADF:对非平稳序列直接拟合会产生"伪回归"。ADF 检验原假设 :存在单位根(非平稳)。拒绝 才可用 ARIMA 等。差分阶数 取使序列平稳的最小整数。
模型选择准则:在候选阶数/复杂度间选
为参数个数, 为样本。AIC/BIC 越小越好,它们在"拟合优度"与"复杂度惩罚"间权衡,避免过拟合——这正是"至少 2 种方法对比、用测试集误差评估"的理论依据。
五、选型流程(怎么选)
- 无时间顺序、只有『x→y』→ 回归(线/多项式/岭)。
- 有时间序列、样本少、要解释 → 灰色预测 GM(1,1)。
- 有时间序列、平稳、要短期 → 移动平均/指数平滑/ARIMA。
- 有明显季节/周期 → 季节性分解 + SARIMA 或 Prophet。
- 样本大、非线性、不苛求解释 → 随机森林/XGBoost/神经网络。
- 用 MAE/RMSE/MAPE 横向比多种方法。
六、问题 → 方法 映射
- 灰色 GM(1,1):小样本(<30)、近似指数增长首选;注意残差检验。
- ARIMA:平稳序列经典;先做差分/ADF 检验。
- 机器学习:大样本、特征多;警惕过拟合,要交叉验证。
七、常见误选与对策
- 小样本硬上深度学习 → 过拟合、不可解释。
- 不做平稳性直接 ARIMA → 伪回归。
- 无误差对比只报一个点 → 不可信。
- 把训练误差当预测精度 → 要测集误差。
八、选型自检清单
- 已判断数据是否时序
- 方法匹配样本量与平稳性
- 至少 2 种方法对比
- 用测试集误差(MAPE/RMSE)评估
- 结果有置信/区间说明
九、配套资源与搭配
- 灰色预测 GM(1,1) 速成手册
- 算法速成手册(预测类)
- 敏感性分析与误差分析
本指南由 MCM520 资料站自动生成(深度版),配套算法速成手册可在资源页下载。
10、实战案例
案例:预测问题选题
常见类型:销量预测、股价预测、人口预测
推荐模型:ARIMA、灰色预测、神经网络
实战案例
预测类问题选型实战
场景:根据数据特性(平稳/周期/多变量)选预测模型。
任务:用数据诊断驱动模型选择。
完整代码(text)
诊断流程:
1. 平稳性 ADF 检验
- 不平稳 → 差分/对数转平稳
2. 周期性检测(FFT/自相关)
- 有周期 → 季节模型(SARIMA/Prophet)
3. 多变量?
- 是 → VAR / 机器学习(XGBoost)
- 否 → ARIMA / 指数平滑
速查:
短期→指数平滑;长期→ARIMA/ML;
多特征→XGBoost/LSTM。
运行效果
选型案例:
- 平稳无季节 → ARIMA(1,1,1)
- 强季节(销售)→ Prophet/SARIMA
- 多因素(房价)→ XGBoost
- 长期依赖(股价)→ LSTM
坑:直接上LSTM训不出→先用ARIMA基线。