2026时序预测机器学习模型排行榜
时序预测作为工业、能源、金融、交通等领域数字化落地的核心能力,近年伴随时序基础模型、长序列Transformer架构的快速迭代,各类模型在精度、算力开销、少样本适配、多变量兼容等维度分化明显,选型难度持续上升。为方便算法工程师、数据分析师与业务决策者快速横向对比主流方案,科技新知综合豆包、DeepSeek、元宝三大模型协同产出,围绕公开基准测试、工业场景落地反馈、长短期预测表现、部署成本四大维度完成归一化打分与排序,覆盖传统机器学习、深度时序网络与时序基础模型多条技术路线,为时序项目选型提供直观参考。

豆包(2026-08-17):
一、时序基础大模型(零样本预训练,2026 工业前沿)
适合:少样本、跨领域、开箱即用,不需要大量重新训练
Toto‑2.0(Datadog)
在 TIME、BOOM、GIFT‑Eval 三大基准综合第一,对监控指标、高基数时序效果极强;参数 4M‑2.5B 多尺寸,长序列推理速度大幅提升,擅长基础设施、运维指标预测。短板:通用业务多变量能力一般。
Zeus(ICML2026)
腾讯 ICML2026 新作,零样本同时支持预测、补缺失、异常检测、分类;GIFT‑Eval 拿到最优 CRPS、MASE;多任务能力是当前 TSFM 里最强,科研与复杂工业场景优先考虑。
Amazon Chronos‑2
综合通用能力第一梯队,支持多变量、概率预测;零售、业务需求预测表现优秀,开源多尺寸,生产落地案例多。
Salesforce Moirai‑2.0
擅长多变量、不同采样频率混合时序;量化概率输出质量高;参数量轻,资源有限场景友好。
Google TimesFM 2.5
谷歌出品,企业生态完善;单变量零样本表现优秀,适合业务指标;原生不擅长复杂多变量,已经集成 BigQuery,适合谷歌云体系业务。
Granite‑TTM(IBM)
极小参数量,边缘设备、IoT 时序首选,推理延迟极低;精度相比上面几款略低,适合端侧部署。
二、深度定制时序模型(从零训练,有充足训练数据)
适合:自有大量数据集,做监督训练,不使用预训练大模型
PatchTST:超长序列预测标杆,上千步长预测稳定;把序列分 patch,缓解长距离依赖;工业长时序基线首选。
iTransformer:反向 Transformer,把特征做注意力,多变量时序 SOTA;电力、交通多变量任务竞赛高频夺冠。
TimesNet:专门针对多周期、工况突变;工业设备时序效果突出,提取多周期模式能力强。
AutoNHITS / AutoNBEATS:MLP 类时序模型,训练快、推理快;单变量时序,可自动分解趋势季节项;中小步长非常稳健,竞赛常用基线。
TCN:空洞卷积,训练快,比 LSTM 收敛快;适合中等长度时序;长序列能力弱于 PatchTST/iTransformer。
LSTM / GRU:经典基线;长序列梯度消失,现在仅做对比基准,新项目一般不作为首选。
三、传统机器学习树模型(工业高频落地,CPU 即可跑)
适合:小样本、低延迟、需要 CPU 部署,做滑动窗口特征工程
LightGBM:工业时序最常用,速度最快,对缺失、异常鲁棒;需要人工构造时间特征(小时、星期、月、滞后特征);实时预测、边缘时序首选。
XGBoost / CatBoost:精度略高于 LightGBM,内存开销更大;CatBoost 对类别变量友好,适合零售销售时序。
DeepSeek(2026-08-17):
时序预测基础模型(TSFMs)第一梯队
这类模型基于海量数据预训练,具备强大的零样本(Zero-shot)预测能力,是当前研究的前沿。
Chronos-2 (AWS):在多项基准测试中稳居顶尖水平。它在平稳序列预测上表现尤为突出。其优势在于对平稳数据的高精度建模,并原生支持多变量预测,上下文长度可达8,192。
TimesFM 2.5 (Google):与Chronos-2并列为性能冠亚军。它在处理非平稳序列(即统计特性随时间变化的数据)时表现更佳。其上下文窗口更长(16,384),参数量约2亿。
EXAONE Forecast (LG AI研究院):在2026年8月的GIFT-Eval零样本时序预测评测中排名第一,超越了谷歌和阿里巴巴的模型。它基于互联网、销售、能源、金融等多行业的真实与时序数据训练而成。
极具竞争力的新兴模型
这些模型在特定基准或任务上展现了超越或比肩顶尖基础模型的实力。
DLFormer:在2026年7月的一项研究中,DLFormer在长时预测任务上综合排名第一,超越了此前公认的SOTA模型iTransformer。它在长时预测中平均MSE(均方误差)比iTransformer提升4.03%,比NLinear提升10.58%。在短时预测中,其性能与iTransformer相当。
TiRex:在多个评测中稳居前列。在一个与19个数据集的对比中,TiRex的几何平均MASE(平均绝对缩放误差)得分为1.351,位列第一。
Moirai-2.0 / Moirai-MoE:在多个基准测试中表现强劲,通常处于第三至第五的位置。在金融回报预测任务中,Moirai-2.0与TimesFM-2.5取得了最强的平均排名。但其MoE(混合专家)版本能耗显著较高。
经典与传统模型的强势地位
尽管基础模型风头正劲,但经典方法和部分非Transformer架构的模型凭借其简单、高效、可解释性强的特点,在特定场景下依然极具竞争力。
iTransformer:作为一个强大的基线模型,它在2026年仍是各类研究的重点比较对象。在短时预测任务中,它甚至能排名第一;在金融预测中,它也能在特定资产(如META)上击败预训练模型。
NLinear:作为一个结构简单的模型,在多个基准测试中表现优异,排名紧随iTransformer之后。
AutoTheta / AutoETS:这些经典的统计模型在特定基准上表现惊人。在一个与19个数据集的对比中,经典模型AutoTheta的几何平均MASE得分为1.362,仅次于TiRex和TimesFM-2.0,位列第三。这表明在追求极简和可解释性时,传统方法依然是可靠的选择。
特定领域与维度的佼佼者
追求极致稳定与泛化:SAMFormer:在2026年的一项评估中,SAMFormer在跨数据集和预测时域上展现了最稳定和一致的性能。
专注短期预测:TimeGPT:在短期预测任务中表现卓越。
追求低能耗与低延迟:Chronos-Bolt:在精度-能耗的权衡中表现突出,实现了持续的低能耗和低延迟。其推理速度比同类模型快250倍,能耗低20倍。
元宝(2026-08-17):
第一梯队:基础模型(Time Series Foundation Models)
这一档是 2026 年真正的"王者组",预训练 + 零样本 / 微调范式已经明显拉开与传统深度学习和统计模型的距离 。
TimeRouter(MASE 0.67) — GIFT-Eval 榜单现役第一,核心思路是"高效自适应路由多个时序基础模型",相当于用路由网络把 Chronos、TimesFM、Moirai 等子模型的优势按需组合 。
TiRex-2-Pretrained(MASE 0.68) — 把基于 xLSTM 的 TiRex 扩展到多变量与流式场景,在 M4-Monthly 上单模型 sMAPE 9.65,是"最佳单模型"之一;在 TIME 基准也位列综合前三 。
Toto 2.0(2.5B 微调版,MASE 0.68) — Datadog AI 研究院与 CMU 联合发布,首次在时间序列领域验证了"参数越大越准"的可靠 scaling law,从 4M 到 2.5B 五个尺度全面领先对手 。
Timer-S1(MASE 0.69) — 十亿级参数的时序基础模型,主打"串行 scaling"。
Chronos-2(MASE 0.70) — Amazon 出品,120M 参数。在 TIME 基准上 综合排名第一,且在平稳(stationary)数据上表现最佳;零售、能源、金融等混合域零样本强 。
TimesFM 2.5(MASE 0.71) — Google 出品,200M 参数,patch-based decoder 架构。在 Impermanent 早期快照里整体领先 ,在 TIME 基准上与 Chronos-2、TiRex 并列前三,且在非平稳 / shifty 序列上反超 Chronos-2 。
一个关键观察:没有一个模型在所有基准上都第一。Chronos-2 赢在平稳数据和综合零样本;TimesFM 2.5 赢在非平稳;TiRex-2 / Toto 2.0 / TimeRouter 赢在 GIFT-Eval 这种大规模综合榜。这也是为什么 2026 年的生产实践更倾向于"按场景选型"而不是"追一个总冠军"。
第二梯队:强基础模型 + 顶级深度学习模型
Moirai 2.0 R-Small(MASE 0.73) — Salesforce 的新一代 Moirai,采用 decoder-only + 分位数损失,概率预测 / 不确定性量化最强,适合金融、供应链等需要校准预测区间的场景 。
FlowState-r1.1(MASE 0.70) — 零样本模型,GIFT-Eval 表现亮眼。
Reverso-Small(MASE 0.73) — 2026 年 2 月发布的零样本模型。
Kairos-50M / Sundial Base 128M / Toto Open Base 1.0(MASE 0.74~0.75) — 各自在特定子集上有亮点。
PatchTST-FM-r1(MASE 0.71) — 2026 年 2 月的零样本版本,延续了 PatchTST 架构的稳健性。
深度学习代表:PatchTST、TFT、N-BEATS — 在 GIFT-Eval 的细分场景(尤其是高频数据、交通 / 云运维等高熵领域)依旧能打赢基础模型 ;在 QuitoBench 上,深度学习模型用 少 59 倍的参数就能匹配或超过基础模型 。
第三梯队:统计模型与经典机器学习
TabPFN-TS(零样本,MASE 0.77) — 把表格基础模型引入时序,零样本表现惊人 。
AutoARIMA / AutoETS / AutoTheta / N-HiTS — 在 M4-Monthly 这种强季节性月度数据上,统计模型 + 精心特征工程仍然极具竞争力;M5 竞赛早就证明:零售需求预测里 LightGBM + 特征工程能打穿花哨神经网络 。
N-HiTS、AutoNBEATS、AutoTFT — 在 Impermanent 基准的某些时间切片上甚至超过部分基础模型 。
下一篇:没有了

人工智能
软件应用
智能硬件
数字娱乐
未来出行
生命科技
科技快讯
关于我们
网站首页






