TimesFM-3:面向多变量预测的零样本基础模型
核心架构与推理机制
TimesFM-3 沿用了其前代验证过的 decoder-only transformer 架构。与前作一致,我们将连续数据点按 32 个时间步划分为 patch,以实现时间序列的高效处理。针对尺度差异悬殊的时间序列,我们采用与 TimesFM-2.5 类似 的逐序列归一化策略。Multivariate token construction
针对 target 与 past-covariate 序列,token 直接由单个 patch 生成。但对于 past-future covariates,TimesFM-3 引入了巧妙的“前瞻(lookahead)”机制:每个 token 将当前 patch 与后续 patch 拼接,使模型能够提前“瞥见”已知的未来信号。Alternating attention architecture
Patch 完成 tokenization 后,先经过输入残差块,再进入主 transformer 堆栈。该堆栈以二维网格的方式运作: 1. 因果时序注意力(Causal temporal attention):Token 沿时间轴进行水平关注。为避免数据泄露,该机制严格遵循因果约束——每个 token 仅能关注同一条时间序列中的历史 token。 2. 全变量注意力(Full variate attention):Token 沿序列轴进行垂直关注。在任意时间步,一个 token 均可观察数据集中的其他所有时间序列,从而捕捉复杂的跨序列关联(例如某项促销对另一序列销量的影响)。 上述两种注意力机制在多个层中交替堆叠,无缝融合时序模式与跨序列关联。
TimesFM-3 架构图。
Non-autoregressive decode: Forecasting in a single pass
早期 TimesFM 版本逐 patch 生成预测,带来延迟、误差累积与计算开销。TimesFM-3 采用 Contiguous Patch Masking 策略,单次前向传播即可输出完整预测区间。模型在观测上下文后拼接未来区间的掩码占位 token:目标序列与 past-covariate 系列因未来值未知而被掩码,past–future covariates 则保持可见,从而输入节假日、计划活动等已知未来信号。借助交替注意力层,模型无需迭代即可同时填充所有掩码区间,并输出每个目标时序在各预测步的 9 个分位数(第 10 至 90 百分位),完整刻画预测不确定性。
多元预测示例
我们以冰淇淋销量预测为例。假设你正在制定下月的促销排期,并希望提前预估销量。传统的单变量模型(下图红线)仅依据历史销量外推周度规律,却无法感知特定日期的促销活动。TimesFM-3 的多元模式(下图蓝线)则另辟蹊径:将促销排期以 past-future covariate 形式输入,模型从历史数据中习得促销与销量增幅的关联,再将其迁移至未来的计划促销日。最终预测能准确捕捉到每个促销日约 20% 的销量跃升。图中促销协变量里的琥珀色区块标示了有促销的天数——蓝线预测对每次促销均有明显响应,红线则毫无反应。纵观整月,这种多变量建模显著提升了收入预期的准确度。
促销规划:TimesFM-3 的多元预测借助促销协变量,提前预判未来计划促销日的销量增幅。
评估与基准测试
我们在三个综合性的公开预测基准上评估了 TimesFM-3:Gift-Eval、FEV-Bench 和 Time。在全部三个基准中,TimesFM-3 在所有预训练基础模型的点预测和概率预测指标上均排名第一。下图展示了这三个基准在不同任务上的平均排名,涵盖了点预测精度和概率预测质量(数值越低越好)。
每个图表包含 TimesFM-3 的两条数据。"单变量模式"表示模型在不使用任何协变量或跨序列信息的情况下进行评估,每个目标序列独立处理,如同传统单变量模型。即便如此,TimesFM-3 已能匹敌或超越其他竞品。切换到完整的多元模式后,TimesFM-3 再攀高峰,在所有点预测和概率预测指标上均取得最佳平均排名。
Performance on Gift-Eval (top), Fev-Bench (middle), and Time (bottom): TimesFM-3 in univariate mode already outperforms other replicable time-series foundation models in both point and probabilistic forecasting metrics. Multivariate mode further improves performance by leveraging cross-series information and covariates when available.
结论
我们推出 TimesFM-3,这是 TimesFM 零样本时间序列基础模型家族的新一代产品,在多个公开基准测试上取得了最先进的多变量与单变量预测性能。TimesFM-3 现已在 GitHub 和 Hugging Face 上线,BigQuery 集成版本也将在未来几周内推出。在此之前,您可以立即在单变量任务上试用 TimesFM-2.5,熟悉 BigQuery 中的 AI.FORECAST 命令——无需任何 ML 专业知识。
Acknowledgements
本项目与 Yichen Zhou、Petros Mol、Abhimanyu Das 和 Samet Oymak 合作完成。