我們推出 TimesFM-3,這是一款最先進的時間序列基礎模型,能夠在單次前向傳播中實現高精度的多變量時間序列預測。它在主要基準測試中顯著超越了其他預測模型。

自從 TimesFM 在 2024 年首次亮相以來,我們看到時間序列基礎模型被廣泛應用於零售、金融、可觀測性、製造、醫療保健和自然科學等多個領域的實際時間序列預測任務。直到 TimesFM-2.5(於 2025 年 9 月發布),我們的模型嚴格限制於單變量預測,即僅使用單一時間序列的歷史數據進行預測。

然而,大多數實際的預測問題本質上是多變量的,其中多個時間序列和輔助外部特徵共同影響時間序列的未來預測。

以零售連鎖店的冰淇淋銷售預測為例,單靠過去的銷售數據很少能說明全貌。一個好的預測還應該參考相關產品(例如冰淇淋甜筒、糖漿)的銷售情況、歷史客流量,以及已知未來事件,如天氣預報、促銷活動和節假日。今天,我們推出 TimesFM-3,這是我們時間序列基礎模型的下一代,原生為多變量預測進行預訓練。

TimesFM-3 擁有 3.3 億個參數,並在包含超過 1 兆個時間點的真實世界和合成時間序列語料庫上進行了預訓練。它在繼承前代模型效率和零樣本泛化能力的基礎上,以零樣本方式增加了對複雜多變量情境的強大支援。它能夠聯合預測多個共同演進的時間序列,捕捉相互依賴關係,從而提高整體準確性,且無需進行特定任務的微調。

該模型原生支援:多個目標:同時預測多個相關的時間序列(例如,聯合預測不同品牌的冰淇淋)。模型支援所有目標的點預測和分位數預測。過去共變數:納入僅在歷史上已知的特徵(例如,過去的客流量)。過去未來(動態)共變數:利用已知的未來事件來指導預測(例如,計劃中的促銷活動或天氣預報)。

底層技術:架構與推論。TimesFM-3 建立在其前代模型已驗證的僅解碼器 Transformer 架構之上。與先前版本一樣,我們透過將連續數據點分組為 32 個時間步長的區塊(patches),來高效處理時間序列。然後,我們對每個時間序列應用類似 TimesFM-2.5 的正規化,以處理規模差異巨大的時間序列。

多變量標記(token)建構。對於目標和過去共變數序列,標記直接從單一區塊建構。然而,對於過去未來共變數,TimesFM-3 採用巧妙的「預視(lookahead)」策略:每個標記將當前區塊與未來區塊串聯起來,讓模型能夠預覽即將到來的已知信號。

交替注意力架構。一旦區塊被標記化,它們會通過一個輸入殘差區塊,並進入主要的 Transformer 堆疊,該堆疊以 2D 網格形式運作。因果時間注意力:標記在時間上水平關注。為防止數據洩漏,這種注意力是嚴格因果的,即標記只能查看其自身特定時間序列中的過去標記。

全變量注意力:標記在序列上垂直關注。在任何給定時間步,標記可以查看數據集中所有其他時間序列,使模型能夠學習複雜的跨序列相關性(例如,一個序列中的促銷活動如何影響另一個序列的銷售)。這兩種注意力機制交替進行多個層,無縫地融合了時間模式與跨序列關係。

非自迴歸解碼:單次傳播預測。TimesFM 的先前版本一次生成一個區塊的預測,這會引入延遲、累積錯誤並增加計算成本。TimesFM-3 採用「連續區塊遮罩(Contiguous Patch Masking)」策略,在單次前向傳播中生成整個預測範圍。

模型將未來範圍的遮罩佔位符標記附加到觀察到的上下文旁邊。目標和過去共變數序列在預測範圍內被遮罩(因為它們的未來值未知),而過去未來共變數則保持可見,為模型提供已知的未來信號,例如節假日或預定事件。

透過交替注意力層,模型同時填補所有被遮罩的預測範圍區塊,無需迭代循環。模型為每個目標時間序列在每個預測步驟預測 9 個分位數(從第 10 到第 90 百分位數),提供了預測不確定性的完整機率視圖。

多變量預測的實例。讓我們再次回到冰淇淋銷售的例子。想像您正在制定下個月的促銷計畫,並希望預測銷售額以進行預期。標準的單變量模型(下圖紅線)僅查看歷史銷售數據並向前推斷每週模式,但它無法得知特定日期的促銷計畫。

TimesFM-3 的多變量模式(下圖藍線)則採用不同的方法:透過將計畫的促銷排程作為過去未來共變數傳入,模型從歷史背景中學習促銷與銷售提升之間的關係。然後,它將這些知識應用於未來有計畫促銷的日期。

結果是預測每個促銷日期的銷售額將增加約 20%。在下圖中,促銷共變數中的琥珀色區塊突顯了哪些日期有促銷活動,而藍色預測明顯對每個促銷活動做出反應,紅色預測則沒有。在整個月份中,這使得預計收入的預測更加準確。

評估與基準測試。我們在三個全面的公開預測基準測試:Gift-Eval、FEV-Bench 和 Time 上評估了 TimesFM-3。在所有三個基準測試中,TimesFM-3 在所有預訓練基礎模型中,無論是點預測準確性還是機率預測品質指標方面,均名列前茅。

下圖顯示了三個基準測試中,點預測準確性和機率預測品質(越低越好)在各任務上的平均排名。我們將其與最近的基礎模型進行比較,包括具備多變量能力的模型,如 Chronos-2 和 Toto 2.0 系列,以及我們的先前模型 TimesFM-2.5。

每個圖表都包含 TimesFM-3 的兩個條目。「單變量模式」點顯示了在沒有任何共變數或跨序列資訊的情況下,模型獨立處理每個目標序列時的性能,就像傳統的單變量模型一樣。即使在這種單變量模式下,TimesFM-3 也已經與其他競爭模型持平或超越。當我們切換到完整的多變量模式時,TimesFM-3 再次躍進,在點預測和機率預測方面均取得了最佳的平均排名。

結論。我們推出了 TimesFM-3,這是我們 TimesFM 系列零樣本時間序列基礎模型的最新一代,它在多個公開基準測試中取得了最先進的多變量和單變量預測性能。TimesFM-3 現已在 GitHub 和 Hugging Face 上提供,其 BigQuery 整合將在未來幾週內推出。

在此期間,您可以立即在 BigQuery 中使用 AI.FORECAST 指令,在您的單變量任務上試用 TimesFM-2.5,無需機器學習專業知識。

致謝。此專案由 Yichen Zhou、Petros Mol、Abhimanyu Das 和 Samet Oymak 共同完成。