Google Research 於 2026 年 8 月 31 日發表時間序列預測的基礎模型「TimesFM-3」。過去的世代只能靠單一序列的歷史推演未來,這一代則能同時接收多條序列與外部因素。零樣本、不必額外訓練就能上手的便利性完整保留,同時把實務預測中最惱人的特徵準備工作一併扛了下來。

一條折線遠遠不夠

以銷售預測為例。想知道連鎖店下個月能賣出多少冰淇淋,只看過去的冰淇淋銷量,答案只有一半。甜筒與糖漿等相關商品的走勢、門市來客數、下個月已排定的促銷活動以及天氣預報,這些因素交織在一起,才決定了真正的銷售結果。

然而在 2025 年 9 月推出的 TimesFM-2.5 之前,模型能處理的只有單變量,也就是一條序列的歷史。想運用相關資訊,使用者只能自行打造特徵,或再搭一套機器學習模型。基礎模型「拿來就能用」的最大賣點,一進入實際場域就被稀釋了。

TimesFM-3 從預訓練階段就把多變量當作前提。參數量為 3.3 億,訓練語料由真實資料與合成資料組成,時間點總數超過 1 兆。以模型規模而言並不算大,但它能吸收的資訊寬度確實往上跨了一階。

能接收的三種資訊

TimesFM-3 依性質把輸入分成三類。

第一類是多個目標序列。彼此相關的序列可以一起預測,例如同時預測不同品牌的冰淇淋,而且對每個目標都支援點預測與分位數預測。

第二類是歷史共變量,指來客數這種過去數值已知、未來數值未知的資訊。

第三類是歷史未來共變量,這一類在實務上最有感。促銷日期與天氣預報屬於已經確定的未來安排。由於可以事先告訴模型預測區間內會發生什麼,它便能從歷史中學到「有促銷時銷量會怎麼動」的關係,再套用到未來的排定日期上。

在 Google 提出的範例中,單變量模型只是把週期原樣往後延伸,而接上促銷排程的 TimesFM-3 則在每個促銷日都計入了約 20% 的成長。累積整整一個月,營收預估的落差已經無法忽視。

一次推論就生成整個預測區間

內部結構沿用先前的僅解碼器 Transformer。把連續 32 個時間步的資料點歸為一個 patch,並依序列進行正規化以吸收數量級差異,這些做法都維持不變。針對歷史未來共變量,模型會把目前的 patch 與未來的 patch 串接成一個 token,讓模型能先一步看見已知訊號。

完成 token 化之後的處理被描述為二維格點。時間方向採用因果注意力,某個 token 只能參考同一序列中更早的 token。序列方向則不設限制,同一時間點的 token 可以查看所有其他序列。把這兩種注意力逐層交替堆疊,模型就能同時學習時間模式與序列間的相關性。

生成方式也改了。以往逐個 patch 依序產生,會累積延遲、誤差與運算成本。TimesFM-3 採用 Contiguous Patch Masking,一開始就把預測區間所需的遮罩 token 全部排好,以一次前向傳遞同時填滿。省去了迭代迴圈,速度自然提升。

輸出並不侷限於點估計。對每個目標序列的每個時間點,模型都會回傳第 10 到第 90 百分位共 9 個分位數,預測的不確定性直接以數值區間呈現。在庫存與人力排班上,上下浮動的幅度往往比中位數更具參考價值,這種輸出形式與實務相當契合。

三項基準測試都拿下第一

評測使用了 GIFT-Eval、FEV-Bench 與 TIME 三項公開基準。在預訓練基礎模型這個範疇內,TimesFM-3 於點預測與機率預測兩類指標上都排名第一。比較對象包含支援多變量的 Chronos-2 與 Toto 2.0 系列,以及前一代的 TimesFM-2.5。

值得注意的是,即使完全不提供共變量與跨序列資訊、以單變量模式運行,TimesFM-3 的成績也與其他模型並駕齊驅甚至更好。換句話說,對多變量的支援並沒有犧牲傳統用法的效能。切換到完整的多變量模式後,差距還會被進一步拉開。

現在可以從哪裡開始試

TimesFM-3 已在 GitHub 與 Hugging Face 上公開,與 BigQuery 的整合預計數週內提供。若想更早掌握手感,針對單變量任務的 TimesFM-2.5 已經能透過 BigQuery 的 AI.FORECAST 指令呼叫。它等同於 SQL 的延伸,不需要機器學習的專業知識,拿內部資料做初步驗證相當合適。

Google 表示,TimesFM-3 的開發參考了零售、金融、可觀測性、製造、醫療與自然科學等領域的導入經驗。序列越多,時間序列預測就越難處理,而不必額外訓練就能跨過這道門檻,對於養不起專職資料科學家的團隊來說意義不小。

總結

TimesFM-3 的重點有三:以多變量為前提完成預訓練、用一次推論生成整個預測區間,以及在三項公開基準上拿下第一。能把促銷、天氣這類未來已經確定的資訊交給模型,正是實務預測中最見效的設計。既然 GitHub 與 Hugging Face 上已經拿得到模型,最快的判斷方式就是用手邊的資料分別跑過單變量模式與多變量模式,看看準備共變量到底值不值得。