IBM Granite Time Series PatchTST-FM-r2:商用友善零樣本預測模型

IBM 發布的 Granite Time Series PatchTST-FM-r2,是面向需求、能源負載、價格、流量與設備遙測等資料的時間序列基礎模型。它主打不必針對每份資料重新訓練的零樣本預測:輸入近期歷史資料,即可產生未來預測與不確定性區間。模型約 3.85 億參數、最長支援 8,192 個時間步,並以 99 分位數輸出同時涵蓋點預測與機率式預測。^[raw/articles/huggingface-ibm-granite-timeseries-patchtst-fm-r2-2026-09-14.md]

核心亮點:把短期波動與長期關係拆開處理

r2 保留 PatchTST 的分段(patch)表示法,但以 Conformer 區塊取代 r1 的標準 Transformer 區塊。每個區塊把多頭注意力與時間卷積結合:卷積較擅長吸收鄰近時間點的局部模式,注意力則可留給較遠的跨區段關係;這是時間序列中「近期衝擊」與「季節性/長週期」並存時相當合理的分工。模型另採 50% 重疊切片、Hamming 視窗與 overlap-and-add 預測,降低切片接縫造成的跳變,並將骨幹擴增至 30 個區塊。^[raw/articles/huggingface-ibm-granite-timeseries-patchtst-fm-r2-2026-09-14.md]

成績要怎麼讀

IBM 以 GIFT-Eval 比較可重現、零樣本且無測試洩漏的模型;截至 2026-09-08,r2 在該子集的 CRPS 與 MASE 均列第 2,幾何平均分別為 0.467 與 0.6846(兩者皆愈低愈好)。更精確的定位不是「所有模型第一」,而是該比較範圍中表現最高、且採寬鬆商用友善授權的模型;放入可使用基準訓練資料的預訓練模型一起比較時,則為 CRPS 第 3、MASE 第 4。這種界定提醒實務團隊:排行榜必須連同零樣本條件、資料洩漏控制與授權條件一起看,不能只截取名次當結論。^[raw/articles/huggingface-ibm-granite-timeseries-patchtst-fm-r2-2026-09-14.md]

對企業落地的意義

模型同時公開權重、架構、推論流程與重現程式,並提供 Apache-2.0 或 OpenMDW-1.0 雙授權選擇;對需要內部部署、審查供應鏈與保留修改權的團隊,這比單純高分更有採用價值。其訓練資料亦列出 GiftEvalPretrain、受限於基準外資料的 TSMixup、KernelSynth 與約 50 萬條 CauKer 合成序列,增加對資料來源與基準洩漏風險的可檢視性;但仍不能取代組織自己的法務、資料治理與場域驗證。

若使用情境是持續流入的監測資料,IBM 與 Confluent 已有透過 Confluent Cloud/Apache Flink 將 Granite 時間序列模型接到串流推論的方向。IBM Granite 時間序列模型 × Confluent:串流原生即時智能記錄了這條從離線 notebook 到即時異常偵測與預測的部署脈絡;本文的 r2 則補上更強的零樣本預測候選。注意原文列出的初始 Early Access 模型為 r1、FlowState-r1.1、TTM-r3 與 TSPulse,未宣稱 r2 已進入該初始清單。^[raw/articles/huggingface-ibm-granite-timeseries-patchtst-fm-r2-2026-09-14.md]

與既有知識的連結

Granite 生態並不只做生成式 LLM;時間序列模型顯示 IBM 將「開放權重+可稽核流程」延伸到專門預測任務。可與 Granite 4.1 LLM 建構揭密——IBM 五階段訓練策略 對照:兩者都重視公開技術路徑,但評估指標分別是語言能力與時間序列的 CRPS/MASE。導入前仍應以自身資料切分、預測視野、遺漏值比例與延遲需求做離線驗證,再決定是否從零樣本試用轉向微調或串流部署。

相關頁面

反向連結

以下頁面引用了本頁: