arXiv論文メモ
新着一覧
cs.LG · 査読状況未確認

時系列基盤モデルが単純な変化や先行指標を見落とす

Foundations without Fundamentals: Zero-Shot Blind Spots in Time Series FMs

Nafiseh Ghoroghchian, Haipeng Zhang, Shuyi Han, Alex Labach, George Stein

この論文をやさしく読む

ひとことで言うと

時系列を予測する大規模モデルが、単純な増減や繰り返し、将来の変化を先に知らせる別の信号を活用できるか調べています。複数の主要モデルで基本的な予測の失敗を報告しています。

何に役立つ?

モデルを導入する前に、平均的なベンチマーク成績だけでは分からない基本動作を確認するのに役立ちます。先行指標を含むセンサーデータの予測にも関係します。

この研究の面白いところ

特定の問題に追加学習して成績を上げても、別の基本パターンでは悪化することを示しています。合成テストの問題が実際のセンサー予測にも現れる点を検討しています。

どこまで分かった?

要旨はChronos-2、Moirai、Totoなどの評価を述べていますが、具体的な誤差値やデータ規模は示していません。帰納バイアスの不足は可能性として提示されており、失敗原因が確定したという主張ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

時系列基盤モデル(TSFM)は広範なベンチマークで成功しているが、基本的な時間の論理を身につけているか、特に外生的な共変量が利用できる状況については十分に調べられていない。本研究では、単調な傾向、周期信号、先行指標となる共変量などの基本要素を対象とした、単変量・多変量の診断用「単体テスト」集SimpleTimeBenchを導入する。これらは、ほぼ完全な予測が容易にできるはずの状況である。 意外にも、主要な多変量TSFMであるChronos-2、Moirai、Totoは、これらの入力に対し、ゼロショットでしばしば最適とはいえない予測を行う。Chronos-2のファインチューニングは特定のタスクで挙動を改善するが、この適応は一般化可能な基盤的能力を高めるのではなく、他の基本パターンで性能を悪化させることを示す。この結果は、事前学習の規模と基本的な時間推論の間の隔たりを明らかにし、現在のTSFMには、単純で予測可能な関数を捉えるために必要な帰納バイアスが不足している可能性を示唆する。 さらに、これらの失敗が合成データだけの特殊な現象ではないことを示す。実際のセンサー予測でも失敗は続き、TSFMは観測された共変量に含まれる先行指標を一貫して十分に活用できない。このような単純な関係を捉えられないことは、現在の多変量モデルの実用性と信頼性を制限している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Despite the success of Time Series Foundation Models (TSFMs) on broad benchmarks, their ability to internalize basic temporal logic, especially in settings supported by exogenous covariates, remains under-examined. We introduce SimpleTimeBench, a diagnostic univariate and multivariate "unit test" suite for primitives such as monotonic trends, periodic signals and leading indicator covariates, scenarios where near-perfect forecasts should be trivial. Surprisingly, prominent multivariate TSFMs (Chronos-2, Moirai and Toto) frequently produce suboptimal zero-shot forecasts for these inputs. While fine-tuning Chronos-2 improves its behaviour on specific tasks, we show that this adaptation degrades performance on other fundamental patterns rather than enhancing its generalizable foundational capabilities. This reveals a gap between pre-training scale and basic temporal reasoning, suggesting that current TSFMs could potentially lack the inductive biases needed to capture simple predictable functions. We further demonstrate that these failures are not merely synthetic curiosities: they persist in real-world sensor forecasting, where TSFMs consistently underutilize leading indicators available in observed covariates. This inability to capture simple relationships limits the practical utility and reliability of current multivariate models.

arXiv ID: 2610.02058 / 要約の誤りについて