統計値の後日修正を考慮する時系列予測の仕組み
Time-Series Foundation Models That Understand Data Revisions
この論文をやさしく読む
ひとことで言うと
公表後に修正される統計値を予測するとき、当時使えた情報だけで評価するための仕組みを提案した。
何に役立つ?
経済統計などを用いる時系列予測で、後から修正された値の混入による過大評価を避けるのに役立つ。
この研究の面白いところ
観測時点と情報の公開時点を分け、初回公表値と後日の値を同時に予測する。
どこまで分かった?
合成データで手順を検証した段階で、実際のALFREDとChronos-2の比較実験は未実施と明記されている。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
過去の観測値は必ずしも固定されない。統計機関は新たな証拠が得られると、以前に公表した値を修正する。現在ダウンロードできるデータで過去時点の予測を評価すると、その時点では利用できなかった情報を模型に与えてしまうことがある。本研究は、観測が対象とする時点と、情報が利用可能になった時点を区別する、時系列基盤モデルの修正対応版VINTAGE-TSを提案する。予測対象は翌期に最初に公表された値と、その公表から一定の日数後に利用できる値であり、どちらも最終的な真値とはみなさない。同時予測分布によって二つの値の関係を保ち、その差の不確実性を表す。ALFREDに基づく時点を進めた評価、条件をそろえたChronos-2との比較、通常型と修正対応型の基準法、事前学習データとの重複を別に監査する方法を指定した。付属ソフトウェアには、値が有効だった期間の再構成、遅れて付くラベルの選別、基盤部分を固定した適応器の仕組み、再現可能な診断が実装されている。実行済みの合成データでの実演と25条件の感度分析は、作業手順を検証し、乱数の種や修正の条件による変動を示し、後知恵の情報混入が測定性能をどう変えるか例示した。31件の自動試験で時系列上の取り決めと統合条件を確認した。実際のALFREDとChronos-2の実験はまだ行われておらず、基盤モデルの実証的な優位性は主張していない。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Historical observations are not always fixed: statistical agencies revise previously published values as new evidence arrives. Forecasting from a contemporary download can therefore expose a model to information unavailable at the date it purportedly made a prediction. We propose VINTAGE-TS, a revision-aware adaptation of a time-series foundation model that distinguishes observation time from information-availability time. Its targets are the next period's first-published value and the value available a fixed number of days after that publication; neither is declared final truth. A joint predictive distribution preserves dependence between these targets and exposes uncertainty about their difference. We specify an ALFRED-based rolling evaluation, a matched Chronos-2 comparison, conventional and revision-aware baselines, and a separate audit of pretraining overlap. The accompanying software implements validity-interval reconstruction, delayed-label filtering, a frozen-backbone adapter interface, and reproducible diagnostics. An executed synthetic demonstration and a 25-configuration sensitivity suite verify the workflow, expose variation across seeds and revision regimes, and illustrate how hindsight contamination changes measured performance. Thirty one automated tests check temporal and integration contracts. Real ALFRED and Chronos-2 experiments have not been executed; no empirical foundation-model advantage is claimed.
arXiv ID: 2609.28576 / 要約の誤りについて