時系列AIの出力を型付きの課題へ変換して形式の誤りを減らす
WaveTLM: Reliable Time-Series Language Modeling through Task Compilation
この論文をやさしく読む
ひとことで言うと
時系列データへの質問を、数値の形や選べるラベルが明確な課題に変換し、文章として自然でも形式が間違っている回答を減らします。
何に役立つ?
予測や欠損補完などの結果を、後続の処理で受け取れる形式で生成するための設計に役立ちます。
この研究の面白いところ
出力の形式・条件が正しいことと、予測値そのものが正確なことを別々に扱い、課題別の実行器に出力を作らせます。
どこまで分かった?
99.40%は契約適合の割合で、予測値の正解率ではありません。要旨は予測性能のバランスを報告しますが、各課題の誤差の詳細は示していません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
時系列言語モデルは、時間に関わるさまざまな課題に共通の自然言語インターフェースを提供するが、もっともらしい文章が信頼できる課題出力を保証するわけではない。回答が妥当に見えても、求められた対象を誤って生成することがある。数値系列は形状、スケール、チャネル順序、時間的な対応が不適切になる場合があり、文章による判断は許可されたラベル集合から外れる場合がある。本研究では、課題の出力対象としての信頼性と予測品質を分け、信頼できる時系列言語モデリングを定式化する。 予測、欠損補完、分類、異常検知、波形分析を含む、契約に基づくベンチマークExecTS-QAを導入する。さらに、統一的なコンパイラ・実行器モデルWaveTLMを提案する。課題コンパイラは、利用者の要求、参照可能な引数、波形に根差した証拠を型付きの課題状態に変換する。一方、課題固有の実行器は数値テンソル、許可された判断、構造化された記録を構成する。 ExecTS-QAでは、単一のWaveTLMチェックポイントが、全5課題群でバランスの取れた予測性能を維持しながら、契約に適合する出力の割合99.40%を達成した。評価した文字列優先のベースラインで最も強いものは37.83%だった。SciTS、TSQA、IRTS-ToolBench、ARFBenchでの評価も、転移に関する追加の証拠を提供する。コード、構築用スクリプト、ExecTS-QAデータセットは論文公開時に一般公開される予定である。これらの結果は、課題のコンパイルによって、もっともらしい言語生成を信頼できる時系列出力へ変換できることを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Time-series language models provide a shared natural-language interface across temporal tasks, but plausible text does not guarantee reliable task outputs. Responses may appear reasonable while hallucinating the required object: numerical sequences can violate shape, scale, channel order, or temporal alignment, and textual decisions can fall outside the legal label space. We formulate reliable time-series language modeling, separating task-object reliability from predictive quality. We introduce ExecTS-QA, a contract-grounded benchmark spanning forecasting, imputation, classification, anomaly detection, and waveform analysis. We further propose WaveTLM, a unified compiler-executor model whose task compiler transforms user requests, visible arguments, and wave-grounded evidence into typed task states, while task-native executors construct numerical tensors, legal decisions, or structured records. On ExecTS-QA, a single WaveTLM checkpoint achieves 99.40% contract-valid coverage, compared with 37.83% for the strongest evaluated string-first baseline, while retaining balanced predictive performance across all five task families. Evaluations on SciTS, TSQA, IRTS-ToolBench, and ARFBench provide additional evidence of transfer. The code, construction scripts, and ExecTS-QA dataset will be publicly released upon publication. These results show that task compilation can convert plausible language generation into reliable time-series outputs.
arXiv ID: 2609.18812 / 要約の誤りについて