金融資産の数値予測を順位学習に変える言語モデル
FinRankGRPO: Optimizing LLMs for Listwise Financial Asset Ranking via Group Relative Policy Optimization
この論文をやさしく読む
ひとことで言うと
資産の将来価格を細かく当てる代わりに、どの資産を上位に置くかを学習させる方法です。
何に役立つ?
資産配分に用いる順位情報を言語モデルから得ることが想定用途です。要旨で報告されるのは実験上の指標であり、将来の投資収益の保証ではありません。
この研究の面白いところ
文章生成の学習目標と資産選択の目的のずれを、順位相関に基づく報酬で直接扱います。
どこまで分かった?
報告された順位相関は0.023です。要旨には市場、評価期間、取引費用などの詳細がなく、別の投資条件で同じ性能になるかは判断できません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデル(LLM)は非構造化された金融の文脈を理解することに優れるが、次のトークンを予測する目的と、資産配分に必要なリスト全体の順位付けの目的が一致しないため、ポートフォリオ最適化への直接利用には限界がある。また、精密な数値予測も苦手で、不安定性や計算上の誤生成につながる。 この隔たりを埋めるため、LLMに基づくポートフォリオ構築を、直接的な数値予測から金融資産のリスト全体の順位付けへ転換する枠組みFinRankGRPOを提案する。学習は2段階で行う。まず思考連鎖による推論データで教師あり追加学習を行い、続いてグループ相対方策最適化による金融資産順位付けを実施する。この段階ではスピアマン順位相関を報酬とし、生成する資産順位を市場での正解順位に整合させる。第2段階の新しいスピアマン順位相関報酬は、モデルが生成時に示す選好を、市場での正解順位へ明示的に合わせる。実験結果では、FinRankGRPOは従来の定量モデルと最先端の商用モデルを上回り、シャープレシオ0.636、スピアマン相関0.023を達成した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
While Large Language Models (LLMs) excel at understanding unstructured financial contexts, their direct use in portfolio optimization is limited by a mismatch between next-token prediction and the listwise ranking objectives required for asset allocation. They also struggle with precise numerical forecasting, leading to instability and arithmetic hallucinations. To bridge this gap, we propose FinRankGRPO, a framework that shifts LLM based portfolio construction from direct numerical prediction to listwise ranking of financial assets. We introduce a two-stage training process, supervised finetuning on Chain-of-Thought reasoning data, followed by our Financial Asset Ranking via Group Relative Policy Optimization with a Spearman rank correlation reward that aligns generated asset rankings with ground truth market orderings. The second stage uses a novel Spearman rank correlation reward to explicitly align the model's generative preferences with ground truth market orderings. Experimental results show that FinRankGRPO outperforms traditional quantitative and state-of-the-art commercial models, achieving a Sharpe ratio of 0.636 and a Spearman correlation of 0.023.
arXiv ID: 2609.24175 / 要約の誤りについて