限られた専門家注釈で逐次方策評価の誤差を減らす
Optimal Sequential Annotations for Off-Policy Evaluation
この論文をやさしく読む
ひとことで言うと
自動ラベルに誤りがあるデータで、どの記録を専門家に確認してもらうかを最適化し、方策の効果の推定誤差を減らします。
何に役立つ?
限られた確認予算の下で、支援記録や人間の選好データから方策を評価する際に役立つ可能性があります。
この研究の面白いところ
時間に沿った記録の注釈の仕方を考慮し、推定の分散を小さくする注釈確率を設計しています。
どこまで分かった?
報告された割合はRMSEの減少であり、入居率や申請進捗そのものの改善率ではありません。住宅関連の結果には全件注釈の40%以上という予算条件があり、比較対象の詳細は要旨に示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
オフライン強化学習とオフポリシー評価は、導入前に過去収集データを使って動的な処置規則を評価する。近年のAI応用では、状態や報酬の情報が複雑な文章や画像として記録され、LLMを判定者として使う方法などの進歩によってラベルを付けられるが、そのバイアスは未知である。専門家の注釈を利用できる場合もあるが、費用は高い。例えば、安全性の分類には、安価だが不完全な分類器と、高価な専門家による確認という選択肢がある。 本研究では、報酬が欠測している場合の二重に頑健なオフポリシー評価を通じて、正解データへの注釈に使える限られた予算をどう活用できるかを示す。注釈済みデータから対象方策の価値を推定する逐次オフポリシー評価について、分散を最小化する注釈確率を最適化する。逐次的な前向き単調注釈プロトコルにおける最適注釈確率を特徴付け、実行可能なバッチ適応型の実装を提示する。 本研究の動機は、個人のケース記録を継続的に作成するホームレス支援の非営利団体との協働である。この方法は、ケース記録から信頼できる推論を可能にし、例えば、時間とともにアウトリーチ活動を拡大すると住宅申請の進捗や入居状況の改善にどう影響するか、という新しい問いに答えるために使える。シミュレーションと、非営利団体のケース記録およびLMArenaの人間の選好投票という二つの実データセットでは、全件注釈の40%以上の予算で、入居についてRMSEが34〜65%、住宅申請の進捗について17〜68%減少し、LMArenaではすべての予算で55〜62%減少した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Offline reinforcement learning and off-policy evaluation evaluates dynamic treatment rules based on retrospectively collected data prior to deployment. In recent AI applications, state and reward information is recorded as complex text or image, which recent AI advancements such as LLM-as-a-judge can label with unknown bias. Expert annotation may be available but at a higher cost. For example, safety classification via cheap but imperfect classifiers vs. expensive expert review. We show how a limited budget for ground-truth data-annotation can be used via doubly-robust OPE with missing rewards, and we optimize variance-optimal annotation probabilities for sequential off-policy evaluation, where the target policy value is estimated from annotated data. We characterize the optimal annotation probabilities for sequential forward-monotone annotation protocols, and provide a feasible batch-adaptive implementation. Our work is motivated by a collaboration with a homelessness services nonprofit that writes casenotes for individuals over time. Our method can be used to unlock trustworthy inference from casenote data and answer new inferential questions such as: how does expanding outreach effort over time affect progress towards a housing application and improvement in housing placement? In simulations and on two real datasets - casenotes from the nonprofit and human-preference votes from LMArena - we see reductions in RMSE of 34-65% for housing placement and 17-68% for progress towards a housing application at budgets of 40% of full annotation and above, and by 55-62% at every budget on LMArena.
arXiv ID: 2609.26707 / 要約の誤りについて