arXiv論文メモ
新着一覧
cs.LG / cs.AI · 査読状況未確認

動作記録を表形式で分析し、模倣学習の方策構造を自動修正

Iterative Policy Refinement through Semantic Rollout Analysis

Feiyu Gavin Zhu, Qi Xu, Zhifei Deng, Zhigang Hua, Luke Simon, Jean Oh, Reid Simmons

この論文をやさしく読む

ひとことで言うと

LLMが作った行動ルールを実際に動かし、その記録を表にして分析させ、うまくいかない構造を繰り返し修正する方法です。

何に役立つ?

専門家の実演から学ぶ模倣学習で、タスクに合った方策構造を自動的に調整するために役立ちます。レースとドア開けのタスクで学習性能や計算量を評価しています。

この研究の面白いところ

LLMの既存知識から一度だけ構造を作るのではなく、動作結果を戻して修正する循環を作っています。表形式の記録と、LLMが生成する診断コードがその接点です。

どこまで分かった?

結果はレースとドア開けの2種類のタスクでの比較です。最大15%の性能向上について、要旨には指標の定義や相対比・ポイント差の区別はありません。また、要旨だけでは各実験が実機かシミュレーションかは判断できません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

構造化された方策は、タスク固有の帰納バイアスを導入することで、模倣学習の効率、頑健性、解釈可能性を改善する。しかし既存の構造生成手法は、大量の人手による入力か、LLMに符号化された静的な分野知識に依存しており、その知識は専門家の実演と整合しない場合がある。 本研究では、方策を実行して得た軌跡をLLMの助けで分析し、構造化された方策を反復的に改善する閉ループの枠組みを提案する。実行軌跡を意味の分かる表形式データとして記録し、LLMに診断用の分析コードを生成させることで、方策構造の不十分な点を特定し、人の指示なしに繰り返し修正する。 車のレースとドア開けのタスクでの実験では、ゼロショットでLLMが生成した構造と比べて模倣学習性能が最大15%向上し、同じ強化学習性能を達成するために必要な計算量は75%少なくなった。これらの結果は、表形式の実行軌跡の分析が、LLM生成の方策構造を専門家の実演に合わせる有効なフィードバック信号となり、良い方策構造の自動生成に利用できることを示している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Structured policies improve efficiency, robustness, and interpretability in imitation learning by introducing task-specific inductive bias, but existing structure generation methods rely either on extensive human input or on static domain knowledge encoded in LLMs, which may be inconsistent with the expert demonstrations. We propose a closed-loop framework that iteratively refines structured policies using LLM-guided analysis of policy rollouts. By logging rollouts as semantically meaningful tabular data and prompting the LLM to generate diagnostic analysis code, our method identifies suboptimalities in the policy structure and iteratively corrects them without requiring human instruction. Experiments on car racing and door opening tasks show that our approach improves imitation learning performance by up to 15% over zero-shot LLM-generated structures and requires 75% less compute to achieve the same reinforcement learning performance. These results demonstrate that tabular rollout analysis provides an effective feedback signal to align LLM-generated policy structures with expert demonstrations, and we can utilize it to generate good policy structures automatically.

arXiv ID: 2610.01652 / 要約の誤りについて