arXiv論文メモ
新着一覧
cs.AI / cs.LG / cs.MA · 査読状況未確認

対話型AIの行動を記憶と自己点検で安定させる

Cognitive Extensions for Dual-Process Language Agents: Memory and Self-Reflection in Interactive Environments

João Meneses dos Santos and Arlindo L. Oliveira

この論文をやさしく読む

ひとことで言うと

行動を始めた後の点検と修正、過去の経験の検索を組み合わせ、AIが対話型課題を進める力を調べた研究です。

何に役立つ?

実証された用途はScienceWorldでの課題遂行です。長い手順を伴うエージェントを設計するとき、記憶の追加と実行時の点検のどちらを優先するか考える材料になります。

この研究の面白いところ

同じ実行基盤で記憶と自己点検を別々に有効化し、自己点検の単独効果が最も強い一方、両方を備えた構成が最良になる関係を比較しています。

どこまで分かった?

結果はScienceWorldでの四構成の比較です。実サービスや別の環境でも同じ効果が得られるかは要旨からは分かりません。成功率は43.17%で、すべての課題を解決したわけではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

言語エージェントは、長い時間範囲にわたる状態の追跡、妥当な行動の実行、失敗した手順からの回復が成功に必要な対話型環境において、依然として脆弱である。本研究では、高速な行動提案器と低速な計画器を組み合わせた二重過程エージェントSwiftSageを、二つのモジュール型の認知機能によって拡張する。一つは、重要度に応じてエピソードを保存し、特定の契機で検索する適応記憶モジュール(AMM)である。もう一つは、実行時に範囲を限定した妥当性確認と修正介入を行う自己省察モジュール(SRM)である。両モジュールは同一の実行基盤上で機能フラグによって切り替えられる拡張として実装され、ScienceWorldで条件をそろえた除去実験を可能にした。 ベースライン、ベースライン+AMM、ベースライン+SRM、全機能を備えたシステムという四つの構成のうち、全機能構成が平均最終スコア64.62、成功率43.17%、成功時のステップ効率19.33ステップで最良の結果を達成した。一方、単独で最も大きく貢献したのはSRMだった。この結果は、当該環境では実行時の制御が主要なボトルネックであり、エピソード記憶は実行ループが安定してから最も役立つことを示唆している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Language agents remain brittle in interactive environments, where success requires long-horizon state tracking, valid action execution, and recovery from failed steps. We extend SwiftSage, a dual-process agent that combines a fast action proposer with a slower planner, using two modular cognitive extensions: an Adaptive Memory Module (AMM) for salience-gated episodic storage and trigger-driven retrieval, and a Self-Reflection Module (SRM) for bounded execution-time validation and corrective intervention. Both modules are implemented as feature-flagged extensions over the same execution substrate, enabling controlled ablations on ScienceWorld. Across four configurations---baseline, baseline+AMM, baseline+SRM, and the full system---the full system achieves the best mean final score (64.62), success rate (43.17%), and successful-step efficiency (19.33 steps), while SRM is the strongest standalone contributor. The results suggest that execution-time control is the dominant bottleneck in this setting, while episodic memory becomes most useful once the runtime loop is stabilized.

著者のコメント

13 pages, 1 figure

arXiv ID: 2609.19128 / 要約の誤りについて