arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

移動ロボットに基盤モデルを導入する際の個人化と記憶

Deploying Foundation Models for Embodied Navigation

Vishnu Sashank Dorbala, Dinesh Manocha

この論文をやさしく読む

ひとことで言うと

移動ロボットで基盤モデルを使う際、利用者の習慣への適応と長い作業を覚える方法を検討した。

何に役立つ?

実環境のナビゲーションで個人化や文脈長の制限に対処する設計の候補となる。

この研究の面白いところ

TAPは実機Turtlebotで平均18%改善し、MemCtrlは文脈量をほぼ半分にして長い指示で20%改善した。

どこまで分かった?

TAPの実機評価は研究室内のTurtlebotによる課題であり、一般の環境での導入効果は要旨からは分からない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

移動を行う身体性エージェントに基盤モデル(FM)を導入する際の2つの問題を提示し、対処する。第一はFMの学習時の偏りによって、初めて訪れる環境での個人化が不十分になること、第二はFMの文脈長の制限が、特に長時間の課題の成功を妨げることである。前者には場面から得た人間の行動習慣のデータをFMへの事前入力に使い、後者には新たなmemory headの追加による能動的な記憶管理を用いる。まず、FMを使う身体性ナビゲーションの既存研究を分類し、これらの限界を示す。次に、対処方法としてTransit-Aware Planning(TAP)とMemCtrlを提示する。TAPについては、研究室内の実環境でTurtlebotが個人に合わせて目標物を探す課題を評価し、TAPを使わない基準と比べて平均18%の改善を示した。MemCtrlはさまざまな身体性課題で平均6%、長い指示の部分集合では20%の改善を示し、使用する文脈量は基準モデルのほぼ半分だった。これらの結果を踏まえ、FMを使う身体性エージェントの実環境への導入可能性についての著者らの立場と、今後の研究課題を述べる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We present and tackle two problems associated with deploying Foundation Models (FMs) on Embodied Agents performing navigation: 1) Training bias in FMs leading to poor personalization in unseen environments, and 2) Limited FM context length hindering success, especially on long horizon tasks. Our solution for the former involves priming the FM with human-habit data mined from the scene and our solution for the latter involves active memory management via a novel `memory head' augmentation. We first present a taxonomy of existing literature on FM-based Embodied Navigation, and highlight these limitations. We then present our approaches, Transit-Aware Planning (TAP) and MemCtrl to address the limitations. With TAP, we present real-world results in a lab environment with a Turtlebot for personalized target finding that shows an average improvement of 18% over a non-TAP baseline. On MemCtrl, we report a 6% average improvement across various embodied tasks, with 20% on long instruction subsets, all while using nearly half the context used in the baseline model. Motivated by these result, we present our stance the deployability of FM-based embodied agents in real-world environments, and highlight open research directions.

arXiv ID: 2609.25666 / 要約の誤りについて