GPT-6-Astraの道案内理解と自律移動の隔たりを測る
How Far Can GPT-6-Astra Go? Evaluating Capabilities in Zero-Shot Vision-and-Language Navigation
この論文をやさしく読む
ひとことで言うと
道順を理解して正しそうな判断をするAIが、最後まで移動して適切に止まれるかを調べています。
何に役立つ?
移動エージェントを評価する際に、成功地点に近づくことと、自分で完了を判断することを分けて見る手掛かりになります。
この研究の面白いところ
成功率52%の内訳を、受理された停止36%と、上限時に距離だけ満たした16%に分けています。理解したように見える応答だけでは完遂能力を説明できない点が具体的です。
どこまで分かった?
50エピソードで、文脈管理や行動制御を含むシステム全体を評価した結果です。モデル単体の性能や、あらゆる移動環境での成功率を直接示すものではありません。
v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
本研究では、連続環境におけるゼロショットの視覚・言語ナビゲーション(VLN-CE)システムで、GPT-6-Astraを検討する。このシステムではモデルが指示を解釈し、周囲を評価し、行動を提案する。既成のエージェント実行基盤やナビゲーション専用の微調整を用いず、モデルAPIを直接呼び出す、一般的な観測・意思決定・実行の流れを採用した。各リクエストには、選択された観測、実行結果のフィードバック、保持された進行記録を与える。評価対象は文脈管理と行動制御を含むシステム全体である。 Open-Navが使用したR2R-CEの未知環境検証用100エピソードのうち、50エピソードで評価した。成功率は52.0%、経路長で重み付けした成功率SPLは48.9%、正規化動的時間伸縮指標nDTWは70.8%だった。分析では3点が明らかになった。第一に、記録された応答は、観測と与えられた履歴を使って、目印やそれまでの行動を指示に結び付けていた。第二に、振り返りには、追加の視点を求めることや、不確かな判断を修正することが含まれていた。第三に、結果は課題の理解と自律的な完遂の隔たりを示唆した。渡り終えていないことを認識しながら、回転を続ける例があった。 終了時には、36.0%のエピソードが実行手順で受理されたSTOPによって成功し、さらに16.0%はステップ上限に達した時点で距離条件を満たしていた。これらの結果は、局所的に正しい判断を、継続的な前進と適切な停止へ結び付けるという中心的な課題を浮き彫りにする。
v2の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-18 · v2
- 査読・掲載
- 査読状況未確認
更新履歴
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
We study GPT-6-Astra in a zero-shot Vision-and-Language Navigation in Continuous Environments (VLN-CE) system, where it interprets instructions, assesses its surroundings, and proposes actions. The system uses a common observation--decision--execution workflow with direct model API calls, without a packaged agent harness or navigation-specific fine-tuning. In this workflow, each request receives selected observations, execution feedback, and retained progress records. Evaluation covers the complete system, including context management and action control. We evaluate the system on 50 of the 100 R2R-CE val-unseen episodes used by Open-Nav. It achieves a success rate of 52.0\%, an SPL of 48.9\%, and an nDTW of 70.8\%. Our analysis highlights three findings. First, recorded responses link landmarks and earlier actions to instructions using observations and supplied history. Second, reviews include requests for additional views and revisions of uncertain judgments. Third, the results suggest a gap between task understanding and autonomous completion: an unfinished crossing is recognized while rotation continues. At termination, 36.0\% of episodes succeed with a workflow-accepted STOP, while another 16.0\% meet the distance criterion at the step limit. These results highlight a central challenge: translating correct local judgments into sustained progress and appropriate stopping.
著者のコメント
Technical Report
arXiv ID: 2609.20116 / 要約の誤りについて