arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

GPT-6 Astraの未学習環境での視覚・言語ナビゲーション評価

GPT-6-Astra Lights Up Embodied Navigation: Evaluation in Zero-Shot Vision-and-Language Navigation in Continuous Environments

Guangzhao Dai, Qianru Sun, Qi Wu, Bin Zhu

この論文をやさしく読む

ひとことで言うと

GPT-6 Astraが、単眼カメラ画像と言語の指示だけで、初めて見る連続環境を移動できるかを評価した研究です。

何に役立つ?

汎用モデルを使った視覚・言語ナビゲーションの能力と、経路実行や目標確認に残る課題を比べる材料になります。要旨の79.0%は指定されたR2R-CE評価での成功率です。

この研究の面白いところ

専用の追加学習、学習済み中継点予測器、事前地図なしに、観測の時点と行動をモデルが選びます。一方、目印の局所的な一致が正しいタスク完了を保証しないことも報告しています。

どこまで分かった?

数値はゼロショットR2R-CEでultraの推論設定を使った結果です。著者ら自身が経路の確実な実行と目標確認を未解決の課題として挙げています。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

汎用の基盤モデルGPT-6 Astraが、自身の知覚、推論、意思決定の能力を使い、見知らぬ環境を移動できるかを調べる。評価対象は、連続した環境で言語の指示に従うゼロショットの視覚・言語ナビゲーション(VLN-CE)であり、Codexの実行環境に最小限のインターフェースを設けて、ナビゲーション能力を評価する。単眼RGB画像を用い、GPT-6 Astra自身が、いつ観測し、どのように移動し、いつ停止するかを決める。ナビゲーション専用の追加学習、学習済みの中継点予測器、事前に作った場面地図は使わない。 評価から主に四つの結果が得られた。第一に、単眼RGBの観測だけで高いゼロショット性能を示す。一般に使われるゼロショットR2R-CEベンチマークでは、ultraの推論設定で成功率が79.0%となり、報告されているゼロショットの最高成功率より13.0ポイント、教師ありの最高成功率より6.9ポイント高かった。第二に、空間的な関係を実際の観測に結び付け、進捗を追い、行動を修正することで、複数段階の言語指示を一貫性を保ちながら状況に応じた移動へ変換した。第三に、ultraの推論設定でも、経路の確実な実行と目標の確認は課題として残った。局所的にもっともらしい目印が一致しても、タスクを正しく完了できるとは限らなかった。第四に、これらの能力は、身体を持つエージェントの学習の役割を再考する動機になる。将来のVLN研究は基盤モデルを土台とし、一般化可能で信頼性の高い身体化知能を進めるべきだと著者らは述べる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We investigate whether GPT-6-Astra, a general-purpose foundation model, can navigate unfamiliar environments using its own perception, reasoning, and decision-making capabilities. Our evaluation focues on zero-shot vision-and-language navigation in continuous environments (VLN-CE) through a minimal interface in the Codex harness, aiming to unleash GPT-6-Astra's full potential for navigation. Using monocular RGB, GPT-6-Astra decides when to observe, how to move, and when to stop, without navigation-specific fine-tuning, a trained waypoint predictor, or a pre-built scene map. Our evaluation yields four main findings. First, \textbf{\textit{GPT-6-Astra achieves strong zero-shot navigation performance using only monocular RGB observations}}. On the common-adopted zero-shot R2R-CE benchmark, ultra reasoning achieves a success rate of \textbf{\textit{79.0\%}}, exceeding the strongest reported zero-shot and supervised success rates by \textbf{\textit{13.0}} and \textbf{\textit{6.9}} percentage points, respectively. Second, \textbf{\textit{GPT-6-Astra advances multi-stage language instructions into coherent, adaptive navigation}} by grounding spatial relations, tracking task progress, and revising its actions. Third, \textbf{\textit{reliable route execution and goal verification remain challenging, even with ultra reasoning}}. Plausible local landmark matches do not consistently lead to correct task completion. Fourth, \textbf{\textit{these capabilities motivate rethinking the role of embodied learning}}. Future VLN research should build on foundation models to advance generalizable and reliable embodied intelligence.

著者のコメント

Technical report

arXiv ID: 2609.29861 / 要約の誤りについて