arXiv論文メモ
新着一覧
cs.HC / cs.AI · 査読状況未確認

視覚障害者が室内の物を手に取るまでを段階的に案内する

Touvigation: Embodied Adaptive Object Acquisition for Blind and Low-Vision Users in Unfamiliar Indoor Environments

George Xi Wang, Xiangyu Li, Shaoyue Wen, Jiaqian Hu, Junan Xie, Yupeng Wang, Ziyue Shi, Qijun Chen, Maaike Bouwmeester, Yuhua Jin, Jing Qian

この論文をやさしく読む

ひとことで言うと

物の説明だけでなく、向きを変える、近づく、手を伸ばす、触って確かめるという動作に合わせて案内を変える支援システムです。

何に役立つ?

不慣れな室内で物を探して手に取る際の支援が想定されています。12人の評価では成功率、所要時間、認知的負荷に改善が報告されています。

この研究の面白いところ

歩いている段階と手を伸ばす段階で、位置の伝え方を適応させています。比較対象には別のAI支援だけでなく、支援なしの探索も含まれます。

どこまで分かった?

100%は12人が参加した当該評価の課題成功率であり、あらゆる室内環境で成功する保証ではありません。要旨には課題数や長期利用の結果は記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

全盲・ロービジョンの利用者は、不慣れな屋内環境で物の位置を探し、実際に手に取る際に困難に直面することが多い。既存の視覚言語モデルに基づく支援システムは意味的な説明を提供できるが、遅延やハルシネーション、身体を使った行動とうまく対応しない案内を生じさせることがある。本研究では、視覚言語理解と持続的な局所空間モデリングを組み合わせ、低遅延で身体を基準とした案内を行う、ハンズフリーの物体取得システムTouvigationを提示する。 全盲・ロービジョンの参加者8人への設計初期のインタビューに基づき、利用者が方向を定め、歩き、手を伸ばして触覚で確認する段階へ移るにつれて、空間の参照基準を適応的に変える多段階の案内の枠組みを設計した。全盲・ロービジョンの参加者12人でTouvigationを評価し、マルチモーダル大規模言語モデルの支援システムおよび支援なしの探索と比較した。Touvigationの課題成功率は100%で、マルチモーダル支援システムの58%、支援なしの85%を上回り、完了時間と認知的負荷も減少した。これらの知見は、持続的な空間への対応付けと、身体動作に適応する案内が、全盲・ロービジョンの利用者の物体取得をどのように改善できるかを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Blind and low-vision users often face challenges when locating and physically acquiring objects in unfamiliar indoor environments. Existing vision-language-model-based assistants can provide semantic descriptions but may introduce latency, hallucinations, and guidance that is poorly aligned with embodied action. We present Touvigation, a hands-free object acquisition system that combines vision-language understanding with persistent local spatial modeling to provide low-latency, body-relative guidance. Drawing on formative interviews with eight blind and low-vision participants, we design a multi-stage guidance framework that adapts spatial references as users transition from orienting, to walking, to reaching and tactile verification. We evaluated Touvigation with 12 blind and low-vision participants against a multimodal large-language-model assistant and unassisted search. Touvigation achieved 100% task success, compared with 58% for the multimodal assistant and 85% for unassisted search, while reducing completion time and cognitive workload. Our findings demonstrate how persistent spatial grounding and adaptive embodied guidance can improve object acquisition for blind and low-vision users.

著者のコメント

12 pages, including figures and references

arXiv ID: 2609.21828 / 要約の誤りについて