ロボットの助けを求める説明を聞き手の知識差で評価する
Toward Human-in-the-Loop Robot Failure Recovery: Bridging Communication Gaps in Human-Robot Collaboration
この論文をやさしく読む
ひとことで言うと
ロボットの依頼文が、詳しい人にも初心者にも伝わるかを、人が実際に課題をこなせたかで評価する研究です。
何に役立つ?
考えられる用途は、故障や作業の失敗時にロボットが人へ出す依頼文の評価です。知識差による伝わりにくさを比較できます。
この研究の面白いところ
文章の見た目の良さではなく、聞き手の行動結果で評価しています。LLMの文章でも初心者と熟練者の差がなくならないことが示されています。
どこまで分かった?
初心者の成功率改善は記述統計上の傾向として述べられており、有意差が確認されたとは要旨にありません。ゲーム内の評価を、実環境での復旧成功率と同一視できません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ロボットは周囲の人に助けを求めて失敗から復旧できるが、人が関わる効果的な復旧には、人々の知識の違いを考慮した伝達が必要である。従来の逆意味論の研究では単一の聞き手モデルを用いて依頼文を生成しており、聞き手の知識差は検証されていなかった。本研究では、人間の聞き手の成績を通じて話し手を評価する、ゲーム、データセット、ベンチマークであるListener Differences in Human-Robot Interaction(LD-HRI)を導入する。評価では、聞き手に与える情報の違いを制御した条件で、依頼文の特性、大規模言語モデル(LLM)の話し手、逆意味論に基づく依頼選択アルゴリズムを調べる。 コーパスは、人が書いた446件の依頼文と、聞き手による1,302試行を含む。加えて、LLMが作成して固定した24件の依頼文を、人間の聞き手70人による560試行で評価した。モデル作成の依頼文では、四つのタスクすべてで初心者の成功率が記述統計上高かった。しかし、どちらの作成元の依頼文でも熟練者と初心者の間には大きな差が残り、LLMの依頼文でも16パーセントポイントの差があった。LD-HRIはこうした差を測定可能にし、人とロボット、および人とエージェントの間で、より頑健な伝達を設計する基盤を提供する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Robots can recover from failures by asking bystanders for help, but effective human-in-the-loop recovery requires communication that accounts for differences in people's knowledge. Prior inverse-semantics work generates requests using a single listener model, leaving differences in listener knowledge untested. We introduce Listener Differences in Human-Robot Interaction (LD-HRI), a game, dataset, and benchmark that evaluates speakers through human listener performance. Our evaluation examines request properties, large language model (LLM) speakers, and inverse-semantics request-selection algorithms under controlled differences in listener information. The corpus contains 446 human-written requests and 1{,}302 listener trials. We additionally evaluated 24 frozen LLM-written requests with 70 human listeners across 560 trials. Novice success is descriptively higher with model-written requests across all four tasks, yet both request sources leave substantial expert--novice gaps, including 16 percentage points for LLM requests. LD-HRI makes these gaps measurable, providing a foundation for designing more robust communication in human-robot and human-agent interaction.
arXiv ID: 2609.24055 / 要約の誤りについて