arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

人と複数ロボットの協働で安全制約とチーム学習を整合させる

SAGE: Safety-Aligned Gradient Enforcement for Human--Robot Collaboration

Yisen Li, Hao Zhang, Ruize Geng, Yves Tseng, Ding Zhao, H. Eric Tseng

この論文をやさしく読む

ひとことで言うと

ロボットが提案した動きを安全装置が直すだけでなく、その制約を学習に反映し、複数ロボットの更新方向もそろえる方法です。

何に役立つ?

考えられる用途は、人と複数ロボットが接触を伴って協働する作業です。説明可能な方策と安全制約の組合せで生じる学習上のずれを扱います。

この研究の面白いところ

安全フィルターだけでは衝突が減る一方で成功率も下がるという結果から、行動提案の学習とチームの更新を別々に補正しています。

どこまで分かった?

成功率71.0%と衝突0.5ステップ/1,000ステップはシミュレーションの値です。実機実験は導入可能性を示すもので、衝突ゼロや人との協働の全面的な安全保証を意味しません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

複数者による人間とロボットの協働には、二つの課題がある。ロボットの判断は解釈可能で監査可能でなければならず、同時に物理的な相互作用で実行される行動は安全制約を満たす必要がある。説明可能な決定木方策と制御バリア関数(CBF)によるフィルタリングを組み合わせる構成は有望だが、マルチエージェント強化学習で二つの不整合を生む。安全性のための射影は環境に適用される行動を変え、結合した提案グラフは、独立に最適化した行動主体の更新をチーム全体の更新とずれさせることがある。 本研究では、この両方に対処する安全整合型勾配制御(SAGE)を提示する。そのshield-annealed internalization layer(SAIL)は、実行時の厳密なCBF二次計画を維持しつつ、微分可能な有限ペナルティの行動提案写像を使う。制約の法線方向の感度を保つことで、繰り返し有効になる安全制約を内部に学習させる。チーム平均Lyapunov方策最適化(TALO)は、チームを考慮した更新の基準を構築し、Lyapunov半空間補正を適用して、独立した行動主体の更新を調整する。 2台のヒューマノイドロボットと人間の協力者による物理実験で、配備の実現可能性を示す。九つのシミュレーションシナリオで、SAGEは成功率71.0%、環境の1,000ステップ当たり衝突0.5ステップを達成する。アブレーションでは、CBFを直接適用すると衝突頻度は98.5%下がるが、成功率も67.3%から59.3%へ下がることが示された。SAILは提案の制約違反を48.8%、提案と実行の間の補正を85.2%減らし、TALOは更新の整合性の隔たりを50.8%減らす。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Multi-party human-robot collaboration poses a dual challenge: robot decisions should remain interpretable and auditable, while executed actions must satisfy safety constraints during physical interaction. Combining explainable decision-tree policies with control-barrier-function (CBF) filtering provides a promising architecture but creates two learning mismatches in multi-agent reinforcement learning. Safety projection changes the action applied to the environment, while the coupled proposal graph can misalign independently optimized actor updates with a team-level update. We present safety-aligned gradient enforcement (SAGE) to address both mismatches. Its shield-annealed internalization layer (SAIL) uses a differentiable finite-penalty proposal map while retaining the exact CBF quadratic program for execution, preserving constraint-normal sensitivity to internalize repeatedly active safety constraints. Team-averaged Lyapunov policy optimization (TALO) constructs a team-aware update reference and applies a Lyapunov half-space correction to regulate independent actor updates. Physical experiments with two humanoid robots and a human partner demonstrate deployment feasibility. Across nine simulation scenarios, SAGE achieves a 71.0% success rate with 0.5 collision steps per thousand environment steps. Ablations show that direct CBF filtering reduces collision frequency by 98.5% but decreases success from 67.3% to 59.3%. SAIL reduces proposal violation by 48.8% and proposal-execution correction by 85.2%, while TALO reduces the update-consistency gap by 50.8%.

arXiv ID: 2609.21130 / 要約の誤りについて