arXiv論文メモ
新着一覧
cs.RO / cs.AI / cs.LG / cs.SY / eess.SY · 査読状況未確認

安全行動を先に学んで対戦時の弱点を減らすロボット方策

Turning Safety into Competence: Minimally Exploitable Robot Policies via Safety-Filtered Reinforcement Learning

Ruihan Wu, Rui Yang, Donggeon David Oh, Duy Nguyen, Haimin Hu

この論文をやさしく読む

ひとことで言うと

対戦するロボットで、安全な行動を守る仕組みを先に学び、その上で勝つ動きを学ぶ方法です。

何に役立つ?

相手に弱点を突かれる可能性がある競争的なロボット課題の安全な学習に役立つ可能性がある。

この研究の面白いところ

安全フィルターを課題学習時と実機運用時で共通に使い、理論上の悪用されにくさも分析する。

どこまで分かった?

完全なフィルターの理論結果は全員が安全行動に従う条件付き。実証は着地対戦のシミュレーションと人間相手の実機試験である。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

競争的な課題に投入するロボットは、安全性を失わずに相手よりうまく動く必要がある。安全な強化学習を含む既存法は、課題の成功と失敗の回避を一つの方策で同時に学ぶ。この結び付きは学習を難しくし、意図的な攻撃に利用される弱点を残すことがある。著者らは、安全な行動の構築と競争的な課題の学習を分ける二段階の強化学習枠組みSafety to Competence(S2C)を提案する。競争的な相互作用を安全性が重要なマルコフゲームとして定式化し、全員が安全な動きに従う場合、完全なフィルターなら方策の悪用されにくさを保てることを証明する。S2Cは敵対的な強化学習で頑健な安全フィルターを学び、課題方策の学習時に環境へ組み込み、実際の配置でも同じフィルターを使う。シミュレーションの着地対戦ゲームでは、安全強化学習の基準手法8種類を上回り、勝率とEloレーティングが最も高く、悪用可能性が最も低かった。人間を相手にした実機の厳しい条件での試験でも、S2Cが課題を遂行できることを確認した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Robots deployed for competitive tasks must outmaneuver their opponents without sacrificing safety. Existing approaches, including safe reinforcement learning (RL), train a single policy to achieve task success and avoid failures simultaneously. This coupling can complicate training and leave the learned policy exploitable by deliberate attacks. We propose Safety to Competence (S2C), a two-stage RL framework that separates safety synthesis from competitive task learning. We formulate competitive interactions as safety-critical Markov games and prove that perfect filtering preserves policy non-exploitability when all players commit to safe maneuvers. S2C learns a robust safety filter via adversarial RL, embeds it in the environment during task policy training, and retains the same filter at deployment. In simulated touchdown games, S2C outperforms eight safe RL baselines, achieving the highest win rate and Elo rating, and the lowest exploitability. Hardware stress tests against a human opponent confirm S2C's competence.

著者のコメント

8 pages, 4 figures

arXiv ID: 2609.27312 / 要約の誤りについて