arXiv論文メモ
新着一覧
cs.LG / cs.RO / cs.SY / eess.SY · 査読状況未確認

計算量を抑えた安全な強化学習の探索

Computationally efficient safe exploration in reinforcement learning

Shreeram Murali, Shankar A. Deka, Dominik Baumann

この論文をやさしく読む

ひとことで言うと

安全性の制約を守りながら探索する強化学習を、計算負荷の軽い推定法で実現しようとする研究。

何に役立つ?

考えられる用途は、安全性が必要な環境での強化学習の探索である。要旨では格子環境と火星地形の観測データで評価している。

この研究の面白いところ

ガウス過程に代えてNadaraya–Watson推定量を使い、データ点数に対する推定計算を定数時間に抑える。

どこまで分かった?

要旨に具体的な安全違反率や性能比較の数値はない。現実の火星で探索を実施したという記述ではなく、観測された火星地形データでの評価である。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

現実の用途で強化学習を使うには、探索中の安全性を保証する必要がある。一般的な強化学習アルゴリズムにはその保証がなく、安全性を確保する多くの修正法は計算負荷の大きいガウス過程(GP)に依存する。本研究は、Nadaraya–Watson 推定量に基づき、制約付きマルコフ決定過程(MDP)を安全に探索・最適化する、計算負荷の軽いアルゴリズム CoLSafe-MDP を提案する。推定値の境界を備えた推定器を使用し、その計算量はデータ点数に対して定数時間である。これはデータ点数の3乗で計算量が増えるGPに基づく手法と比べて大幅な改善である。格子状の環境と、観測された火星地形データで性能を評価する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-19(UTC)
最新改訂
2026-09-19 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Reinforcement learning in real-life applications requires safety guarantees during exploration. Typical reinforcement learning algorithms do not provide such guarantees, and many modifications that do rely on Gaussian processes (GPs), which have a large computational cost. We propose a computationally lightweight algorithm based on the Nadaraya-Watson estimator that safely explores and optimizes constrained Markov decision processes (MDPs). Our algorithm, \textsc{CoLSafe-MDP}, uses an estimator that scales in constant-time with bounds on the estimates, a significant improvement from its GP-based counterparts that scale cubically with the number of data points. We then evaluate its performance in a grid-based environment and on observational Martian terrain data.

著者のコメント

8 pages

arXiv ID: 2609.22919 / 要約の誤りについて