arXiv論文メモ
新着一覧
cs.RO / cs.SY / eess.SY · 査読状況未確認

時空間チューブ報酬で時間論理の制約を満たすロボット学習

Tractable Reinforcement Learning for Full Class of Signal Temporal Logic Specifications Using Spatiotemporal Tube Reward

Vaishnavi Jagabathula, P Sangeerth, Pushpak Jagtap

この論文をやさしく読む

ひとことで言うと

時間に関する複雑な条件を守りながらロボットを動かすため、幾何学的な報酬を用いる強化学習法を提案した。

何に役立つ?

考えられる用途は、入力制限のあるロボットの時間指定タスクの制御である。要旨には具体的な実機実験は記載されていない。

この研究の面白いところ

論理式を時間変化する幾何学的な境界へ写し、長い状態履歴や実行時の複雑な論理評価を要しないようにする。

どこまで分かった?

著者らは仕様と入力制約を満たす方策を学べると述べる。要旨には成功率などの数値的な検証結果はない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

本論文は、未知の動力学と厳しいアクチュエータ制限のもとで複雑な高水準の仕様を満たすロボット制御を扱う。対象には、横方向へ直接動けない非ホロノミック系や、制御入力の少ない劣駆動系も含む。高水準の仕様を信号時間論理(STL)で表し、時空間チューブ(STT)の幾何学的性質を利用する、時間を考慮した新しい強化学習の枠組みを提案する。従来の解析的STT制御器では入力制約を守らせるのが難しく、既存の強化学習手法では大量の状態履歴を記憶する必要があるが、本手法は両方の制約に直接対処する。 STLの全クラスにわたる論理的・時間的な複雑さを、時間とともに変わる幾何学的境界へ写すことで、単一のスカラーの頑健性指標に頼らず、多次元のシステム状態を直接制約する。状態空間に時刻を加え、連続的で幾何学を考慮した報酬関数を使って、時間を認識するSoft Actor-Critic(SAC)エージェントを学習する。このため実行時には複雑な論理意味論を明示的に評価する必要がない。提案枠組みは履歴を使わず計算効率が高い方法であり、システムの入力制約を厳守しつつ仕様を頑健に満たす連続制御方策を学ぶ。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

This paper addresses the control problem for robotic systems, including non-holonomic and underactuated platforms operating under unknown dynamics and strict actuator limits to satisfy complex high-level specifications. We denote these high-level specifications using Signal Temporal Logic (STL) and propose a novel time-aware Reinforcement Learning (RL) framework that leverages the geometric properties of Spatiotemporal Tubes (STTs). While traditional analytical STT controllers often struggle to enforce input constraints, and existing RL approaches rely on memory-intensive state history, our method natively overcomes both limitations. By mapping the logical and temporal complexities of the full class of STL into time-varying geometric boundaries, we directly constrain the multidimensional system state without relying on scalar robustness metrics. Augmenting the state space with time, we train a time-aware Soft Actor-Critic (SAC) agent using a continuous, geometry-aware reward function that eliminates the need to explicitly evaluate complex logical semantics during execution. The proposed framework offers a history-free, computationally efficient approach to learn continuous control policies that ensure robust satisfaction of specifications while strictly adhering to system input constraints.

arXiv ID: 2609.28396 / 要約の誤りについて