arXiv論文メモ
新着一覧
math-ph / math.MP · 査読状況未確認

環境の変化が学習する主体間の信頼に与える影響

Payoffs and perception mediate environmental feedback in an N-player trust game with Q-learning

Ruqiang Guo, Zhaoyi Hu, Fangfang Wang, Linjie Liu

この論文をやさしく読む

ひとことで言うと

行動によって環境が変わり、その環境が次の報酬や見え方を変えると、学習する主体同士の信頼がどう変わるかを調べたモデル研究です。

何に役立つ?

協力や信頼の変化を、報酬だけでなく環境の知覚も含めて考えるための材料になります。人の信頼を直接測定した研究ではありません。

この研究の面白いところ

比較する条件を同じ学習済み状態から始め、過去の学習の違いを抑えています。環境フィードバックは常に信頼を促すわけではなく、動作点によって逆の効果になります。

どこまで分かった?

役割を固定した2集団の表形式Q学習モデルで、有限期間の挙動を比較しています。要旨は人間集団への一般化や、長期極限での信頼の収束を示していません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

信頼は学習を通じて発達する一方、集団の行動は、その後の意思決定が行われる環境を変化させ得る。強化学習モデルは適応を記述し、生態・進化モデルは行動と環境のフィードバックを記述するが、内生的な環境が物質的インセンティブや知覚された状態を通じて信頼をどう変えるかは明らかでない。 本研究では、異質な表形式Q学習エージェントからなる、役割を固定した2集団の階層型信頼ゲームを、中心化された内生環境へ結合する。主要なフィードバック比較では、過去の学習の影響を揃えるため、固定利得の基準系とフィードバックを持つ各分岐を、同じ学習済み状態から開始する。その上で、利得パラメータまたは観測される環境段階が変化したときの応答を比較する。 利得の増倍率が増えると、固定利得ゲームで成立する信頼は、リスク選好的な投資主体に先導され、有限期間内で低い水準から高い水準へ移った。環境フィードバックは、知覚する段階の境界付近では信頼を促し、高収益の動作点ではその低下を強めた。高収益の動作点では、利得のフィードバックが学習による信頼低下を強めた。駆動を強め、対象期間を長くすると、この負の効果は深まった。固定利得の信頼ゲームと比べ、環境フィードバックは過去の集団的な結果を将来の利得と観測状態へ持ち越す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Trust develops through learning, while collective behavior can alter the environment in which later decisions are made. Reinforcement-learning models describe adaptation, and eco-evolutionary models describe behavior-environment feedback, but how an endogenous environment changes trust through material incentives and perceived states remains unclear. We couple a fixed-role, two-population hierarchical trust game populated by heterogeneous tabular $Q$-learning agents to a centered endogenous environment. For the main feedback comparisons, we initialize the fixed-payoff baseline and feedback branches from the same learned state to control for prior learning. We then compare responses when payoff parameters or the observed environmental tier vary. As the payoff multiplication factor increased, successful trust in the fixed-payoff game crossed from a low to a higher finite-horizon level, led by risk-seeking investors. Environmental feedback promoted trust near perception-tier boundaries and reinforced its decline at the high-return operating point. At the high-return operating point, payoff feedback reinforced the learning-driven decline in trust. Stronger drive and longer horizons deepened this negative effect. Compared with a fixed-payoff trust game, environmental feedback carries past collective outcomes into future payoffs and observed states.

arXiv ID: 2609.24493 / 要約の誤りについて