26キャラクターを操作する対戦ゲームAIの学習と評価
Faynt: Scaling and Optimizing Policies for Competitive Melee
この論文をやさしく読む
ひとことで言うと
1つのモデルで全26キャラクターを操作するゲームAIを作り、学習方法と実際の勝率の関係を調べています。
何に役立つ?
操作予測の精度だけでは選べない対戦方策を、勝敗や重み付き検証指標で評価する手掛かりになります。公開された対戦基盤はモデル比較にも使えます。
この研究の面白いところ
小さいモデルが大きい事前学習モデルより高い勝率を示し、通常の予測損失と勝率の順位が一致しない点が具体的に示されています。蒸留や対戦限定の強化学習も組み合わせています。
どこまで分かった?
主な比較相手には行動遅延があり、Fayntとの遅延差の影響は未分離です。遅延ゼロの相手との別評価もありますが、相手は1モデルです。推論時間にはゲーム実行と通信を含みません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大乱闘スマッシュブラザーズDX向けに、1,000万および7,500万パラメータのTransformer方策群Fayntを導入する。各モデルは、単一のチェックポイントで全26キャラクターを操作する。強化学習(RL)後の1,000万パラメータ版は、特定キャラクター専用または複数キャラクター対応の14種類の公開モデルを相手に、それぞれが対応するキャラクターで同キャラクター対戦を行い、244試合中240勝、勝率98.4%を記録した。すべての相手モデルに対して勝ち越している。これらの相手には21または24フレームの行動遅延が残っている一方、Fayntには追加の遅延がなく、この違いの影響は切り分けていない。別の評価として、非公開で提供された遅延ゼロのSlippi-AIモデルと対戦したところ、1,000万パラメータ版は2つの条件付け設定を通じて68試合すべてに勝利した。 約84万件の人間のリプレイによる事前学習の方針を定めるため、構造、最適化、規模拡大、ハイパーパラメータの転用を調べる。事後学習では、ランクと勝敗に基づくカリキュラム、7,500万から1,000万パラメータ版への蒸留、Fox同士の対戦に限定したRLを組み合わせる。最初の152試合のベンチマークでは、教師あり学習を行った1,000万パラメータ版の勝率は69.7%で、事前学習した7,500万パラメータ版の45.4%を上回った。ただし、保留データ全体でのコントローラ操作の予測損失は、1,000万パラメータ版の方が大きい。教師あり学習のチェックポイント選択に用いる重み付き検証損失は、事前学習版と教師あり学習版の計4方策について、勝率の順位と一致する。 教師あり事後学習の後、両モデルは1分当たりの被ダメージが減り、序盤により大きなリードを築き、最初の残機を失った後にもより多く勝つようになる。記録済みのゲーム状態に対する最適化した推論は、NVIDIA T4上で1判断当たり平均5.2ミリ秒(1,000万版)と8.7ミリ秒(7,500万版)であり、エミュレータの実行と通信は含まない。重み、両方のベンチマーク群、モデル間の自動対戦プラットフォームをオープンソースとして公開する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
We introduce Faynt, a family of 10M- and 75M-parameter Transformer policies for Super Smash Bros. Melee, each controlling all 26 characters with a single checkpoint. After reinforcement learning (RL), the 10M wins 240 of 244 same-character games (98.4%) against fourteen specialist and multi-character releases on their supported rosters, with a winning record against every release. These opponents retain 21- or 24-frame action delays; Faynt uses no added delay, and we have not isolated the effect of this difference. In a separate evaluation against a privately supplied zero-delay Slippi-AI model, the 10M wins all 68 games across two conditioning settings. We study architecture, optimization, scaling, and hyperparameter transfer to guide pretraining on approximately 840,000 human replays. Post-training combines rank- and outcome-based curricula, 75M-to-10M distillation, and RL restricted to Fox mirror matches. On the initial 152-game benchmark, the supervised 10M wins 69.7% of games, compared with 45.4% for the pretrained 75M, despite higher overall held-out controller-prediction loss. The weighted validation loss used for supervised checkpoint selection agrees with the win-rate ordering of all four pretrained and supervised policies. After supervised post-training, both models take less damage per minute, build larger early leads, and win more often after losing the first life. Optimized inference on recorded game states averages 5.2 ms per decision for the 10M and 8.7 ms for the 75M on an NVIDIA T4, excluding emulator execution and communication. We open-source the weights, both benchmark suites, and a platform for automated model tournaments.
著者のコメント
54 pages. Preprint, in review
arXiv ID: 2610.02144 / 要約の誤りについて