スマホ・PC・ウェブの操作を統合する視覚AI MintAct
MintAct: A Unified Visual Agent for Digital Environments
この論文をやさしく読む
ひとことで言うと
画面を見ながら操作する能力を、スマホ、パソコン、ウェブごとに別々に作らず、一つのモデル群にまとめる研究です。
何に役立つ?
考えられる用途は、異なるデジタル環境をまたぐ操作支援です。要旨で示されているのは複数のベンチマークにおける性能で、任意の実務を自動化できるとの実証ではありません。
この研究の面白いところ
モデルだけでなく、数百の環境を同時に動かす収集・学習基盤も設計しています。領域ごとの学習量を管理しながら非同期に学習する点が統合の鍵です。
どこまで分かった?
比較は同程度のモデル規模を条件としています。OSWorld-Verifiedの値は48.9と報告されていますが、要旨には個々のモデル規模の結果や失敗の内訳は記載されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
本研究では、UI上の対象位置の特定、モバイル・デスクトップ・ウェブを横断する複数ステップの移動操作、視覚に基づくツール使用を統合した視覚言語モデル群MintActを提案する。モデルは20億、40億、80億パラメータの規模で学習した。環境、データ、学習手順を入念に設計することで、MintActはこれらすべての能力において、各領域に特化したモデルに匹敵する性能を実現する。 これを可能にするため、拡張可能な環境基盤と強化学習(RL)基盤を開発した。環境側では、領域ごとに異なるバックエンド上で数百のインスタンスを同時に稼働させ、実行軌跡のデータ収集とオンラインRLの両方に利用する。効率的で拡張可能なRL学習のために、領域をまたぐ学習分布を明示的に管理しながら、雑音を含む環境のフィードバックやオフポリシーのずれに対して安定性を保つ非同期の枠組みを採用した。実験結果では、同程度のモデル規模で比較した幅広いベンチマークにおいて、MintActが最先端の性能を達成したことが示されており、OSWorld-Verifiedでは48.9を記録した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
We present MintAct, a family of vision-language models that unifies UI grounding, multi-step navigation across mobile, desktop, and web, and visual tool use, trained at 2B, 4B, and 8B scales. Through careful design of our environments, data, and training recipes, MintAct models match the performance of per-domain specialists across all of these capabilities. To enable this, we develop a scalable environment and reinforcement learning (RL) infrastructure. On the environment side, we host hundreds of concurrent instances across heterogeneous per-domain backends, serving both trajectory data collection and online RL. To enable efficient and scalable RL training, an asynchronous framework keeps explicit control over the cross-domain training distribution and remains stable under noisy environment feedback and off-policy drift. Experimental results show that MintAct achieves state-of-the-art performance (48.9 on OSWorld-Verified) across a wide range of benchmarks at comparable model sizes.
arXiv ID: 2609.22083 / 要約の誤りについて