arXiv論文メモ
新着一覧
cs.DC · 査読状況未確認

大規模エージェント学習向けサンドボックス基盤の運用

DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale

Jialiang Huang, Hongxuan Tang, Jingchang Chen, Yuxuan Liu, Yixiao Chen, Yuan Cheng, Yi Tao, Jingli Zhou, Yupeng Chen, Haoyu Chen, Jiarui Wang, Shengkai Lin, Chuqi Zhang, Bryan Lee Teng, Lian Guo, Zhe Fu, Wenjun Gao, Yisong Wang, Liang Zhao, Zehao Wang, Ziwei Xie, Yongqiang Guo, Peixin Cong, Ziyi Gao, Shuiping Yu, Hanwei Xu, Zuofan Wu, Zhizhou Ren, Yuyang Zhou, Bowei Zhang, Zhihuan Huang, Qihao Zhu, Lei Wang, Tianle Lin, Han Yu, Jiewen Hu, Dejian Yang, Shuo Yang, Shanghao Lu, Shaoyuan Chen, Junjie Qiu, Zhangli Sha, Yinmin Zhong, Yongtong Wu, Shiyu Wang, Wei Liu, Bingzheng Xu, Longhao Chen, Qiushi Du, Yuzhen Huang, Shirong Ma, Yaohui Wang, Mingshu Chen, Tongrui Xiong, Y.C. Yan, Haowen Luo, Haofen Liang, Xiaokang Zhang, Weihao Zeng, Runxin Xu, Peiyi Wang, Jinhua Zhu, Ruoyu Zhang, Wenkai Yang, Qi Tang, Jiping Yu, Tian Ye, Ruizhe Pan, Honghui Ding, Xiaodong Liu, Lingxiao Luo, Zhihong Shao, Yuhan Wu, Jibai Lu, Wen Liu, Haoling Zhang, Jingcheng Hu, Yaoyang Ye, Chaofan Lin, Zhaochen Zhang, Jianan Tong, Hengxu Wu, Zhihao Li, Yicheng Wang, Luyao Wang, Yuzhuo Bai, Lingyue Fu, Ruifan Xu, Y.Z. Wang, Zonglin Li, Mingqi Wei, Haiyang Shen, Chengyuan Zhang, Chao Jin, Zili Zhang, R.H. Yang, Xinbo Xu, Jian Zhou, Ruidong Zhu, Yuzhe Guo, Zelun Pan, Shaoheng Nie, Erhang Li, Shuhan Lin, Zheng Liu, Anshuo Chen, Zilong Lyu, Sinuo Cao, Rui Yu, Chuhao Wang, Junyi Guo, Junxiao Song, Kaifeng Chen, Menghao Ye, Junxian Li, Di Wu, Haiyang Ma, Yilun Wang, Haoran Yang, Yizai Cai, Shichun Liu, Yiping Wang, Junbo Sun, Shicheng Xu, Xiao Bi, Ying He, Yichao Zhang, Mingxing Zhang, Liyue Zhang, Panpan Huang, Wenfeng Liang

この論文をやさしく読む

ひとことで言うと

大量のAIエージェントを学習・評価するため、用途別の隔離環境を高速に用意する基盤の設計と運用を報告した。

何に役立つ?

大規模なエージェント学習で、サンドボックスの配置、状態維持、資源回収を設計する際の参考になる。

この研究の面白いところ

約160ノードの単位システムで1日約300万個を処理し、本番で38万個超を同時実行したという運用規模が示されている。

どこまで分かった?

性能の記述は著者らの評価と本番運用経験に基づく。要旨には他基盤との詳細な定量比較は記載されていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)のエージェント学習と評価には、モデルがリポジトリを調べ、ツールを呼び、コマンドを実行し、課題ごとのサービスを利用できる、隔離された状態保持型の実行環境が必要である。こうした処理ではサンドボックスが短時間に大量生成され、機能や隔離要件は多様で、長い対話の間は状態を維持し、再利用の少ない大量のイメージを使う。このため単一のサンドボックス実行方式ではなく、伸縮可能な実行基盤が求められる。本報告は、本番運用向けのDeepSeek Elastic Compute(DSec)を示す。DSecは統一SDKを通じ、FnCall、コンテナ、マイクロVM、フルVMの各サンドボックスを提供する。クラスタ全体で配置とライフサイクルを調整し、個別に版管理された層から環境を組み立てる。メモリ共有・回収とCPUスケジューリングを組み合わせて高密度実行を実現し、クラスタ全体の分散ファイルシステムFire-Flyer File System(3FS)から必要に応じてイメージデータを読み込む。DSecは強化学習の枠組みと共同設計され、状態を保持するロールアウトの実行を、停止可能なGPU学習から分離する。また学習とサンドボックスのライフサイクルを連携させ、ロールアウトの状態を保ちながら遊休資源を回収し、報酬ハッキングなどのエージェントの望ましくない振る舞いを抑える。DSecの本番規模の単位システムは約160ノードに及び、1日約300万個のサンドボックスを処理する。本番環境では同時に38万個超のサンドボックスを支え、毎秒5000個超を生成する。評価と運用経験によれば、これらの仕組みは環境準備とイメージ配布の負荷を下げ、メモリ効率を改善し、高密度で資源を過剰割り当てした場合にも遅延に敏感な処理の性能を維持する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-19(UTC)
最新改訂
2026-09-19 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Large-scale agentic training and evaluation with large language models (LLMs) rely on isolated, stateful execution environments in which models inspect repositories, invoke tools, execute commands, and interact with task-specific services. These workloads create sandboxes in large bursts, span heterogeneous functionality and isolation requirements, retain state across long interactions, and draw from large image corpora with limited reuse. Supporting them therefore requires an elastic execution platform rather than a single sandbox runtime. This report presents DeepSeek Elastic Compute (DSec), a production sandbox platform that exposes FnCall, container, microVM, and full-VM sandbox backends through a unified SDK. DSec coordinates placement and lifecycle management across the cluster, composes environments from independently versioned layers, combines memory sharing, reclamation, and CPU scheduling for high-density execution, and loads image data on demand from Fire-Flyer File System (3FS), a cluster-wide distributed filesystem. DSec is co-designed with the reinforcement learning (RL) framework, decouples stateful rollout execution from preemptible GPU training, coordinates sandbox lifecycle with training to preserve rollout state while reclaiming idle resources, and mitigates agent misbehavior such as reward hacking. A single production-scale unit of DSec spans around 160 nodes, serving about 3 million sandboxes per day; in production, it supports over 380,000 concurrent sandboxes and sustains over 5,000 sandbox creations per second. Our evaluation and deployment experience show that these mechanisms reduce environment setup and image-distribution overhead, improve memory efficiency, and preserve latency-sensitive performance under high-density overcommit.

著者のコメント

31 pages, 13 figures. This version has been substantially expanded from an earlier version, whose two-page extended abstract underwent first-round review for the Operational Systems Track of ACM SIGOPS ATC 2026

arXiv ID: 2609.22978 / 要約の誤りについて