複数ホストのAI計算装置を統一的に接続する基盤
Co-Fabric: Breaking Host-Domain Boundaries for Unified xPU Interconnection
この論文をやさしく読む
ひとことで言うと
複数のホストに分かれたAI計算装置を、共通のアドレス空間で高速に接続する方式を提案した。
何に役立つ?
大規模モデルを多くのxPUで動かす計算センターの通信設計に役立つ可能性がある。64 xPUの3次元メッシュでRoCEとの性能比較を報告した。
この研究の面白いところ
ホスト境界を越えるバス型接続と統一アドレス空間を組み合わせ、通信遅延だけでなく推論時間、費用、消費電力も評価している。
どこまで分かった?
数値は示された64 xPU構成とRoCEとの比較に基づく。別の装置構成や運用条件で同じ改善幅になるかは要旨からは分からない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模モデルのパラメータは単一のxPUが扱える容量を超え、異なるホスト領域にまたがる複数のxPUに分散するようになった。この場合、xPU間の通信がシステム全体の効率を大きく左右する。既存の装置内規模拡張用の接続方式は十分ではない。RoCEなどEthernetに基づくネットワーク方式には、特定のメッセージ意味論とプロトコル階層の性質があり、アドレス管理もホストごとに分断される。一方、従来のホスト基盤のファブリックは単一ホスト領域に閉じ、ホストをまたぐ統一的なアドレス空間を持たない。 本論文は、従来のバス設計と異なりホスト領域の境界を越え、規模拡張型の大規模計算システムでxPUを統一的に接続するバス型のCo-Fabricを提示する。貢献は3点ある。第1に、ネイティブな信頼性を備えつつ、ナノ秒単位の処理遅延を実現する簡素化した4層のプロトコル階層。第2に、パケットヘッダー内のポート識別子で経路選択する、領域をまたぐ拡張とxPU間の直接通信の仕組み。第3に、シャドーデバイスの自動列挙に基づく統一アドレス空間である。 64個のxPUからなる3次元メッシュのシステムでは、RoCEに比べてノード間通信遅延を50%超削減し、帯域幅を2〜5倍に向上させ、DeepSeek R1の推論を30〜80%高速化した。また、4層の簡素なプロトコルと高い通信効率により、Ethernetを使うRoCEに比べてプロトコルと処理の負荷が減り、接続基盤自体の費用を最大80%、消費電力を最大5%削減した。これらの結果は、AI計算センター向けのCo-Fabricの優位性を示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Large-model parameters have grown beyond the capacity of a single xPU, dispersing across multiple xPUs spanning distinct host domains, where xPU-to-xPU communication dominates overall system efficiency. Existing scale-up interconnect remains inadequate: network-based solutions built on Ethernet--such as RoCE (RDMA over Converged Ethernet)--introduce specific message-semantics and protocol-stack characteristics, and rely on fragmented per-host addressing, while conventional host-based fabrics are confined to a single host domain and lack cross-host unified addressing. This paper presents Co-Fabric, a bus-based interconnect that, unlike conventional bus designs, breaks host-domain boundaries to deliver unified xPU interconnection for scale-up superpods. Co-Fabric makes three contributions: a streamlined four-layer protocol stack achieving nanosecond-scale processing latency with native reliability; a cross-domain scaling and P2P mechanism that routes using port identifiers embedded in the packet header; and a unified address space built on shadow-device auto-enumeration. On a 64-xPU 3D-Mesh system, Co-Fabric cuts inter-node communication latency by over 50% and improves bandwidth by 2-5x over RoCE, accelerating DeepSeek R1 inference by 30%-80%. Moreover, since its streamlined four-layer protocol stack and higher data-communication efficiency reduce protocol and processing overhead relative to the Ethernet-based RoCE stack, Co-Fabric cuts the cost and power of the interconnect itself by up to 80% and 5%, respectively. These results demonstrate Co-Fabric's advantage for AI computing centers.
arXiv ID: 2609.25560 / 要約の誤りについて