arXiv論文メモ
新着一覧
cs.AI / cs.CL · 査読状況未確認

異なる推論処理を一緒に実行する検索システム

Efficient Iterative Retrieval with Heterogeneous Batching

Dohyun Park, Hubertus Franke, Daniel G. Waddington, Swaminathan Sundararaman, Yongjoo Park

この論文をやさしく読む

ひとことで言うと

検索で使う埋め込みモデルと文章生成モデルを同じ推論ループでまとめて処理し、GPUの利用効率を高めるシステムです。

何に役立つ?

考えられる用途は、反復して検索と生成を行うシステムで、GPU上の処理量や待ち時間を改善することです。

この研究の面白いところ

計算特性の異なる二種類の処理を混合バッチにし、埋め込みの分割処理と負荷に応じたバッチ調整を組み合わせています。

どこまで分かった?

評価はA100 GPU四基で、制御された負荷と反復型RAGのベンチマークを使用しています。他のGPU構成や実運用環境での改善幅は要旨に記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

現在の情報検索では、複雑な質問に対応するため、埋め込みモデルと生成モデルの両方を使うことが増えている。しかし、既存の提供システムはこれらのモデルを別々に実行するため、処理量が低く、GPUの利用効率も悪い。GPUを処理の種類ごとに割り当てるような粗い分割は、変化する負荷に対応できず、計算資源が遊ぶ時間を生じる。 これに対して本研究は、統一した推論ループの中で異なる種類の処理を一つのバッチにまとめる提供システムOrthrusを提案する。計算の仕方が異なる埋め込み処理と生成処理を統合しながら、高い性能が出るようバッチの構成を最適化することが主な課題となる。Orthrusは、埋め込み処理を分割して逐次的にプーリングする方法と、負荷を考慮してバッチ構成を調整する方法で対応する。A100 GPU四基での評価では、比較対象の配備構成に比べ、制御された負荷で処理量が1.28~4.52倍となり、反復型RAGのベンチマークでは一連の処理にかかる時間の99パーセンタイルが最大55.8%短縮された。コードは著者らが公開している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Modern information retrieval increasingly employs both embedding and generative models to handle complex queries. However, current serving systems suffer from low throughput and poor GPU utilization because they execute these models in isolation. Coarse-grained partitioning, such as dedicating GPUs to specific tasks, fails to adapt to dynamic workloads and creates computational "bubbles". To address these, we present Orthrus, a serving system that performs heterogeneous batching within a unified inference loop. The primary challenge lies in unifying embedding and generation workloads with conflicting computational patterns while optimizing batch composition for high performance. Orthrus addresses these challenges through chunked embedding with incremental pooling and by adjusting batch composition in a workload-aware manner. Evaluation on four A100 GPUs shows that, relative to baseline deployments, Orthrus achieves 1.28$\times$--4.52$\times$ higher throughput on controlled workloads and up to 55.8% lower end-to-end p99 latency on an iterative-RAG benchmark. We release our code at https://github.com/illinoisdata/Orthrus .

著者のコメント

15 pages, 8 figures, Accepted to EMNLP 2026 (main conference)

arXiv ID: 2609.25405 / 要約の誤りについて