検索と段階的なラベル追加でLLMの文書分類を大規模化
RAILS: Retrieval-Augmented Incremental LLM Clustering at Scale
この論文をやさしく読む
ひとことで言うと
大量の文書をLLMで話題ごとにまとめるとき、候補ラベルを検索し、新しいラベルを必要に応じて増やしながら処理する方法です。文書のまとめ処理と並行実行も組み合わせます。
何に役立つ?
問い合わせチケットの話題整理など、文書が継続的に追加される処理に役立ちます。要旨では、公開ベンチマークに加えてSaaSの本番パイプラインへの導入も報告されています。
この研究の面白いところ
ラベルの全一覧を毎回プロンプトに入れる制約を、検索と状態の保持で扱います。分類の質と、実運用で必要になる継続処理の両方を対象にしています。
どこまで分かった?
示された精度・NMI・ARIは6ベンチマークの平均結果です。要旨には本番環境の処理量、費用、具体的な改善値は記載されておらず、すべての文書分野で同じ改善を保証するものではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデル(LLM)を本番規模のクラスタリングに使うことは難しい。プロンプトにはラベル空間全体を収められず、文書を1件ずつ逐次処理する方法では、実際の負荷が要求する処理量を達成できない。本研究では、検索で拡張した段階的なLLMクラスタリング手法RAILSを提案する。RAILSは、増え続けるラベル集合に対する単純な繰り返し処理としてクラスタリングを行い、文書のバッチ処理と上限を設けた並行実行により規模を拡張する。 6つの公開ベンチマークでは、RAILSは先行する最も強力なLLMクラスタリング手法を平均で上回り、正確度を51.2%から59.3%へ、正規化相互情報量(NMI)を67.2%から74.8%へ、調整Rand指数(ARI)を45.4%から54.7%へ高めた。さらに、SaaSの問い合わせチケットから話題を発見するパイプラインにおける本番導入の証拠も報告する。ここではRAILSが従来のHDBSCAN段階を置き換え、より高いクラスタリング品質、プロンプトによる透明性のある制御、状態を保持した段階的な運用を実現している。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Using a Large Language Model (LLM) as the clusterer at production scale is hard: prompts cannot hold the entire label space, and per-document serial processing does not deliver the throughput real workloads require. We present RAILS, a retrieval-augmented incremental LLM clusterer that turns clustering into a simple loop over a growing label pool and scales through document batching with bounded concurrency. On six public benchmarks RAILS exceeds the strongest prior LLM-clustering method on average, lifting accuracy from 51.2% to 59.3%, NMI from 67.2% to 74.8%, and ARI from 45.4% to 54.7%. We further report production-deployment evidence from a SaaS ticket-topic-discovery pipeline, where RAILS has replaced a traditional HDBSCAN stage with higher clustering quality, transparent prompt-driven control, and stateful incremental operation.
arXiv ID: 2609.24464 / 要約の誤りについて