arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

意味ごとの分類で少数例プロンプトの選択を改善

ClusterFewshot: Improving Few-shot Optimization for LLMs workflow

Omri Bar Haim, Shahar Katz, Lior Wolf

この論文をやさしく読む

ひとことで言うと

LLMに見せる少数の手本を、意味のまとまりと有用性の両方から選ぶ方法です。

何に役立つ?

少数例を使うLLMの処理を、より少ない最適化コストで調整する際に役立つ可能性があります。報告された精度改善はDSPyを用いた評価での結果です。

この研究の面白いところ

成功した推論例を単に無作為に選んだり得点順に並べたりせず、タスクの意味構造を反映させます。

どこまで分かった?

要旨には各ベンチマークの名称、削減率、精度差の具体的な数値は示されていません。DSPy以外の処理での効果も要旨からは分かりません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)を組み込んだ処理の性能は、新しいタスクでの振る舞いを導くため、文脈内に示す少数の例をどう選ぶかに左右されることが多い。最近の方法は、成功した推論の道筋をプロンプトに加えてこの過程を改善する。しかし、その例の選択は無作為抽出や指標に基づく順位づけに依存し、タスクの意味的な構造を見落としている。本研究は、意味に基づく構造化と有用性を考慮した得点づけを組み合わせ、代表性があり効果的な少数例の集合を作るClusterFewshotを提案する。DSPyを用いた処理の中で評価したところ、複数のベンチマークで最適化コストを大幅に削減した。また、プロンプトだけを調整する場合も、プロンプトと重みを組み合わせて最適化する場合も、従来のブートストラップ型手法より一貫して精度が向上した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

The performance of large language model (LLM) workflows often depends on selecting a small set of in-context demonstrations to guide model behavior on new tasks. Recent methods improve this process by augmenting prompts with successful reasoning paths. However, their demonstration selection relies on random sampling or metric-based rankings, overlooking the semantic structure of the task. We propose ClusterFewshot, a strategy that combines semantic structuring with utility-aware scoring to construct representative and effective few-shot demonstration sets. Evaluated within DSPy-based pipelines, ClusterFewshot substantially reduces optimization cost across multiple benchmarks, while consistently improving accuracy relative to prior bootstrap-based methods in both standalone prompt tuning and hybrid prompt-weight optimization.

arXiv ID: 2609.25939 / 要約の誤りについて