人とAIの協働を成果と対話の手間で評価する
From Task Success to Productive Success: Evaluating Human-AI Collaboration by Quality and Cost
この論文をやさしく読む
ひとことで言うと
良い答えが得られたかだけでなく、そこへ至るまで利用者がどれだけ説明や修正をしたかも評価する研究です。
何に役立つ?
AI支援の評価で、同じ成果でも多くの手間がかかる仕組みを見分けるのに役立ちます。改善の着眼点として、早い段階の問いかけや対話修復の負担が挙げられます。
この研究の面白いところ
同じ品質評価でも対話コストが最大70倍異なる点です。また、対話を短くすれば常に良いわけではなく、タスクによって関係が変わります。
どこまで分かった?
結果は二つのデータセット、4種類のタスクに基づきます。早い質問が生産性を因果的に高めると実証したかどうかは、要旨だけでは確認できません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
AIの生産性は、タスク完了時間、経済的価値、または成果の品質向上で測られることが多い。しかし、これらの尺度は通常、協働をブラックボックスとして扱い、何が出力されたかは捉えても、それを生み出すのに必要だった対話コストは捉えない。経済学の文献に着想を得て、人とAIの協働を、対話コストに対する成果の品質として評価する、生産性を重視した枠組みを導入する。 4種類のタスクにまたがる二つのデータセットから、次のことを示す。(1)品質評価が同一のセッションでも、対話コストは最大70倍異なり得る。(2)品質とコストの関係はタスクによって異なり、長い対話が報われるものもあれば、早く収束する方が有利なものもある。(3)利用者の主観的な評価は、生産性の信頼できる代替指標ではない。(4)生産的なセッションでは、エージェントがより早く探索的な質問をし、利用者が対話の修復に費やす労力が小さいという特徴がある。生産的な成功と高コストな成功を区別することで、この枠組みは対話に伴うコストを可視化し、対話分析がAIシステムの評価と設計にどう役立つかを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
AI productivity is often measured by task completion time, economic value, or improvements in outcome quality. However, these measures usually treat collaboration as a black box where they capture what output was produced, but not the interaction cost required to produce it. Motivated by economics literature, we introduce a productivity-oriented framework for evaluating human-AI collaboration as outcome quality relative to interaction cost. Across two datasets spanning four tasks, we show that: (1) sessions with identical quality ratings can differ by up to 70 times in interaction cost; (2) quality-cost relationships vary by task, with some tasks rewarding extended interaction and others favoring fast convergence; (3) subjective user ratings are not reliable substitutes for productivity; and (4) productive sessions are characterized by agents probing earlier and users spending less effort repairing the interaction. By distinguishing productive success from costly success, our framework makes interactional cost visible and shows how dialogue analysis can inform the evaluation and design of AI systems.
著者のコメント
EMNLP 2026
arXiv ID: 2609.21117 / 要約の誤りについて