36枚のカードで説明可能AIの評価を設計する
XAI Evaluation Cards: A Practical Method for Designing Human-Centred XAI Evaluations
この論文をやさしく読む
ひとことで言うと
AIの説明を人がどう理解し使うかを評価するとき、何を測るべきかを36枚のカードで整理する方法です。82件の既存研究を基に作られています。
何に役立つ?
XAIの評価計画を立てる研究チームが、必要な観点を話し合い、優先順位を付ける際に利用できます。カードと過去の評価方法の一覧を使い、計画段階の選択を助けます。
この研究の面白いところ
新しい自動評価指標を一つ提案するのではなく、複数分野の研究者が評価の観点を選ぶ過程そのものを支援します。二つのグループ、計13人、五つのプロジェクトで試されています。
どこまで分かった?
著者は網羅的な方法ではないと明記しています。試行の規模は限定され、要旨には評価品質の定量的な改善率や、他の設計方法に対する比較結果はありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
人間中心の方法で説明可能AI(XAI)システムを評価するには、多数の評価の側面と測定法から研究者が選ぶ必要があり、その選択はしばしば場当たり的で断片的になる。本論文は、HCI、計算機科学、デザイン、社会科学の研究者が、XAIシステムを系統的に評価するための方法を導入する。 この方法は、82件の研究の分析から得た、更新版のXAI専用評価フレームワークに基づく。この枠組みを用いて、関係する評価の側面に研究者が優先順位を付けるための、36枚のカードによるカード分類法を開発した。この手順を、二つの研究グループ(n=13)の五つのプロジェクトで試した。XAI Evaluation Cardsは印刷可能な付録として提供され、過去のXAI研究で使われた方法のオンラインリポジトリも併せて利用できる。 網羅的なものではないが、本研究の知見は、カード分類法が評価プロセスの設計を整理・効率化し、研究開発におけるXAIシステムの、より包括的で学際的な評価を促せることを示している。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Evaluating explainable AI (XAI) systems from a human-centred approach requires researchers to select from numerous evaluation dimensions and measures, often in an ad hoc and fragmented manner. This paper introduces a method to help HCI, computer science, designers and social science researchers systematically evaluate XAI systems. The approach is based on an updated XAI-specific evaluation framework derived from an analysis of 82 studies. Using this framework, we developed a card-sorting method with 36 cards to help researchers prioritise relevant evaluation aspects. The process was tested with two research groups (n = 13) across five projects. The XAI Evaluation Cards are available as a printable appendix, along with an online repository of methods from previous XAI studies. Although not exhaustive, our findings indicate that the card-sorting approach can organise and streamline the design of the evaluation process, encouraging a more comprehensive and multidisciplinary assessment of XAI systems in research and development.
arXiv ID: 2610.02011 / 要約の誤りについて