安全・セキュリティ・プライバシー評価用の動的ベンチマーク
SSP-Bench: A Hybrid Data Generation Framework for Safety, Security, and Privacy Evaluation
この論文をやさしく読む
ひとことで言うと
AIの安全性などを固定問題だけで測ると見落とす振る舞いを、動的に問題を作って調べる枠組み。
何に役立つ?
考えられる用途は、モデルの安全性、セキュリティ、プライバシーの評価方法を見直すこと。実証は24モデルと四つのサービスでの評価である。
この研究の面白いところ
意味の同じ言い換えへの弱さや、評価概念を混ぜたときに安全性順位の相関がほぼ0になる問題を明らかにした。
どこまで分かった?
結果は評価した24モデルと四つのSSPサービスに基づく。要旨は実運用での長期的な性能を示していない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデルの安全性、セキュリティ、プライバシー(SSP)の評価は固定されたベンチマークに大きく依存している。しかし、固定テストにはスコアの飽和、データ汚染、集計に伴う見かけ上の問題があり、言い回しの違いに対する感度も捉えられない。そのため、固定のテスト集合で高い成績を示すモデルでも、意味が同じ別の言い方では失敗することがある。 本研究は、分野としての一貫性を保ちながら、必要に応じて評価問題を生成する動的ベンチマークSSP-Benchを導入する。外部の根拠資料によってラベルの妥当性を確保し、サービスごとの検証によって対象範囲を守り、複数モデルによる調整パネルを用いて難易度を調整する。ベンチマークの構築は、難易度、区別のしやすさ、新規性、多様性を対象とした多目的最適化問題として定式化した。 24モデルと四つのSSPサービスで評価したところ、固定評価の系統的な失敗が明らかになった。異なる評価概念を混ぜたことで安全性の順位の相関がほぼ0になる例、安全性と過剰な拒否の強い結び付き、同じモデル系列内に隠れた性能低下などが含まれる。これらの結果は、固定ベンチマークがモデルの振る舞いを誤って表し得ることを示し、実際の導入状況に即した動的評価の必要性を裏付ける。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Evaluation of large language models (LLMs) for safety, security, and privacy (SSP) relies heavily on static benchmarks, which suffer from score saturation, data contamination, and aggregation artifacts, and fail to capture sensitivity to linguistic variation. As a result, models that perform well on fixed test sets often fail under semantically equivalent rephrasings. We introduce SSP-Bench, a dynamic benchmarking framework that generates evaluation instances on demand while preserving domain consistency. The framework ensures label validity through externally grounded sources, enforces scope via service-specific validation, and calibrates difficulty using a multi-model steering panel. Benchmark construction is formulated as a multi-objective optimization problem over difficulty, separability, novelty, and diversity. Across 24 models and four SSP services, SSP-Bench reveals systematic failures of static evaluation, including near-zero correlation in safety rankings due to construct mixing, strong safety--over-refusal coupling, and hidden within-family regressions. These results show that static benchmarks can misrepresent model behavior, motivating dynamic, deployment-relevant evaluation.
arXiv ID: 2609.25352 / 要約の誤りについて