arXiv論文メモ
新着一覧
cs.SD / cs.CL · 査読状況未確認

音声理解モデルの属性間公平性を監査し改善する

When Entanglement Lower-Bounds Disparity: Auditing and Repairing Demographic Fairness in Audio Understanding Models

Kian Shamsaie, Iman Modarressi

この論文をやさしく読む

ひとことで言うと

音声モデルが話者の性別、年齢、アクセントによってどの程度不公平になるかを測り、改善する方法です。

何に役立つ?

音声理解モデルの属性別の性能差を監査し、改善策を比較する際に役立つと考えられる。要旨では公開モデル10種と非公開モデル2種を評価している。

この研究の面白いところ

同じ発話内容を異なる属性や話し方で合成し、内容の違いと属性による影響を切り分けている。測定した情報漏れと格差の相関も示した。

どこまで分かった?

要旨の実証は合成音声による監査と指定したモデル群での結果であり、実際の話者集団で格差が同じ割合で改善するとは示していない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

音声技術は一部の話者に不利に働く。音声認識では黒人話者の誤りが約2倍になり、第二言語のアクセントを持つ話者や高齢話者でも精度が下がる。著者らは、120のテキスト、性別・年齢層・アクセントで構成した24の人口属性別音声プロファイル、10の感情表現スタイルを組み合わせる監査用格子TRIADを導入する。制御可能な音声合成により、知覚される人口属性を発話内容や感情表現から切り分ける。公開ウェイトを持つ10のエンコーダーについて、各軸の忠実度関数、軸の部分空間間における主角に基づく情報漏れ、群条件付きの格差を定義する。命題では、平均的なプローブ格差が、測定対象である音声と意味の漏れの集約量Λとともに増えることを証明し、系では漏れのピークが、活動領域内での最悪の格差を強いることを示す。測定した平均二乗プローブ格差はΛに追随し、ピアソン相関係数は0.93だった。また、ブラックボックスの手順でも、非公開モデル2つに同じ特徴が見られた。軸別の対照学習ヘッド、直交性へのペナルティ、群間で均衡したサンプリングを組み合わせるアダプターORCAは、漏れを72%減らし、格差をおよそ半減させた。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Speech technology penalizes some voices: recognition errs nearly twice as often for Black speakers, and accuracy declines for second-language accents and older speakers. We introduce TRIAD, an audit grid crossing 120 texts, 24 rendered demographic voice profiles (gender, age band, accent), and ten expressive styles via controllable text-to-speech, isolating perceived demographic attributes from content and affect. For ten open-weights encoders we define axis-fidelity functionals, principal-angle leakage between axis subspaces, and group-conditional gaps; a proposition proves that average probe disparity grows with the same aggregate voice-semantic leakage $\Lambda$ we measure, and a corollary shows that peak leakage forces worst-case disparity inside an active region. The measured mean-square probe disparity tracks $\Lambda$ (Pearson r = 0.93), and a black-box protocol exposes the same signature in two closed-source models. ORCA, an adapter combining axis-specific contrastive heads, an orthogonality penalty, and group-balanced sampling, cuts leakage 72% and roughly halves the gaps.

著者のコメント

Accepted by IEEE SLT 2026

arXiv ID: 2609.27382 / 要約の誤りについて