arXiv論文メモ
新着一覧
eess.AS · 査読状況未確認

音声の三つの表現を共通情報と固有情報に分けて感情を読む

Consensus-Guided Shared-Specific Tri-View Learning for Speech Emotion Recognition

Bing Huang, Yujian Ma, Xikun Lu, Xianquan Jiang, Jinqiu Sang

この論文をやさしく読む

ひとことで言うと

同じ声を三つの方法で表し、どの表現にも共通する感情の情報と、それぞれ独自の情報を整理して組み合わせます。

何に役立つ?

音声感情認識で複数の特徴表現を使うときに、情報の重複を減らしつつ、補い合う手掛かりを残す設計に役立ちます。

この研究の面白いところ

特徴をそのまま結合せず、共通の参照表現を作ってから各表現の固有部分と調整して融合する点が特徴です。

どこまで分かった?

報告値はIEMOCAPとEmoDBの話者独立評価によるものです。要旨には日常会話や異なる収録条件での評価はなく、人の内面を確実に読み取れるという結果ではありません。

v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

音声感情認識(SER)は異質な音響表現を活用できる一方、同じ発話から得られる各ビューには、重複する感情の手掛かりと、表現ごとに異なる手掛かりの両方が含まれる。そのため、直接融合すると、冗長な情報を伝播させたり、相補的な細部を見えにくくしたりする可能性がある。この問題に対処するため、スペクトログラム、メル周波数ケプストラム係数、HuBERT表現を共同でモデル化する、3ビュー合意誘導融合TriCGFを提案する。 TriCGFは、融合前に各ビューを共通成分とビュー固有成分に整理する。ビュー間合意学習は共通成分を集約して全体の参照表現を作り、ビュー別のゲート付き統合は、その参照表現と各ビュー固有成分を適応的に組み合わせる。さらに、差異を促すソフトな正則化によって、情報の過剰な重複を抑える。 話者独立の評価において、TriCGFはIEMOCAPで重み付き正解率(WA)74.19%、重みなし正解率(UA)75.17%を達成し、EmoDBではWA 94.36%、UA 94.28%を達成した。両データセットで代表的な音声感情認識手法を上回った。

v2の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-18 · v2
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Speech emotion recognition (SER) benefits from heterogeneous acoustic representations, but views derived from the same utterance contain both overlapping emotional evidence and representation-dependent cues. Direct fusion may therefore propagate redundant information or obscure complementary details. To address this issue, we propose Tri-view Consensus-Guided Fusion (TriCGF) for jointly modeling spectrogram, Mel-frequency cepstral coefficients, and HuBERT representations. TriCGF organizes each view into common and view-specific components before fusion. Cross-view Consensus Learning aggregates the common components into a global reference, while View-wise Gated Integration adaptively combines this reference with each view-specific component. A soft difference regularizer further discourages excessive information overlap. Under speaker-independent evaluation, TriCGF achieves 74.19% weighted accuracy (WA) and 75.17% unweighted accuracy (UA) on IEMOCAP, and 94.36% WA and 94.28% UA on EmoDB, outperforming representative SER methods on both datasets.

著者のコメント

5 pages, 3 figures, 4 tables. Submitted to ICASSP 2027

arXiv ID: 2609.19826 / 要約の誤りについて