音声言語モデルの感情認識を分類器として読み出す
Reading Emotions in the Token Space: Discriminative Adaptation of SpeechLLMs for Emotion Recognition
この論文をやさしく読む
ひとことで言うと
音声LLMに感情名を自由生成させる代わりに、内部状態を線形分類器へ渡して決められた感情から選ばせます。
何に役立つ?
対象外のラベルの出力を防ぎ、少数派の感情を含む認識性能を改善するための読み出し方法です。
この研究の面白いところ
同じ最終プロンプト位置の内部状態を使い、生成型と分類型を比較します。各感情をトークン空間の方向として見られるため、関連語も分析できます。
どこまで分かった?
IEMOCAPと二つの構成での結果です。幻覚の除去は対象外ラベルの問題についてで、感情の誤分類がすべてなくなる意味ではありません。学習テキスト由来の間接的な偏りも見つかっています。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
音声LLMは感情認識で高い可能性を示しているが、予測する感情を、分類には適さない生成型デコーダから読み出している。このデコーダは対象集合にないラベルを出力することがあり、頻度の高いクラスを優先する。私たちは、最後のプロンプトトークンの隠れ状態を分類ヘッドで読み出す識別型の適応手法を提案する。基盤モデルを変更せず、1回の順伝播でラベルを生成する。 この読み出しは、通常であればモデルがデコードに使う隠れ状態を出発点とするため、それ以外は同じ音声LLMで、生成型推論と識別型推論を条件をそろえて比較できる。ヘッドは単一の線形層に保ち、わずかな精度を引き換えに解釈可能性を得る。各感情がLLMの出力トークン空間における一つの方向となり、関連するトークンが明らかになる。 IEMOCAPにおいて、二つの音声LLM構造でMacro F1が向上し、幻覚的なラベル出力がなくなった。改善が最も大きかったのは、現実的な自動音声認識(ASR)の書き起こしを使った場合である。分析から、これらの感情方向は、ウェブ規模のテキストに含まれる偏りを反映した、間接的な連想を符号化していることが分かった。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
SpeechLLMs have shown strong potential for emotion recognition, yet they read the predicted emotion off a generative decoder not suited for classification: it can emit labels outside the target set and favors frequent classes. We propose a discriminative adaptation that reads the final prompt token's hidden state through a classification head, producing a label in one forward pass without modifying the backbone. Because this readout starts from the hidden state the model would otherwise decode, it gives a controlled comparison of generative and discriminative inference in an otherwise identical speechLLM. We keep the head a single linear layer, trading little accuracy for interpretability: each emotion becomes one direction in the LLM output token space, revealing associated tokens. On IEMOCAP, across two speechLLM architectures, it improves Macro F1 and removes hallucinations, with largest gains on realistic ASR transcripts. Our analysis reveals that these emotion directions encode indirect associations mirroring biases in web-scale text.
arXiv ID: 2609.20081 / 要約の誤りについて