arXiv論文メモ
新着一覧
cs.SD · 査読状況未確認

二つの教師モデルから人工喉頭音声の軽量表現を学ぶ

Multi-Teacher Distillation for Cross-Domain Streaming Electrolaryngeal Speech Encoding

Benedikt Mayrhofer, Enrique Orozco Olivares, Franz Pernkopf, Philipp Aichinger, Martin Hagmüller

この論文をやさしく読む

ひとことで言うと

通常の音声から学ぶ教師と人工喉頭音声に適応した教師の両方を使い、人工喉頭音声にも対応する小さな音声エンコーダーを学習します。

何に役立つ?

端末上で人工喉頭音声を逐次処理する音声認識システムへの利用が考えられます。単一CPUコアでの処理速度も報告されています。

この研究の面白いところ

離散的な音声クラスタと連続的な特徴という異なる教師信号を段階的に組み合わせ、複数の生徒構造を比較しています。

どこまで分かった?

21.2%と39.3%は下流音声認識の単語誤り率であり、改善幅は18.1パーセントポイントです。比較先はゼロショットSSLで、提案側はELで微調整した教師を使います。要旨には被験者数やCPU機種は示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

自己教師あり学習(SSL)は音声表現を改善してきたが、電気式人工喉頭(EL)音声のような病理的領域では性能が低下する。また、SSLモデルの計算負荷は、端末上でのリアルタイム利用を制限している。本研究では、健常者(HE)音声とEL音声の両方に汎化する、軽量なストリーミング用内容エンコーダーを学習するため、複数教師による知識蒸留の枠組みを提案する。 二つの教師を段階的に蒸留する。一つは凍結したSSLモデルで、HE音声から離散的な音声クラスタの目標を提供する。もう一つはEL音声で微調整した音声認識モデルで、連続値のボトルネック特徴を目標として提供する。 下流の音声認識タスクで評価したところ、本手法はEL音声の単語誤り率を21.2%に低下させた。最も強力なゼロショットSSLベースラインでは39.3%だった。因果的な畳み込み、Transformer、Conformer、Mambaに基づく生徒アーキテクチャの中で、Mel-ConformerがEL音声の精度と計算効率の最も良い組合せを実現した。最終的なエンコーダーは2190万パラメータを持ち、CPUの1コア上でONNX Runtimeを用いた場合、リアルタイム係数0.30で動作する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Self-supervised learning (SSL) has improved speech representations, yet performance degrades in pathological domains such as electrolaryngeal (EL) speech, and the computational footprint of SSL models limits their applicability in real-time, on-device deployment. We propose a multi-teacher knowledge distillation framework to train a lightweight, streaming content encoder that generalizes across healthy (HE) and EL speech. Two teachers are distilled progressively: a frozen SSL model providing discrete phonetic cluster targets from HE speech, and an EL-fine-tuned speech recognition model supplying continuous bottleneck feature targets. Evaluated via downstream speech recognition, our approach reduces the EL word error rate to 21.2%, compared to 39.3% for the strongest zero-shot SSL baseline. Among causal convolutional, Transformer, Conformer, and Mamba-based student architectures, a Mel-Conformer achieves the best combination of EL accuracy and computational efficiency. The final encoder contains 21.9,M parameters and runs at a real-time factor of 0.30 under ONNX Runtime on a single CPU core.

著者のコメント

7 pages, 4 figures, 4 tables. Accepted at IEEE Spoken Language Technology Workshop (SLT) 2026

arXiv ID: 2609.18686 / 要約の誤りについて