arXiv論文メモ
新着一覧
cs.CL / cs.AI · 査読状況未確認

多言語音声認識の連合学習で構成と集約方法を比較する

Federated Multilingual Speech-LLMs: Architecture and Aggregation Strategy Benchmarking

Jordi Luque, Aleix Sant, Fernando López

この論文をやさしく読む

ひとことで言うと

複数の端末でデータを分けて学習する多言語音声認識について、モデルの部品や集約方法、学習率の選び方を比較した研究です。

何に役立つ?

音声エンコーダ・接続器・言語デコーダのどこを適応させるか、FedAvgとFedProxのどちらを使うかを検討する参考になります。

この研究の面白いところ

全体で一つの学習率を使うのではなく、3要素を別々に調整する重要性を示しています。FedProxの利点も一定ではなく、基盤モデルの構成に左右されます。

どこまで分かった?

比較はMultilingual LibriSpeech上の4構成で、要旨には具体的な誤り率が示されていません。分散学習の評価は、それ自体で情報漏えいを防ぐプライバシー保証を実証するものではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

多言語自動音声認識(ASR)に対する連合学習(FL)の包括的なベンチマークを提示し、Multilingual LibriSpeechデータセット上で4種類のSpeech-LLMアーキテクチャを評価する。エンコーダを固定する構成と固定しない構成でFedAvgとFedProxを比較し、学習率の最適化が性能に不可欠であることを示す。具体的には、音声エンコーダ、接続器、デコーダの学習率を独立に調整すると最も低い誤り率が得られ、3要素すべてを適応させる構成、すなわちエンコーダとデコーダにはLoRA、接続器には全体学習を用いる構成が、連合学習で最良の結果を生む。 FedProxの有効性はアーキテクチャに依存し、多言語で事前学習された構成で顕著な利点があると分かった。例えば、エンコーダを固定した場合、TinyLlamaと比べてEuroLLMで利点が見られる。これは、LLM基盤の能力が、不均一なデータ分布への頑健性を左右するうえで重要な役割を果たすことを示している。これらの知見は、プライバシーが重視される分散環境に多言語Speech-LLMを導入する際の、具体的な設計指針を提供する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We present a comprehensive benchmark of Federated Learning (FL) for multilingual Automatic Speech Recognition (ASR), evaluating four Speech-LLM architectures on the Multilingual LibriSpeech dataset. We compare FedAvg and FedProx across frozen and unfrozen encoder configurations, demonstrating that optimized learning rates are critical for performance. Specifically, independently tuning the learning rates for the speech encoder, connector, and decoder yields the lowest error rates, with full three-component adaptation (LoRA for encoder and decoder, full training for the connector) producing the best FL results. We observe that FedProx efficacy is architecture-dependent, providing notable advantages in multilingual pre-trained architectures (e.g., EuroLLM over TinyLlama when keeping the encoder fixed); this indicates that LLM backbone capacity plays a key role in mediating resilience to heterogeneous data distributions. These findings offer concrete design guidance for deploying multilingual Speech-LLMs in privacy-sensitive, distributed environments.

著者のコメント

Accepted Iberspeech 2026

arXiv ID: 2609.23825 / 要約の誤りについて