arXiv論文メモ
新着一覧
cs.SD / cs.AI / eess.AS · 査読状況未確認

専門家モデルを組み合わせた軽量な話者照合

MECT: Mixture of Experts with CNN-Transformer Network for Speaker verification

Yu Zheng, Jinghan Peng, ChangHao Zhang, Jian Liu, Weiqiang Wang

この論文をやさしく読む

ひとことで言うと

音声が同じ人のものかを判定するモデルで、複数の専門家を使い分ける仕組みを組み込んでいます。

何に役立つ?

考えられる用途は、計算量が限られた環境での話者照合や、音声を小分けに処理するシステムです。100ミリ秒単位の入力でも性能を保つ方式を示しています。

この研究の面白いところ

専門家を選ぶ単位と、全体を使うか一部だけ使うかを四通りで比較しています。単にモデルを大きくするだけでなく、軽量さを保った構成を検討しています。

どこまで分かった?

要旨には具体的な誤り率、パラメータ数、推論時間がありません。100ミリ秒はチャンクサイズであり、システム全体の応答遅延を示す数値ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

本論文では、ブロック構造と積み重ね方を最適化したCNN–Transformerの基盤に、Mixture-of-Experts(MoE)機構を組み込む話者照合モデルMECTを提案する。具体的には、発話単位とフレーム単位の粒度、および密なルーティングと疎なルーティングを組み合わせた四つのMoE方式を調べた。MoE機構は、パラメータの増加を小さく抑えながら、MoEを使わないベースラインに対して有効であることが示された。さらにMECTを複数のモデル規模へ展開し、いずれも少ないパラメータ数と低い計算複雑性を維持した。特にMECT-B2はVoxCeleb1で最先端の性能を達成し、CN-Celebでも高い性能を示して、多様なデータセットでの有効性を示した。加えて、因果的な再学習によりストリーミング推論の方式を構築し、100ミリ秒のチャンクサイズでも高い性能を維持した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

In this paper, we propose MECT, a speaker verification model that integrates the Mixture-of-Experts (MoE) mechanism into a CNN-Transformer backbone with optimized block structure and stacking scheme. Specifically, we investigated four MoE variants that span utterance-level and frame-level granularity with dense and sparse routing strategies. The MoE mechanism proves to be effective over the baseline without MoE with only a small increase in parameters. We further scale MECT to a series of model sizes, all maintaining compact parameters and low computational complexity. In particular, MECT-B2 achieves state-of-the-art performance on VoxCeleb1 and delivers strong results on CN-Celeb, demonstrating its effectiveness across diverse datasets. In addition, we establish a streaming inference paradigm through causal retraining, which maintains strong performance at a chunk size of 100ms.

著者のコメント

5 pages

arXiv ID: 2609.24061 / 要約の誤りについて