意味と音響を別々に学習圧縮する低頻度の音声トークン化
Q-SPT: Learnable Query-Based Compression for Low-Frame-Rate Speech Tokenization
この論文をやさしく読む
ひとことで言うと
音声を少ないトークンに圧縮するとき、発話内容と音の細かい特徴を、それぞれ別の学習可能な処理でまとめる方法です。
何に役立つ?
音声言語モデルの計算量とメモリー使用量を抑えつつ、認識や合成に必要な情報を残す設計に役立ちます。同じフレームレートでの比較が行われています。
この研究の面白いところ
意味側で決まった圧縮区切りを音響側にも流用せず、両方が文脈に応じて独立に情報を集めます。意味側にはテキストを予測する損失も加えています。
どこまで分かった?
「最も優れる」は評価したコーデックや下流設定の中での結果です。具体的なフレームレート、データセット、改善量や遅延は要旨に示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ニューラル音声コーデックは、音声言語モデル(SLM)のトークナイザーとして使われることが増えている。フレームレートを下げるとSLMの計算費用とメモリー費用を減らせるが、言語情報と音響的な細部の両方を保つことが難しくなる。既存の方法は規則に基づく圧縮に依存している。平均プーリングは言語情報を失わせる可能性があり、類似度に基づく統合は隣接フレームの類似度に固定閾値を使い、その結果の境界を音響ストリームにも適用する。 本研究は、低フレームレートの2ストリーム音声トークナイザーQ-SPTを提案する。意味表現と音響表現にそれぞれ特化した、文脈を考慮する学習可能なクエリーに基づく圧縮器を別々に備える。具体的には、固定レートのクエリーが、意味と音響のストリームをそれぞれ独立したキー・値の供給元として参照する。これにより、個別に学習する2つの圧縮器を通じ、ストリームごとに文脈を考慮した集約ができる。さらに、自己回帰的なテキスト損失で意味側の圧縮器を明示的に教師あり学習し、言語情報を保持させる。 実験結果では、同じフレームレートで評価したコーデックの中で、Q-SPTが最も優れた再構成を達成する。下流のSLMでは、競争力のある明瞭度を保ちながら、最も高い音声認識精度と、音声合成の知覚品質を実現する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Neural speech codecs increasingly serve as tokenizers for speech language models (SLMs). Lowering the frame rate reduces the computational and memory costs of SLMs, but makes it difficult to preserve both linguistic information and acoustic detail. Existing approaches rely on rule-based compression: average pooling can discard linguistic information, whereas similarity-based merging uses a fixed threshold on adjacent-frame similarity and applies the resulting boundaries to the acoustic stream. We propose Q-SPT, a low-frame-rate dual-stream speech tokenizer with separate, context-aware, learnable query-based compressors specialized for semantic and acoustic representations. In particular, queries at a fixed rate independently attend to the semantic and acoustic streams as separate key-value sources, enabling stream-specific, context-aware aggregation through two separately learned compressors. In addition, an autoregressive text loss explicitly supervises the semantic compressor to preserve linguistic information. Experimental results show that Q-SPT achieves the best reconstruction among the evaluated codecs at the same frame rate. In downstream SLMs, it yields the best speech recognition accuracy and text-to-speech perceptual quality with competitive intelligibility.
arXiv ID: 2610.01492 / 要約の誤りについて