arXiv論文メモ
新着一覧
cs.SD · 査読状況未確認

音声言語モデルを軽量化する層の重要度

Speech Block Influence: Component-Specific Layer Scoring for Pruning Speech LLMs

Siyu Yao, Du Q. Huynh, Lian Xu, Mark Reynolds

この論文をやさしく読む

ひとことで言うと

音声LLMのエンコーダーとデコーダーを別々に評価し、削除する層を選ぶ方法です。

何に役立つ?

音声LLMを計算資源の限られた環境へ導入するとき、刈り込み対象の層を選ぶ助けになります。

この研究の面白いところ

デコーダーの評価をテキストトークンに絞ると選択が安定し、テキストだけの較正でも似た順位が得られます。

どこまで分かった?

要旨での評価対象は三つの音声LLMです。具体的な計算費用の削減量は要旨に示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

音声を扱う大規模言語モデル(LLM)は、計算資源が限られた環境での導入に費用がかかる。層の刈り込みによって費用を減らせるが、従来の重要度指標は音声LLMへうまく移せない。従来の指標は、デコーダーのみの構造と均質なトークン列を想定する一方、音声LLMにはエンコーダーとアダプターが加わり、複数種類の情報を含む列を処理するためである。本研究は、音声LLMの刈り込み向けに設計された層の重要度評価の枠組みSpeech Block Influence(SBI)を提案する。二つの部品別スコアからなり、SBI-Encはエンコーダー層を除いた影響をアダプターの出力で測って下流への影響をより反映する。SBI-Decは、音声トークンの影響が支配的になるのを避けるため、テキストトークンの位置だけで層の入出力の類似度を測る。 三つの音声LLMで、SBIは刈り込みの頑健性を改善した。刈り込み率が高いときにはエンコーダー側の性能がより高く、デコーダーでは音声が支配する列全体でなくテキストトークンを採点することで、層をより確実に選べた。また、テキストのみを使う較正で得たデコーダーの順位は、音声とテキストを使う較正による順位と高く相関しており、層の重要度を測る費用の低い代替法となる可能性を示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Speech LLMs are costly to deploy in resource-constrained settings. Layer pruning can cut this cost, but existing scoring metrics transfer poorly to speech LLMs: they assume a decoder-only architecture with homogeneous token sequences, whereas speech LLMs add encoder and adapter components and process multimodal sequences. We propose Speech Block Influence (SBI), the first layer-importance scoring framework designed for speech LLM pruning that consists of two component-specific scores: SBI-Enc measures the effect of encoder-layer removal at the adapter's output to better reflect downstream impact; SBI-Dec measures layer-wise input-output similarity over text-token positions only to avoid audio-token dominance. Across three speech LLMs, SBI improves pruning robustness, with stronger encoder performance at higher pruning rates and more reliable decoder layer selection by scoring text tokens rather than the audio-dominated full sequence. We further find that text-only calibration yields decoder rankings highly correlated with those from speech-text calibration, suggesting a cheaper alternative to measure decoder layer importance.

著者のコメント

5 pages, 3 figures. Submitted to ICASSP 2027

arXiv ID: 2609.29343 / 要約の誤りについて