1億5930万パラメータの音声言語モデルMizar
Mizar: A 159M-Parameter Audio-Language Model for Audio Understanding
この論文をやさしく読む
ひとことで言うと
限られた計算資源でも音声を理解できるよう、約1億5930万パラメータの音声言語モデルを作り、精度とCPU上の速度を測った研究です。
何に役立つ?
小型の音声質問応答モデルを設計する際の学習手順と、ベンチマーク精度・CPU遅延の比較材料になります。
この研究の面白いところ
三段階学習と小型の音声・言語モデルの接続を組み合わせ、五つの乱数シードで三つのベンチマークを評価しています。
どこまで分かった?
示された精度はMMAU、MMAR、ADQA-cleanでの結果で、1.09秒の遅延はMMAUの質問を単一CPUで処理した条件です。一般の機器や別の音声課題で同じ性能とは限りません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
音声言語モデルは、音の知覚と言語モデルに蓄えられた知識を統合し、音の出来事を文脈に沿って理解できるようにする。メモリや計算資源が限られる機器でも実用的に使えるよう、本研究は2億パラメータ未満の小型モデルに注目する。アーキテクチャ、データ、三段階の学習を組み合わせて、1億5,930万パラメータの音声言語モデルMizarを構築する手順を示す。小型のCED-Small音声エンコーダを、周波数方向を統合する写像器を介してSmolLM2-135Mにつなぐ。ReasonAQA、AudioMCQ、AVQAから得た教師データを用い、音声と言語の対応付け、音声に依存する微調整、弱い能力を補いつつ学習済みの能力を保つ追加学習の三段階で訓練する。 五つの乱数シードでの平均正答率は、MMAUで52.92%、MMARで42.42%、ADQA-cleanで36.02%となり、三つのベンチマークすべてで、従来最も高性能だった2億パラメータ未満の音声言語モデルを上回った。単一のCPUでローカル推論もでき、MMAUの質問では、音声ファイルを開いてから回答全体を生成するまでの平均遅延は1.09秒だった。コードとチェックポイントは公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Audio-language models (ALMs) integrate acoustic perception with the knowledge encoded in language models, enabling contextual understanding of auditory events. Making these capabilities practical on devices with limited memory and computation motivates our focus on small ALMs with fewer than 200M parameters. We introduce a recipe that brings together architecture, data, and three-stage training to build Mizar, a 159.3M-parameter ALM. Its architecture connects a compact CED-Small audio encoder to SmolLM2-135M through a frequency-merging mapper. With supervision drawn from ReasonAQA, AudioMCQ, and AVQA, the model undergoes three training stages: audio-language alignment (Stage 1), audio-dependent fine-tuning (Stage 2), and post-training (Stage 3) aimed at strengthening weak skills while retaining learned capabilities. Across five random seeds, Mizar achieves mean accuracies of 52.92% on MMAU, 42.42% on MMAR, and 36.02% on ADQA-clean, surpassing the previous best-performing ALM below 200M parameters on all three benchmarks. It also supports local inference on a single CPU: on questions from the MMAU benchmark, the mean latency from opening the audio file to generating a complete answer is 1.09 seconds. Code and checkpoints are available at https://github.com/KaiyangLi1992/Mizar_159M.
著者のコメント
5 pages, submitted to ICASSP 2027
arXiv ID: 2609.28344 / 要約の誤りについて