音楽の構造と音響の細部を分ける音声トークン化
Rethinking Music Tokenization: A Semantic Codec toward High-Fidelity LLM Music Generation
この論文をやさしく読む
ひとことで言うと
音楽をAIが扱う記号列へ変換するとき、音楽としての構造と細かい音響情報を分け、音質と予測のしやすさを両立しようとする研究です。
何に役立つ?
考えられる用途は、音質を維持しながらLLMで音楽を生成するための入力・出力表現です。要旨が報告する成果は、主に再構成品質とトークン系列の予測しやすさの改善です。
この研究の面白いところ
音楽の意味を曖昧な概念のまま使わず、音楽情報検索のタスクで測れる情報として定めています。楽器ごとに音源分離することなく、混合音から2種類の情報を取り出します。
どこまで分かった?
要旨には改善の具体的な数値や評価データの規模がありません。コーデックの評価から、最終的な生成音楽のあらゆる品質が向上するとまでは判断できません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
近年の音楽生成において、音声の離散トークン化は、生の波形と自己回帰モデルをつなぐ重要なインターフェースとなっている。このため、音楽トークナイザーには、高忠実度の再構成を支えると同時に、言語モデルが扱いやすい離散系列を生成することが求められる。既存の再構成重視のトークナイザーは、音楽的な構造と細かな音響情報を混在させがちであり、モデル化しにくい高エントロピーのトークンを生む。一方、意味情報を利用する代替方式は音声会話向けに設計されていて音楽に適合しにくく、再構成品質を損なうことが多い。 本研究では、後段の音楽情報検索タスクに基づく測定可能な音楽の意味内容という概念を中心にトークン化を捉え直し、これらのトレードオフに対処する。この定義を指針として、音源分離を行わずに混合信号から意味内容と音響内容を直接分解する音楽意味コーデックMuSeCを提案する。MuSeCは、高忠実度の再構成に必要な情報を保持しながら、言語モデルがより扱いやすい離散単位を生成する。実験では再構成品質を改善し、より予測しやすいトークン系列を実現した。これにより、高忠実度のLLM音楽生成に向けた実用的な基盤を提供する。デモは https://longwaytog0.github.io/MuSeC/ で公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Discrete audio tokenization has become the critical interface between raw waveforms and autoregressive modeling in recent music generation. As a result, music tokenizers must simultaneously support high-fidelity reconstruction and produce discrete sequences that remain amenable to language modeling. Existing reconstruction-oriented tokenizers often mix musical structure with fine acoustic details, producing high-entropy tokens that are hard to model. In contrast, semantics-guided alternatives are designed for speech and do not fit music well, often hurting reconstruction quality. We address these trade-offs by rethinking music tokenization around a measurable notion of music semantic content grounded in downstream Music Information Retrieval tasks. Guided by this definition, we propose MuSeC, a music semantic codec that factorizes semantic and acoustic content directly from mixed signals without source separation. MuSeC preserves information required for high-fidelity reconstruction while producing more LM-friendly discrete units. Empirically, it improves reconstruction quality and yields more predictable token sequences, providing a practical foundation toward high-fidelity LLM music generation. Demos are available at https://longwaytog0.github.io/MuSeC/.
arXiv ID: 2609.21240 / 要約の誤りについて