MIDIで複数楽器の音声を生成・部分編集する方法
Synthesis and editing of multi-instrument audio mixtures using scalar-quantised latents with MIDI Span conditioning
この論文をやさしく読む
ひとことで言うと
MIDIの修正内容を使い、複数楽器が混ざった音声の一部を再生成する手法。
何に役立つ?
考えられる用途は、既存の音色や周辺音声を参照しながら、演奏の一部の音符を編集する作曲作業である。
この研究の面白いところ
楽器別の音符イベントを順序なしの集合で表し、音声の各潜在フレームに条件を集約する。フレーム内の発音開始も制御できた。
どこまで分かった?
単一・複数楽器のベンチマークで性能を評価した。採譜による音符忠実度評価には限界があると著者ら自身が述べている。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
作曲では、ほかの部分を保ったまま特定の音楽要素を繰り返し修正することが多い。こうした作業を支援するため、低フレームレートのスカラー量子化潜在表現を用い、MIDIに従って複数楽器の混合音声を生成・編集するフローマッチングモデルSpanSynth-Editを提案する。MIDI Spanは、楽器名を付けた各音符の開始から終了までを、連続値の属性を持つ順序なしのイベント集合として符号化し、音声潜在表現の各フレームについて集合を一つの条件ベクトルに集約する。モデルは周辺の音声を使って楽器固有の音色を参照し、変更したMIDIから対象区間を再合成して編集する。単一楽器と複数楽器のベンチマークでの実験では、競争力のある性能を示し、同じフレーム内での発音開始時刻の制御も実証した。また、採譜に基づいて音符への忠実度を評価する方法の限界も議論する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Music creation often involves iterative refinement, changing selected musical details while retaining the rest. To support such refinement, we introduce SpanSynth-Edit, a flow-matching model for MIDI-guided synthesis and editing of multi-instrument audio mixtures using low-frame-rate scalar-quantised latents. MIDI Span encodes instrument-labelled note lifecycles as unordered event sets with continuous-valued attributes and pools each set into one conditioning vector per audio-latent frame. The model uses contextual audio for instrument-specific timbre guidance and supports editing by resynthesising the target region from revised MIDI. Experiments on single- and multi-instrument benchmarks show competitive performance and demonstrate within-frame onset control. We also discuss limitations of transcription-based note-adherence evaluation.
著者のコメント
13 pages including appendices, 2 figures. Submitted to ICASSP 2027
arXiv ID: 2609.25546 / 要約の誤りについて