歌い手の声質を保ちながら音程とリズムを補正する手法
SRF-SVB: Style-Consistent Singing Voice Beautifying via Rectified Flow
この論文をやさしく読む
ひとことで言うと
歌い手らしい声や表現を残しながら、音程とリズムを直す歌声生成モデルを提案した。
何に役立つ?
歌唱の補正技術で、歌い手固有の声質と表現を残す設計を考える材料になる。
この研究の面白いところ
rectified flowによる生成と、文脈を使ってメルスペクトログラムを補完する仕組みを組み合わせた。
どこまで分かった?
英語と中国語のテスト集合で大半の指標が比較モデルを上回ったと記載されるが、要旨には改善幅や歌い手の人数は示されていない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
歌声の補正・改善(SVB)は、歌詞と歌い手の声質を保ちつつ、アマチュアの歌唱の音程とリズムを修正し、声の品質を高めることを目指す。しかし既存の方法は、生成品質と効率に限界があり、歌い手の歌唱スタイルの保持を軽視しがちである。本論文は、音程とリズムの補正を含む、高品質で効率的な歌唱補正を実現するため、rectified flowを使うスタイル一貫型モデルSRF-SVBを提案する。さらに、文脈を手がかりにメルスペクトログラムの隠された部分を埋める機構を設計し、アマチュア歌手固有の声質や表現のパターンを含む歌唱スタイルを効果的に保持する。英語と中国語のテスト集合を用いた実験では、SRF-SVBは客観的指標と主観的指標の大半で比較モデルを上回った。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Singing voice beautifying (SVB) aims to correct pitch and rhythm of amateur singing while enhancing vocal quality, preserving lyrics and the singer's timbre. Existing methods, however, suffer from limited generation quality and efficiency, and tend to neglect the preservation of the singer's style. We propose SRF-SVB, a style-consistent model for SVB via rectified flow, which achieves high-fidelity and efficient beautification covering pitch and rhythm correction. Furthermore, we design a context-guided masked mel-spectrogram inpainting mechanism that effectively preserves the amateur singer's style, including unique timbre and expressive patterns. Experiments on both English and Chinese test sets show that SRF-SVB outperforms baseline models in most objective and subjective metrics.
arXiv ID: 2609.25610 / 要約の誤りについて