arXiv論文メモ
新着一覧
cs.SD / cs.CV · 査読状況未確認

ギリシャ伝統音楽のタグ付けに踊り手の姿勢を加える効果

Pose-Aware Multimodal Automatic Tagging for Greek Traditional Music

Alexandros Alexiou, Charilaos Papaioannou, Alexandros Potamianos

この論文をやさしく読む

ひとことで言うと

ギリシャ伝統音楽のタグ付けに、音声と映像に加えて踊り手の姿勢情報を使う効果を調べた。

何に役立つ?

地域固有の音楽や舞踊の検索用タグを自動で付ける方法の設計に役立つ可能性がある。要旨は Lyra データセットでの比較結果を示す。

この研究の面白いところ

骨格情報だけでは弱かったが、三形態を組み合わせると最も強い音声のみの基準よりマクロ ROC-AUC が約4ポイント改善した。

どこまで分かった?

効果は Lyra データセットでの評価であり、ほかの地域の音楽や舞踊への一般化は要旨に記載されていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

自動タグ付けは音楽情報検索の中心的な課題だが、多くのシステムは音声だけを利用する。生演奏は本来複数の情報形態を持ち、楽器、地域様式、舞踊の形式などの意味的なラベルは、音響、映像、身体の動きの手がかりに同時に表れる。音楽情報検索のベンチマークで十分に扱われていないギリシャ伝統音楽のような地域固有のレパートリーでは、特にそうである。本研究は、ギリシャ伝統音楽の自動タグ付けに、踊り手の姿勢が音声に加えて補完的な情報を与えるかを調べる。Lyra データセットを使い、従来の音声のみの研究を拡張して、対応する映像特徴と姿勢由来の骨格系列を抽出し、複数の情報形態による自動タグ付けの実験環境を作った。さらに、自然な環境で撮影された舞踊映像から主な踊り手の骨格系列を自動抽出する処理を導入する。これは舞踊場面の検出、複数人物の追跡、踊り手の選択、姿勢推定、品質の選別を組み合わせる。一つの情報形態だけ、二つのすべての組み合わせ、三つすべてを使うシステムを、複数の統合方法で比較した。音声は単独では最も強く、AST のマクロ ROC-AUC は0.821だった。骨格情報は単独では弱いものの、複数情報の統合によって性能を高めた。最良の三形態のシステムでは、最も強い音声だけの基準に比べ、マクロ ROC-AUC が約4パーセントポイント高くなった。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Automatic tagging is a core task in Music Information Retrieval (MIR), yet most tagging systems exploit only audio. Live music performance is inherently multimodal, as semantic labels such as instruments, regional styles, and dance forms are encoded simultaneously across acoustic, visual, and embodied performance cues. This is especially true of culturally specific repertoires such as Greek traditional music, which remain underrepresented in MIR benchmarks. In this paper, we investigate whether the use of dancer pose provides complementary information for automatic tagging in Greek traditional music beyond audio. Using the Lyra dataset, we extend prior audio-only work by extracting aligned video features and pose-derived skeleton streams, enabling an experimental setting for multimodal auto-tagging. We further introduce an automated pipeline for extracting primary-dancer skeleton sequences from in-the-wild dance footage, combining dance-scene detection, multi-person tracking, dancer selection, pose estimation, and quality filtering. We compare unimodal, all bimodal combinations, and trimodal systems using multiple fusion strategies. Audio remains the strongest single modality (AST: macro ROC-AUC 0.821), while skeletons, though weak in isolation, enhance performance through multimodal fusion. The best trimodal system improves macro ROC-AUC by about 4 percentage points over the strongest audio baseline.

arXiv ID: 2609.27094 / 要約の誤りについて