顔・体形・外見を統合して人物別に動画を要約
Identity-Centric Video Summarization via Hierarchical Fusion of Biometric, Appearance, and 3D Body Features
この論文をやさしく読む
ひとことで言うと
動画に映る人物を複数の手がかりで追跡し、人物ごとに重要で重複の少ないフレームをまとめる方法。
何に役立つ?
人物別の動画検索や要約の設計に役立つ可能性がある。生体情報を使うため、実用時には利用目的に応じた取扱いが必要と考えられる。
この研究の面白いところ
顔、三次元体形、外見を統合して遮蔽に対応し、フレーム選択では見やすさ、交流、動き、時間的な多様性を同時に考える。
どこまで分かった?
数値は独自データセットでの評価とTop-K方式との比較。別の動画や撮影条件での性能は要旨から分からない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
複数物体追跡と人物の再識別に基づく動画要約アルゴリズムを提案する。顔の埋め込み表現、三次元の体形特徴、視覚的な外見を一つの追跡枠組みに統合する。これらの表現を用いた階層的な人物IDの割り当てと、双方向のアンカーに基づく追跡により、強い遮蔽や画質の低下がある場合でも移動軌跡を頑健に復元する。安定した軌跡から、人物ごとに簡潔な要約を生成する。生体情報がはっきり写っているか、社会的なやり取り、動きの変化を重み付けして重要フレームを選び、適応的な非最大抑制で時間的な多様さも確保する。独自のデータセットでの評価では追跡の安定性を示し、IDF1は97.89%、MOTAは95.79%だった。上位K枚を選ぶ方式と比べ、視覚的な多様性は146%、時間的な網羅性は89%、情報の探しやすさは3.5%向上した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
This work presents a video summarization algorithm based on multi-object tracking and person reidentification. We integrate facial embeddings, 3D body-shape features, and visual appearance into a unified tracking framework. These representations enable hierarchical identity assignment and tracking through bidirectional anchoring, which robustly recovers trajectories under severe occlusion or low visual quality. From these stable trajectories, we generate a compact set of summaries for each identity. We select keyframes using a multi-factor weighting scheme that optimizes biometric clarity, social interaction, and motion dynamics, while Adaptive Non-Maximum Suppression ensures temporal diversity. Evaluation on a custom dataset demonstrates tracking stability, achieving an IDF1 of 97.89% and a MOTA of 95.79%. Compared to Top-K selection, our algorithm also increases visual diversity by 146%, temporal coverage by 89%, and information retrievability by 3.5%.
著者のコメント
21 pages, 3 figures
arXiv ID: 2609.25837 / 要約の誤りについて