複数視点の空間・時間情報を統合して3次元姿勢を推定
STA-TFM: Spatio-Temporal Aggregation Across Views TransForMer for Pose Estimation
この論文をやさしく読む
ひとことで言うと
複数のカメラから得た人体の2次元姿勢を、時間の流れも使って3次元の動きにまとめる方法です。視点ごとの特徴抽出と視点間の統合を段階的に行います。
何に役立つ?
考えられる用途は、運動計測や健康状態のモニタリングなどです。要旨で実証されているのは姿勢データセット上の誤差削減であり、医療現場での効果そのものではありません。
この研究の面白いところ
既存の3次元姿勢データを条件を調整できる複数視点データへ変換し、学習データ不足にも対処しています。位置だけでなく速度の誤差も評価し、動きの一貫性を確認しています。
どこまで分かった?
改善率はデータセットと指標によって異なり、比較対象はカメラパラメータを必要としない複数視点手法です。要旨には実際の運用環境での精度や必要な計算資源の詳しい条件は示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
単眼画像からの3次元人体姿勢推定(HPE)は、奥行きの曖昧さ、遮蔽、時間的な一貫性の必要性のため、依然として難しい。複数視点を用いる手法は単眼手法より高い精度を示す一方、複雑な構成を必要とすることが多い。本研究では、複数視点での姿勢推定に向けて空間情報と時間情報を組み合わせるTransformerベースの構造、STA-TFMを提案する。単眼の特徴抽出器であるDSTformerを利用して、各視点内の姿勢に関する長距離の依存関係を捉える。その後、融合Transformerが視点間の情報を集約し、一貫した3次元推定を生成する。学習データの不足に対処するため、既存の任意の3次元姿勢データセットを、パラメータを制御できる複数視点の構成へ変換するデータ生成パイプラインを用いる。 複数のデータセットでの実験により、STA-TFMは既存のカメラパラメータを必要としない複数視点手法を上回ることを示した。DHP19データセットでは、関節位置誤差の平均(MPJPE)を50.9%、関節速度誤差の平均(MPJVE)を49.5%削減した。HAA4Dではそれぞれ6.7%と7.7%削減し、TotalCaptureではMPJPEを15.2%削減した。STA-TFMはノイズや欠落を含む2次元入力に対応し、健康状態のモニタリング、運動能力の評価、没入型技術への導入の可能性を支える。コード、学習済みチェックポイント、データは https://zenodo.org/records/22832620 で公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Monocular 3D human pose estimation (HPE) remains challenging due to depth ambiguity, occlu- sions, and the need for temporal consistency. While multi-view methods provide superior accuracy over monocular approaches, they often require complex setups. We introduce STA-TFM, a transformer-based architecture that combines spatial and temporal information for multi-view pose estimation. The approach leverages DSTformer, a monocular feature extractor, to capture long-range pose dependencies within each view. A fusion transformer then aggregates information across views to produce coherent 3D estimates. To address training data scarcity, we use a data generation pipeline that transforms any existing 3D pose dataset into multi-view setups with controllable parameters. Experiments on various datasets demonstrate that STA-TFM outperforms existing camera-parameter-free multi-view methods. STA-TFM achieves 50.9% and 49.5% reductions in mean per joint position error (MPJPE) and mean per joint velocity error (MPJVE) on the DHP19 dataset. Furthermore, it achieves 6.7% and 7.7% respective reductions on HAA4D, and a 15.2% MPJPE reduction on TotalCapture. STA-TFM handles noisy and missing 2D inputs, supporting potential deployment in healthcare monitoring, athletic assessment, and immersive technologies. Code, training checkpoints, and data are available at https://zenodo.org/records/22832620.
arXiv ID: 2609.24482 / 要約の誤りについて