単眼動画から人物と場面をメートル単位で四次元復元する手法
WildHSR: Metric Feed-Forward 4D People-Scene Reconstruction from a 3D Foundation Model
この論文をやさしく読む
ひとことで言うと
1台のカメラで撮った動画から、人物の動き、周囲の三次元形状、カメラ位置を実際の長さの単位で復元する研究です。
何に役立つ?
単眼動画から人物と場面の位置関係を把握する用途が考えられます。要旨ではEMDB-2とRICHの評価およびGPU上の速度を報告しています。
この研究の面白いところ
尺度の擬似ラベルを作って学習し、基盤モデルの中間特徴から人物のフレーム間対応も読み出します。
どこまで分かった?
性能比較は要旨に挙げられたデータセットと公表済み手法の範囲です。すべての撮影条件で人物同一性や尺度が正確になるとは述べられていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
三次元基盤モデルは一度の順方向計算で動画のカメラと形状を復元できるが、有力なモデルの中には尺度が定まらないものがある。人物と場面を同時に復元するには、実際の長さを表す尺度と、フレームをまたいで持続する人物の同一性という二つの情報がさらに必要になる。本研究は、尺度が定まらない一つの基盤表現から、軽量な適応によって両方を得られるかを調べる。正確なメートル単位のラベルは少ない一方、ラベルのない自然な動画は豊富にある。選別したウェブ動画内の人物を利用し、姿勢が分かるメートル単位の人体モデルと二次元のキーポイントから、近似的な尺度の擬似ラベルを閉形式で求める。この擬似ラベルで尺度読み出し器を事前学習し、次に標準的な実動画の学習用分割から得た正確な尺度の教師情報を使い、軽量なアダプターとともに微調整する。推論時には、尺度を測る物差しや教師モデルを使わず、基盤モデルのトークンから尺度を予測する。人物の同一性については、事前学習済み基盤モデルだけを調べ、中間層のquery-key特徴がフレーム間の人物対応を表す証拠を見つけた。評価した動く人物の動画の大半で、中間層のトークンは、その人物が去った位置や他の人物より本人を優先した。小さな射影でこの対応を読み出し、メートル単位の骨盤の動きと検出候補の信頼度と組み合わせ、未対応を扱えるSinkhorn法によってフレームごとの人体を対応づける。WildHSRは両読み出し器を組み合わせ、単眼動画からメートル単位のカメラ、場面、人物を復元する。各時間窓は順方向計算で予測し、解析的な対応付けとSim(3)変換の合成で窓同士をつなぐ。EMDB-2では、公表された比較の中で、最良の最適化ベース手法のWA-MPJPEとRTEを上回った初の順方向手法となり、世界座標系での3指標すべてで順方向手法の首位となった。RICHでは、人物と場面を扱う順方向手法の中でWA-MPJPEとW-MPJPEが首位だった。処理全体は1台のGPUで毎秒10.1フレームで動作する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
3D foundation models recover video cameras and geometry in one forward pass, but some of the strongest are up to scale. Joint people-scene reconstruction then requires two missing outputs: metric scale and persistent person identity. We ask whether one up-to-scale foundation representation can support both through lightweight adaptation. Exact metric labels are scarce, but unlabeled in-the-wild video is abundant. We use people in curated web video to initialise the solution: a posed metric body and 2D keypoints give an approximate, closed-form scale pseudo-label. These pseudo-labels pretrain a Scale Readout, which is then fine-tuned together with a lightweight adapter using exact metric supervision from standard real-video training splits. At inference the head predicts metric scale from foundation-model tokens, without the ruler or its teachers. For person identity, we probe the pretrained foundation model alone and find evidence that its intermediate query-key features encode person correspondence across frames. In most evaluated moving-person clips, a mid-layer token prefers that person over the vacated location and other people. A tiny projection reads this correspondence; together with metric pelvis motion and proposal confidence, it drives dustbin-aware Sinkhorn association of per-frame bodies. WildHSR combines both readouts to reconstruct metric cameras, scene and people from monocular video. Each window is predicted feed-forward; analytic association and Sim(3) composition connect windows. On EMDB-2, WildHSR is the first feed-forward method in the published comparison to beat the best optimization-based WA-MPJPE and RTE while leading feed-forward methods on all three world-frame metrics. On RICH, it leads feed-forward people-and-scene methods on WA-MPJPE and W-MPJPE. The complete pipeline runs at 10.1 fps on one GPU.
arXiv ID: 2609.29106 / 要約の誤りについて