arXiv論文メモ
新着一覧
cs.CV / cs.AI · 査読状況未確認

3次元モデルを描画して単眼動画の物体を追跡

AgentSTAR: Agentic Shape Tracking and Reconstruction from Monocular Videos

Kirill Mazur, Nikita Karaev, Matthew Chang, Jitendra Malik, Nur Muhammad "Mahi'' Shafiullah

この論文をやさしく読む

ひとことで言うと

動画の画素を追う代わりに、物体の3次元形状と動く仕組みを推定し、そのモデルを描いた画像と動画を比べて追跡を修正します。

何に役立つ?

物体が大きく動いたり一部が隠れたりする動画で、形状と姿勢を追跡する用途が考えられます。関節物体と剛体の既存データセットで評価しています。

この研究の面白いところ

VLMの視覚的な推論と、数値計算による姿勢の精密な最適化を同じループへ組み込んでいます。形状と運動構造を持つモデルが追跡の手掛かりになります。

どこまで分かった?

要旨はARCTICとHOT3Dでの優位性を述べますが、改善の具体値、計算時間、失敗例は記載していません。リアルタイム性能が示されたという意味ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

本研究では、エージェントによる合成を通じた解析を用いて、動画から形状を復元し追跡する手法を提示する。従来のように、まず密な画素対応を推定してから物体の動きを復元するのではなく、幾何形状と運動学的構造を含む構造化された3次元物体モデルを推定し、このモデルを用いて時間に沿う物体の追跡推定を最適化する。 最適化ループでは、視覚言語モデル(VLM)のエージェントが、描画と比較を繰り返しながら形状または一般化姿勢を逐次改善する。大まかな視覚的推論と数値的な姿勢最適化を組み合わせ、精密な状態推定を行う。この構造化された定式化によって、画素の対応付けを目的関数にせず、大きな動き、関節運動、強い遮蔽があっても追跡できる。定量的には、ARCTICでは関節を持つ物体について最先端の3次元点追跡の基準手法を大きく上回り、HOT3Dでは評価したすべての剛体追跡の基準手法を上回る。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

In this work, we present a method for shape reconstruction and tracking from video via agentic analysis-by-synthesis. Unlike prior methods which first estimate dense pixel correspondences and then recover object motion from them, our method infers a structured 3D object model, including its geometry and kinematic structure, and uses this model to optimise object track estimates over time. In our optimisation loop, a Vision-Language Model (VLM) agent iteratively refines shape or generalised pose through a render-and-compare loop, combining coarse visual reasoning with numerical pose optimisation for precise state estimation. This structured formulation enables our method to track through large motion, articulation, and severe occlusion without relying on pixel-matching objectives. Quantitatively, on ARCTIC, our method substantially outperforms state-of-the-art 3D point-tracking baselines for articulated objects, and on HOT3D it outperforms all evaluated rigid-object tracking baselines.

arXiv ID: 2609.24487 / 要約の誤りについて