合成画像で訓練する宇宙機の姿勢推定を大規模モデルで改善
Vision Foundation Models with Synthetic-Only Training for Monocular Spacecraft Pose Estimation
この論文をやさしく読む
ひとことで言うと
一枚の画像から宇宙機の向きを推定する方法で、画像用の大規模基盤モデルを使うと、合成画像による訓練でも誤差が小さくなると報告しています。
何に役立つ?
考えられる用途は、協力用の信号を出さない既知の宇宙機に対する視覚的な姿勢推定です。組み込み計算機での推論時間と電力も測っています。
この研究の面白いところ
3億から8億4000万パラメーターまで大型化しても精度改善が続き、合成画像による訓練から異なる照明のテスト集合へ適応しています。
どこまで分かった?
最良精度は3モデルと4回転の拡張を使った結果ですが、133.8ミリ秒は単一パスの値です。同じ処理条件の数値ではありません。軌道上でこのモデルを実証したという報告でもありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
既知の非協力的な宇宙機を対象とする従来の姿勢推定アーキテクチャーを改善し、SPEED+のlightboxとsunlampテスト集合で、著者らの知る限り公表済みで最小の平均回転誤差を達成する。既存のヒートマップに基づく姿勢推定アーキテクチャーを用い、従来の小規模な畳み込み型・ViT型エンコーダーを、大規模な自己教師ありViT基盤モデルDINOv3に置き換えて適応させる。パラメーター数を3億から8億4000万へ増やすと姿勢推定精度が改善し、今のところ飽和は見られない。 8億4000万パラメーターのモデルをJetson Orin NX 16GBでも評価し、ネットワークの単一パス推論が切り出し画像1枚当たり133.8ミリ秒、ボード消費電力が32.0 Wであると測定した。これらの測定は、軌道飛行の実績があるプロセッサー系列上で組み込み推論が可能であることを示す。得られたモデルは、合成データだけで訓練しながら、lightboxとsunlampの両領域で従来モデルを上回る。 最良のモデルは、DINOv3の8億4000万パラメーターモデルをLoRAで適応させたエンコーダーを用いる。LoRAのランクは64で、3つの乱数シードのモデルのアンサンブルと、4回転のテスト時データ拡張を組み合わせる。その平均回転誤差はsunlampで1.56度、lightboxで1.17度である。これらのテスト集合で著者らが把握する従来最良の平均回転誤差は、EagerNetによるそれぞれ2.66度と1.75度だった。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
We present an improvement on previous spacecraft pose estimation architectures that results in the lowest published mean rotation errors we know of on the SPEED+ lightbox and sunlamp test sets for a known, non-cooperative spacecraft. By using a previously established heatmap-based pose estimation architecture and adapting a large self-supervised ViT foundation model (DINOv3) in place of the smaller convolutional and ViT encoders of previous work, we show that pose estimation accuracy improves from 300M to 840M parameters with no saturation yet observed. We also evaluate our 840M model on a Jetson Orin NX 16GB, measuring single-pass network inference at 133.8 ms per crop with a board draw of 32.0 W. These measurements demonstrate embedded inference feasibility on a processor family with orbital flight heritage. Our resulting model outperforms previous models across lightbox and sunlamp domains while training only on synthetic data. Our best model, using DINOv3 840M adapted with LoRA as the encoder (rank 64, three-seed ensemble with four-rotation test-time augmentation), results in $1.56^\circ$ mean rotation error on sunlamp and $1.17^\circ$ on lightbox, compared to the previous best mean rotation errors we know of on these test sets, $2.66^\circ$ and $1.75^\circ$ by EagerNet.
著者のコメント
6 pages, 3 figures, 4 tables. A shorter version was accepted to the IROS 2026 Space Robotics Workshop (non-archival)
arXiv ID: 2609.26561 / 要約の誤りについて