arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

実画像の説明から合成画像200枚を作り部品検出を改善

Semantically-Guided Domain Randomization for Industrial Object Detection in Low-Image-Budget Regimes

Jose Moises Araya-Martinez, Gautham Mohan, and Jens Lambrecht

この論文をやさしく読む

ひとことで言うと

少数の実画像から文章で現場の特徴を取り出し、その特徴に合う背景と物体を合成して、部品検出を学習する研究です。

何に役立つ?

現場の画像に新しく注釈を付ける負担を抑えたい、多品種少量生産の認識モデルの適応に関わります。評価では合成画像を200枚に制限しています。

この研究の面白いところ

画像を大量に作るのではなく、実画像の意味情報で背景生成を誘導しています。同じ200枚という予算で複数の合成・変換手法と比較した点が特徴です。

どこまで分かった?

報告は一つの自動車分野のベンチマークでの初期評価です。0.739と0.697の差はmAPで0.042、百分率表示なら4.2ポイントで、検出精度が4.2%相対改善したという意味ではありません。エネルギーや時間の削減量は要旨にありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

多品種少量(HMLV)の自動車製造では、視覚認識処理系の再学習を、厳しい注釈付与、エネルギー、時間の予算内で行わなければならない。それでも、合成データ生成(SDG)の戦略の多くは、依然として数千枚の画像を前提としている。 本研究では、意味情報に基づくドメインランダム化(S-GDR)を評価する。これは、少数の未注釈の実参照画像を視覚言語モデル(VLM)で意味的に説明し、拡散モデルによる背景合成と、マスクに基づく物体合成を組み合わせる、注釈付与不要の適応処理系である。背景合成には、ControlNetとIP-Adapterで条件づけたStable Diffusion XL(SDXL)を用いる。 自動車分野の複数物体検出ベンチマークにおいて、合成訓練画像を200枚に固定した場合、S-GDRは学習に使わない実画像のテスト集合でmAP50–95=0.739に達した。これはドメインランダム化したレンダリングの基準手法(mAP50–95=0.697)を上回り、同じ200枚の予算を共有する明るさフィルタリング、知覚ハッシュ、CycleGANによるスタイル変換、誘導なしの拡散モデルの各方式も上回った。これらの初期的な観察は、極端にデータの少ない条件で、S-GDRが注釈付与不要の有望な選択肢となることを示している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Retraining visual perception pipelines in High-Mix, Low-Volume (HMLV) automotive manufacturing must be carried out under tight annotation, energy, and time budgets, yet most Synthetic Data Generation (SDG) strategies still operate in the thousands of images. This work evaluates Semantically-Guided Domain Randomization (S-GDR), an annotation-free adaptation pipeline that couples Vision-Language Model (VLM)-based semantic captioning of a small unannotated real reference set with diffusion-based background synthesis (Stable Diffusion XL (SDXL) conditioned by ControlNet and IP-Adapter) and mask-based object composition. On an automotive multi-object detection benchmark and with a fixed budget of 200 synthetic training images, S-GDR reaches mAP50-95 = 0.739 on a real held-out test set, outperforming a domain-randomized render baseline (mAP50-95 = 0.697) as well as brightness filtering, perceptual hashing, CycleGAN style transfer, and unguided diffusion variants sharing the same 200-image budget. These initial observations position S-GDR as a promising annotation- free alternative for extreme data-scarcity regimes.

arXiv ID: 2609.26505 / 要約の誤りについて