arXiv論文メモ
新着一覧
cs.HC / cs.AI · 査読状況未確認

作業場所に合わせて画像と動画の手順を生成するAR支援

Generative Tutorial: Towards Live Contextualized Visual Instructions for Physical Tasks

Muzhe Wu, Zuchen Li, Xu Wang, Anhong Guo

この論文をやさしく読む

ひとことで言うと

目の前の道具や作業場所に合わせて、お手本の画像や動画を生成するARの作業支援です。別の環境で撮られた説明を自分の環境に読み替える負担に着目しています。

何に役立つ?

考えられる用途は、実物を操作する作業の手順案内です。24人の実験では、事前作成の案内より出来栄えや環境との対応の評価が高くなりました。

この研究の面白いところ

現在の作業場所だけでなく、前の行動によって次にどう見えるかの予測も使い、次の説明を生成します。見た目が似ていることと信頼の関係も調べています。

どこまで分かった?

検証は試作システムを使った24人の実験室研究です。生成の誤りが解釈に影響する点も報告されており、すべての作業で正確な手順を保証したわけではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

物理的な作業の視覚的な説明は、通常ある状況で作られ、別の状況で利用される。そのため、利用者は提示された道具、材料、空間的な関係を、自分の環境に置き換えて理解する必要がある。本研究では、利用者の環境と作業の流れの中に、目指す結果と行動を描く、その場に応じた視覚的な説明の概念的枠組み「Generative Tutorial」を提案する。 最先端の画像・動画生成技術を15種類の物理的作業で形成的に評価し、失敗例と潜在的な利点を明らかにした。この知見を基に、観測した作業空間の状況と、先行する行動の視覚的な結果の予測を使って、目標画像と実演動画を先回りして生成する拡張現実の試作システムを構築した。 24人が参加した実験室での研究では、あらかじめ作成されたガイダンスと比べて、このシステムでは作業の出来栄えが高く、作業空間に対応しているという主観的な評価が高く、手順を確認する間隔が短かった。定性的な結果からは、状況の類似性が信頼をどう形作るか、生成の誤りが解釈にどう影響するか、ガイダンスの提示が利用者の必要にどう適応すべきかが浮かび上がり、今後の設計への示唆が得られた。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Visual instructions for physical tasks are typically authored in one context and followed in another, requiring users to translate demonstrated tools, materials, and spatial relationships into their own environment. We introduce Generative Tutorial, a conceptual framework for live visual instruction that depicts intended outcomes and actions within the user's environment and task flow. A formative evaluation of state-of-the-art image and video generation identifies failures and potential benefits across 15 physical tasks. Drawing on these findings, we build an augmented-reality prototype system that proactively generates goal images and demonstration videos using observed workspace context and predicted visual outcomes of preceding actions. A 24-participant lab study found higher task performance quality, greater perceived workspace correspondence, and shorter step-confirmation intervals with the system than with pre-authored guidance. Qualitative findings highlighted how contextual resemblance shapes trust, how generation errors affect interpretation, and how guidance delivery should adapt to users' needs, informing future designs.

arXiv ID: 2609.24955 / 要約の誤りについて