arXiv論文メモ
新着一覧
cs.CV / cs.GR · 査読状況未確認

文章の動作内容と参照動画の作風を組み合わせた3D人物アニメ生成

VISTA: Video-Injected Stylized Text-to-Animation

Monseej Purkayastha, Anindita Ghosh, Philipp Slusallek

この論文をやさしく読む

ひとことで言うと

文章で人物の動作内容を指定し、別の動画から動きの作風を取り入れて3Dアニメーションを作る方法。

何に役立つ?

考えられる用途は、文章の内容を保ちながら参照動画の作風を取り込むアニメーション制作である。要旨ではレンダリングしたモーションキャプチャを参照にした概念実証を報告している。

この研究の面白いところ

文章、動画、完成動作の三つ組データを用意せず、別々のデータセットを共通の潜在空間で学習する。生成時には内容と作風の強さを個別に調整できる。

どこまで分かった?

評価はレンダリングしたモーションキャプチャの参照動画による概念実証である。実写の多様な動画や制作現場で同じ性能になるかは要旨に示されていない。

v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

本研究では、文章の指示が持つ動作の構造と、参照動画が持つ表現上の作風を融合し、様式化された3D人物の動きを生成する二段階の枠組みVISTAを提案する。文章、動画、様式化された動作を三つ組として対応付けた学習データは必要としない。まず二経路のオートエンコーダーが、動作系列と動画クリップを共通の潜在空間に写す。次に、マスク付き自己回帰型の拡散モデルがその空間で動作し、専用の後段融合経路Dual-AdaLNを通して動画由来の作風を注入しつつ、文章で指定された動作内容の構造を保つ。潜在表現のサイクル整合性を使う、バッチ間で対応付けを必要としない学習手順により、意味情報の豊かなデータセットと作風の多様な別のデータセットから共同学習できる。 制御可能なアニメーション生成の概念実証として、レンダリングしたモーションキャプチャの参照動画で検証した。動画を条件に使う方法の中で作風認識の正確さが最も高く、動作内容との対応も競争力のある水準に保った。また、内容と作風を分けた三方向の分類器なしガイダンスにより、生成時に利用者が両者のバランスを独立に調整できる。

v2の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-23 · v2
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We present VISTA, a two-stage framework for generating stylized 3D human motion by fusing structural content from text prompts with expressive style from reference videos, without requiring jointly paired (text, video, stylized motion) triplets. A Dual-channel Autoencoder first maps motion sequences and video clips into a shared latent manifold. A masked autoregressive diffusion backbone then operates within this manifold, injecting video-derived style through a dedicated late-fusion Dual-AdaLN pathway while preserving text-conditioned content structure. A cross-batch unpaired training protocol with latent cycle consistency enables joint learning across separate semantically rich and stylistically diverse datasets. As a proof-of-concept for controllable animation synthesis, we validate VISTA on rendered motion-capture references: it achieves the highest style recognition accuracy among video-conditioned methods while preserving competitive content alignment, and its decomposed 3-way classifier-free guidance provides independent, user-controllable calibration of the content-style balance at inference time.

著者のコメント

3 pages, 1 figure

arXiv ID: 2609.23817 / 要約の誤りについて