arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

発音に合う口の動きと人が好む動きを分けて学ぶアバター生成

VibeAvatar: Aligning Phonetic Kinematics and Human Aesthetics for High-Fidelity Talking Avatar Synthesis

Qilin Wang, Mingyu Li, Hao Tang

この論文をやさしく読む

ひとことで言うと

音声に合った口の動きと、人が自然で好ましいと感じる動きを別々の段階で学び、肖像画像を話す動画にする方法です。

何に役立つ?

考えられる用途は、音声と画像から発話アバターを生成する際の、口の同期、見た目、必要な計算資源の両立です。

この研究の面白いところ

発音に必要な情報は条件付けで整え、動きへの人の好みは事後学習で調整するという役割分担をしています。

どこまで分かった?

10秒未満という生成時間の計測機器や比較条件の詳細は要旨にありません。最先端という評価は著者らの実験報告であり、すべての人物・音声・環境で同じ性能を保証するものではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

複数モダリティを用いる発話アバター合成は、参照用の肖像画像と音声から、写実的に話す動画を生成することを目指す。拡散モデルに基づく手法は急速に進歩しているが、既存手法では、正確な口唇の調音、人が好む動きの見た目、効率的な推論を同時に実現することがなお難しい。本研究では、発音の正確さと動きの美的な好ましさは根本的に異なる源から生じるため、単一の生成器に暗黙に学習させるのではなく、相補的な段階で扱うべきだと考える。 この着想に基づき、2つの目的を分離するVibeAvatarを提案する。条件付け段階では、音声認識向けの音声特徴を発音・運動学的な条件へ変換するPhonetic Kinematics Adapter(PKA)を用いる。事後学習段階では、Aesthetic Motion Policy(AMP)が、Group Relative Policy Optimization(GRPO)を使って、フローに整合する確率的サンプリング方策を最適化する。 コンパクトな1次元のワープに基づく潜在運動空間で動作する、軽量のフローベース動作生成器により、VibeAvatarは、客観指標とユーザー調査の両方で、調音、見た目、効率について最先端の結果を達成する。また、約3 GBのVRAMだけで、10秒の512 px動画を10秒未満で生成する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Multi-modal talking avatar synthesis aims to generate realistic talking videos from a reference portrait and speech. Despite rapid progress in diffusion-based methods, existing approaches still struggle to jointly achieve accurate lip articulation, human-preferred motion aesthetics, and efficient inference. We observe that phonetic accuracy and motion aesthetics arise from fundamentally different sources and should be addressed at complementary stages rather than learned implicitly by a single generator. Based on this insight, we propose VibeAvatar, which disentangles these two objectives through a Phonetic Kinematics Adapter (PKA) that converts recognition-oriented speech features into phonetic-kinematic conditions at the conditioning stage, and an Aesthetic Motion Policy (AMP) that optimizes a flow-consistent stochastic sampling policy via Group Relative Policy Optimization (GRPO) at the post-training stage. With a lightweight flow-based motion generator operating in a compact 1D warp-based latent motion space, VibeAvatar achieves state-of-the-art results in articulation, aesthetics, and efficiency on both objective metrics and user studies, while generating a 10-second 512px video in under 10 seconds with only $\sim$3GB VRAM.

arXiv ID: 2609.18632 / 要約の誤りについて