arXiv論文メモ
新着一覧
cs.CV / cs.GR / cs.HC · 査読状況未確認

話し途中の音声に合わせて自然な身ぶりを生成

GestureFAR: Streaming Co-Speech Gesture Generation with Flow Autoregression

Pinxin Liu, Haiyang Liu, Jiahao Luo, Junhua Huang, Chunhao Zou, Luchuan Song

この論文をやさしく読む

ひとことで言うと

話の終わりを待たず、届いた音声に合わせて連続的な身ぶりを逐次生成するAIです。

何に役立つ?

会話するアバターや身体を持つ対話エージェントで、応答の遅れを抑えた動作生成への利用が考えられます。

この研究の面白いところ

連続表現で動作の表現力を保ちつつ、生成ヘッドだけを蒸留して計算を1回に減らしています。

どこまで分かった?

要旨の評価はBEAT2上の比較です。品質・遅延の具体値や、実際の対話参加者による評価は要旨には記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

ストリーミング音声から自然な発話随伴ジェスチャーを生成することは、身体を持つ対話エージェントに不可欠であり、ユーザーがまだ話している間に動作を生成する必要がある。近年のストリーミングジェスチャーシステムは、離散的な動作トークンを自己回帰的に扱うことでオンライン生成を可能にするが、この設計は高次元の連続的な動作を有限のコードブックへ圧縮するため、生成する身ぶりのリアリティや多様性を制限し得る。因果性と連続的な表現力の両方を保つため、本研究はストリーミング発話随伴ジェスチャー生成のフロー自己回帰型枠組みGestureFARを提案する。 第一に、GestureFARは因果的な連続動作潜在表現上で自己回帰を行う。Transformerでストリーミングの音声・動作文脈をモデル化し、トークンごとのフローマッチングヘッドで連続分布から次の潜在表現をサンプリングする。第二に、ヘッドだけを対象とするフロー蒸留戦略を導入する。因果的なバックボーンを固定し、整合性と分布一致の目的関数を用いて、トークンごとの多段フローヘッドを1回のネットワーク評価へ蒸留する。これにより、トークン単位の因果性を維持したまま、リアルタイム対話での主な遅延要因を取り除く。BEAT2での実験は、GestureFARがストリーミング対応手法の中で品質と遅延のトレードオフを大幅に改善し、高いジェスチャー品質を保ちながらリアルタイムのトークン因果的生成を可能にすることを示す。プロジェクトページは https://andypinxinliu.github.io/GestureFAR にある。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Generating natural co-speech gestures from streaming speech is essential for embodied conversational agents, where motion must be produced while a user is still speaking. Recent streaming gesture systems make online generation possible by autoregressing over discrete motion tokens, but this design compresses high-dimensional continuous motion into finite codebooks and can limit the realism and diversity of generated gestures. To preserve both causality and continuous expressiveness, we propose \textbf{GestureFAR}, a flow-autoregressive framework for streaming co-speech gesture generation. First, GestureFAR autoregresses over causal continuous motion latents, using a transformer to model streaming audio-motion context and a per-token flow-matching head to sample the next latent from a continuous distribution. Second, we introduce a head-only flow distillation strategy that freezes the causal backbone and distills the multi-step per-token flow head into a single network evaluation using consistency and distribution-matching objectives. This keeps the model token-causal while removing the main latency bottleneck for live interaction. Experiments on BEAT2 show that GestureFAR significantly improves the quality--latency trade-off among streaming-capable methods, preserving strong gesture quality while enabling real-time token-causal generation. Project Page: https://andypinxinliu.github.io/GestureFAR

arXiv ID: 2609.21576 / 要約の誤りについて