arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

複雑な映像でもリアルタイムに動く口唇同期手法

ComplexSync: High-Fidelity and Real-Time Lip Sync in Complex Scenarios

Jiaran Cai, Xingpei Ma, Shenneng Huang

この論文をやさしく読む

ひとことで言うと

音声に合わせて口の映像を作る際、複雑な場面でも画質と処理速度を両立させる手法を提案した研究。

何に役立つ?

動画の音声に合わせた口唇同期を、リアルタイムで処理したい場合の手法として考えられる。複雑な場面を含む評価用ベンチマークも提供している。

この研究の面白いところ

参照画像からの情報漏出を抑える学習、1ステップ生成への蒸留、視覚基盤モデルの構造情報を使う損失を組み合わせ、毎秒70フレーム超を報告している。

どこまで分かった?

要旨では標準的な場面と複雑な場面での実験結果を述べているが、比較対象ごとの具体的な数値や運用環境の条件は記載されていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

口唇同期は、音声に正確に合う口の動きを映像として生成する技術である。拡散モデルは生成品質が高い一方、複雑な場面ではうまく動かないことがあり、推論に時間がかかるため、実際の利用が難しい。本研究では、複雑な条件でも高品質な口唇同期をリアルタイムで行う、拡散モデルに基づく統合的な手法ComplexSyncを提案する。 第一に、参照フレームからの情報漏出を抑えながら自然な動きを保つため、二つの系列を用いる共同学習法を導入する。第二に、蒸留によって1ステップのノイズ除去を実現し、毎秒70フレーム超の処理速度を達成する。第三に、視覚基盤モデルから得られる構造的な事前知識を利用する関係的な整合損失を提案し、複雑な場面の要因に対する頑健性を高める。さらに、難しい動画列200本超と専用の評価指標からなる、複雑な口唇同期向けのベンチマークを初めて提示する。広範な実験では、標準的な場面と複雑な場面の両方で最先端の性能を示し、リアルタイムの推論も可能だった。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Lip synchronization aims to generate visual lip dynamics that align precisely with speech audio. Despite the high generation quality of diffusion models, they often struggle in complex scenarios and suffer from prohibitive inference latency, limiting real-world deployment. We present ComplexSync, a unified diffusion-based framework that enables real-time, high-fidelity lip sync under complex conditions. First, we introduce a dual-stream joint training strategy to mitigate information leakage from reference frames while preserving natural dynamics. Second, we develop a distillation-based acceleration scheme for single-step denoising, achieving a throughput of over 70 FPS. Third, we propose a relational alignment loss that leverages structural priors from Vision Foundation Models (VFMs) to enhance robustness against complex scene factors. Furthermore, we present the first benchmark specifically designed for complex lip synchronization, comprising over 200 challenging video sequences and specialized metrics. Extensive experiments demonstrate that ComplexSync achieves state-of-the-art performance across both standard and complex scenarios while enabling real-time inference.

arXiv ID: 2609.29225 / 要約の誤りについて