arXiv論文メモ
新着一覧
cs.AI / cs.CL / cs.CV / cs.SD · 査読状況未確認

聞き手の直前の表情から話し方を計画する音声生成

Listen Before You Speak: Response Planning from Listener Facial Reactions for Conversational Speech Generation

Yunji Chu

この論文をやさしく読む

ひとことで言うと

話し始める直前の相手の表情を見て、次の返答をどんな感情や抑揚で話すか決める仕組みです。

何に役立つ?

考えられる用途は、聞き手の反応を踏まえた対話音声の生成です。評価では文脈への適切さに関する好みが改善しましたが、対話サービス全体の効果を測ったわけではありません。

この研究の面白いところ

顔の静止した特徴だけでなく、直前1秒の変化を利用します。平均macro-F1とVADの一致度が改善する一方で正解率はほぼ同じであり、指標ごとの違いも示しています。

どこまで分かった?

結果はMELDの二者対話評価と音声研究者20人の評価に基づきます。76%は判定の割合で、参加者の割合ではありません。広範な日常会話で同じ効果が得られるかは要旨では示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

会話の音声は、対話の文脈と、聞き手の直前の振る舞いに左右される。本研究では、応答直前の1秒間の聞き手の顔画像系列を使い、音声を実際に生成する前に、次の発話の感情と韻律を計画する2段階の枠組みReACT-TTSを提案する。厳格な二者対話のMELD評価手順では、時間的情報を用いるTemporal条件は、10個の乱数シードにわたって、Text-only条件より平均macro-F1とVADの一致度が高かった一方、正解率はほぼ変わらなかった。 アブレーション実験では、視覚情報を利用する方式の中で時間的モデル化が最も良く、初期から終期への差分を明示的に与える必要はないことが示された。また、正しい聞き手の反応を使う場合は、反応を循環的に入れ替えた不整合な場合よりも平均的に良い結果となった。音声研究者20人による文脈への適切さの評価では、判定の76%がTemporalを、9%がText-onlyを好み、15%はどちらともいえないとした。さらに、予測した応答スタイルをGrad-TTSの基盤モデルにつなぎ、端から端までの音声生成を実現する。総じて、応答前の聞き手の動きが、会話での応答計画を補う手掛かりになることを結果は支持する。ソースコードは https://github.com/CYJ1/ReACT-TTS_public で公開している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Conversational speech depends on dialogue context and the listener's immediately preceding behavior. We propose ReACT-TTS, a two-stage framework that uses a one-second pre-response listener facial sequence to plan the next utterance's emotion and prosody before speech realization. On a strict dyadic MELD protocol, Temporal conditioning yields higher mean macro-F1 and VAD concordance than Text-only across ten seeds, while accuracy remains essentially unchanged. Ablations show that temporal modeling performs best among the visual variants and that an explicit early-to-late difference is unnecessary; correct listener reactions also outperform cyclic mismatches on average. In a contextual-appropriateness study with 20 speech researchers, 76% of judgments prefer Temporal, 9% Text-only, and 15% report no preference. We further connect the predicted response style to a Grad-TTS backbone for end-to-end speech realization. Overall, the results support pre-response listener dynamics as complementary cues for conversational response planning. The source code is available at https://github.com/CYJ1/ReACT-TTS_public.

著者のコメント

15 pages, 2 figures, 2026 ECCV Workshop (11th ABAW) Best Student Paper Award

arXiv ID: 2609.21683 / 要約の誤りについて