音声入力に俳句形式の音声で応答するHaikuS2S
HaikuS2S: A Cascaded System For Responding In Verse
この論文をやさしく読む
ひとことで言うと
話しかけた内容を認識し、LLMで俳句形式の返答を作り、その形式に合う間や抑揚を持つ音声へ変換する仕組みです。
何に役立つ?
定型詩の音声応答で、文章の生成だけでなく読み上げ方も調整する検討に役立ちます。実験は感情類似度、音声品質、韻律に着目しています。
この研究の面白いところ
一般的な詩と俳句を組み合わせて微調整したシステムで、韻律や調子の整合性が特によくなりました。一方、感情類似度は各システムで同程度でした。
どこまで分かった?
要旨は5–7–5を音節として記述しています。日本語の俳句のモーラ数と同じものとみなすべきではありません。具体的な改善値や、全出力が定型を守る割合は示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
表現豊かな音声合成は韻律のモデル化によって進歩してきたが、俳句のように構造を持つ詩的な発話の生成は依然として難しい。先行研究では韻律転移が表現力を改善し、詩向けに微調整したテキスト音声変換(TTS)システムが詩の抑揚を捉えている。しかし、これらのモデルは俳句の5–7–5の音節構造や行末の間をモデル化していない。 本研究では、自動音声認識(ASR)、大規模言語モデル(LLM)による俳句生成、散文と独自の俳句データセットの両方を使ったTTSの微調整を組み合わせる、段階接続型システムHaikuS2Sを提示する。評価は感情の類似度、音声品質、韻律の整合性に着目する。実験では、微調整したシステム、とりわけ一般的な詩と俳句の両方で学習したシステムで、韻律と調子の整合性が大きく改善した。また、すべてのシステムで感情類似度の得点は同程度に維持された。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Expressive speech synthesis has advanced through prosody modeling, yet generating structured poetic speech, such as haiku, remains challenging. Prior work on prosody transfer improves expressiveness, and fine-tuned poetry TTS (text-to-speech) systems capture verse intonation. However, these models do not model haiku's 5-7-5 syllable structure or line-ending pauses. We present a cascaded system, HaikuS2S, combining ASR (automatic speech recognition), LLM (large language model)-generated haiku, and TTS fine-tuning on both prose and custom haiku datasets. Our evaluation focuses on emotion similarity, speech quality, and prosody alignment. In our experiments, we see that our prosody and tonal alignment improve significantly with our fine-tuned systems, particularly the one trained on both general poetry and haiku. We also see that we maintain similar emotion similarity scores across all systems.
著者のコメント
Accepted to SLT 2026, Demo Track. 5 pages, 5 figures
arXiv ID: 2609.23951 / 要約の誤りについて