arXiv論文メモ
新着一覧
cs.CL / eess.AS · 査読状況未確認

音声認識の内部情報で書き起こしの話題区間を探す

Reusing Latent Speech Representations for Query-Conditioned Topic Localization in Transcripts

Steffen Freisinger, Philipp Seeberger, Thomas Ranzenberger, Tobias Bocklet, Korbinian Riedhammer

この論文をやさしく読む

ひとことで言うと

会議や講演の書き起こしから特定の話題の開始・終了位置を探す際に、文字だけでなく音声認識がすでに計算した内部情報も使う方法です。

何に役立つ?

長い書き起こしから必要な部分だけを検索や後段の処理に渡す用途が考えられます。音声の再解析用モデルを別途動かさずに情報を補える設計です。

この研究の面白いところ

音声認識器の内部表現を使い回すことで、単なる話題の一致だけでなく文区間の境界を厳密に当てる評価でも改善しています。

どこまで分かった?

検証は2つの公開データセットです。構成の整った発話で効果が強く、自由な会話のような自然発生的発話では改善が限られ、結果も混在しています。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

長い書き起こしは、後段の自然言語処理システムにとって処理コストの高い入力であり、無関係な文脈を含むことも多い。本研究では、話題の見出しを検索クエリとして与えたとき、その話題に最もよく対応する書き起こし中の文区間を予測する、クエリ条件付きの話題区間特定を扱う。区間特定の精度を高めるため、自動音声認識のエンコーダ状態を文単位の表現として再利用し、テキストの埋め込み表現と融合する。これにより、軽量な区間特定モデルが、別の音声エンコーダを実行せずに音声情報を利用できる。 2つの公開データセットでの実験では、テキストだけを使うベースラインに対して一貫した改善が見られ、特に区間境界の厳密な一致を求める評価基準で効果が大きかった。データセットをまたいだ実験では、利点は構造化または半構造化された発話で最も大きく、自然発生的な発話での改善は限定的で、一貫しないことも示された。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Long transcripts are costly inputs for downstream NLP systems and often contain irrelevant context. We study query-conditioned topic localization: predicting the sentence span in a transcript that best addresses a topic-title query. To improve span localization, we reuse ASR encoder states as sentence-level representations and fuse them with textual embeddings. This lets lightweight span locators exploit speech information without running a separate audio encoder. Experiments on two public datasets show consistent gains over text-only baselines, especially under strict boundary-matching criteria. Cross-dataset experiments further indicate that the benefits are strongest for structured or semi-structured speech, while gains on spontaneous speech are limited and mixed.

著者のコメント

Accepted at EMNLP 2026 Main Conference

arXiv ID: 2609.21844 / 要約の誤りについて