arXiv論文メモ
新着一覧
eess.AS / cs.CL / cs.MM / cs.SD · 査読状況未確認

Wikipediaの読み上げ音声にスライドを添えた認識用データ

The Spoken Wikipedia Presentation Corpus

Thomas Ranzenberger, Steffen Freisinger, Tobias Bocklet, Korbinian Riedhammer

この論文をやさしく読む

ひとことで言うと

Wikipediaの読み上げ音声に、内容に対応する自動生成スライドを付けた音声認識用のデータ集です。

何に役立つ?

音声だけでなく、画面に書かれた内容や画像も利用する認識手法の研究に使えます。スライドと音声の対応を持つため、複数種類の情報を組み合わせる評価の基盤になります。

この研究の面白いところ

内容はLLMに計画させ、見た目はルールで選ぶ構成です。データを作るだけでなく、音声のみの認識と複数情報を使う設定の難しさも評価しています。

どこまで分かった?

10.23%の単語誤り率と6.48%の文字誤り率は音声のみでの最良モデルの値です。スライド追加による改善率ではありません。資源の少ない言語では性能が落ち、ゼロショットのマルチモーダル認識にも課題が残ります。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

本研究では、マルチモーダル自動音声認識(ASR)向けにLLM生成のスライド資料を加え、Spoken Wikipedia Corporaを拡張したSpoken Wikipedia Presentation Corpusを提示する。スライドは、LLMで区切った節から、LLMによる内容計画とルールに基づくデザイン上の判断を組み合わせるハイブリッド処理系で作成する。各節について、LLMがスライドの表題、箇条書き、要点となるメッセージ、挿絵を作るための視覚的な説明を生成する。その後、ルールに基づく対応付けでレイアウト、テーマ、スタイルを選び、最終的なスライドを作成する。視覚対応LLMはスライドのテキストをMarkdownとして抽出する。 複数のASRモデルと音声言語モデル(SLM)を評価する。最良のモデルは音声のみの入力で、平均micro-WERが10.23%、平均micro-CERが6.48%に達する。英語の誤り率が最も低く、ドイツ語、オランダ語が続く一方、資源の少ない言語では性能が低下する。音声のみのベースラインは強力だが、オムニモデルへのマルチモーダルなゼロショット・プロンプティングは依然として難しい。対応付けられたスライド、テキスト、音声のデータは、モダリティをまたぐ文脈を通じて認識を改善する大きな可能性を示している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We present the Spoken Wikipedia Presentation Corpus, an extension of the Spoken Wikipedia Corpora featuring LLM-generated slide decks for multimodal ASR. Slides are created from LLM-segmented sections using a hybrid pipeline that combines LLM-based content planning with rule-based design decisions. For each section, an LLM generates a slide title, bullet points, a takeaway message, and a visual description that is used to create an illustration. Rule-based matching then selects layouts, themes, and styles to produce the final slides. A vision LLM extracts slide text as Markdown. We evaluate multiple ASR and spoken language models (SLMs). The best model achieves an average micro-WER of 10.23% and an average micro-CER of 6.48% on audio-only inputs. English yields the lowest error rates, followed by German and Dutch, while performance declines across lower-resource languages. Although audio-only baselines are strong, multimodal zero-shot prompting of omni models remains challenging. The aligned slide, text, and audio data show a strong potential to improve recognition through cross-modal context.

著者のコメント

Accepted at SLT 2026

arXiv ID: 2609.21676 / 要約の誤りについて