arXiv論文メモ
新着一覧
eess.AS / cs.CL / cs.CV · 査読状況未確認

韓国語読唇で利用者ごとの誤差と少量動画による適応を測定

Personalized Korean Lipreading as Visual Speech Recognition: Transfer, Census and Adaptation on OLKAVS

Se Un Park, Hakjun Kim, Taehoon Roh, Junyoung Park

この論文をやさしく読む

ひとことで言うと

韓国語の読唇で、平均点だけでは見えない利用者ごとの誤差と、短い動画での個人適応を調べています。

何に役立つ?

読唇システムを個々の利用者へ適用する際、必要な適応データ量やカメラ位置の影響を見積もる材料になります。要旨ではOLKAVS上での評価を報告しています。

この研究の面白いところ

話者別の誤り率に大きな幅があることを示し、少量の正面動画で学んだ適応が別のカメラにも移るかを調べています。

どこまで分かった?

数値はOLKAVSコーパスの評価手順と選ばれた話者に基づきます。実利用環境や別言語でも同じ誤り率になるとは示していません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

個人に合わせた韓国語の視覚的音声認識(読唇)システムを提示し、9台のカメラを使うOLKAVSコーパスで、集団全体のベンチマーク得点と個々の利用者の誤差との差を定量化する。英語データで学習した重みから始める動画のみのConformerは、コーパスの評価手順で文字誤り率(CER)9.95~12.19%を達成した。公表済みの比較値は26.64%であり、未見の発話内容ではCERは19.00~21.52%だった。話者別のCERは1.0~52.2%と幅が広い。既出の発話内容ではCERが7.0~9.0ポイント低くなり、職業的な話し方と自然発話では、それぞれ8.5~10.5ポイント、12.7ポイント高くなった。 全パラメータの4.6%を使う低ランク適応器を、各利用者の正面動画4~29分で学習すると、誤りの多い12人のCERが2.13~3.58ポイント下がった。この改善はすべてのカメラへ損失なく移り、ほかの話者への影響は全パラメータ微調整のコストの12%で、その改善幅の85%を保った。口の高さより上にあるカメラはCERをおよそ6ポイント押し上げるが、全視点を使った学習ではその差は小さく保たれる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We present a personalized Korean visual speech recognition (VSR) system and quantify, on the nine-camera OLKAVS corpus, the gap between the population-level benchmark score and an individual user's error. A video-only Conformer initialized from English-trained weights attains 9.95 - 12.19% character error rate (CER) under the corpus protocol against the published 26.64, and 19.00 - 21.52 on unseen wording. Per speaker, CER spans 1.0 to 52.2%, with seen wording lowering CER by 7.0 - 9.0 points and professional delivery and spontaneous speech raising it by 8.5 - 10.5 and 12.7 points. A low-rank adapter with 4.6% of the parameters, trained on 4 to 29 minutes of the user's frontal video, lowers the CER of twelve high-error speakers by 2.13 to 3.58 points, transfers to every camera without loss, and keeps 85% of the full fine-tuning gain at 12% of its cost to other speakers. Cameras above the mouth plane add about six CER points as a constant offset that training on all views keeps small.

著者のコメント

Submitted to ICASSP 2027. 4 pages plus references

arXiv ID: 2609.28988 / 要約の誤りについて