arXiv論文メモ
新着一覧
cs.LG · 査読状況未確認

筋電による無声発話解読を短時間で個人調整する条件

Multi-Subject Pretraining Enables Short-Calibration Personalization for Closed-Corpus Surface EMG Speech Decoding

Chenqian Le, Beatrice Fumagalli, Yasamin Esmaeili, Xupeng Chen, Tianyu He, Nikasadat Emami, Adeen Flinker, Yao Wang

この論文をやさしく読む

ひとことで言うと

口や顔の筋肉の電気信号から発話内容を読む仕組みを、複数人のデータで先に学習し、新しい人の短いデータで調整する研究です。

何に役立つ?

限られた定型文を扱う無声発話インターフェースで、利用者ごとの調整時間を短くする手掛かりになります。

この研究の面白いところ

3分の個人調整でも約13分との差が統計的に有意でなかった一方、評価文を全学習データから除くと誤り率が急増します。短時間調整の利点と、既知の文への依存を同時に示しています。

どこまで分かった?

通常の発話能力を持つ27人、標準化した電極配置、50文の閉じたコーパスという条件です。未知の5文ではCER 78.6%、WER 99.9%であり、自由な会話や発話障害のある人への有効性が実証されたわけではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

表面筋電(sEMG)に基づく無声発話インターフェースは、利用者間の違いと、個人調整の負担に制約される。本研究では、通常の発話能力を持つ27人が、声を出す発話と声を出さずに口を動かす発話を通じて、各自0.5時間未満、平均21.3分のデータを提供する、少量データの設定を調べる。 50文に限定された閉じたコーパスで、1人ずつ評価対象として除外する評価を用いた。公開済みの単一被験者の学習済みチェックポイントから初期化し、評価対象以外の参加者で事前学習してから、対象参加者で微調整する。この処理は文字誤り率(CER)21.7%、単語誤り率(WER)31.9%を達成した。これに対し、対象者の調整なしではCER 49.3%、チェックポイントを直接微調整した場合はCER 68.0%であった。 ランダム初期化から複数被験者で事前学習して微調整するとCERは44.9%となり、27回の分割評価中5回では、固定した学習スケジュールで収束しなかった。これは、チェックポイントによる初期化が最適化と精度に大きな利点をもたらすことを示す。事前学習の参加者を1人から26人に増やすと、マクロ平均CERは74.4%から21.7%に下がった。 対象者の調整データが3分でも、CER 20.5%、WER 31.7%を達成し、利用可能な約13分のデータすべてを用いた場合のCER 21.7%、WER 31.9%と統計的に有意な差はなかった。被験者固有のアダプタには、検出できる利益がなかった。評価用の5文をsEMGモデルのすべての学習データから除くと、CERとWERは78.6%と99.9%に上昇した。これらの結果は、電極配置を標準化した閉じたコーパスの条件において、短時間の調整による個人化を支持する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Surface electromyography (sEMG)-based silent speech interfaces are limited by cross-user variability and calibration burden. We study a limited-data setting in which each of 27 speech-typical participants contributed less than 0.5 h of data (21.3 min on average) across Aloud and Mimed speech. Within a closed 50-sentence corpus, we used leave-one-subject-out evaluation, initializing from a released single-subject checkpoint, pretraining on non-held-out participants, and fine-tuning on the target participant. This pipeline achieved 21.7% character error rate (CER) and 31.9% word error rate (WER), compared with 49.3% CER without target-subject calibration and 68.0% CER for direct checkpoint fine-tuning. Multi-subject pretraining from random initialization followed by fine-tuning reached 44.9% CER and did not converge under the fixed schedule in 5 of 27 folds, indicating substantial optimization and accuracy benefits from checkpoint initialization. Macro-averaged CER declined from 74.4% with one pretraining participant to 21.7% with 26. Three minutes of target-subject calibration achieved 20.5% CER and 31.7% WER, with no statistically significant difference from the full approximately 13-min pool (21.7% CER and 31.9% WER). A subject-specific adapter provided no detectable benefit. Excluding the five evaluation sentences from all sEMG model-training data increased CER and WER to 78.6% and 99.9%. These results support short-calibration personalization in a standardized-montage, closed-corpus setting.

著者のコメント

20 pages

arXiv ID: 2609.21288 / 要約の誤りについて