米国手話の学習からカタルーニャ手話の手形を認識
Zero-Shot Cross-Lingual Recognition of Sign Language Handshapes
この論文をやさしく読む
ひとことで言うと
米国手話で学んだ手の形の認識を、カタルーニャ手話に移す研究です。手形を指の曲がり方など共通の要素に分けることで、言語をまたいだ対応を作ります。
何に役立つ?
学習用のラベル付き動画が少ない手話言語に、認識技術を広げる手掛かりになります。手話全体の翻訳ではなく、その構成要素である手形の認識を支援する方法です。
この研究の面白いところ
言語ごとの手形ラベルを直接対応させず、五つの音韻特徴と距離を経由して認識します。記録形式をそろえることが転移を成立させる条件になっている点も重要です。
どこまで分かった?
LSCの評価は37手形、単一話者のベンチマークです。80.0%は音韻特徴の正解率で、期待手形正解率は54.5%です。複数話者や連続した手話文の認識性能を示すものではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
米国手話(ASL)のようにデータ資源が豊富な言語では、手話処理が急速に進歩している。しかし、世界の大半の手話言語には、新たな手法が必要とする音韻的な注釈が不足している。本研究では、ASLからカタルーニャ手話(LSC)へ転用する、手形認識のための初めてのゼロショット言語間転移の枠組みを示す。 手形を、両言語に共通する五つの音韻的特徴、すなわち選択された指、屈曲、指の開き、親指の位置、親指の接触に分解することを利用する。予測した特徴から、複合的な音韻距離指標を用いてLSCの手形を復号する。 二つのASLコーパス、PopSignとSem-Lexで学習した三つのアーキテクチャ、MLP、SL-GCN、SHuBERTを、37種類の手形を含む単一話者のLSCベンチマークで評価する。記録形式の違いをそろえるとゼロショット転移は可能になり、音韻特徴の正解率80.0%、期待手形正解率54.5%に達する。したがって音韻的分解は、対象言語の動画の学習ラベルを一切使わずに、資源の少ない言語へ手話技術を広げる橋渡しになる。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Sign language processing advances rapidly for high-resource languages such as American Sign Language (ASL), yet most of the world's sign languages lack the phonological annotations new methods require. We present the first zero-shot cross-lingual framework for handshape recognition, transferring from ASL to Catalan Sign Language (LSC). Our approach leverages the decomposition of handshapes into five phonological features -- selected fingers, flexion, spread, thumb position, and thumb contact -- shared across both languages, to decode LSC handshapes from predicted features via a composite phonological distance metric. We evaluate three architectures (MLP, SL-GCN, SHuBERT) trained on two ASL corpora (PopSign, Sem-Lex) against a 37-handshape, single-signer LSC benchmark. Zero-shot transfer proves viable once recording-format disparities are harmonized, reaching 80.0% phonological feature accuracy and 54.5% expected handshape accuracy. Phonological decomposition thus offers a bridge for extending sign language technologies to low-resource languages without any target-language video training labels.
著者のコメント
Accepted at the Workshop on Sign Language Processing (WSLP), EMNLP 2026
arXiv ID: 2609.18772 / 要約の誤りについて